跳转至

Qwen3.6-35B-A3B

1 引言

Qwen3.6-35B-A3B 是 Qwen3.6 系列中的稀疏 MoE 模型,总参数量为 35B,每个 token 激活约 3B 参数。它采用了 Qwen3.5 风格模型使用的混合注意力架构,适用于在昇腾硬件上进行长上下文在线服务。

本文档描述了该模型的主要验证步骤,包括支持特性、前提条件、安装、单节点在线部署、功能验证、精度与性能评估、性能调优以及常见问题解答。

Qwen3.6-35B-A3B 模型首次在 vllm-ascend:v0.18.0rc1 中得到支持。请使用 v0.18.0rc1 或更高版本。以下示例使用文档构建系统配置的版本占位符。

2 支持特性

请参阅支持的特性获取该模型的支持特性,包括BF16、W8A8量化、分块预填充、自动前缀缓存、异步调度、张量并行、专家并行以及ACLGraph支持。

请参阅功能指南以获取功能配置详情。

3 前提条件

3.1 模型权重

权重版本 硬件要求 下载链接
Qwen3.6-35B-A3B(BF16 版本) 1 个 Atlas A3 推理产品(64GB x 16)节点、1 个 Atlas A2 推理产品(64GB x 8)节点,或 Atlas 300I DUO ModelScope
Qwen3.6-35B-A3B-w8a8(量化版本) 1 个 Atlas A3 推理产品(64GB x 16)节点、1 个 Atlas A2 推理产品(64GB x 8)节点,或 Atlas 300I DUO ModelScope

建议将模型权重下载到 /root/.cache/。

路径说明:将模型权重下载到您选择的目录并记录该路径。请确保后续部署命令中的模型路径与此目录一致。

4 安装

4.1 Docker 镜像安装

根据您的机器类型选择镜像。例如,对于Atlas A2推理产品,使用quay.io/ascend/vllm-ascend:v0.23.0;对于Atlas A3推理产品,使用quay.io/ascend/vllm-ascend:v0.23.0-a3;对于Atlas 300I DUO,使用quay.io/ascend/vllm-ascend:v0.23.0-310p。

完整的安装指南请参阅使用docker。

# Download the model weight to /root/.cache in advance.
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0-a3
export NAME=vllm-ascend

docker run --rm \
  --name $NAME \
  --net=host \
  --shm-size=1g \
  --device /dev/davinci0 \
  --device /dev/davinci1 \
  --device /dev/davinci2 \
  --device /dev/davinci3 \
  --device /dev/davinci4 \
  --device /dev/davinci5 \
  --device /dev/davinci6 \
  --device /dev/davinci7 \
  --device /dev/davinci8 \
  --device /dev/davinci9 \
  --device /dev/davinci10 \
  --device /dev/davinci11 \
  --device /dev/davinci12 \
  --device /dev/davinci13 \
  --device /dev/davinci14 \
  --device /dev/davinci15 \
  --device /dev/davinci_manager \
  --device /dev/devmm_svm \
  --device /dev/hisi_hdc \
  -v /usr/local/dcmi:/usr/local/dcmi \
  -v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
  -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
  -v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
  -v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
  -v /etc/ascend_install.info:/etc/ascend_install.info \
  -v /root/.cache:/root/.cache \
  -it $IMAGE bash
# Download the model weight to /root/.cache in advance.
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0
export NAME=vllm-ascend

docker run --rm \
  --name $NAME \
  --net=host \
  --shm-size=1g \
  --device /dev/davinci0 \
  --device /dev/davinci1 \
  --device /dev/davinci2 \
  --device /dev/davinci3 \
  --device /dev/davinci4 \
  --device /dev/davinci5 \
  --device /dev/davinci6 \
  --device /dev/davinci7 \
  --device /dev/davinci_manager \
  --device /dev/devmm_svm \
  --device /dev/hisi_hdc \
  -v /usr/local/dcmi:/usr/local/dcmi \
  -v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
  -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
  -v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
  -v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
  -v /etc/ascend_install.info:/etc/ascend_install.info \
  -v /root/.cache:/root/.cache \
  -it $IMAGE bash

标准容器

# Use the vllm-ascend image
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0-310p

docker run --rm \
--name vllm-ascend \
--shm-size=10g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-p 8080:8080 \
-it $IMAGE bash

进入容器后,验证 vLLM 和 vLLM-Ascend 是否可以导入:

python -c "import vllm, vllm_ascend; print('vllm and vllm_ascend are ready')"

4.2 源码安装

您也可以从源码构建并安装vllm-ascend。请参阅使用python进行设置。

Note

对于Atlas 300I DUO,源码安装可能会引入triton和triton-ascend。在Atlas 300I DUO上运行vLLM-Ascend之前,请先卸载它们:

pip uninstall -y triton-ascend triton

5 在线服务部署

5.1 单节点在线部署

单节点部署在同一节点上运行Prefill和Decode。Qwen3.6-35B-A3B-w8a8可以部署在1个Atlas A3推理产品(64G x 16)、1个Atlas A2推理产品(64G x 8)或Atlas 300I DUO上。W8A8版本需要--quantization ascend。

运行以下脚本,在1个Atlas A3推理产品(64G x 16)上执行上下文长度高达262144的在线推理。

#!/bin/sh

# Load model from ModelScope to speed up download.
export VLLM_USE_MODELSCOPE=True
export HCCL_BUFFSIZE=1024
export HCCL_OP_EXPANSION_MODE="AIV"
export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True

# Reduce memory fragmentation and avoid out-of-memory errors.

echo performance | tee /sys/devices/system/cpu/cpu*/cpufreq/scaling_governor
sysctl -w vm.swappiness=0
sysctl -w kernel.numa_balancing=0
sysctl kernel.sched_migration_cost_ns=50000

# Ensure the model path matches the directory recorded during download
vllm serve Eco-Tech/Qwen3.6-35B-A3B-w8a8 \
  --host 0.0.0.0 \
  --port 8000 \
  --data-parallel-size 1 \
  --tensor-parallel-size 2 \
  --enable-expert-parallel \
  --seed 1024 \
  --quantization ascend \
  --served-model-name qwen3.6 \
  --max-num-seqs 128 \
  --max-model-len 262144 \
  --max-num-batched-tokens 16384 \
  --trust-remote-code \
  --gpu-memory-utilization 0.90 \
  --enable-prefix-caching \
  --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \
  --additional-config '{"enable_cpu_binding":true, "multistream_overlap_shared_expert": true}'

关键参数:

  • --data-parallel-size 1 和 --tensor-parallel-size 2 为默认的单节点服务示例设置DP和TP。
  • --enable-expert-parallel 为MoE层启用专家并行。不要在同一个MoE层中混合使用MoE张量并行和专家并行。
  • --max-model-len 是单个请求的最大输入加输出长度。仅在KV缓存充足时增加该值。
  • --max-num-seqs 是每个DP组调度的最大活动请求数。对于性能测试,设置 --max-num-seqs * --data-parallel-size 大于或等于测试并发数。
  • --max-num-batched-tokens 是单个调度步骤中处理的最大token数。较大的值可以提高预填充效率,但会消耗更多的激活内存。
  • --gpu-memory-utilization 控制vLLM可用于计算KV缓存容量的HBM量。较高的值会增加KV缓存大小,但如果运行时内存高于性能分析运行时的内存,则可能触发OOM。
  • --enable-prefix-caching 启用前缀缓存。对于长上下文服务,请监控内存使用情况,因为前缀缓存可能会增加KV缓存压力。
  • --quantization ascend 为W8A8模型启用Ascend量化。部署BF16模型时请移除该选项。
  • --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' 启用完整的解码ACLGraph重放以减少调度开销。
export VLLM_USE_MODELSCOPE=True
export ASCEND_RT_VISIBLE_DEVICES=0,1

# Ensure the model path matches the directory recorded during download
vllm serve Eco-Tech/Qwen3.6-35B-A3B-w8a8 \
  --host 127.0.0.1 \
  --port 8080 \
  --tensor-parallel-size 2 \
  --gpu-memory-utilization 0.90 \
  --max-num-seqs 16 \
  --served-model-name qwen3.6 \
  --dtype float16 \
  --additional-config '{"ascend_compilation_config": {"enable_npugraph_ex":false}}' \
  --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,8]}' \
  --quantization ascend \
  --max-model-len 20480 \
  --no-enable-prefix-caching

关键参数:

  • --tensor-parallel-size 2将模型映射到两个Atlas推理设备上。请根据可用设备和内存,将其与ASCEND_RT_VISIBLE_DEVICES一起调整。
  • --dtype float16用于Atlas 300I DUO,以匹配Atlas推理执行路径。
  • --max-num-seqs 16限制并发活动请求数,以减少Atlas 300I DUO上的KV缓存和图捕获压力。
  • --gpu-memory-utilization控制KV缓存容量。如果启动或运行时请求报告OOM,请减小该值。
  • 需要--additional-config,其中包含"ascend_compilation_config": {"enable_npugraph_ex": false},因为Atlas 300I DUO不支持enable_npugraph_ex。
  • --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,2,4,8,16]}'启用decode ACLGraph重放,并明确限制Atlas 300I DUO的捕获大小。
  • --no-enable-prefix-caching是此Atlas 300I DUO示例的默认建议,以减少内存压力。
  • --quantization ascend为W8A8模型启用Ascend量化。部署BF16模型时请移除该选项。
  • 要启用MTP推测解码,请使用--speculative_config '{"method": "mtp", "num_speculative_tokens": 1}'。我们建议将num_speculative_tokens设置为1。如果您的使用场景涉及少于两个并发请求,建议启用MTP。否则,建议不要启用MTP。

常见问题提示:如果服务启动失败、HBM不足或请求未按预期调度,请先参考公共FAQ,然后查看第10节中特定于模型的FAQ。

6 功能验证

服务器启动后,发送请求以验证模型基本功能。

curl http://<server_ip>:<port>/v1/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.6",
    "prompt": "The future of AI is",
    "max_tokens": 50,
    "temperature": 0
  }'

预期结果:HTTP 状态码为 200,JSON 响应包含带有生成文本的 choices 字段。

7 精度评估

以下是两种精度评估方法。

7.1 使用 AISBench

详情请参考使用 AISBench。执行后,您可以获得 Qwen3.6-35B-A3B-w8a8 的精度结果。

dataset version metric mode vllm-api-general-chat
mmmu - accuracy gen 83.3
gpqa - accuracy gen 83.3

7.2 使用 Language Model Evaluation Harness

安装和使用详情请参考使用 lm_eval。使用在线服务时,请将 base_url 设置为第5节中启动的端点。

lm_eval \
  --model local-completions \
  --model_args model=qwen3.6,base_url=http://127.0.0.1:8000/v1/completions,tokenized_requests=False,trust_remote_code=True \
  --tasks gsm8k \
  --output_path ./

8 性能评估

8.1 使用 AISBench

详情请参考使用 AISBench 进行性能评估。

8.2 使用 vLLM 基准测试

以 Qwen3.6-35B-A3B-w8a8 为例进行性能评估。更多详情请参考 vLLM 基准测试。

vllm bench 有三个子命令:

  • latency:对单批请求的延迟进行基准测试。
  • serve:对在线服务吞吐量进行基准测试。
  • throughput:对离线推理吞吐量进行基准测试。

以 serve 为例:

export VLLM_USE_MODELSCOPE=True

vllm bench serve \
  --model Eco-Tech/Qwen3.6-35B-A3B-w8a8 \
  --served-model-name qwen3.6 \
  --dataset-name random \
  --random-input 200 \
  --num-prompts 200 \
  --request-rate 1 \
  --save-result \
  --result-dir ./

几分钟后,您将获得性能评估结果。

9 性能调优

9.1 推荐配置

以下配置在特定测试环境中经过验证,仅供参考。最佳配置取决于硬件类型、最大输入/输出长度、请求并发数、前缀缓存命中率和量化方式。请根据实际工作负载调整第9.2节中的参数。

场景 部署模式 NPU总数 权重版本 关键考量
长上下文 单节点在线服务 2个或更多NPU W8A8 使用更大的--max-model-len并预留足够的KV缓存。如果发生OOM,则降低--max-num-seqs。
高吞吐量 单节点在线服务 8个或更多NPU W8A8 增加节点内的本地DP组,并调整--max-num-batched-tokens。
低延迟 单节点在线服务 2个或更多NPU W8A8 使用更小的--max-num-batched-tokens、全解码ACLGraph,并默认禁用推测解码。
场景 节点角色 NPU数量 TP DP 最大序列数 最大模型长度 最大批量Token数 前缀缓存 主要优化
Long context Single node 2 or more 2 1 128 262144 16384 On FullGraph, sequence parallelism, shared expert overlap, CPU binding
High throughput Single node 8 or more 2 4 or more 32 per DP 65536 8192 On FullGraph, sequence parallelism, async scheduling, shared expert overlap
Low latency Single node 2 or more 2 1 Tune by concurrency 32768 or 65536 1024 to 4096 Workload dependent FullGraph, CPU binding, speculative decoding disabled

9.2 调优指南

有关通用调优方法,请参阅公共性能调优文档,有关功能描述,请参阅功能矩阵。

推荐的调优顺序:

  1. 使用单节点部署。如果需要更高的吞吐量,请在同一节点内增加本地DP组。
  2. 使用 --max-model-len 选择最大上下文长度。长上下文会增加KV缓存使用量,因此如果发生OOM,请减少 --max-num-seqs 或 --gpu-memory-utilization。
  3. 调整 --max-num-batched-tokens。较大的值通常可以提高预填充吞吐量,但会增加激活内存。解码密集型工作负载通常需要较小的值。
  4. 根据服务并发数调整 --max-num-seqs。超过此值的请求将在队列中等待,等待时间计入TTFT和TPOT。
  5. 调整 --gpu-memory-utilization。增加该值以提供更多KV缓存,但需为运行时内存波动和专家不平衡留出余量。
  6. 调整ACLGraph捕获。对于解码,建议使用 FULL_DECODE_ONLY。如果手动设置 cudagraph_capture_sizes,请包含常见的解码批处理大小。使用序列并行时,请使用TP大小的倍数作为捕获大小。

9.3 模型特定优化

优化项 启用方式 收益 备注
混合注意力支持 由模型实现启用 支持Qwen3.6长上下文推理。 根据KV缓存容量调整上下文长度。
全解码ACLGraph --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' 减少算子分发开销,稳定解码性能。 推荐用于解码密集型服务。
共享专家重叠 --additional-config '{"multistream_overlap_shared_expert": true}' 在MoE工作负载中重叠共享专家计算。 推荐用于吞吐量场景。
前缀缓存 --enable-prefix-caching 改善重复前缀工作负载。 对于长上下文工作负载,监控HBM使用情况。
Qwen3.6 MTP推测解码 --speculative-config '{"method": "qwen3_5_mtp", "num_speculative_tokens": 3, "enforce_eager": true}' 当稳定且被接受的token数量较高时,可提高解码吞吐量。 验证工作负载的稳定性、TTFT、TPOT和吞吐量。

10 常见问题解答

对于常见的环境、安装和通用参数问题,请参考公共FAQ。本节仅涵盖Qwen3.6-35B-A3B模型特有的问题。

Q1:为什么服务在启动时或接受请求后不久报告 OOM?

现象: 服务在性能分析运行期间失败,或者成功启动但在真实流量到来时报告 OOM。

原因: Qwen3.6 长上下文服务会消耗大量 KV 缓存。较大的 --max-model-len、--max-num-seqs、--max-num-batched-tokens 或较高的 --gpu-memory-utilization 可能导致 HBM 余量不足。

解决方案: 尽可能使用带有 --quantization ascend 的 W8A8 模型,降低 --max-model-len、--max-num-seqs、--max-num-batched-tokens,或减少 --gpu-memory-utilization。保持 PYTORCH_NPU_ALLOC_CONF=expandable_segments:True。

Q2:为什么启用前缀缓存没有提升性能?

现象: 已启用前缀缓存,但吞吐量或延迟没有改善。

原因: 前缀缓存仅在请求共享可重用前缀时才有帮助。对于随机提示或低缓存命中率,它可能会增加内存压力而没有明显收益。

解决方案: 为重复前缀的工作负载启用前缀缓存。对于随机基准数据集或内存受限的长上下文工作负载,请与 --no-enable-prefix-caching 进行比较。