Qwen3.6-35B-A3B¶
1 引言¶
Qwen3.6-35B-A3B 是 Qwen3.6 系列中的稀疏 MoE 模型,总参数量为 35B,每个 token 激活约 3B 参数。它采用了 Qwen3.5 风格模型使用的混合注意力架构,适用于在昇腾硬件上进行长上下文在线服务。
本文档描述了该模型的主要验证步骤,包括支持特性、前提条件、安装、单节点在线部署、功能验证、精度与性能评估、性能调优以及常见问题解答。
Qwen3.6-35B-A3B 模型首次在 vllm-ascend:v0.18.0rc1 中得到支持。请使用 v0.18.0rc1 或更高版本。以下示例使用文档构建系统配置的版本占位符。
2 支持特性¶
请参阅支持的特性获取该模型的支持特性,包括BF16、W8A8量化、分块预填充、自动前缀缓存、异步调度、张量并行、专家并行以及ACLGraph支持。
请参阅功能指南以获取功能配置详情。
3 前提条件¶
3.1 模型权重¶
| 权重版本 | 硬件要求 | 下载链接 |
|---|---|---|
Qwen3.6-35B-A3B(BF16 版本) |
1 个 Atlas A3 推理产品(64GB x 16)节点、1 个 Atlas A2 推理产品(64GB x 8)节点,或 Atlas 300I DUO | ModelScope |
Qwen3.6-35B-A3B-w8a8(量化版本) |
1 个 Atlas A3 推理产品(64GB x 16)节点、1 个 Atlas A2 推理产品(64GB x 8)节点,或 Atlas 300I DUO | ModelScope |
建议将模型权重下载到 /root/.cache/。
路径说明:将模型权重下载到您选择的目录并记录该路径。请确保后续部署命令中的模型路径与此目录一致。
4 安装¶
4.1 Docker 镜像安装¶
根据您的机器类型选择镜像。例如,对于Atlas A2推理产品,使用quay.io/ascend/vllm-ascend:v0.23.0;对于Atlas A3推理产品,使用quay.io/ascend/vllm-ascend:v0.23.0-a3;对于Atlas 300I DUO,使用quay.io/ascend/vllm-ascend:v0.23.0-310p。
完整的安装指南请参阅使用docker。
# Download the model weight to /root/.cache in advance.
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0-a3
export NAME=vllm-ascend
docker run --rm \
--name $NAME \
--net=host \
--shm-size=1g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci8 \
--device /dev/davinci9 \
--device /dev/davinci10 \
--device /dev/davinci11 \
--device /dev/davinci12 \
--device /dev/davinci13 \
--device /dev/davinci14 \
--device /dev/davinci15 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-it $IMAGE bash
# Download the model weight to /root/.cache in advance.
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0
export NAME=vllm-ascend
docker run --rm \
--name $NAME \
--net=host \
--shm-size=1g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-it $IMAGE bash
标准容器¶
# Use the vllm-ascend image
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0-310p
docker run --rm \
--name vllm-ascend \
--shm-size=10g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-p 8080:8080 \
-it $IMAGE bash
进入容器后,验证 vLLM 和 vLLM-Ascend 是否可以导入:
4.2 源码安装¶
您也可以从源码构建并安装vllm-ascend。请参阅使用python进行设置。
Note
对于Atlas 300I DUO,源码安装可能会引入triton和triton-ascend。在Atlas 300I DUO上运行vLLM-Ascend之前,请先卸载它们:
5 在线服务部署¶
5.1 单节点在线部署¶
单节点部署在同一节点上运行Prefill和Decode。Qwen3.6-35B-A3B-w8a8可以部署在1个Atlas A3推理产品(64G x 16)、1个Atlas A2推理产品(64G x 8)或Atlas 300I DUO上。W8A8版本需要--quantization ascend。
运行以下脚本,在1个Atlas A3推理产品(64G x 16)上执行上下文长度高达262144的在线推理。
#!/bin/sh
# Load model from ModelScope to speed up download.
export VLLM_USE_MODELSCOPE=True
export HCCL_BUFFSIZE=1024
export HCCL_OP_EXPANSION_MODE="AIV"
export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
# Reduce memory fragmentation and avoid out-of-memory errors.
echo performance | tee /sys/devices/system/cpu/cpu*/cpufreq/scaling_governor
sysctl -w vm.swappiness=0
sysctl -w kernel.numa_balancing=0
sysctl kernel.sched_migration_cost_ns=50000
# Ensure the model path matches the directory recorded during download
vllm serve Eco-Tech/Qwen3.6-35B-A3B-w8a8 \
--host 0.0.0.0 \
--port 8000 \
--data-parallel-size 1 \
--tensor-parallel-size 2 \
--enable-expert-parallel \
--seed 1024 \
--quantization ascend \
--served-model-name qwen3.6 \
--max-num-seqs 128 \
--max-model-len 262144 \
--max-num-batched-tokens 16384 \
--trust-remote-code \
--gpu-memory-utilization 0.90 \
--enable-prefix-caching \
--compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \
--additional-config '{"enable_cpu_binding":true, "multistream_overlap_shared_expert": true}'
关键参数:
--data-parallel-size 1和--tensor-parallel-size 2为默认的单节点服务示例设置DP和TP。--enable-expert-parallel为MoE层启用专家并行。不要在同一个MoE层中混合使用MoE张量并行和专家并行。--max-model-len是单个请求的最大输入加输出长度。仅在KV缓存充足时增加该值。--max-num-seqs是每个DP组调度的最大活动请求数。对于性能测试,设置--max-num-seqs * --data-parallel-size大于或等于测试并发数。--max-num-batched-tokens是单个调度步骤中处理的最大token数。较大的值可以提高预填充效率,但会消耗更多的激活内存。--gpu-memory-utilization控制vLLM可用于计算KV缓存容量的HBM量。较高的值会增加KV缓存大小,但如果运行时内存高于性能分析运行时的内存,则可能触发OOM。--enable-prefix-caching启用前缀缓存。对于长上下文服务,请监控内存使用情况,因为前缀缓存可能会增加KV缓存压力。--quantization ascend为W8A8模型启用Ascend量化。部署BF16模型时请移除该选项。--compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}'启用完整的解码ACLGraph重放以减少调度开销。
export VLLM_USE_MODELSCOPE=True
export ASCEND_RT_VISIBLE_DEVICES=0,1
# Ensure the model path matches the directory recorded during download
vllm serve Eco-Tech/Qwen3.6-35B-A3B-w8a8 \
--host 127.0.0.1 \
--port 8080 \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.90 \
--max-num-seqs 16 \
--served-model-name qwen3.6 \
--dtype float16 \
--additional-config '{"ascend_compilation_config": {"enable_npugraph_ex":false}}' \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,8]}' \
--quantization ascend \
--max-model-len 20480 \
--no-enable-prefix-caching
关键参数:
--tensor-parallel-size 2将模型映射到两个Atlas推理设备上。请根据可用设备和内存,将其与ASCEND_RT_VISIBLE_DEVICES一起调整。--dtype float16用于Atlas 300I DUO,以匹配Atlas推理执行路径。--max-num-seqs 16限制并发活动请求数,以减少Atlas 300I DUO上的KV缓存和图捕获压力。--gpu-memory-utilization控制KV缓存容量。如果启动或运行时请求报告OOM,请减小该值。- 需要
--additional-config,其中包含"ascend_compilation_config": {"enable_npugraph_ex": false},因为Atlas 300I DUO不支持enable_npugraph_ex。 --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [1,2,4,8,16]}'启用decode ACLGraph重放,并明确限制Atlas 300I DUO的捕获大小。--no-enable-prefix-caching是此Atlas 300I DUO示例的默认建议,以减少内存压力。--quantization ascend为W8A8模型启用Ascend量化。部署BF16模型时请移除该选项。- 要启用MTP推测解码,请使用--speculative_config '{"method": "mtp", "num_speculative_tokens": 1}'。我们建议将num_speculative_tokens设置为1。如果您的使用场景涉及少于两个并发请求,建议启用MTP。否则,建议不要启用MTP。
常见问题提示:如果服务启动失败、HBM不足或请求未按预期调度,请先参考公共FAQ,然后查看第10节中特定于模型的FAQ。
6 功能验证¶
服务器启动后,发送请求以验证模型基本功能。
curl http://<server_ip>:<port>/v1/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.6",
"prompt": "The future of AI is",
"max_tokens": 50,
"temperature": 0
}'
预期结果:HTTP 状态码为 200,JSON 响应包含带有生成文本的 choices 字段。
7 精度评估¶
以下是两种精度评估方法。
7.1 使用 AISBench¶
详情请参考使用 AISBench。执行后,您可以获得 Qwen3.6-35B-A3B-w8a8 的精度结果。
| dataset | version | metric | mode | vllm-api-general-chat |
|---|---|---|---|---|
| mmmu | - | accuracy | gen | 83.3 |
| gpqa | - | accuracy | gen | 83.3 |
7.2 使用 Language Model Evaluation Harness¶
安装和使用详情请参考使用 lm_eval。使用在线服务时,请将 base_url 设置为第5节中启动的端点。
lm_eval \
--model local-completions \
--model_args model=qwen3.6,base_url=http://127.0.0.1:8000/v1/completions,tokenized_requests=False,trust_remote_code=True \
--tasks gsm8k \
--output_path ./
8 性能评估¶
8.1 使用 AISBench¶
详情请参考使用 AISBench 进行性能评估。
8.2 使用 vLLM 基准测试¶
以 Qwen3.6-35B-A3B-w8a8 为例进行性能评估。更多详情请参考 vLLM 基准测试。
vllm bench 有三个子命令:
latency:对单批请求的延迟进行基准测试。serve:对在线服务吞吐量进行基准测试。throughput:对离线推理吞吐量进行基准测试。
以 serve 为例:
export VLLM_USE_MODELSCOPE=True
vllm bench serve \
--model Eco-Tech/Qwen3.6-35B-A3B-w8a8 \
--served-model-name qwen3.6 \
--dataset-name random \
--random-input 200 \
--num-prompts 200 \
--request-rate 1 \
--save-result \
--result-dir ./
几分钟后,您将获得性能评估结果。
9 性能调优¶
9.1 推荐配置¶
以下配置在特定测试环境中经过验证,仅供参考。最佳配置取决于硬件类型、最大输入/输出长度、请求并发数、前缀缓存命中率和量化方式。请根据实际工作负载调整第9.2节中的参数。
| 场景 | 部署模式 | NPU总数 | 权重版本 | 关键考量 |
|---|---|---|---|---|
| 长上下文 | 单节点在线服务 | 2个或更多NPU | W8A8 | 使用更大的--max-model-len并预留足够的KV缓存。如果发生OOM,则降低--max-num-seqs。 |
| 高吞吐量 | 单节点在线服务 | 8个或更多NPU | W8A8 | 增加节点内的本地DP组,并调整--max-num-batched-tokens。 |
| 低延迟 | 单节点在线服务 | 2个或更多NPU | W8A8 | 使用更小的--max-num-batched-tokens、全解码ACLGraph,并默认禁用推测解码。 |
| 场景 | 节点角色 | NPU数量 | TP | DP | 最大序列数 | 最大模型长度 | 最大批量Token数 | 前缀缓存 | 主要优化 |
|---|---|---|---|---|---|---|---|---|---|
| Long context | Single node | 2 or more | 2 | 1 | 128 | 262144 | 16384 | On | FullGraph, sequence parallelism, shared expert overlap, CPU binding |
| High throughput | Single node | 8 or more | 2 | 4 or more | 32 per DP | 65536 | 8192 | On | FullGraph, sequence parallelism, async scheduling, shared expert overlap |
| Low latency | Single node | 2 or more | 2 | 1 | Tune by concurrency | 32768 or 65536 | 1024 to 4096 | Workload dependent | FullGraph, CPU binding, speculative decoding disabled |
9.2 调优指南¶
有关通用调优方法,请参阅公共性能调优文档,有关功能描述,请参阅功能矩阵。
推荐的调优顺序:
- 使用单节点部署。如果需要更高的吞吐量,请在同一节点内增加本地DP组。
- 使用
--max-model-len选择最大上下文长度。长上下文会增加KV缓存使用量,因此如果发生OOM,请减少--max-num-seqs或--gpu-memory-utilization。 - 调整
--max-num-batched-tokens。较大的值通常可以提高预填充吞吐量,但会增加激活内存。解码密集型工作负载通常需要较小的值。 - 根据服务并发数调整
--max-num-seqs。超过此值的请求将在队列中等待,等待时间计入TTFT和TPOT。 - 调整
--gpu-memory-utilization。增加该值以提供更多KV缓存,但需为运行时内存波动和专家不平衡留出余量。 - 调整ACLGraph捕获。对于解码,建议使用
FULL_DECODE_ONLY。如果手动设置cudagraph_capture_sizes,请包含常见的解码批处理大小。使用序列并行时,请使用TP大小的倍数作为捕获大小。
9.3 模型特定优化¶
| 优化项 | 启用方式 | 收益 | 备注 |
|---|---|---|---|
| 混合注意力支持 | 由模型实现启用 | 支持Qwen3.6长上下文推理。 | 根据KV缓存容量调整上下文长度。 |
| 全解码ACLGraph | --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' |
减少算子分发开销,稳定解码性能。 | 推荐用于解码密集型服务。 |
| 共享专家重叠 | --additional-config '{"multistream_overlap_shared_expert": true}' |
在MoE工作负载中重叠共享专家计算。 | 推荐用于吞吐量场景。 |
| 前缀缓存 | --enable-prefix-caching |
改善重复前缀工作负载。 | 对于长上下文工作负载,监控HBM使用情况。 |
| Qwen3.6 MTP推测解码 | --speculative-config '{"method": "qwen3_5_mtp", "num_speculative_tokens": 3, "enforce_eager": true}' |
当稳定且被接受的token数量较高时,可提高解码吞吐量。 | 验证工作负载的稳定性、TTFT、TPOT和吞吐量。 |
10 常见问题解答¶
对于常见的环境、安装和通用参数问题,请参考公共FAQ。本节仅涵盖Qwen3.6-35B-A3B模型特有的问题。
Q1:为什么服务在启动时或接受请求后不久报告 OOM?¶
现象: 服务在性能分析运行期间失败,或者成功启动但在真实流量到来时报告 OOM。
原因: Qwen3.6 长上下文服务会消耗大量 KV 缓存。较大的 --max-model-len、--max-num-seqs、--max-num-batched-tokens 或较高的 --gpu-memory-utilization 可能导致 HBM 余量不足。
解决方案: 尽可能使用带有 --quantization ascend 的 W8A8 模型,降低 --max-model-len、--max-num-seqs、--max-num-batched-tokens,或减少 --gpu-memory-utilization。保持 PYTORCH_NPU_ALLOC_CONF=expandable_segments:True。
Q2:为什么启用前缀缓存没有提升性能?¶
现象: 已启用前缀缓存,但吞吐量或延迟没有改善。
原因: 前缀缓存仅在请求共享可重用前缀时才有帮助。对于随机提示或低缓存命中率,它可能会增加内存压力而没有明显收益。
解决方案: 为重复前缀的工作负载启用前缀缓存。对于随机基准数据集或内存受限的长上下文工作负载,请与 --no-enable-prefix-caching 进行比较。