GLM-5/GLM-5.1¶
1 引言¶
本文档同时适用于 GLM-5 和 GLM-5.1。除非另有说明,本文档中所有关于 GLM-5 的描述、配置和部署流程同样适用于 GLM-5.1。为简洁起见,下文统一使用 GLM-5 指代 GLM-5 和 GLM-5.1。
GLM-5 采用混合专家(MoE)架构,面向复杂的系统工程和长周期智能体任务。
GLM-5 模型首次在 vllm-ascend:v0.17.0rc1 中得到支持,所有 v0.17.0rc1 及更高版本 均可稳定运行。如需使用最新特性(如 PD 分离、MTP),建议使用最新的候选发布版或正式版。transformers 版本需升级至 5.2.0 或更高版本。
本文档将展示该模型的主要验证步骤,包括支持的特性、特性配置、环境准备、单节点和多节点部署、精度及性能评估。
2 支持的特性¶
请参考支持的特性获取模型支持的特性矩阵。
请参考特性指南获取特性的配置方法。
3 前提条件¶
3.1 模型权重¶
GLM-5(BF16版本):下载模型权重。GLM-5-w4a8(量化版本):下载模型权重。GLM-5-w8a8(量化版本):下载模型权重。GLM-5.1(BF16版本):下载模型权重。GLM-5.1-w4a8(量化版本):下载模型权重。GLM-5.1-w8a8(量化版本):下载模型权重。
建议将模型权重下载到多节点的共享目录中,例如 /root/.cache/
3.2 验证多节点通信(可选)¶
如果需要多节点部署,请按照验证多节点通信环境指南进行通信验证。
4 安装¶
4.1 Docker 镜像安装¶
您可以直接使用我们的官方 Docker 镜像来运行 GLM-5/5.1。
在每个节点上启动docker镜像。
export IMAGE=quay.io/ascend/vllm-ascend:v0.22.1rc1-a3
export NAME=vllm-ascend
# Run the container using the defined variables
# Note: If you are running bridge network with docker, please expose available ports for multiple nodes communication in advance
docker run --rm \
--name $NAME \
--net=host \
--shm-size=1g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci8 \
--device /dev/davinci9 \
--device /dev/davinci10 \
--device /dev/davinci11 \
--device /dev/davinci12 \
--device /dev/davinci13 \
--device /dev/davinci14 \
--device /dev/davinci15 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-it $IMAGE bash
在每个节点上启动docker镜像。
export IMAGE=quay.io/ascend/vllm-ascend:v0.22.1rc1
docker run --rm \
--name vllm-ascend \
--shm-size=1g \
--net=host \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-it $IMAGE bash
如果要部署多节点环境,需要在每个节点上进行环境设置。
要验证环境是否安装成功,请参考安装指南。
4.2 源码安装¶
此外,如果您不想使用上述 Docker 镜像,也可以从源码构建所有内容:
- 从源码安装
vllm-ascend,请参考安装指南。
如果要部署多节点环境,需要在每个节点上进行环境设置。
5 在线服务部署¶
5.1 单节点在线部署¶
- 量化模型
glm-5-w4a8和glm-5.1-w4a8可部署在1台Atlas 800 A3(64GB × 16)上。
运行以下脚本执行在线推理。
常见问题提示:如果遇到问题,请参考常见问题解答。
# The version of transformers needs to be upgraded to 5.2.0.
# pip install transformers==5.2.0 --upgrade
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w4a8 \
--host 0.0.0.0 \
--port 8077 \
--data-parallel-size 1 \
--tensor-parallel-size 16 \
--enable-expert-parallel \
--seed 1024 \
--served-model-name glm-5 \
--max-num-seqs 16 \
--max-model-len 200000 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--quantization ascend \
--enable-chunked-prefill \
--enable-prefix-caching \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
- 量化模型
glm-5-w8a8和glm-5.1-w8a8可部署在1台Atlas 800 A3(64GB × 16)上。
运行以下脚本执行在线推理。
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export VLLM_ASCEND_ENABLE_MLAPO=1
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \
--host 0.0.0.0 \
--port 8077 \
--data-parallel-size 1 \
--tensor-parallel-size 16 \
--enable-expert-parallel \
--seed 1024 \
--served-model-name glm-5 \
--max-num-seqs 16 \
--max-model-len 40960 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--quantization ascend \
--enable-chunked-prefill \
--enable-prefix-caching \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
- 量化模型
glm-5-w4a8可部署在1台Atlas 800 A2(64GB × 8)上。
运行以下脚本执行在线推理。
常见问题提示:如果遇到问题,请参考常见问题解答。
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w4a8 \
--host 0.0.0.0 \
--port 8077 \
--data-parallel-size 1 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--seed 1024 \
--served-model-name glm-5 \
--max-num-seqs 8 \
--max-model-len 32768 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--quantization ascend \
--enable-chunked-prefill \
--enable-prefix-caching \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
关键参数说明:
以下仅描述该模型/场景特有的关键参数。max-model-len 和 max-num-seqs 需要根据实际使用场景进行设置。
模型特有参数:
--enable-expert-parallel:必须为 GLM-5 的 MoE 架构启用。--tensor-parallel-size 16/--tensor-parallel-size 8:每个 DP rank 内的张量并行度。对于 A3(16 个 NPU),使用tp16;对于 A2(8 个 NPU),使用tp8。--quantization ascend:为 w4a8/w8a8 量化权重启用 Ascend 量化。--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}':使用 GLM-5 的 DeepSeek 风格 MTP 草稿模型启用多 token 预测(MTP)投机解码。num_speculative_tokens(3-5)控制每步推测的 token 数量;enforce_eager: true是必需的,因为 GLM-5 不支持图模式投机解码。--enable-chunked-prefill/--enable-prefix-caching:推荐用于长上下文和多用户场景——chunked prefill 拆分长提示以改善 TTFT,prefix caching 为共享前缀(如系统提示)复用 KV cache。--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}':仅对解码阶段启用图捕获,通过减少内核启动开销来提升解码性能。--additional-config '{"multistream_overlap_shared_expert": true}':在额外的流上重叠共享专家计算。注意:当VLLM_ASCEND_ENABLE_FUSED_MC2=1时自动禁用,因为这两种优化存在冲突。
关键环境变量:
VLLM_ASCEND_ENABLE_FLASHCOMM1=1:启用 FlashComm 优化以减少通信开销(主要有利于 prefill 路径)。启用 FlashComm 后,layer_sharding不能包含o_proj。VLLM_ASCEND_ENABLE_MLAPO=1:启用 MLA 预处理融合算子(MlaPreprocessOperation)。对于 w8a8 模型默认启用——显著提升 Decode 性能但消耗更多 NPU 内存;如果内存优先,请设置VLLM_ASCEND_ENABLE_MLAPO=0。推荐用于 w8a8;w4a8 可能无法受益。VLLM_ASCEND_BALANCE_SCHEDULING=1:启用平衡调度以提升 v1 调度器的输出吞吐量并降低 TPOT。
单节点性能调优说明:
- 对于低延迟场景,使用
dp1tp16(data-parallel-size 1,tensor-parallel-size 16),并考虑减小--max-num-seqs和--max-num-batched-tokens。 - 对于高吞吐量场景,增大
--max-num-seqs并启用--enable-prefix-caching。 - 对于长上下文场景(如 200K),使用 w8a8 权重(为 KV cache 留出更多内存),并将
--max-model-len设置为所需的上下文长度。考虑启用--enable-chunked-prefill。 - 如果遇到 OOM,请减小
--gpu-memory-utilization、--max-num-seqs或--max-model-len。禁用VLLM_ASCEND_ENABLE_MLAPO也可以减少内存使用(以性能为代价)。
5.2 多节点部署¶
如果要部署多节点环境,需要按照验证多节点通信环境进行多节点通信验证。
常见问题提示:如果遇到问题,请参考常见问题解答。
glm-5-bf16和glm-5.1-bf16:至少需要2台Atlas 800 A3(64GB × 16)。
分别在两个节点上运行以下脚本。
节点 0
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-bf16 \
--host 0.0.0.0 \
--port 8077 \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12890 \
--tensor-parallel-size 16 \
--seed 1024 \
--served-model-name glm-5 \
--enable-expert-parallel \
--max-num-seqs 16 \
--max-model-len 8192 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
节点 1
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-bf16 \
--host 0.0.0.0 \
--port 8077 \
--headless \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-start-rank 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12890 \
--tensor-parallel-size 16 \
--seed 1024 \
--served-model-name glm-5 \
--enable-expert-parallel \
--max-num-seqs 16 \
--max-model-len 8192 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
分别在两个节点上运行以下脚本。
节点 0
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w4a8 \
--host 0.0.0.0 \
--port 8077 \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 13389 \
--tensor-parallel-size 8 \
--quantization ascend \
--seed 1024 \
--served-model-name glm-5 \
--enable-expert-parallel \
--max-num-seqs 2 \
--max-model-len 131072 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
节点 1
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w4a8 \
--host 0.0.0.0 \
--port 8077 \
--headless \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-start-rank 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 13389 \
--tensor-parallel-size 8 \
--quantization ascend \
--seed 1024 \
--served-model-name glm-5 \
--enable-expert-parallel \
--max-num-seqs 2 \
--max-model-len 131072 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
- 对于 bf16 权重,在每个节点上使用此脚本启用多 Token 预测(MTP)。
# adjust_weight.py
from safetensors.torch import safe_open, save_file
import torch
import json
import os
import sys
target_keys = ["model.embed_tokens.weight", "lm_head.weight"]
def get_tensor_info(file_path):
with safe_open(file_path, framework="pt", device="cpu") as f:
tensor_names = f.keys()
tensor_dict = {}
for name in tensor_names:
tensor = f.get_tensor(name)
tensor_dict[name] = tensor
return tensor_dict
if __name__ == "__main__":
directory_path = sys.argv[1]
json_name = "model.safetensors.index.json"
json_path = os.path.join(directory_path, json_name)
with open(json_path, 'r', encoding='utf-8') as f:
json_data = json.load(f)
weight_map = json_data.get('weight_map', {})
file_list = []
for key in target_keys:
safetensor_file = weight_map.get(key)
file_list.append(directory_path + safetensor_file)
new_dict = {}
for file_path in file_list:
tensor_dict = get_tensor_info(file_path)
for key in target_keys:
if key in tensor_dict:
if key == "model.embed_tokens.weight":
new_key = "model.layers.78.embed_tokens.weight"
elif key == "lm_head.weight":
new_key = "model.layers.78.shared_head.head.weight"
new_dict[new_key] = tensor_dict[key]
new_file_name = os.path.join(directory_path, "mtp-others.safetensors")
new_keys = ["model.layers.78.embed_tokens.weight", "model.layers.78.shared_head.head.weight"]
save_file(tensors=new_dict, filename=new_file_name)
for key in new_keys:
json_data["weight_map"][key] = "mtp-others.safetensors"
with open(json_path, 'w', encoding='utf-8') as f:
json.dump(json_data, f, indent=2)
glm-5-w8a8:需要2台Atlas 800 A3(64GB × 16)。
分别在两个节点上运行以下脚本。
节点 0
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export VLLM_ASCEND_ENABLE_MLAPO=1
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \
--host 0.0.0.0 \
--port 8077 \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12890 \
--tensor-parallel-size 16 \
--seed 1024 \
--served-model-name glm-5 \
--enable-expert-parallel \
--max-num-seqs 16 \
--max-model-len 200000 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--quantization ascend \
--enable-chunked-prefill \
--enable-prefix-caching \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
节点 1
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_ASCEND_BALANCE_SCHEDULING=1
export VLLM_ASCEND_ENABLE_MLAPO=1
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \
--host 0.0.0.0 \
--port 8077 \
--headless \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-start-rank 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12890 \
--tensor-parallel-size 16 \
--seed 1024 \
--served-model-name glm-5 \
--enable-expert-parallel \
--max-num-seqs 16 \
--max-model-len 200000 \
--max-num-batched-tokens 4096 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--quantization ascend \
--enable-chunked-prefill \
--enable-prefix-caching \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}'
多节点部署的关键参数说明:
除了单节点在线部署中描述的所有单节点参数外,以下参数专门用于多节点部署:
网络和数据并行配置:
HCCL_IF_IP、GLOO_SOCKET_IFNAME、TP_SOCKET_IFNAME、HCCL_SOCKET_IFNAME:多节点通信的网络接口配置。将nic_name设置为网络接口名称(通过ifconfig获取),将local_ip设置为当前节点的 IP 地址。每个节点都必须正确配置这些参数,多节点通信才能成功。--data-parallel-size:所有节点上的数据并行 rank 总数。对于 2 节点部署,通常设置为2。--data-parallel-size-local:当前节点上的数据并行 rank 数。通常设置为1(每个节点一个 DP rank)。--data-parallel-address:数据并行主节点(节点 0)的 IP 地址。必须与主节点的local_ip匹配。--data-parallel-rpc-port:数据并行主节点通信的 RPC 端口。所有节点必须相同。--headless:表示这是非主节点。不要在节点 0 上使用。--data-parallel-start-rank:此节点上数据并行 rank 的起始 rank 偏移量。节点 0 使用0,节点 1 使用1。
多节点性能调优:
- 对于低延迟多节点场景,保持
--data-parallel-size-local 1以最小化跨节点通信。 --max-num-seqs应根据模型加载后可用的 KV cache 内存进行调整。对于 A3 多节点上的 w8a8,推荐使用16。对于 A2 多节点上长上下文的 w4a8,从2开始,如果内存允许则增大。- 多节点部署中的所有节点必须使用相同的
--tensor-parallel-size、--enable-expert-parallel和模型权重路径配置。
5.3 预填充-解码分离¶
我们将在多节点环境中展示 GLM-5 的部署指南,采用 1P1D 配置以获得更佳性能。预填充-解码分离 指的是将预填充阶段和解码阶段分散到不同节点上,以提升吞吐量和降低延迟。
开始之前,请
-
在每个节点上准备脚本
launch_online_dp.py:import argparse import multiprocessing import os import subprocess import sys def parse_args(): parser = argparse.ArgumentParser() parser.add_argument( "--dp-size", type=int, required=True, help="Data parallel size." ) parser.add_argument( "--tp-size", type=int, default=1, help="Tensor parallel size." ) parser.add_argument( "--dp-size-local", type=int, default=-1, help="Local data parallel size." ) parser.add_argument( "--dp-rank-start", type=int, default=0, help="Starting rank for data parallel." ) parser.add_argument( "--dp-address", type=str, required=True, help="IP address for data parallel master node." ) parser.add_argument( "--dp-rpc-port", type=str, default=12345, help="Port for data parallel master node." ) parser.add_argument( "--vllm-start-port", type=int, default=9000, help="Starting port for the engine." ) return parser.parse_args() args = parse_args() dp_size = args.dp_size tp_size = args.tp_size dp_size_local = args.dp_size_local if dp_size_local == -1: dp_size_local = dp_size dp_rank_start = args.dp_rank_start dp_address = args.dp_address dp_rpc_port = args.dp_rpc_port vllm_start_port = args.vllm_start_port def run_command(visible_devices, dp_rank, vllm_engine_port): command = [ "bash", "./run_dp_template.sh", visible_devices, str(vllm_engine_port), str(dp_size), str(dp_rank), dp_address, dp_rpc_port, str(tp_size), ] subprocess.run(command, check=True) if __name__ == "__main__": template_path = "./run_dp_template.sh" if not os.path.exists(template_path): print(f"Template file {template_path} does not exist.") sys.exit(1) processes = [] num_cards = dp_size_local * tp_size for i in range(dp_size_local): dp_rank = dp_rank_start + i vllm_engine_port = vllm_start_port + i visible_devices = ",".join(str(x) for x in range(i * tp_size, (i + 1) * tp_size)) process = multiprocessing.Process(target=run_command, args=(visible_devices, dp_rank, vllm_engine_port)) processes.append(process) process.start() for process in processes: process.join() -
在每个节点上准备脚本
run_dp_template.sh。-
预填充节点 0
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ASCEND_AGGREGATE_ENABLE=1 export ASCEND_TRANSPORT_PRINT=1 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 # Timeout (in seconds) for automatically releasing the prefiller’s KV cache for a particular request. export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480 export ASCEND_RT_VISIBLE_DEVICES=$1 export VLLM_ASCEND_ENABLE_FLASHCOMM1=1 export VLLM_ASCEND_ENABLE_FUSED_MC2=1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \ --host 0.0.0.0 \ --port $2 \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens": 1, "method":"deepseek_mtp", "enforce_eager": true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 131072 \ --additional-config '{"enable_dsa_cp": true}' \ --max-num-batched-tokens 4096 \ --trust-remote-code \ --max-num-seqs 64 \ --enable-chunked-prefill \ --quantization ascend \ --gpu-memory-utilization 0.95 \ --enforce-eager \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_producer", "kv_port": "30000", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 2, "tp_size": 16 }, "decode": { "dp_size": 16, "tp_size": 4 } } }' -
预填充节点 1
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ASCEND_AGGREGATE_ENABLE=1 export ASCEND_TRANSPORT_PRINT=1 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 # Timeout (in seconds) for automatically releasing the prefiller’s KV cache for a particular request. export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480 export ASCEND_RT_VISIBLE_DEVICES=$1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export VLLM_ASCEND_ENABLE_FLASHCOMM1=1 export VLLM_ASCEND_ENABLE_FUSED_MC2=1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \ --host 0.0.0.0 \ --port $2 \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens": 1, "method":"deepseek_mtp", "enforce_eager": true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 131072 \ --additional-config '{"enable_dsa_cp": true}' \ --max-num-batched-tokens 4096 \ --trust-remote-code \ --max-num-seqs 64 \ --enable-chunked-prefill \ --gpu-memory-utilization 0.95 \ --quantization ascend \ --enforce-eager \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_producer", "kv_port": "30000", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 2, "tp_size": 16 }, "decode": { "dp_size": 16, "tp_size": 4 } } }' -
解码节点 0
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name #Mooncake export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ASCEND_AGGREGATE_ENABLE=1 export ASCEND_TRANSPORT_PRINT=1 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 # Timeout (in seconds) for automatically releasing the prefiller’s KV cache for a particular request. export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480 export TASK_QUEUE_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export VLLM_ASCEND_ENABLE_FUSED_MC2=1 export VLLM_ASCEND_ENABLE_MLAPO=1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \ --host 0.0.0.0 \ --port $2 \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens": 3, "method":"deepseek_mtp", "enforce_eager": true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 200000 \ --max-num-batched-tokens 32 \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \ --additional-config '{"recompute_scheduler_enable": true}' \ --trust-remote-code \ --max-num-seqs 8 \ --gpu-memory-utilization 0.92 \ --quantization ascend \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_consumer", "kv_port": "30100", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 2, "tp_size": 16 }, "decode": { "dp_size": 16, "tp_size": 4 } } }' -
解码节点 1
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name #Mooncake export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ASCEND_AGGREGATE_ENABLE=1 export ASCEND_TRANSPORT_PRINT=1 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 # Timeout (in seconds) for automatically releasing the prefiller’s KV cache for a particular request. export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480 export TASK_QUEUE_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export VLLM_ASCEND_ENABLE_FUSED_MC2=1 export VLLM_ASCEND_ENABLE_MLAPO=1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \ --host 0.0.0.0 \ --port $2 \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens": 3, "method":"deepseek_mtp", "enforce_eager": true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 200000 \ --max-num-batched-tokens 32 \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \ --additional-config '{"recompute_scheduler_enable": true}' \ --trust-remote-code \ --max-num-seqs 8 \ --gpu-memory-utilization 0.92 \ --quantization ascend \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_consumer", "kv_port": "30100", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 2, "tp_size": 16 }, "decode": { "dp_size": 16, "tp_size": 4 } } }' -
解码节点 2
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name #Mooncake export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ASCEND_AGGREGATE_ENABLE=1 export ASCEND_TRANSPORT_PRINT=1 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 # Timeout (in seconds) for automatically releasing the prefiller’s KV cache for a particular request. export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480 export TASK_QUEUE_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export VLLM_ASCEND_ENABLE_FUSED_MC2=1 export VLLM_ASCEND_ENABLE_MLAPO=1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \ --host 0.0.0.0 \ --port $2 \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens": 3, "method":"deepseek_mtp", "enforce_eager": true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 200000 \ --max-num-batched-tokens 32 \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \ --additional-config '{"recompute_scheduler_enable": true}' \ --trust-remote-code \ --max-num-seqs 8 \ --gpu-memory-utilization 0.92 \ --quantization ascend \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_consumer", "kv_port": "30100", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 2, "tp_size": 16 }, "decode": { "dp_size": 16, "tp_size": 4 } } }' -
解码节点 3
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name #Mooncake export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ASCEND_AGGREGATE_ENABLE=1 export ASCEND_TRANSPORT_PRINT=1 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 # Timeout (in seconds) for automatically releasing the prefiller’s KV cache for a particular request. export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480 export TASK_QUEUE_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export VLLM_ASCEND_ENABLE_FUSED_MC2=1 export VLLM_ASCEND_ENABLE_MLAPO=1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM5-w8a8 \ --host 0.0.0.0 \ --port $2 \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens": 3, "method":"deepseek_mtp", "enforce_eager": true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 200000 \ --max-num-batched-tokens 32 \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \ --additional-config '{"recompute_scheduler_enable": true}' \ --trust-remote-code \ --max-num-seqs 8 \ --gpu-memory-utilization 0.92 \ --quantization ascend \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_consumer", "kv_port": "30100", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 2, "tp_size": 16 }, "decode": { "dp_size": 16, "tp_size": 4 } } }'
-
准备工作完成后,可以在每个节点上使用以下命令启动服务器:
-
预填充节点 0
-
预填充节点 1
-
解码节点 0
-
解码节点 1
-
解码节点 2
-
解码节点 3
5.4 请求转发¶
要设置请求转发,请在任意机器上运行以下脚本。您可以在仓库的示例中获取代理程序:load_balance_proxy_server_example.py
unset http_proxy
unset https_proxy
python load_balance_proxy_server_example.py \
--port 8000 \
--host 0.0.0.0 \
--prefiller-hosts \
$node_p0_ip \
$node_p1_ip \
--prefiller-ports \
6700 \
6700 \
--decoder-hosts \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d2_ip \
$node_d2_ip \
$node_d2_ip \
$node_d2_ip \
$node_d3_ip \
$node_d3_ip \
$node_d3_ip \
$node_d3_ip \
--decoder-ports \
6721 6722 6723 6724 \
6721 6722 6723 6724 \
6721 6722 6723 6724 \
6721 6722 6723 6724
PD 分离部署的关键参数说明:
除了上述单节点和多节点参数外,以下参数专门用于 Prefill-Decode 分离:
Mooncake KV 传输配置(--kv-transfer-config):
"kv_connector": "MooncakeConnectorV1":使用 Mooncake 作为 prefill 和 decode 节点之间的 KV 缓存传输连接器。"kv_role": "kv_producer":在 prefill 节点上设置 — 生成 KV 缓存并将其发送到 decode 节点。在 decode 节点上使用"kv_consumer"。"kv_port":Mooncake KV 传输通信的端口。每个节点组应使用不同的端口范围。"use_ascend_direct": true:启用 Ascend 直接(类似 RDMA)传输 KV 缓存,降低延迟。"prefill"/"decode"部分:分别指定 prefill 和 decode 节点组的dp_size和tp_size。这些必须与实际部署拓扑匹配。
Prefill 节点特定配置:
VLLM_ASCEND_ENABLE_FUSED_MC2=1:启用融合 MC2 算子(dispatch_ffn_combine/mega_moe)以优化 MoE 通信。约束:dispatch_ffn_combine仅适用于 w8a8 且 EP≤32;mega_moe适用于 w8a8/w4a8/bf16 且 EP≤64。两者均与 MTP 和动态 EPLB 不兼容。--additional-config '{"enable_dsa_cp": true}':在 prefill 节点上启用 DSA 上下文并行,加速长上下文 prefill。处理高达 128K token 的提示词时需要此配置。
Decode 节点特定配置:
VLLM_ASCEND_ENABLE_MLAPO=1:在 decode 节点上启用 MLA 预处理操作融合,显著提升 decode 性能。消耗更多 NPU 内存。在 PD 场景中,仅在 decode 节点上启用 MLAPO。--max-num-batched-tokens 32:decode 节点上的小批量 token 限制 — decode 每步每个序列处理一个 token,因此批量 token 应接近max-num-seqs。--additional-config '{"recompute_scheduler_enable": true}':启用重计算调度器。当 decode 节点 KV 缓存不足时,请求被发送回 prefill 节点进行 KV 缓存重计算。建议在 PD 场景中的 prefill 和 decode 节点上都启用。
常见 PD 环境变量:
ASCEND_AGGREGATE_ENABLE=1,ASCEND_A3_ENABLE=1:A3 特定的通信聚合优化。ACL_OP_INIT_MODE=1:ACL 算子初始化模式。VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480:请求中止时自动释放 prefill 节点 KV 缓存的超时时间(秒)。LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib:Mooncake 库加载所需。
PD 场景中的 MTP:
- Prefill 节点通常使用
"num_speculative_tokens": 1进行 MTP(prefill 期间最小化推测)。 - Decode 节点使用
"num_speculative_tokens": 3进行 MTP 以最大化 decode 吞吐量。 - Prefill 和 decode 节点必须使用相同的
"method": "deepseek_mtp"和"enforce_eager": true。
有关上述环境变量的进一步说明和限制,请参阅:envs.py。
6 功能验证¶
服务器启动后,您可以使用输入提示来查询模型:
curl http://<node0_ip>:<port>/v1/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5",
"prompt": "The future of AI is",
"max_completion_tokens": 15,
"temperature": 0
}'
预期结果:
{"id": "chatcmlib-bc44ad093dec79a2", "object": "chat.completion", "created": "1770903266", "model": "glm-5", "choices": [{ "index": 0, "message": {"role": "assistant", "content": "The future of AI is not one thing, but a convergence of several powerful trends.", "annotations": "null", "audio": "null", "function_call": "null", "tool_calls": [], "reasoning": "null"}, "logprobs": "null", "finish_reason": "length", "stop_reason": "null", "token_ids": null}], "service_tier": "null", "system fingerprint": "null", "usage": {"prompt_tokens": 5, "total_tokens": 20, "completion_tokens": 15, "prompt_tokens_details": null}, "prompt_logprobs": "null", "prompt_token_ids": "null", "kv_transfer_params": null}
7 精度评估¶
7.1 使用 AISBench¶
-
有关详细信息,请参阅 使用 AISBench。
-
执行后,您可以获取结果。
8 性能评估¶
8.1 使用 AISBench¶
有关详细信息,请参阅 使用 AISBench 进行性能评估。
8.2 使用 vLLM Benchmark¶
更多详情请参考vllm基准测试。
9 性能调优¶
9.1 推荐配置¶
注意:以下配置在特定测试环境中验证,仅供参考。最佳配置取决于最大输入/输出长度、前缀缓存命中率、精度要求和部署机器比例等因素。建议参考调优指南根据实际情况进行调优。
下表提供了不同部署场景的推荐参数配置。所有场景按用例分类(高吞吐量、低延迟、长上下文),并对应于在线服务部署中记录的部署模式。
9.1.1 表 1:场景概述¶
*NPU 总数表示所有节点上使用的 NPU 总数。1 个节点 = 1 台 Atlas 800 A3 服务器(64G × 16 NPU)或 1 台 Atlas 800 A2 服务器(64G × 8 NPU)。
| 场景 | 部署模式 | *NPU 总数 | 权重版本 | 关键考虑因素 |
|---|---|---|---|---|
| 低延迟 (64K 输入) |
PD 分离,Prefill-Decode 分离 | 4 个节点(A3) | w8a8c8 | P:dp4 tp8(max-num-seqs 64,max-num-batched-tokens 8192);D:dp8 tp4(max-num-seqs 32,max-num-batched-tokens 164);MTP3,max-model-len 202752,Mooncake KV 传输 |
| 低延迟 (128K 输入) |
PD 分离,Prefill-Decode 分离 | 4 个节点(A3) | w8a8c8 | P:dp4 tp8(max-num-seqs 64,max-num-batched-tokens 8192);D:dp8 tp4(max-num-seqs 32,max-num-batched-tokens 164);MTP3,max-model-len 202752,Mooncake KV 传输 |
| 高吞吐量 (64K 输入) |
PD 分离,Prefill-Decode 分离 | 4 个节点(A3) | w8a8c8 | P:dp4 tp8(max-num-seqs 64,max-num-batched-tokens 8192);D:dp8 tp4(max-num-seqs 32,max-num-batched-tokens 164);MTP3,max-model-len 202752,Mooncake KV 传输 |
| 高吞吐量 (128K 输入) |
PD 分离,Prefill-Decode 分离 | 4 个节点(A3) | w8a8c8 | P:dp4 tp8(max-num-seqs 64,max-num-batched-tokens 8192);D:dp8 tp4(max-num-seqs 32,max-num-batched-tokens 164);MTP3,max-model-len 202752,Mooncake KV 传输 |
| 长上下文 (198K 输入) |
PD 分离,Prefill-Decode 分离 | 4 个节点(A3) | w8a8c8 | P:dp4 tp8(max-num-seqs 64,max-num-batched-tokens 8192);D:dp8 tp4(max-num-seqs 32,max-num-batched-tokens 164);MTP3,max-model-len 202752,Mooncake KV 传输 |
9.1.2 表 2:详细节点配置¶
TP/DP 列显示部署脚本中配置的每节点值(一个承载 2 个 TP8 DP rank 的 prefill 节点使用 16 个 NPU;一个承载 4 个 TP4 DP rank 的 decode 节点使用 16 个 NPU)。
| 场景 | 配置 | NPU数量 | TP | DP | 最大序列数 | 最大批处理令牌数 | 最大模型长度 | MTP推测数 |
|---|---|---|---|---|---|---|---|---|
| Low Latency 64K (A3) | PD — Server-P Node | 16 | 8 | 2 | 64 | 8192 | 202752 | 3 |
| Low Latency 64K (A3) | PD — Server-D Node | 16 | 4 | 4 | 32 | 164 | 202752 | 3 |
| Low Latency 128K (A3) | PD — Server-P Node | 16 | 8 | 2 | 64 | 8192 | 202752 | 3 |
| Low Latency 128K (A3) | PD — Server-D Node | 16 | 4 | 4 | 32 | 164 | 202752 | 3 |
| High Throughput 64K (A3) | PD — Server-P Node | 16 | 8 | 2 | 64 | 8192 | 202752 | 3 |
| High Throughput 64K (A3) | PD — Server-D Node | 16 | 4 | 4 | 32 | 164 | 202752 | 3 |
| High Throughput 128K (A3) | PD — Server-P Node | 16 | 8 | 2 | 64 | 8192 | 202752 | 3 |
| High Throughput 128K (A3) | PD — Server-D Node | 16 | 4 | 4 | 32 | 164 | 202752 | 3 |
| Long Context 198K (A3) | PD — Server-P Node | 16 | 8 | 2 | 64 | 8192 | 202752 | 3 |
| Long Context 198K (A3) | PD — Server-D Node | 16 | 4 | 4 | 32 | 164 | 202752 | 3 |
有关完整的启动命令和详细的参数说明,请参阅在线服务部署中的部署示例和关键参数说明。
9.1.3 表3:性能相关参数调优指南¶
| 参数 | 低延迟 | 高吞吐 | 长上下文 | 描述 |
|---|---|---|---|---|
--max-num-seqs |
较低(4–8) | 较高(16–64) | 受控(2–8) | 限制并发序列数。较低的值可减少调度延迟;较高的值可提高吞吐量。 |
--max-model-len |
较短(32K–40K) | 较长(128K–200K) | 最大(128K–200K) | 最大上下文长度。必须容纳最长的输入+输出。较大的值会消耗更多KV缓存内存。 |
--max-num-batched-tokens |
较低(2048–4096) | 较高(4096–8192) | 预填充时较高(4096) | 控制每步的批处理大小。较低的值可减少每步延迟;较高的值可提高预填充吞吐量。 |
--gpu-memory-utilization |
0.92–0.95 | 0.95 | 0.92–0.95 | NPU内存占比。较高的值可为KV缓存留出更多内存。若发生OOM请降低。 |
--enable-chunked-prefill |
启用 | 启用 | 启用 | 将长提示拆分为多个块,防止预填充阻塞解码。建议在所有场景中启用。 |
--enable-prefix-caching |
可选 | 启用 | 可选 | 对共享前缀(如系统提示)复用KV缓存。当缓存命中率高时可提高吞吐量,但可能减少可用的KV缓存内存。 |
num_speculative_tokens |
3 | 3 | 3 | MTP推测数量。较高的值可提高解码吞吐量,但会占用草稿模型KV缓存的内存。在PD模式的预填充节点上请使用1。 |
VLLM_ASCEND_ENABLE_MLAPO |
1 (w8a8) | 1 (w8a8) | 0或1 | 在w8a8模型上启用MLA融合。可提高解码性能,但会消耗更多NPU内存。若长上下文场景内存不足,请禁用。 |
VLLM_ASCEND_ENABLE_FLASHCOMM1 |
1 | 1 | 1 | 通信优化。除非layer_sharding包含o_proj,否则建议在所有场景中启用。 |
9.2 调优指南¶
有关常规性能调优方法,请参阅公开性能调优文档。
有关详细的功能说明和配置选项,请参阅功能指南。
有关环境变量的说明和约束,请参阅envs.py。
10 常见问题解答¶
-
常见问题提示:如果遇到问题,请参考 常见问题解答。
-
问:如何解决 ValueError: Tokenizer class TokenizersBackend does not exist or is not currently imported?
答:请将 transformers 的版本更新到 5.2.0
- 问:如何为 GLM-5 启用函数调用?
答:请在 vLLM 启动命令中添加以下配置