GLM-5.2¶
1 引言¶
GLM-5.2 采用混合专家(MoE)架构,面向复杂系统工程和长周期智能体任务。
本文档将展示该模型的主要验证步骤,包括支持特性、特性配置、环境准备、单节点与多节点部署、精度及性能评估。
2 支持的特性¶
请参阅支持特性列表以获取模型的支持特性矩阵。
请参阅特性指南以获取特性的配置。
3 前提条件¶
3.1 模型权重¶
GLM-5.2(BF16版本):需要2个Atlas 800 A3(128GB × 8)节点或4个Atlas 800 A2(64GB × 8)节点。下载模型权重。GLM-5.2-w8a8:需要1个Atlas 800 A3(128GB × 8)节点或2个Atlas 800 A2(64GB × 8)节点。下载模型权重。GLM-5.2-w4a8c8:需要1个Atlas 800 A3(128GB × 8)节点或2个Atlas 800 A2(64GB × 8)节点。下载模型权重。- 您可以使用msmodelslim直接对模型进行量化。
建议将模型权重下载到多节点共享目录中,例如 /root/.cache/
3.2 验证多节点通信(可选)¶
If you want to deploy multi-node environment, you need to verify multi-node communication according to verify multi-node communication environment.
4 安装¶
4.1 Docker镜像安装¶
- 您可以直接使用我们官方的docker镜像来运行GLM-5.2。
在每个节点上启动docker镜像。
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0-a3
export NAME=vllm-ascend
# Run the container using the defined variables
# Note: If you are running bridge network with docker, please expose available ports for multiple nodes communication in advance
docker run --rm \
--name $NAME \
--net=host \
--shm-size=1g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci8 \
--device /dev/davinci9 \
--device /dev/davinci10 \
--device /dev/davinci11 \
--device /dev/davinci12 \
--device /dev/davinci13 \
--device /dev/davinci14 \
--device /dev/davinci15 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-it $IMAGE bash
在每个节点上启动Docker镜像。
export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0
docker run --rm \
--name vllm-ascend \
--shm-size=1g \
--net=host \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-it $IMAGE bash
如需部署多节点环境,需要在每个节点上进行环境配置。
4.2 源码安装¶
如果您不想使用上述docker镜像,也可以从源码构建所有内容:
- Install
vllm-ascendfrom source, refer to installation.
5 部署¶
本次发布验证的部署场景按上下文窗口大小(1M以下 / 1M)、硬件(Atlas 800 A3 / A2)和部署模式(单节点、多节点共置、Prefill-Decode分离)进行组织。以下所有启动脚本均为经过验证的参考命令;每个场景后会对关键参数进行说明。
5.1 上下文低于1M¶
5.1.1 Atlas 800 A3¶
5.1.1.1 单节点部署¶
- 量化模型
GLM-5.2-w4a8c8可以部署在1个Atlas 800 A3(64GB × 16)上。
运行以下脚本执行在线推理。
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port 8077 \
--safetensors-load-strategy prefetch \
--api-server-count 1 \
--data-parallel-size 2 \
--enable-expert-parallel \
--tensor-parallel-size 8 \
--seed 1024 \
--served-model-name glm-5 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--max-num-seqs 12 \
--max-model-len 135000 \
--max-num-batched-tokens 8192 \
--trust-remote-code \
--gpu-memory-utilization 0.92 \
--quantization ascend \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_dsa_cp": true,"enable_sparse_li_c8": true,"enable_balance_scheduling": true,"multistream_overlap_shared_expert":true,"enable_fused_mc2":0}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
关键参数说明:
以下仅描述此模型/场景特有的关键参数。max-model-len和max-num-seqs需要根据实际使用场景进行设置。
模型特有参数:
--enable-expert-parallel:必须为GLM-5.2的MoE架构启用。--quantization ascend:为w4a8c8量化权重启用Ascend量化。--data-parallel-size 2/--tensor-parallel-size 8:DP2 TP8并行布局,建议用于平衡w4a8c8权重的内存容量和计算效率。对于低延迟场景,改用dp1tp16并关闭专家并行,但吞吐量会降低。--tool-call-parser glm47/--reasoning-parser glm45/--enable-auto-tool-choice:为GLM-5.2启用函数调用。--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}':使用GLM-5.2的DeepSeek风格MTP草稿头启用多令牌预测(MTP)投机解码。num_speculative_tokens(3-5)控制每步推测的令牌数量;enforce_eager: true是必需的,因为GLM-5.2不支持图模式投机解码。--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}':仅对解码阶段启用图捕获,通过减少内核启动开销提升解码性能。additional_config.enable_fused_mc2=0:在此场景中禁用融合的dispatch_ffn_combine/mega_moe算子,因为它们与multistream_overlap_shared_expert冲突;在多节点场景中,如果它们有益,请启用它们。
--additional-config字段(Ascend特有优化):
"enable_dsa_cp": true:启用DSA上下文并行以加速长上下文预填充。启用DSA-CP后,layer_sharding不能包含o_proj。"enable_sparse_li_c8": true:C8量化模型的稀疏注意力优化。enable_sparse_li_c8加速层索引(LI)稀疏注意力,建议保持为true;如果由于序列长度过长导致GPU内存不足,建议启用enable_sparse_sfa_c8。"enable_balance_scheduling": true:平衡调度提高v1调度器的输出吞吐量并降低TPOT。此配置字段取代了已移除的环境设置;在某些场景下TTFT可能会下降,在预填充-解码分离时不建议使用。"multistream_overlap_shared_expert": true:在额外流上重叠共享专家计算,提高解码效率。
5.1.1.2 多节点共置部署¶
GLM-5.2-w4a8c8:可以部署在2个Atlas 800 A3(64GB × 16)上。
分别在两个节点上运行以下脚本。
节点0
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=400
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port 8077 \
--safetensors-load-strategy prefetch \
--api-server-count 1 \
--data-parallel-size 4 \
--data-parallel-start-rank 0 \
--data-parallel-size-local 2 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12980 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--seed 1024 \
--served-model-name glm-52 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--max-num-seqs 16 \
--max-model-len 66000 \
--max-num-batched-tokens 8192 \
--trust-remote-code \
--gpu-memory-utilization 0.90 \
--quantization ascend \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_dsa_cp": true,"enable_sparse_li_c8": true,"enable_balance_scheduling": true,"enable_fused_mc2":1}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
节点1
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=400
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port 8077 \
--headless \
--safetensors-load-strategy prefetch \
--data-parallel-size 4 \
--data-parallel-start-rank 2 \
--data-parallel-size-local 2 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12980 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--seed 1024 \
--served-model-name glm-52 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--max-num-seqs 16 \
--max-model-len 66000 \
--max-num-batched-tokens 8192 \
--trust-remote-code \
--gpu-memory-utilization 0.90 \
--quantization ascend \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_dsa_cp": true,"enable_sparse_li_c8": true,"enable_balance_scheduling": true,"enable_fused_mc2":1}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'
关键参数说明(除单节点部署外):
多节点网络和数据并行配置:
HCCL_IF_IP、GLOO_SOCKET_IFNAME、TP_SOCKET_IFNAME、HCCL_SOCKET_IFNAME:多节点通信的网络接口配置。将nic_name设置为网络接口名称(通过ifconfig获取),将local_ip设置为当前节点的IP地址。这些必须在每个节点上正确配置,才能实现成功的多节点通信。--data-parallel-size 4:所有节点上的数据并行rank总数(此场景中每个节点2个rank)。--data-parallel-size-local 2:当前节点上的数据并行rank数量。--data-parallel-start-rank:此节点上数据并行rank的起始rank偏移。节点0使用0,节点1使用2。--data-parallel-address:数据并行主节点(节点0)的IP地址。必须与主节点的local_ip匹配。--data-parallel-rpc-port 12980:数据并行主节点通信的RPC端口。所有节点必须相同。--headless:表示非主节点(在节点1上使用)。不要在节点0上使用。
注意:
此场景启用了additional_config.enable_fused_mc2=1(融合的dispatch_ffn_combine/mega_moe算子)。融合MC2与multistream_overlap_shared_expert冲突——这两种优化不能同时启用(当融合MC2开启时,运行时强制禁用multistream_overlap_shared_expert)。
5.1.1.3 Prefill-Decode分离¶
我们想展示GLM-5.2在多节点环境下使用1P1D的部署指南,以获得更好的性能。
Prefill-Decode分离可以部署在4台Atlas 800 A3(64GB × 16)上。
部署拓扑:
| 节点组 | 节点 | 并行度 | 引擎端口 |
|---|---|---|---|
| Prefill | 2(节点0/1) | DP4 TP8(每节点2个rank) |
每节点9081/9082 |
| 解码 | 2(节点0/1) | DP32 TP1(每节点16个rank) |
每节点9900-9915 |
开始之前,请
-
在每个节点上准备脚本
launch_online_dp.py:import argparse import multiprocessing import os import subprocess import sys def parse_args(): parser = argparse.ArgumentParser() parser.add_argument( "--dp-size", type=int, required=True, help="Data parallel size." ) parser.add_argument( "--tp-size", type=int, default=1, help="Tensor parallel size." ) parser.add_argument( "--dp-size-local", type=int, default=-1, help="Local data parallel size." ) parser.add_argument( "--dp-rank-start", type=int, default=0, help="Starting rank for data parallel." ) parser.add_argument( "--dp-address", type=str, required=True, help="IP address for data parallel master node." ) parser.add_argument( "--dp-rpc-port", type=str, default=12345, help="Port for data parallel master node." ) parser.add_argument( "--vllm-start-port", type=int, default=9000, help="Starting port for the engine." ) return parser.parse_args() args = parse_args() dp_size = args.dp_size tp_size = args.tp_size dp_size_local = args.dp_size_local if dp_size_local == -1: dp_size_local = dp_size dp_rank_start = args.dp_rank_start dp_address = args.dp_address dp_rpc_port = args.dp_rpc_port vllm_start_port = args.vllm_start_port def run_command(visible_devices, dp_rank, vllm_engine_port): command = [ "bash", "./run_dp_template.sh", visible_devices, str(vllm_engine_port), str(dp_size), str(dp_rank), dp_address, dp_rpc_port, str(tp_size), ] subprocess.run(command, check=True) if __name__ == "__main__": template_path = "./run_dp_template.sh" if not os.path.exists(template_path): print(f"Template file {template_path} does not exist.") sys.exit(1) processes = [] num_cards = dp_size_local * tp_size for i in range(dp_size_local): dp_rank = dp_rank_start + i vllm_engine_port = vllm_start_port + i visible_devices = ",".join(str(x) for x in range(i * tp_size, (i + 1) * tp_size)) process = multiprocessing.Process(target=run_command, args=(visible_devices, dp_rank, vllm_engine_port)) processes.append(process) process.start() for process in processes: process.join() -
在每个节点上准备脚本
run_dp_template.sh。-
Prefill节点0
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name export HCCL_TRANSFER_TIMEOUT=600 export HCCL_EXEC_TIMEOUT=3600 export HCCL_CONNECT_TIMEOUT=3600 export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=400 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \ --host 0.0.0.0 \ --port $2 \ --safetensors-load-strategy prefetch \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens":1, "method":"deepseek_mtp","enforce_eager":true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 133120 \ --additional-config '{"enable_dsa_cp":true,"enable_sparse_li_c8": true,"c8_enable_reshape_optim":true,"enable_fused_mc2":1}' \ --max-num-batched-tokens 8192 \ --trust-remote-code \ --max-num-seqs 64 \ --quantization ascend \ --gpu-memory-utilization 0.92 \ --enforce-eager \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_producer", "kv_port": "30000", "engine_id": "0", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 4, "tp_size": 8 }, "decode": { "dp_size": 32, "tp_size": 1 } } }' -
Prefill节点1
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name export HCCL_TRANSFER_TIMEOUT=600 export HCCL_EXEC_TIMEOUT=3600 export HCCL_CONNECT_TIMEOUT=3600 export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=400 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \ --host 0.0.0.0 \ --port $2 \ --safetensors-load-strategy prefetch \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --speculative-config '{"num_speculative_tokens":1, "method":"deepseek_mtp","enforce_eager":true}' \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 133120 \ --additional-config '{"enable_dsa_cp":true, "enable_sparse_li_c8": true,"c8_enable_reshape_optim":true,"enable_fused_mc2":1}' \ --max-num-batched-tokens 8192 \ --trust-remote-code \ --max-num-seqs 64 \ --quantization ascend \ --gpu-memory-utilization 0.92 \ --enforce-eager \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_producer", "kv_port": "30000", "engine_id": "0", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 4, "tp_size": 8 }, "decode": { "dp_size": 32, "tp_size": 1 } } }' -
Decode节点0
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name export HCCL_TRANSFER_TIMEOUT=600 export HCCL_EXEC_TIMEOUT=3600 export HCCL_CONNECT_TIMEOUT=3600 #Mooncake export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 export TASK_QUEUE_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \ --host 0.0.0.0 \ --port $2 \ --safetensors-load-strategy prefetch \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 133120 \ --max-num-batched-tokens 164 \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \ --speculative-config '{"num_speculative_tokens": 5, "method":"deepseek_mtp","enforce_eager":true}' \ --additional-config '{"recompute_scheduler_enable":true,"enable_sparse_li_c8":true,"enable_fused_mc2":1}' \ --trust-remote-code \ --max-num-seqs 32 \ --gpu-memory-utilization 0.92 \ --quantization ascend \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_consumer", "kv_port": "30100", "engine_id": "1", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 4, "tp_size": 8 }, "decode": { "dp_size": 32, "tp_size": 1 } } }' -
Decode节点1
nic_name="xxxx" # change to your own nic name local_ip="xxxx" # change to your own ip export HCCL_OP_EXPANSION_MODE="AIV" export HCCL_IF_IP=$local_ip export GLOO_SOCKET_IFNAME=$nic_name export TP_SOCKET_IFNAME=$nic_name export HCCL_SOCKET_IFNAME=$nic_name export HCCL_TRANSFER_TIMEOUT=600 export HCCL_EXEC_TIMEOUT=3600 export HCCL_CONNECT_TIMEOUT=3600 #Mooncake export OMP_PROC_BIND=false export OMP_NUM_THREADS=1 export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True export HCCL_BUFFSIZE=256 export ACL_OP_INIT_MODE=1 export ASCEND_A3_ENABLE=1 export TASK_QUEUE_ENABLE=1 export ASCEND_RT_VISIBLE_DEVICES=$1 export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \ --host 0.0.0.0 \ --port $2 \ --safetensors-load-strategy prefetch \ --data-parallel-size $3 \ --data-parallel-rank $4 \ --data-parallel-address $5 \ --data-parallel-rpc-port $6 \ --tensor-parallel-size $7 \ --enable-expert-parallel \ --seed 1024 \ --served-model-name glm-5 \ --max-model-len 133120 \ --max-num-batched-tokens 164 \ --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \ --speculative-config '{"num_speculative_tokens": 5, "method":"deepseek_mtp","enforce_eager":true}' \ --additional-config '{"recompute_scheduler_enable":true,"enable_sparse_li_c8":true,"enable_fused_mc2":1}' \ --trust-remote-code \ --max-num-seqs 32 \ --gpu-memory-utilization 0.92 \ --quantization ascend \ --enable-auto-tool-choice \ --tool-call-parser glm47 \ --reasoning-parser glm45 \ --kv-transfer-config \ '{"kv_connector": "MooncakeConnectorV1", "kv_role": "kv_consumer", "kv_port": "30100", "engine_id": "1", "kv_connector_extra_config": { "use_ascend_direct": true, "prefill": { "dp_size": 4, "tp_size": 8 }, "decode": { "dp_size": 32, "tp_size": 1 } } }'
-
准备工作完成后,可在每个节点上使用以下命令启动服务器:
-
Prefill节点0
-
Prefill节点1
-
Decode节点0
-
Decode节点1
要设置请求转发,请在任意机器上运行以下脚本。您可以在仓库的示例中获取代理程序:load_balance_proxy_server_example.py
unset http_proxy
unset https_proxy
python load_balance_proxy_server_example.py \
--port 8000 \
--host 0.0.0.0 \
--prefiller-hosts \
$node_p0_ip \
$node_p0_ip \
$node_p1_ip \
$node_p1_ip \
--prefiller-ports \
9081 9082 \
9081 9082 \
--decoder-hosts \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d0_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
$node_d1_ip \
--decoder-ports \
9900 9901 9902 9903 9904 9905 9906 9907 9908 9909 9910 9911 9912 9913 9914 9915 \
9900 9901 9902 9903 9904 9905 9906 9907 9908 9909 9910 9911 9912 9913 9914 9915
launch_online_dp.py参数:
| 参数 | 类型 | 必填 | 默认值 | 描述 |
|---|---|---|---|---|
--dp-size |
int | 是 | - | 数据并行大小(所有节点上DP rank的总数)。 |
--tp-size |
int | 否 | 1 | 每个DP rank内的张量并行大小。 |
--dp-size-local |
int | 否 | (与--dp-size相同) |
当前节点上的DP rank数量。若未设置,默认为--dp-size。 |
--dp-rank-start |
int | 否 | 0 | 本节点上数据并行rank的起始偏移量。 |
--dp-address |
str | 是 | - | 数据并行主节点(节点0)的IP地址。 |
--dp-rpc-port |
str | 否 | 12345 | 数据并行主节点通信的RPC端口。 |
--vllm-start-port |
int | 否 | 9000 | 本节点上每个vLLM引擎实例的起始端口。每个DP rank的引擎端口 = vllm_start_port + 本地rank索引。 |
预填充节点专属配置:
additional_config.enable_fused_mc2=1:启用dispatch_ffn_combine/mega_moe融合算子。注意:融合MC2与multistream_overlap_shared_expert冲突。ACL_OP_INIT_MODE=1/ASCEND_A3_ENABLE=1:A3特定的算子初始化和通信聚合优化。--speculative-config '{"num_speculative_tokens": 1, ...}':预填充期间的最小MTP推测(解码节点使用更高的数量,见下文)。
解码节点专属配置:
--max-num-batched-tokens 164:解码节点上的小批量token限制——解码每步每序列处理一个token,因此批量token数应接近max-num-seqs。--speculative-config '{"num_speculative_tokens": 5, ...}':解码节点上更高的MTP推测数量以最大化解码吞吐量。--additional-config '{"recompute_scheduler_enable": true}':启用重计算调度器。当解码节点KV缓存不足时,请求被发送回预填充节点以重计算KV缓存。建议在PD场景中的预填充和解码节点上均启用。
Mooncake KV传输配置(--kv-transfer-config):
"kv_connector": "MooncakeConnectorV1":使用Mooncake作为预填充和解码节点之间的KV缓存传输连接器。"kv_role": "kv_producer"/"kv_consumer":预填充节点上为kv_producer,解码节点上为kv_consumer。"kv_port":Mooncake KV传输通信端口。预填充(30000)和解码(30100)节点组使用不同的端口范围。"use_ascend_direct": true:启用Ascend直接传输KV缓存,降低延迟。"prefill"/"decode"部分:分别指定预填充和解码节点组的dp_size和tp_size。这些必须与实际部署拓扑匹配(prefill: dp4 tp8,decode: dp32 tp1)。
请求转发(代理):
- 代理命令将每个预填充引擎端点(每节点4个预填充主机 × 2个端口)和每个解码引擎端点(32个解码主机/端口)映射到端口
8000上的单一入口点。 - 代理程序可在load_balance_proxy_server_example.py中找到。
请参阅envs.py以了解上述环境变量的进一步说明和限制。
5.1.1.4 基于RoCE的多节点部署¶
本节介绍在物理节点之间使用RoCE的A3部署(例如跨SuperPod的部署)所需的额外配置。请在上文对应的A3部署命令基础上应用这些设置。
-
逻辑SuperPod配置
为每个物理节点设置唯一的
HCCL_LOGIC_SUPERPOD_ID。同一物理节点上的所有vLLM进程必须使用相同的值。 -
专家并行通信配置
支持的MC2通信模式取决于专家并行(EP)通信域是否跨越物理节点:
- 如果EP通信域包含在物理节点内,则无需更改现有配置。融合MC2仍然受支持。
- 如果EP通信域跨越物理节点,则不支持融合MC2。需要通过RoCE进行分层MC2通信,并且必须通过将
"mc2_comm_alg": "hierarchy"添加到--additional-config来启用。
示例
对于1P1D(2+2)场景,请按如下方式配置逻辑SuperPod ID:
| Physical node | Configuration |
|---|---|
| Prefill node 0 | export HCCL_LOGIC_SUPERPOD_ID=0 |
| Prefill node 1 | export HCCL_LOGIC_SUPERPOD_ID=1 |
| Decode node 0 | export HCCL_LOGIC_SUPERPOD_ID=2 |
| Decode node 1 | export HCCL_LOGIC_SUPERPOD_ID=3 |
在每个节点上应用以下Fused MC2设置:
将"mc2_comm_alg": "hierarchy"合并到现有的--additional-config JSON对象中。以下模式使用...表示现有字段:
5.1.2 Atlas 800 A2¶
5.1.2.1 多节点共置部署¶
GLM-5.2-w4a8c8:可部署在2台Atlas 800 A2(64GB × 8)上。单台Atlas 800 A2节点(8 × 64GB)无法容纳w4a8c8权重,因此2节点部署是A2系列的最低配置。
节点0
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export VLLM_RPC_TIMEOUT=360000
export VLLM_EXECUTE_MODEL_TIMEOUT_SECONDS=30000
export HCCL_EXEC_TIMEOUT=200
export HCCL_CONNECT_TIMEOUT=120
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export ACL_OP_INIT_MODE=1
export TASK_QUEUE_ENABLE=1
export CPU_AFFINITY_CONF=1
export VLLM_ENGINE_READY_TIMEOUT_S=1200
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--max_model_len 40000 \
--max-num-batched-tokens 4096 \
--served-model-name glm-52 \
--seed 1024 \
--gpu-memory-utilization 0.95 \
--api-server-count 1 \
--max-num-seqs 16 \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 13389 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--quantization ascend \
--port 7000 \
--safetensors-load-strategy 'prefetch' \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 5, "method": "deepseek_mtp", "enforce_eager": true}'
节点1
# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"
# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxx"
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export VLLM_RPC_TIMEOUT=360000
export VLLM_EXECUTE_MODEL_TIMEOUT_SECONDS=30000
export HCCL_EXEC_TIMEOUT=200
export HCCL_CONNECT_TIMEOUT=120
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export ACL_OP_INIT_MODE=1
export TASK_QUEUE_ENABLE=1
export CPU_AFFINITY_CONF=1
export VLLM_ENGINE_READY_TIMEOUT_S=1200
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--max_model_len 40000 \
--max-num-batched-tokens 4096 \
--served-model-name glm-52 \
--seed 1024 \
--gpu-memory-utilization 0.95 \
--max-num-seqs 16 \
--headless \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-start-rank 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 13389 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--quantization ascend \
--port 7000 \
--safetensors-load-strategy 'prefetch' \
--block-size 128 \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 5, "method": "deepseek_mtp", "enforce_eager": true}'
A2系列使用与A3不同的优化栈;此处不使用DSA-CP。
A2专属环境变量:
CPU_AFFINITY_CONF=1:为工作进程启用CPU核心亲和性绑定。ACL_OP_INIT_MODE=1:ACL算子初始化模式,加速算子编译。VLLM_RPC_TIMEOUT=360000/VLLM_EXECUTE_MODEL_TIMEOUT_SECONDS=3000/HCCL_EXEC_TIMEOUT=200/HCCL_CONNECT_TIMEOUT=120/VLLM_ENGINE_READY_TIMEOUT_S=1200:针对较慢的A2平台的多节点启动和模型执行超时设置。若引擎未能及时就绪,请增大这些值。
5.1.2.2 预填充-解码分离¶
在Atlas 800 A2上,每个节点暴露8张卡,相同的全局P/D拓扑(预填充DP4 TP8,解码DP8 TP4)分布在8个节点上:4个预填充节点各托管1个DP rank(每个rank 8张卡),4个解码节点各托管2个DP rank(每个rank 4张卡)。上述launch_online_dp.py原样复用。预填充侧使用DSA CP;解码侧启用MLAPO和带有FULL_DECODE_ONLY图的DYNAMIC_EPLB。两侧均启用前缀缓存和MTP(预填充num_speculative_tokens=1,解码3)。以下所有IP、NIC名称、端口和权重路径均为占位符。
KV Cache Pool(Ascend Store)的启动方法及Mooncake配置文件请参考KV Cache Pool(Ascend Store)部署指南。
prefill节点的run_dp_template.sh:
#!/usr/bin/bash
nic_name="<NIC_NAME>"
local_ip="<CURRENT_NODE_IP>"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export HCCL_BUFFSIZE=256
export TASK_QUEUE_ENABLE=1
export HCCL_OP_EXPANSION_MODE="AIV"
export VLLM_USE_V1=1
export ASCEND_RT_VISIBLE_DEVICES=$1
export LD_LIBRARY_PATH=/usr/local/python3.11.10/lib:/usr/local/lib:$LD_LIBRARY_PATH
export ASCEND_AGGREGATE_ENABLE=1
export ASCEND_TRANSPORT_PRINT=1
export PYTHONHASHSEED=0
export MOONCAKE_CONFIG_PATH="/mnt/share/scripts/mooncake.json"
export HCCL_INTRA_ROCE_ENABLE=1
export ACL_OP_INIT_MODE=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port $2 \
--data-parallel-size $3 \
--data-parallel-rank $4 \
--data-parallel-address $5 \
--data-parallel-rpc-port $6 \
--tensor-parallel-size $7 \
--enable-expert-parallel \
--enable-prefix-caching \
--seed 1024 \
--enable-chunked-prefill \
--served-model-name glm-5 \
--max-model-len 256000 \
--max-num-batched-tokens 8192 \
--trust-remote-code \
--max-num-seqs 256 \
--gpu-memory-utilization 0.95 \
--safetensors-load-strategy prefetch \
--quantization ascend \
--enforce-eager \
--enable-auto-tool-choice \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--kv-transfer-config \
'{
"kv_connector": "MultiConnector",
"kv_role": "kv_producer",
"kv_load_failure_policy": "recompute",
"kv_connector_extra_config": {
"connectors": [
{
"kv_connector": "MooncakeConnectorV1",
"kv_role": "kv_producer",
"kv_port": "30000",
"kv_connector_extra_config": {
"prefill": {
"dp_size": 4,
"tp_size": 8
},
"decode": {
"dp_size": 8,
"tp_size": 4
}
}
},
{
"kv_connector": "AscendStoreConnector",
"kv_role": "kv_producer",
"kv_connector_extra_config": {
"lookup_rpc_port":"0",
"backend": "mooncake"
}
}
]
}
}' \
--additional-config '{"enable_dsa_cp": true, "multistream_overlap_shared_expert": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true}' \
--speculative-config '{"num_speculative_tokens": 1, "method":"deepseek_mtp", "enforce_eager":true}'
run_dp_template.sh 用于解码节点:
#!/usr/bin/bash
nic_name="<NIC_NAME>"
local_ip="<CURRENT_NODE_IP>"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export VLLM_HOST_IP=$local_ip
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export HCCL_BUFFSIZE=2560
export TASK_QUEUE_ENABLE=1
export HCCL_OP_EXPANSION_MODE="AIV"
export VLLM_USE_V1=1
export ASCEND_RT_VISIBLE_DEVICES=$1
export LD_LIBRARY_PATH=/usr/local/python3.11.10/lib:/usr/local/lib:$LD_LIBRARY_PATH
export PYTHONHASHSEED=0
export MOONCAKE_CONFIG_PATH="/mnt/share/scripts/mooncake.json"
export HCCL_INTRA_ROCE_ENABLE=1
export ACL_OP_INIT_MODE=1
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port $2 \
--data-parallel-size $3 \
--data-parallel-rank $4 \
--data-parallel-address $5 \
--data-parallel-rpc-port $6 \
--tensor-parallel-size $7 \
--enable-expert-parallel \
--enable-prefix-caching \
--seed 1024 \
--served-model-name glm-5 \
--max-model-len 256000 \
--max-num-batched-tokens 256 \
--trust-remote-code \
--max-num-seqs 128 \
--gpu-memory-utilization 0.95 \
--safetensors-load-strategy prefetch \
--quantization ascend \
--enable-auto-tool-choice \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--kv-transfer-config \
'{
"kv_connector": "MultiConnector",
"kv_role": "kv_consumer",
"kv_load_failure_policy": "recompute",
"kv_connector_extra_config": {
"connectors": [
{
"kv_connector": "MooncakeConnectorV1",
"kv_role": "kv_consumer",
"kv_port": "30100",
"kv_connector_extra_config": {
"prefill": {
"dp_size": 4,
"tp_size": 8
},
"decode": {
"dp_size": 8,
"tp_size": 4
}
}
},
{
"kv_connector": "AscendStoreConnector",
"kv_role": "kv_consumer",
"kv_connector_extra_config": {
"lookup_rpc_port":"0",
"load_async": true,
"backend": "mooncake"
}
}
]
}
}' \
--compilation-config \
'{
"cudagraph_mode": "FULL_DECODE_ONLY",
}' \
--additional-config '{"multistream_overlap_shared_expert": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, "recompute_scheduler_enable": true, "enable_mlapo": true}' \
--speculative-config '{"num_speculative_tokens": 3, "method":"deepseek_mtp", "enforce_eager":true}'
准备工作完成后,使用以下命令启动服务器:
-
预填充节点 — 在
$node_p0_ip、$node_p1_ip、$node_p2_ip、$node_p3_ip上运行,使用--dp-rank-start0/1/2/3:python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 0 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081 python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 1 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081 python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 2 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081 python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 3 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081 -
解码节点 — 在
$node_d0_ip、$node_d1_ip、$node_d2_ip、$node_d3_ip上运行,使用--dp-rank-start0/2/4/6:python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 0 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900 python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 2 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900 python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 4 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900 python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 6 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900
对于此 8 节点 A2 布局的请求转发,请在下面的请求转发命令中使用 4 个预填充主机(每个 1 个端点)和 4 个解码器主机(每个 2 个端点)。
要设置请求转发,请在任意机器上运行以下脚本。您可以在仓库的示例中获取代理程序:load_balance_proxy_server_example.py
unset http_proxy
unset https_proxy
python load_balance_proxy_server_example.py \
--port 8000 \
--host 0.0.0.0 \
--prefiller-hosts \
$node_p0_ip \
$node_p1_ip \
$node_p2_ip \
$node_p3_ip \
--prefiller-ports \
9081 9081 \
9081 9081 \
--decoder-hosts \
$node_d0_ip \
$node_d0_ip \
$node_d1_ip \
$node_d1_ip \
$node_d2_ip \
$node_d2_ip \
$node_d3_ip \
$node_d3_ip \
--decoder-ports \
9900 9901 9900 9901 \
9900 9901 9900 9901
关键参数说明(除预填充-解码分离外):
该8节点A2布局将全局P/D拓扑分布到8个Atlas 800 A2节点上:4个预填充节点各承载1个DP rank(每个rank 8张卡,DP4 TP8),4个解码节点各承载2个DP rank(每个rank 4张卡,DP8 TP4)。launch_online_dp.py脚本与预填充-解码分离中的相同。
预填充节点特定配置(A2):
--additional-config '{"enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, ...}':此场景中启用了两个SFA C8优化(而A3共置场景中为enable_sparse_sfa_c8: false)。
解码节点特定配置(A2):
additional_config.enable_mlapo=true:在解码节点上进行MLAPO融合,用于内存带宽受限的令牌生成。--max-num-batched-tokens 256:解码节点上的小批量令牌限制。
多连接器KV传输配置(--kv-transfer-config):
"kv_connector": "MultiConnector":组合多个KV传输连接器。MooncakeConnectorV1:预填充节点与解码节点之间的Mooncake KV缓存传输(与预填充-解码分离中的角色相同)。AscendStoreConnector:KV Cache Pool(Ascend Store)连接器,自v0.23.0起可用——参见KV Cache Pool(Ascend Store)部署指南。"kv_load_failure_policy": "recompute":当从KV池加载KV块失败时,请求回退到重计算而不是失败。"load_async": true(解码侧):在解码节点上异步从池中加载KV缓存。"backend": "mooncake":连接器使用的Ascend Store后端。
A2 PD场景的环境变量:
VLLM_USE_V1=1:强制使用v1调度器。ASCEND_AGGREGATE_ENABLE=1/ASCEND_TRANSPORT_PRINT=1:通信聚合和传输调试打印。PYTHONHASHSEED=0:固定哈希种子,用于可复现的分布式调度。MOONCAKE_CONFIG_PATH="/mnt/share/scripts/mooncake.json":Mooncake配置文件路径(每个节点上必须存在)。HCCL_INTRA_ROCE_ENABLE=1:启用通过RoCE的HCCL节点内通信。ACL_OP_INIT_MODE=1:ACL算子初始化模式。VLLM_HOST_IP=$local_ip:解码引擎为跨节点通信通告的主机IP。
请参阅envs.py以了解上述环境变量的进一步说明和限制。
5.2 1M上下文部署¶
在Atlas 800 A3(64GB x 16)上使用1M上下文窗口服务GLM-5.2以及量化GLM-5.2(W4A8C8)权重的推荐配置:
| 模式 | 硬件 | 并行配置 | 上下文长度 |
|---|---|---|---|
| 单节点共置 | 1个Atlas 800 A3(64GB x 16) | DP1 PP1 TP16 PCP1 DCP16 |
1024000 |
| 双节点共置 | 2个Atlas 800 A3(64GB x 16) | DP4 PP1 TP8 PCP1 DCP8 |
1024000 |
| 1P1D PD 分离部署 | 1 个预填充节点(2 台 A3)+ 1 个解码节点(2 台 A3) | 预填充 DP4 PP1 TP8 PCP1 DCP8,解码 DP4 PP1 TP8 PCP1 DCP8 |
1024000 |
1M上下文场景仅在Atlas 800 A3上验证;A2系列未针对1M上下文进行验证。
Warning
DCP 和稀疏 Flash Attention C8(enable_sparse_sfa_c8,也称为 sfa_c8)是 v0.23.0 中的实验性功能。在此版本中同时启用它们存在已知问题,包括性能下降,因此不建议这样做。以下 1M 部署示例启用了 DCP,并保持 enable_sparse_sfa_c8 为禁用状态。
5.2.1 单节点1M部署¶
推荐命令:
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1
vllm serve <MODEL_PATH> \
--seed 1024 \
--host 0.0.0.0 \
--port 9000 \
--served-model-name glm-52 \
--max-model-len 1024000 \
--max-num-batched-tokens 16384 \
--gpu-memory-utilization 0.80 \
--api-server-count 1 \
--max-num-seqs 32 \
--data-parallel-size 1 \
--pipeline-parallel-size 1 \
--tensor-parallel-size 16 \
--prefill-context-parallel-size 1 \
--decode-context-parallel-size 16 \
--cp-kv-cache-interleave-size 128 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [4, 16, 128]}' \
--additional-config '{"enable_dsa_cp": true, "ascend_compilation_config": {"enable_npugraph_ex": true}, "multistream_overlap_shared_expert": true, "enable_sparse_li_c8": true, "enable_cpu_binding": true,"weight_nz_mode":1}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}' \
--quantization ascend \
--enable-expert-parallel \
--safetensors-load-strategy prefetch
关键参数说明(除单节点部署外):
1M特定环境变量:
additional_config.weight_nz_mode=1:为C8量化张量启用NZ格式内存布局,这是1M上下文部署所必需的。VLLM_WORKER_MULTIPROC_METHOD=spawn:为多进程工作器使用spawn启动方法(此场景下必需)。
1M特定vllm serve参数:
--data-parallel-size 1/--pipeline-parallel-size 1/--tensor-parallel-size 16:单节点并行布局DP1 PP1 TP16。--prefill-context-parallel-size 1/--decode-context-parallel-size 16:解码阶段使用16的解码上下文并行(DCP);预填充使用PCP 1。--cp-kv-cache-interleave-size 128:上下文并行的KV缓存交错大小。
5.2.2 双节点共置1M部署¶
两个共部署节点的推荐命令:
nic_name="<NIC_NAME>"
local_ip="<CURRENT_NODE_IP>"
node_0_ip="<NODE0_IP>"
# Node 0: data_parallel_start_rank=0, server_role_args="--api-server-count 1"
# Node 1: data_parallel_start_rank=2, server_role_args="--headless"
data_parallel_start_rank=0
server_role_args="--api-server-count 1"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1
vllm serve <MODEL_PATH> \
--seed 1024 \
--host 0.0.0.0 \
--port 9000 \
--served-model-name glm-52 \
--max-model-len 1024000 \
--max-num-batched-tokens 16384 \
--gpu-memory-utilization 0.75 \
${server_role_args} \
--max-num-seqs 8 \
--data-parallel-size 4 \
--data-parallel-size-local 2 \
--data-parallel-start-rank $data_parallel_start_rank \
--data-parallel-address $node_0_ip \
--data-parallel-rpc-port 16591 \
--pipeline-parallel-size 1 \
--tensor-parallel-size 8 \
--prefill-context-parallel-size 1 \
--decode-context-parallel-size 8 \
--cp-kv-cache-interleave-size 128 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_dsa_cp": true, "ascend_compilation_config": {"enable_npugraph_ex": true}, "multistream_overlap_shared_expert": true,"enable_sparse_li_c8": true, "enable_cpu_binding": true,"weight_nz_mode":1}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}' \
--quantization ascend \
--enable-expert-parallel \
--safetensors-load-strategy prefetch
关键参数说明(除单节点1M部署外):
多节点配置:
--data-parallel-size 4/--data-parallel-size-local 2/--data-parallel-start-rank:节点0使用data_parallel_start_rank=0并带server_role_args="--api-server-count 1";节点1使用data_parallel_start_rank=2并带server_role_args="--headless"。--data-parallel-address $node_0_ip/--data-parallel-rpc-port 16591:数据并行主节点IP和RPC端口,两个节点上相同。--tensor-parallel-size 8/--decode-context-parallel-size 8:DP4 TP8 DCP8布局——每个节点承载2个DP rank × TP8。
5.2.3 PD分离1M部署¶
两个预填充节点的推荐命令:
nic_name="<NIC_NAME>"
local_ip="<CURRENT_PREFILL_NODE_IP>"
node_p0_ip="<PREFILL_NODE0_IP>"
# Prefiller node 0: data_parallel_start_rank=0, server_role_args="--api-server-count 1"
# Prefiller node 1: data_parallel_start_rank=2, server_role_args="--headless"
data_parallel_start_rank=0
server_role_args="--api-server-count 1"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1
export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480
vllm serve <MODEL_PATH> \
--seed 1024 \
--host 0.0.0.0 \
--port 9081 \
--served-model-name glm-52 \
--max-model-len 1024000 \
--max-num-batched-tokens 16384 \
--gpu-memory-utilization 0.75 \
${server_role_args} \
--max-num-seqs 8 \
--data-parallel-size 4 \
--data-parallel-size-local 2 \
--data-parallel-start-rank $data_parallel_start_rank \
--data-parallel-address $node_p0_ip \
--data-parallel-rpc-port 16591 \
--pipeline-parallel-size 1 \
--tensor-parallel-size 8 \
--prefill-context-parallel-size 1 \
--decode-context-parallel-size 8 \
--cp-kv-cache-interleave-size 128 \
--enforce-eager \
--additional-config '{"enable_dsa_cp": true, "ascend_compilation_config": {"enable_npugraph_ex": true}, "multistream_overlap_shared_expert": true,"enable_sparse_li_c8": true, "enable_cpu_binding": true, "recompute_scheduler_enable": true,"weight_nz_mode":1}' \
--speculative-config '{"num_speculative_tokens": 1, "method": "deepseek_mtp", "enforce_eager": true}' \
--quantization ascend \
--enable-expert-parallel \
--safetensors-load-strategy prefetch \
--kv-transfer-config \
'{"kv_connector": "MooncakeConnectorV1",
"kv_role": "kv_producer",
"kv_port": "30000",
"engine_id": "0",
"kv_connector_extra_config": {
"use_ascend_direct": true,
"prefill": {
"dp_size": 4,
"tp_size": 8
},
"decode": {
"dp_size": 4,
"tp_size": 8
}
}
}'
两个解码节点的推荐命令:
nic_name="<NIC_NAME>"
local_ip="<CURRENT_DECODE_NODE_IP>"
node_d0_ip="<DECODE_NODE0_IP>"
# Decoder node 0: data_parallel_start_rank=0, server_role_args="--api-server-count 1"
# Decoder node 1: data_parallel_start_rank=2, server_role_args="--headless"
data_parallel_start_rank=0
server_role_args="--api-server-count 1"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1
export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480
vllm serve <MODEL_PATH> \
--seed 1024 \
--host 0.0.0.0 \
--port 9900 \
--served-model-name glm-52 \
--max-model-len 1024000 \
--max-num-batched-tokens 128 \
--gpu-memory-utilization 0.93 \
${server_role_args} \
--max-num-seqs 32 \
--data-parallel-size 4 \
--data-parallel-size-local 2 \
--data-parallel-start-rank $data_parallel_start_rank \
--data-parallel-address $node_d0_ip \
--data-parallel-rpc-port 16600 \
--pipeline-parallel-size 1 \
--tensor-parallel-size 8 \
--prefill-context-parallel-size 1 \
--decode-context-parallel-size 8 \
--cp-kv-cache-interleave-size 128 \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"ascend_compilation_config": {"enable_npugraph_ex": true},"multistream_overlap_shared_expert": true,"enable_sparse_li_c8": true, "enable_cpu_binding": true, "recompute_scheduler_enable": true,"weight_nz_mode":1}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}' \
--quantization ascend \
--enable-expert-parallel \
--safetensors-load-strategy prefetch \
--kv-transfer-config \
'{"kv_connector": "MooncakeConnectorV1",
"kv_role": "kv_consumer",
"kv_port": "30100",
"engine_id": "1",
"kv_connector_extra_config": {
"use_ascend_direct": true,
"prefill": {
"dp_size": 4,
"tp_size": 8
},
"decode": {
"dp_size": 4,
"tp_size": 8
}
}
}'
推荐代理命令:
unset http_proxy
unset https_proxy
python load_balance_proxy_server_example.py \
--host 0.0.0.0 \
--port 8000 \
--prefiller-hosts <PREFILL_NODE0_IP> \
--prefiller-ports 9081 \
--decoder-hosts <DECODE_NODE0_IP> \
--decoder-ports 9900
预填充节点(1M):
--additional-config '{"recompute_scheduler_enable": true, ...}':此场景中预填充和解码节点均启用重计算调度器。--kv-transfer-config:Mooncake连接器作为kv_producer,使用prefill: dp4 tp8/decode: dp4 tp8(与1M P/D拓扑匹配,不同于sub-1M PD场景中的dp32 tp1解码)。
解码节点(1M):
--max-num-batched-tokens 128:解码节点存储从预填充节点接收的大型1M KV缓存。--kv-transfer-config:Mooncake连接器作为kv_consumer(kv_port: 30100)。
6 功能验证¶
服务器启动后,您可以使用输入提示查询模型:
curl http://<node0_ip>:<port>/v1/completions \
-H "Content-Type: application/json" \
-d '{
"model": "glm-52",
"prompt": "The future of AI is",
"max_completion_tokens": 50,
"temperature": 0
}'
7 精度评估¶
这里提供两种精度评估方法。
7.1 使用AISBench¶
-
有关详细信息,请参阅使用 AISBench。
-
执行后,您可以获取结果。
7.2 使用Language Model Evaluation Harness¶
尚未测试。
8 性能评估¶
8.1 使用AISBench¶
有关详细信息,请参阅使用 AISBench 进行性能评估。
8.2 使用vLLM Benchmark¶
更多详细信息请参考 vllm benchmark。
9 性能调优¶
9.1 推荐配置¶
注意:以下配置在特定测试环境中验证通过,仅供参考。最佳配置取决于最大输入/输出长度、前缀缓存命中率、精度要求以及部署机器比例等因素。建议参考调优指南根据实际情况进行调优。
下表提供了不同部署场景下的推荐参数配置。所有场景按用途(低延迟、高吞吐、长上下文)分类,并对应部署章节中记录的部署模式。
9.1.1 表1:场景概览¶
*Total NPUs表示所有节点使用的NPU总数。1个节点 = 1台Atlas 800 A3服务器(64GB × 16 NPU)或1台Atlas 800 A2服务器(64GB × 8 NPU)。
| 场景 | 部署模式 | *NPU总数 | 权重版本 | 关键考虑因素 |
|---|---|---|---|---|
| Low Latency (64k input) |
Dual-Node Co-Located (A3), Multi-Node Co-Located Deployment | 32 (A3) | w4a8c8 | dp2 tp16, MTP3, max-num-seqs 8, max-model-len 135000, DSA CP |
| Low Latency (128k input) |
Dual-Node Co-Located (A3), Multi-Node Co-Located Deployment | 32 (A3) | w4a8c8 | dp2 tp16, MTP3, max-num-seqs 8, max-model-len 135000, DSA CP |
| High Throughput (64k input) |
Dual-Node Co-Located (A3), Multi-Node Co-Located Deployment | 32 (A3) | w4a8c8 | dp4 tp8, fused MC2, MTP3, max-num-seqs 16, max-model-len 66000, DSA CP |
| 高吞吐 | PD分离(A3),预填充-解码分离 | 4节点 (A3) | w4a8c8 | P:dp4 tp8(max-num-seqs 64, max-num-batched-tokens 8192, MTP1);D:dp32 tp1(max-num-seqs 32, max-num-batched-tokens 164, MTP5),max-model-len 133120,专用P/D节点,Mooncake KV传输 |
| 长上下文 (1M) |
PD分离(A3),PD分离1M部署 | 4节点 (A3) | w4a8c8 | P/D:dp4 tp8, DCP8, max-model-len 1040000, Mooncake KV传输 |
9.1.2 表2:详细节点配置¶
TP/DP列显示部署脚本中配置的每节点值(一个承载2个TP8 DP rank或1个TP16 DP rank的节点使用16个NPU)。
注意:
max-model-len和max-num-seqs需要根据实际使用场景进行设置。其他设置请参考部署章节。
| 场景 | 配置 | NPU(每节点) | TP | DP(每节点) | Max Num Seqs | Max Num Batched Tokens | Max Model Len | MTP Spec Num |
|---|---|---|---|---|---|---|---|---|
| Low Latency 64k (A3) | Dual-Node (per node), Multi-Node Co-Located Deployment | 16 | 16 | 1 | 8 | 8192 | 135000 | 3 |
| Low Latency 128k (A3) | Dual-Node (per node), Multi-Node Co-Located Deployment | 16 | 16 | 1 | 8 | 8192 | 135000 | 3 |
| High Throughput 64k (A3) | Dual-Node (per node), Multi-Node Co-Located Deployment | 16 | 8 | 2 | 16 | 8192 | 66000 | 3 |
| High Throughput (A3) | PD — Server-P Node, Prefill-Decode Disaggregation | 16 | 8 | 2 | 64 | 8192 | 133120 | 1 |
| High Throughput (A3) | PD — Server-D Node, Prefill-Decode Disaggregation | 16 | 1 | 16 | 32 | 164 | 133120 | 5 |
| Long Context 1M (A3) | PD — Server-P Node, PD Disaggregation 1M Deployment | 16 | 8 | 2 | 8 | 16384 | 1040000 | 1 |
| Long Context 1M (A3) | PD — Server-D Node, PD Disaggregation 1M Deployment | 16 | 8 | 2 | 32 | 128 | 1040000 | 3 |
在PD解码节点上,
--max-num-batched-tokens配置为(MTP Spec Num + 1) × Max Num Seqs——每个序列在每个解码步骤生成一个目标token加上推测的MTP token。完整的启动命令和详细参数说明,请参考部署章节中的部署示例和关键参数说明。
9.1.3 表3:性能相关参数调优指南¶
| 参数 | 低延迟 | 高吞吐 | 长上下文 | 描述 |
|---|---|---|---|---|
--max-num-batched-tokens |
较低(4096–8192) | 预填充较高(8192) | 预填充较高(16384) | 控制每步的批处理大小。较低的值降低每步延迟;较高的值提升预填充吞吐。 |
--gpu-memory-utilization |
0.92–0.95 | 0.90–0.95 | 0.75–0.93 | NPU内存比例。1M场景必须为巨大的KV缓存预留内存,因此使用较低的值(预填充/共置节点上为0.75–0.80)。 |
num_speculative_tokens (MTP) |
3–5 | 3–5 | 1(预填充)/ 3(解码) | MTP推测数量。较高的值以草稿模型KV缓存内存为代价提升解码吞吐。PD模式下预填充节点使用1。 |
enable_dsa_cp |
可选 | 启用(预填充节点) | 启用(预填充节点) | DSA上下文并行加速长上下文预填充。 |
enable_sparse_sfa_c8 / enable_sparse_li_c8 |
false / true |
true / true (PD) |
false / true |
enable_sparse_sfa_c8 是针对 C8 量化模型的实验性 SFA 优化;由于已知问题,在 v0.23.0 中请勿将其与 DCP 结合使用。enable_sparse_li_c8 是独立的,仍然推荐启用。 |
enable_balance_scheduling |
启用(单节点) | 启用 | PD模式下禁用 | 在v1调度器中提升输出吞吐并降低TPOT。某些场景下TTFT可能劣化;预填充-解码分离时不推荐使用。 |
additional_config.enable_mlapo |
— | 1(A2 P/D节点) | — | 融合算子,显著提升性能但消耗更多NPU内存。在A3上仅用于解码节点。 |
cudagraph_mode |
FULL_DECODE_ONLY | FULL_DECODE_ONLY(解码) | FULL_DECODE_ONLY(解码) | 仅对解码阶段进行图捕获。PD模式下的预填充节点改用--enforce-eager。 |
9.2 调优指南¶
通用性能调优方法请参考公开性能调优文档。
有关详细的特性描述和配置选项,请参阅特性矩阵。
有关环境变量的描述和约束,请参阅 envs.py。
10 常见问题解答¶
- 问:如何为 GLM-5.2 启用函数调用?
答:请在 vLLM 启动命令中添加以下配置