跳转至

GLM-5.2

1 引言

GLM-5.2 采用混合专家(MoE)架构,面向复杂系统工程和长周期智能体任务。

本文档将展示该模型的主要验证步骤,包括支持特性、特性配置、环境准备、单节点与多节点部署、精度及性能评估。

2 支持的特性

请参阅支持特性列表以获取模型的支持特性矩阵。

请参阅特性指南以获取特性的配置。

3 前提条件

3.1 模型权重

  • GLM-5.2(BF16版本):需要2个Atlas 800 A3(128GB × 8)节点或4个Atlas 800 A2(64GB × 8)节点。下载模型权重
  • GLM-5.2-w8a8:需要1个Atlas 800 A3(128GB × 8)节点或2个Atlas 800 A2(64GB × 8)节点。下载模型权重
  • GLM-5.2-w4a8c8:需要1个Atlas 800 A3(128GB × 8)节点或2个Atlas 800 A2(64GB × 8)节点。下载模型权重
  • 您可以使用msmodelslim直接对模型进行量化。

建议将模型权重下载到多节点共享目录中,例如 /root/.cache/

3.2 验证多节点通信(可选)

If you want to deploy multi-node environment, you need to verify multi-node communication according to verify multi-node communication environment.

4 安装

4.1 Docker镜像安装

  • 您可以直接使用我们官方的docker镜像来运行GLM-5.2。

在每个节点上启动docker镜像。

export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0-a3
export NAME=vllm-ascend

# Run the container using the defined variables
# Note: If you are running bridge network with docker, please expose available ports for multiple nodes communication in advance
docker run --rm \
--name $NAME \
--net=host \
--shm-size=1g \
--device /dev/davinci0 \
--device /dev/davinci1 \
--device /dev/davinci2 \
--device /dev/davinci3 \
--device /dev/davinci4 \
--device /dev/davinci5 \
--device /dev/davinci6 \
--device /dev/davinci7 \
--device /dev/davinci8 \
--device /dev/davinci9 \
--device /dev/davinci10 \
--device /dev/davinci11 \
--device /dev/davinci12 \
--device /dev/davinci13 \
--device /dev/davinci14 \
--device /dev/davinci15 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-v /root/.cache:/root/.cache \
-it $IMAGE bash

在每个节点上启动Docker镜像。

export IMAGE=quay.io/ascend/vllm-ascend:v0.23.0
docker run --rm \
    --name vllm-ascend \
    --shm-size=1g \
    --net=host \
    --device /dev/davinci0 \
    --device /dev/davinci1 \
    --device /dev/davinci2 \
    --device /dev/davinci3 \
    --device /dev/davinci4 \
    --device /dev/davinci5 \
    --device /dev/davinci6 \
    --device /dev/davinci7 \
    --device /dev/davinci_manager \
    --device /dev/devmm_svm \
    --device /dev/hisi_hdc \
    -v /usr/local/dcmi:/usr/local/dcmi \
    -v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \
    -v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
    -v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \
    -v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \
    -v /etc/ascend_install.info:/etc/ascend_install.info \
    -v /root/.cache:/root/.cache \
    -it $IMAGE bash

如需部署多节点环境,需要在每个节点上进行环境配置。

4.2 源码安装

如果您不想使用上述docker镜像,也可以从源码构建所有内容:

5 部署

本次发布验证的部署场景按上下文窗口大小(1M以下 / 1M)、硬件(Atlas 800 A3 / A2)和部署模式(单节点、多节点共置、Prefill-Decode分离)进行组织。以下所有启动脚本均为经过验证的参考命令;每个场景后会对关键参数进行说明。

5.1 上下文低于1M

5.1.1 Atlas 800 A3

5.1.1.1 单节点部署
  • 量化模型GLM-5.2-w4a8c8可以部署在1个Atlas 800 A3(64GB × 16)上。

运行以下脚本执行在线推理。

export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=200
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port 8077 \
--safetensors-load-strategy prefetch \
--api-server-count 1 \
--data-parallel-size 2 \
--enable-expert-parallel \
--tensor-parallel-size 8 \
--seed 1024 \
--served-model-name glm-5 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--max-num-seqs 12 \
--max-model-len 135000 \
--max-num-batched-tokens 8192 \
--trust-remote-code \
--gpu-memory-utilization 0.92 \
--quantization ascend \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_dsa_cp": true,"enable_sparse_li_c8": true,"enable_balance_scheduling": true,"multistream_overlap_shared_expert":true,"enable_fused_mc2":0}' \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'

关键参数说明:

以下仅描述此模型/场景特有的关键参数。max-model-lenmax-num-seqs需要根据实际使用场景进行设置。

模型特有参数:

  • --enable-expert-parallel:必须为GLM-5.2的MoE架构启用。
  • --quantization ascend:为w4a8c8量化权重启用Ascend量化。
  • --data-parallel-size 2 / --tensor-parallel-size 8:DP2 TP8并行布局,建议用于平衡w4a8c8权重的内存容量和计算效率。对于低延迟场景,改用dp1tp16并关闭专家并行,但吞吐量会降低。
  • --tool-call-parser glm47 / --reasoning-parser glm45 / --enable-auto-tool-choice:为GLM-5.2启用函数调用。
  • --speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}':使用GLM-5.2的DeepSeek风格MTP草稿头启用多令牌预测(MTP)投机解码。num_speculative_tokens(3-5)控制每步推测的令牌数量;enforce_eager: true是必需的,因为GLM-5.2不支持图模式投机解码。
  • --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}':仅对解码阶段启用图捕获,通过减少内核启动开销提升解码性能。
  • additional_config.enable_fused_mc2=0:在此场景中禁用融合的dispatch_ffn_combine/mega_moe算子,因为它们与multistream_overlap_shared_expert冲突;在多节点场景中,如果它们有益,请启用它们。

--additional-config字段(Ascend特有优化):

  • "enable_dsa_cp": true:启用DSA上下文并行以加速长上下文预填充。启用DSA-CP后,layer_sharding不能包含o_proj
  • "enable_sparse_li_c8": true:C8量化模型的稀疏注意力优化。enable_sparse_li_c8加速层索引(LI)稀疏注意力,建议保持为true;如果由于序列长度过长导致GPU内存不足,建议启用enable_sparse_sfa_c8
  • "enable_balance_scheduling": true:平衡调度提高v1调度器的输出吞吐量并降低TPOT。此配置字段取代了已移除的环境设置;在某些场景下TTFT可能会下降,在预填充-解码分离时不建议使用。
  • "multistream_overlap_shared_expert": true:在额外流上重叠共享专家计算,提高解码效率。
5.1.1.2 多节点共置部署
  • GLM-5.2-w4a8c8:可以部署在2个Atlas 800 A3(64GB × 16)上。

分别在两个节点上运行以下脚本。

节点0

# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"

# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"

export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=400
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True

vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port 8077 \
--safetensors-load-strategy prefetch \
--api-server-count 1 \
--data-parallel-size 4 \
--data-parallel-start-rank 0 \
--data-parallel-size-local 2 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12980 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--seed 1024 \
--served-model-name glm-52 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--max-num-seqs 16 \
--max-model-len 66000 \
--max-num-batched-tokens 8192 \
--trust-remote-code \
--gpu-memory-utilization 0.90 \
--quantization ascend \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_dsa_cp": true,"enable_sparse_li_c8": true,"enable_balance_scheduling": true,"enable_fused_mc2":1}'  \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'

节点1

# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"

# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxxx"

export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=1
export HCCL_BUFFSIZE=400
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True

vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--host 0.0.0.0 \
--port 8077 \
--headless \
--safetensors-load-strategy prefetch \
--data-parallel-size 4 \
--data-parallel-start-rank 2 \
--data-parallel-size-local 2 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 12980 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--seed 1024 \
--served-model-name glm-52 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \
--max-num-seqs 16 \
--max-model-len 66000 \
--max-num-batched-tokens 8192 \
--trust-remote-code \
--gpu-memory-utilization 0.90 \
--quantization ascend \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--additional-config '{"enable_dsa_cp": true,"enable_sparse_li_c8": true,"enable_balance_scheduling": true,"enable_fused_mc2":1}'  \
--speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp","enforce_eager":true}'

关键参数说明(除单节点部署外):

多节点网络和数据并行配置:

  • HCCL_IF_IPGLOO_SOCKET_IFNAMETP_SOCKET_IFNAMEHCCL_SOCKET_IFNAME:多节点通信的网络接口配置。将nic_name设置为网络接口名称(通过ifconfig获取),将local_ip设置为当前节点的IP地址。这些必须在每个节点上正确配置,才能实现成功的多节点通信。
  • --data-parallel-size 4:所有节点上的数据并行rank总数(此场景中每个节点2个rank)。
  • --data-parallel-size-local 2:当前节点上的数据并行rank数量。
  • --data-parallel-start-rank:此节点上数据并行rank的起始rank偏移。节点0使用0,节点1使用2
  • --data-parallel-address:数据并行主节点(节点0)的IP地址。必须与主节点的local_ip匹配。
  • --data-parallel-rpc-port 12980:数据并行主节点通信的RPC端口。所有节点必须相同。
  • --headless:表示非主节点(在节点1上使用)。不要在节点0上使用。

注意: 此场景启用了additional_config.enable_fused_mc2=1(融合的dispatch_ffn_combine/mega_moe算子)。融合MC2与multistream_overlap_shared_expert冲突——这两种优化不能同时启用(当融合MC2开启时,运行时强制禁用multistream_overlap_shared_expert)。

5.1.1.3 Prefill-Decode分离

我们想展示GLM-5.2在多节点环境下使用1P1D的部署指南,以获得更好的性能。

Prefill-Decode分离可以部署在4台Atlas 800 A3(64GB × 16)上。

部署拓扑:

节点组 节点 并行度 引擎端口
Prefill 2(节点0/1) DP4 TP8(每节点2个rank) 每节点9081/9082
解码 2(节点0/1) DP32 TP1(每节点16个rank) 每节点9900-9915

开始之前,请

  1. 在每个节点上准备脚本 launch_online_dp.py

    import argparse
    import multiprocessing
    import os
    import subprocess
    import sys
    
    def parse_args():
        parser = argparse.ArgumentParser()
        parser.add_argument(
            "--dp-size",
            type=int,
            required=True,
            help="Data parallel size."
        )
        parser.add_argument(
            "--tp-size",
            type=int,
            default=1,
            help="Tensor parallel size."
        )
        parser.add_argument(
            "--dp-size-local",
            type=int,
            default=-1,
            help="Local data parallel size."
        )
        parser.add_argument(
            "--dp-rank-start",
            type=int,
            default=0,
            help="Starting rank for data parallel."
        )
        parser.add_argument(
            "--dp-address",
            type=str,
            required=True,
            help="IP address for data parallel master node."
        )
        parser.add_argument(
            "--dp-rpc-port",
            type=str,
            default=12345,
            help="Port for data parallel master node."
        )
        parser.add_argument(
            "--vllm-start-port",
            type=int,
            default=9000,
            help="Starting port for the engine."
        )
        return parser.parse_args()
    
    args = parse_args()
    dp_size = args.dp_size
    tp_size = args.tp_size
    dp_size_local = args.dp_size_local
    if dp_size_local == -1:
        dp_size_local = dp_size
    dp_rank_start = args.dp_rank_start
    dp_address = args.dp_address
    dp_rpc_port = args.dp_rpc_port
    vllm_start_port = args.vllm_start_port
    
    def run_command(visible_devices, dp_rank, vllm_engine_port):
        command = [
            "bash",
            "./run_dp_template.sh",
            visible_devices,
            str(vllm_engine_port),
            str(dp_size),
            str(dp_rank),
            dp_address,
            dp_rpc_port,
            str(tp_size),
        ]
        subprocess.run(command, check=True)
    
    if __name__ == "__main__":
        template_path = "./run_dp_template.sh"
        if not os.path.exists(template_path):
            print(f"Template file {template_path} does not exist.")
            sys.exit(1)
    
        processes = []
        num_cards = dp_size_local * tp_size
        for i in range(dp_size_local):
            dp_rank = dp_rank_start + i
            vllm_engine_port = vllm_start_port + i
            visible_devices = ",".join(str(x) for x in range(i * tp_size, (i + 1) * tp_size))
            process = multiprocessing.Process(target=run_command,
                                            args=(visible_devices, dp_rank,
                                                    vllm_engine_port))
            processes.append(process)
            process.start()
    
        for process in processes:
            process.join()
    
  2. 在每个节点上准备脚本 run_dp_template.sh

    1. Prefill节点0

      nic_name="xxxx" # change to your own nic name
      local_ip="xxxx" # change to your own ip
      
      export HCCL_OP_EXPANSION_MODE="AIV"
      export HCCL_IF_IP=$local_ip
      export GLOO_SOCKET_IFNAME=$nic_name
      export TP_SOCKET_IFNAME=$nic_name
      export HCCL_SOCKET_IFNAME=$nic_name
      export HCCL_TRANSFER_TIMEOUT=600
      export HCCL_EXEC_TIMEOUT=3600
      export HCCL_CONNECT_TIMEOUT=3600
      export OMP_PROC_BIND=false
      export OMP_NUM_THREADS=1
      export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
      export HCCL_BUFFSIZE=400
      export ACL_OP_INIT_MODE=1
      export ASCEND_A3_ENABLE=1
      export ASCEND_RT_VISIBLE_DEVICES=$1
      export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib
      
      vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
          --host 0.0.0.0 \
          --port $2 \
          --safetensors-load-strategy prefetch \
          --data-parallel-size $3 \
          --data-parallel-rank $4 \
          --data-parallel-address $5 \
          --data-parallel-rpc-port $6 \
          --tensor-parallel-size $7 \
          --enable-expert-parallel \
          --speculative-config '{"num_speculative_tokens":1, "method":"deepseek_mtp","enforce_eager":true}' \
          --seed 1024 \
          --served-model-name glm-5 \
          --max-model-len 133120 \
          --additional-config '{"enable_dsa_cp":true,"enable_sparse_li_c8": true,"c8_enable_reshape_optim":true,"enable_fused_mc2":1}' \
          --max-num-batched-tokens 8192 \
          --trust-remote-code \
          --max-num-seqs 64 \
          --quantization ascend \
          --gpu-memory-utilization 0.92 \
          --enforce-eager \
          --enable-auto-tool-choice \
          --tool-call-parser glm47 \
          --reasoning-parser glm45 \
          --kv-transfer-config \
          '{"kv_connector": "MooncakeConnectorV1",
          "kv_role": "kv_producer",
          "kv_port": "30000",
          "engine_id": "0",
          "kv_connector_extra_config": {
                      "use_ascend_direct": true,
                      "prefill": {
                              "dp_size": 4,
                              "tp_size": 8
                      },
                      "decode": {
                              "dp_size": 32,
                              "tp_size": 1
                      }
              }
          }'
      
    2. Prefill节点1

      nic_name="xxxx" # change to your own nic name
      local_ip="xxxx" # change to your own ip
      
      export HCCL_OP_EXPANSION_MODE="AIV"
      export HCCL_IF_IP=$local_ip
      export GLOO_SOCKET_IFNAME=$nic_name
      export TP_SOCKET_IFNAME=$nic_name
      export HCCL_SOCKET_IFNAME=$nic_name
      export HCCL_TRANSFER_TIMEOUT=600
      export HCCL_EXEC_TIMEOUT=3600
      export HCCL_CONNECT_TIMEOUT=3600
      export OMP_PROC_BIND=false
      export OMP_NUM_THREADS=1
      export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
      export HCCL_BUFFSIZE=400
      export ACL_OP_INIT_MODE=1
      export ASCEND_A3_ENABLE=1
      export ASCEND_RT_VISIBLE_DEVICES=$1
      export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib
      
      vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
          --host 0.0.0.0 \
          --port $2 \
          --safetensors-load-strategy prefetch \
          --data-parallel-size $3 \
          --data-parallel-rank $4 \
          --data-parallel-address $5 \
          --data-parallel-rpc-port $6 \
          --tensor-parallel-size $7 \
          --enable-expert-parallel \
          --speculative-config '{"num_speculative_tokens":1, "method":"deepseek_mtp","enforce_eager":true}' \
          --seed 1024 \
          --served-model-name glm-5 \
          --max-model-len 133120 \
          --additional-config '{"enable_dsa_cp":true, "enable_sparse_li_c8": true,"c8_enable_reshape_optim":true,"enable_fused_mc2":1}' \
          --max-num-batched-tokens 8192 \
          --trust-remote-code \
          --max-num-seqs 64 \
          --quantization ascend \
          --gpu-memory-utilization 0.92 \
          --enforce-eager \
          --enable-auto-tool-choice \
          --tool-call-parser glm47 \
          --reasoning-parser glm45 \
          --kv-transfer-config \
          '{"kv_connector": "MooncakeConnectorV1",
          "kv_role": "kv_producer",
          "kv_port": "30000",
          "engine_id": "0",
          "kv_connector_extra_config": {
                      "use_ascend_direct": true,
                      "prefill": {
                              "dp_size": 4,
                              "tp_size": 8
                      },
                      "decode": {
                              "dp_size": 32,
                              "tp_size": 1
                      }
              }
          }'
      
    3. Decode节点0

      nic_name="xxxx" # change to your own nic name
      local_ip="xxxx" # change to your own ip
      
      export HCCL_OP_EXPANSION_MODE="AIV"
      export HCCL_IF_IP=$local_ip
      export GLOO_SOCKET_IFNAME=$nic_name
      export TP_SOCKET_IFNAME=$nic_name
      export HCCL_SOCKET_IFNAME=$nic_name
      export HCCL_TRANSFER_TIMEOUT=600
      export HCCL_EXEC_TIMEOUT=3600
      export HCCL_CONNECT_TIMEOUT=3600
      #Mooncake
      export OMP_PROC_BIND=false
      export OMP_NUM_THREADS=1
      export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
      export HCCL_BUFFSIZE=256
      export ACL_OP_INIT_MODE=1
      export ASCEND_A3_ENABLE=1
      export TASK_QUEUE_ENABLE=1
      export ASCEND_RT_VISIBLE_DEVICES=$1
      export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib
      
      vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
          --host 0.0.0.0 \
          --port $2 \
          --safetensors-load-strategy prefetch \
          --data-parallel-size $3 \
          --data-parallel-rank $4 \
          --data-parallel-address $5 \
          --data-parallel-rpc-port $6 \
          --tensor-parallel-size $7 \
          --enable-expert-parallel \
          --seed 1024 \
          --served-model-name glm-5 \
          --max-model-len 133120 \
          --max-num-batched-tokens 164 \
          --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \
          --speculative-config '{"num_speculative_tokens": 5,  "method":"deepseek_mtp","enforce_eager":true}' \
          --additional-config '{"recompute_scheduler_enable":true,"enable_sparse_li_c8":true,"enable_fused_mc2":1}' \
          --trust-remote-code \
          --max-num-seqs 32 \
          --gpu-memory-utilization 0.92 \
          --quantization ascend \
          --enable-auto-tool-choice \
          --tool-call-parser glm47 \
          --reasoning-parser glm45 \
          --kv-transfer-config \
          '{"kv_connector": "MooncakeConnectorV1",
          "kv_role": "kv_consumer",
          "kv_port": "30100",
          "engine_id": "1",
          "kv_connector_extra_config": {
                      "use_ascend_direct": true,
                      "prefill": {
                              "dp_size": 4,
                              "tp_size": 8
                      },
                      "decode": {
                              "dp_size": 32,
                              "tp_size": 1
                      }
              }
          }'
      
    4. Decode节点1

      nic_name="xxxx" # change to your own nic name
      local_ip="xxxx" # change to your own ip
      
      export HCCL_OP_EXPANSION_MODE="AIV"
      export HCCL_IF_IP=$local_ip
      export GLOO_SOCKET_IFNAME=$nic_name
      export TP_SOCKET_IFNAME=$nic_name
      export HCCL_SOCKET_IFNAME=$nic_name
      export HCCL_TRANSFER_TIMEOUT=600
      export HCCL_EXEC_TIMEOUT=3600
      export HCCL_CONNECT_TIMEOUT=3600
      #Mooncake
      export OMP_PROC_BIND=false
      export OMP_NUM_THREADS=1
      export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
      export HCCL_BUFFSIZE=256
      export ACL_OP_INIT_MODE=1
      export ASCEND_A3_ENABLE=1
      export TASK_QUEUE_ENABLE=1
      export ASCEND_RT_VISIBLE_DEVICES=$1
      export LD_LIBRARY_PATH=$LD_LIBRARY_PATH:/usr/local/lib
      
      vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
          --host 0.0.0.0 \
          --port $2 \
          --safetensors-load-strategy prefetch \
          --data-parallel-size $3 \
          --data-parallel-rank $4 \
          --data-parallel-address $5 \
          --data-parallel-rpc-port $6 \
          --tensor-parallel-size $7 \
          --enable-expert-parallel \
          --seed 1024 \
          --served-model-name glm-5 \
          --max-model-len 133120 \
          --max-num-batched-tokens 164 \
          --compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY"}' \
          --speculative-config '{"num_speculative_tokens": 5,  "method":"deepseek_mtp","enforce_eager":true}' \
          --additional-config '{"recompute_scheduler_enable":true,"enable_sparse_li_c8":true,"enable_fused_mc2":1}' \
          --trust-remote-code \
          --max-num-seqs 32 \
          --gpu-memory-utilization 0.92 \
          --quantization ascend \
          --enable-auto-tool-choice \
          --tool-call-parser glm47 \
          --reasoning-parser glm45 \
          --kv-transfer-config \
          '{"kv_connector": "MooncakeConnectorV1",
          "kv_role": "kv_consumer",
          "kv_port": "30100",
          "engine_id": "1",
          "kv_connector_extra_config": {
                      "use_ascend_direct": true,
                      "prefill": {
                              "dp_size": 4,
                              "tp_size": 8
                      },
                      "decode": {
                              "dp_size": 32,
                              "tp_size": 1
                      }
              }
          }'
      

准备工作完成后,可在每个节点上使用以下命令启动服务器:

  1. Prefill节点0

    # change ip to your own
    python launch_online_dp.py --dp-size 4 --tp-size 8  --dp-size-local 2 --dp-rank-start 0 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081
    
  2. Prefill节点1

    # change ip to your own
    python launch_online_dp.py --dp-size 4 --tp-size 8  --dp-size-local 2 --dp-rank-start 2 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081
    
  3. Decode节点0

    # change ip to your own
    python launch_online_dp.py --dp-size 32 --tp-size 1 --dp-size-local 16 --dp-rank-start 0 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900
    
  4. Decode节点1

    # change ip to your own
    python launch_online_dp.py --dp-size 32 --tp-size 1 --dp-size-local 16 --dp-rank-start 16 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900
    

要设置请求转发,请在任意机器上运行以下脚本。您可以在仓库的示例中获取代理程序:load_balance_proxy_server_example.py

unset http_proxy
unset https_proxy

python load_balance_proxy_server_example.py \
    --port 8000 \
    --host 0.0.0.0 \
    --prefiller-hosts \
      $node_p0_ip \
      $node_p0_ip \
      $node_p1_ip \
      $node_p1_ip \
    --prefiller-ports \
      9081 9082 \
      9081 9082 \
    --decoder-hosts \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d0_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d1_ip \
    --decoder-ports \
      9900 9901 9902 9903 9904 9905 9906 9907 9908 9909 9910 9911 9912 9913 9914 9915 \
      9900 9901 9902 9903 9904 9905 9906 9907 9908 9909 9910 9911 9912 9913 9914 9915

关键参数说明(除单节点部署多节点共置部署外):

launch_online_dp.py参数:

参数 类型 必填 默认值 描述
--dp-size int - 数据并行大小(所有节点上DP rank的总数)。
--tp-size int 1 每个DP rank内的张量并行大小。
--dp-size-local int (与--dp-size相同) 当前节点上的DP rank数量。若未设置,默认为--dp-size
--dp-rank-start int 0 本节点上数据并行rank的起始偏移量。
--dp-address str - 数据并行主节点(节点0)的IP地址。
--dp-rpc-port str 12345 数据并行主节点通信的RPC端口。
--vllm-start-port int 9000 本节点上每个vLLM引擎实例的起始端口。每个DP rank的引擎端口 = vllm_start_port + 本地rank索引。

预填充节点专属配置:

  • additional_config.enable_fused_mc2=1:启用dispatch_ffn_combine/mega_moe融合算子。注意:融合MC2与multistream_overlap_shared_expert冲突。
  • ACL_OP_INIT_MODE=1 / ASCEND_A3_ENABLE=1:A3特定的算子初始化和通信聚合优化。
  • --speculative-config '{"num_speculative_tokens": 1, ...}':预填充期间的最小MTP推测(解码节点使用更高的数量,见下文)。

解码节点专属配置:

  • --max-num-batched-tokens 164:解码节点上的小批量token限制——解码每步每序列处理一个token,因此批量token数应接近max-num-seqs
  • --speculative-config '{"num_speculative_tokens": 5, ...}':解码节点上更高的MTP推测数量以最大化解码吞吐量。
  • --additional-config '{"recompute_scheduler_enable": true}':启用重计算调度器。当解码节点KV缓存不足时,请求被发送回预填充节点以重计算KV缓存。建议在PD场景中的预填充和解码节点上均启用。

Mooncake KV传输配置(--kv-transfer-config):

  • "kv_connector": "MooncakeConnectorV1":使用Mooncake作为预填充和解码节点之间的KV缓存传输连接器。
  • "kv_role": "kv_producer" / "kv_consumer":预填充节点上为kv_producer,解码节点上为kv_consumer
  • "kv_port":Mooncake KV传输通信端口。预填充(30000)和解码(30100)节点组使用不同的端口范围。
  • "use_ascend_direct": true:启用Ascend直接传输KV缓存,降低延迟。
  • "prefill" / "decode"部分:分别指定预填充和解码节点组的dp_sizetp_size。这些必须与实际部署拓扑匹配(prefill: dp4 tp8decode: dp32 tp1)。

请求转发(代理):

  • 代理命令将每个预填充引擎端点(每节点4个预填充主机 × 2个端口)和每个解码引擎端点(32个解码主机/端口)映射到端口8000上的单一入口点。
  • 代理程序可在load_balance_proxy_server_example.py中找到。

请参阅envs.py以了解上述环境变量的进一步说明和限制。

5.1.1.4 基于RoCE的多节点部署

本节介绍在物理节点之间使用RoCE的A3部署(例如跨SuperPod的部署)所需的额外配置。请在上文对应的A3部署命令基础上应用这些设置。

  1. 逻辑SuperPod配置

    为每个物理节点设置唯一的HCCL_LOGIC_SUPERPOD_ID。同一物理节点上的所有vLLM进程必须使用相同的值。

  2. 专家并行通信配置

    支持的MC2通信模式取决于专家并行(EP)通信域是否跨越物理节点:

    • 如果EP通信域包含在物理节点内,则无需更改现有配置。融合MC2仍然受支持。
    • 如果EP通信域跨越物理节点,则不支持融合MC2。需要通过RoCE进行分层MC2通信,并且必须通过将"mc2_comm_alg": "hierarchy"添加到--additional-config来启用。

示例

对于1P1D(2+2)场景,请按如下方式配置逻辑SuperPod ID:

Physical node Configuration
Prefill node 0 export HCCL_LOGIC_SUPERPOD_ID=0
Prefill node 1 export HCCL_LOGIC_SUPERPOD_ID=1
Decode node 0 export HCCL_LOGIC_SUPERPOD_ID=2
Decode node 1 export HCCL_LOGIC_SUPERPOD_ID=3

在每个节点上应用以下Fused MC2设置:

--additional-config '{..., "enable_fused_mc2": 0, "mc2_comm_alg": "hierarchy"}'

"mc2_comm_alg": "hierarchy"合并到现有的--additional-config JSON对象中。以下模式使用...表示现有字段:

--additional-config '{..., "mc2_comm_alg": "hierarchy"}'

5.1.2 Atlas 800 A2

5.1.2.1 多节点共置部署
  • GLM-5.2-w4a8c8:可部署在2台Atlas 800 A2(64GB × 8)上。单台Atlas 800 A2节点(8 × 64GB)无法容纳w4a8c8权重,因此2节点部署是A2系列的最低配置。

节点0

# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"

# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxx"

export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export VLLM_RPC_TIMEOUT=360000
export VLLM_EXECUTE_MODEL_TIMEOUT_SECONDS=30000
export HCCL_EXEC_TIMEOUT=200
export HCCL_CONNECT_TIMEOUT=120
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export ACL_OP_INIT_MODE=1
export TASK_QUEUE_ENABLE=1
export CPU_AFFINITY_CONF=1
export VLLM_ENGINE_READY_TIMEOUT_S=1200

vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--max_model_len 40000 \
--max-num-batched-tokens 4096 \
--served-model-name glm-52 \
--seed 1024 \
--gpu-memory-utilization 0.95 \
--api-server-count 1 \
--max-num-seqs 16 \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 13389 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--quantization ascend \
--port 7000 \
--safetensors-load-strategy 'prefetch' \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 5, "method": "deepseek_mtp", "enforce_eager": true}'

节点1

# this obtained through ifconfig
# nic_name is the network interface name corresponding to local_ip of the current node
nic_name="xxx"
local_ip="xxx"

# The value of node0_ip must be consistent with the value of local_ip set in node0 (master node)
node0_ip="xxx"

export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export VLLM_RPC_TIMEOUT=360000
export VLLM_EXECUTE_MODEL_TIMEOUT_SECONDS=30000
export HCCL_EXEC_TIMEOUT=200
export HCCL_CONNECT_TIMEOUT=120
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export ACL_OP_INIT_MODE=1
export TASK_QUEUE_ENABLE=1
export CPU_AFFINITY_CONF=1
export VLLM_ENGINE_READY_TIMEOUT_S=1200

vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
--max_model_len 40000 \
--max-num-batched-tokens 4096 \
--served-model-name glm-52 \
--seed 1024 \
--gpu-memory-utilization 0.95 \
--max-num-seqs 16 \
--headless \
--data-parallel-size 2 \
--data-parallel-size-local 1 \
--data-parallel-start-rank 1 \
--data-parallel-address $node0_ip \
--data-parallel-rpc-port 13389 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--quantization ascend \
--port 7000 \
--safetensors-load-strategy 'prefetch' \
--block-size 128 \
--additional-config '{"multistream_overlap_shared_expert": true}' \
--compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
--speculative-config '{"num_speculative_tokens": 5, "method": "deepseek_mtp", "enforce_eager": true}'

关键参数说明(除单节点部署多节点共置部署外):

A2系列使用与A3不同的优化栈;此处不使用DSA-CP。

A2专属环境变量:

  • CPU_AFFINITY_CONF=1:为工作进程启用CPU核心亲和性绑定。
  • ACL_OP_INIT_MODE=1:ACL算子初始化模式,加速算子编译。
  • VLLM_RPC_TIMEOUT=360000 / VLLM_EXECUTE_MODEL_TIMEOUT_SECONDS=3000 / HCCL_EXEC_TIMEOUT=200 / HCCL_CONNECT_TIMEOUT=120 / VLLM_ENGINE_READY_TIMEOUT_S=1200:针对较慢的A2平台的多节点启动和模型执行超时设置。若引擎未能及时就绪,请增大这些值。
5.1.2.2 预填充-解码分离

在Atlas 800 A2上,每个节点暴露8张卡,相同的全局P/D拓扑(预填充DP4 TP8,解码DP8 TP4)分布在8个节点上:4个预填充节点各托管1个DP rank(每个rank 8张卡),4个解码节点各托管2个DP rank(每个rank 4张卡)。上述launch_online_dp.py原样复用。预填充侧使用DSA CP;解码侧启用MLAPO和带有FULL_DECODE_ONLY图的DYNAMIC_EPLB。两侧均启用前缀缓存和MTP(预填充num_speculative_tokens=1,解码3)。以下所有IP、NIC名称、端口和权重路径均为占位符。

KV Cache Pool(Ascend Store)的启动方法及Mooncake配置文件请参考KV Cache Pool(Ascend Store)部署指南

prefill节点的run_dp_template.sh

#!/usr/bin/bash
nic_name="<NIC_NAME>"
local_ip="<CURRENT_NODE_IP>"

export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export HCCL_BUFFSIZE=256
export TASK_QUEUE_ENABLE=1
export HCCL_OP_EXPANSION_MODE="AIV"
export VLLM_USE_V1=1
export ASCEND_RT_VISIBLE_DEVICES=$1
export LD_LIBRARY_PATH=/usr/local/python3.11.10/lib:/usr/local/lib:$LD_LIBRARY_PATH
export ASCEND_AGGREGATE_ENABLE=1
export ASCEND_TRANSPORT_PRINT=1
export PYTHONHASHSEED=0
export MOONCAKE_CONFIG_PATH="/mnt/share/scripts/mooncake.json"
export HCCL_INTRA_ROCE_ENABLE=1
export ACL_OP_INIT_MODE=1

vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
    --host 0.0.0.0 \
    --port $2 \
    --data-parallel-size $3 \
    --data-parallel-rank $4 \
    --data-parallel-address $5 \
    --data-parallel-rpc-port $6 \
    --tensor-parallel-size $7 \
    --enable-expert-parallel \
    --enable-prefix-caching \
    --seed 1024 \
    --enable-chunked-prefill \
    --served-model-name glm-5 \
    --max-model-len 256000 \
    --max-num-batched-tokens 8192 \
    --trust-remote-code \
    --max-num-seqs 256 \
    --gpu-memory-utilization 0.95 \
    --safetensors-load-strategy prefetch \
    --quantization ascend \
    --enforce-eager \
    --enable-auto-tool-choice \
    --tool-call-parser glm47 \
    --reasoning-parser glm45 \
    --kv-transfer-config \
    '{
    "kv_connector": "MultiConnector",
    "kv_role": "kv_producer",
    "kv_load_failure_policy": "recompute",
    "kv_connector_extra_config": {
        "connectors": [
            {
                "kv_connector": "MooncakeConnectorV1",
                "kv_role": "kv_producer",
                "kv_port": "30000",
                "kv_connector_extra_config": {
                    "prefill": {
                        "dp_size": 4,
                        "tp_size": 8
                    },
                    "decode": {
                        "dp_size": 8,
                        "tp_size": 4
                    }
                }
            },
            {
                "kv_connector": "AscendStoreConnector",
                "kv_role": "kv_producer",
                "kv_connector_extra_config": {
                    "lookup_rpc_port":"0",
                    "backend": "mooncake"
                }
            }
        ]
    }
    }' \
    --additional-config '{"enable_dsa_cp": true, "multistream_overlap_shared_expert": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true}' \
    --speculative-config '{"num_speculative_tokens": 1, "method":"deepseek_mtp", "enforce_eager":true}'

run_dp_template.sh 用于解码节点:

#!/usr/bin/bash

nic_name="<NIC_NAME>"
local_ip="<CURRENT_NODE_IP>"

export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export VLLM_HOST_IP=$local_ip
export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=10
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export HCCL_BUFFSIZE=2560
export TASK_QUEUE_ENABLE=1
export HCCL_OP_EXPANSION_MODE="AIV"
export VLLM_USE_V1=1
export ASCEND_RT_VISIBLE_DEVICES=$1
export LD_LIBRARY_PATH=/usr/local/python3.11.10/lib:/usr/local/lib:$LD_LIBRARY_PATH
export PYTHONHASHSEED=0
export MOONCAKE_CONFIG_PATH="/mnt/share/scripts/mooncake.json"
export HCCL_INTRA_ROCE_ENABLE=1
export ACL_OP_INIT_MODE=1

vllm serve /root/.cache/modelscope/hub/models/vllm-ascend/GLM-5.2-w4a8c8 \
    --host 0.0.0.0 \
    --port $2 \
    --data-parallel-size $3 \
    --data-parallel-rank $4 \
    --data-parallel-address $5 \
    --data-parallel-rpc-port $6 \
    --tensor-parallel-size $7 \
    --enable-expert-parallel \
    --enable-prefix-caching \
    --seed 1024 \
    --served-model-name glm-5 \
    --max-model-len 256000 \
    --max-num-batched-tokens 256 \
    --trust-remote-code \
    --max-num-seqs 128 \
    --gpu-memory-utilization 0.95 \
    --safetensors-load-strategy prefetch \
    --quantization ascend \
    --enable-auto-tool-choice \
    --tool-call-parser glm47 \
    --reasoning-parser glm45 \
    --kv-transfer-config \
    '{
    "kv_connector": "MultiConnector",
    "kv_role": "kv_consumer",
    "kv_load_failure_policy": "recompute",
    "kv_connector_extra_config": {
        "connectors": [
            {
                "kv_connector": "MooncakeConnectorV1",
                "kv_role": "kv_consumer",
                "kv_port": "30100",
                "kv_connector_extra_config": {
                    "prefill": {
                        "dp_size": 4,
                        "tp_size": 8
                    },
                    "decode": {
                        "dp_size": 8,
                        "tp_size": 4
                    }
                }
            },
            {
                "kv_connector": "AscendStoreConnector",
                "kv_role": "kv_consumer",
                "kv_connector_extra_config": {
                    "lookup_rpc_port":"0",
                    "load_async": true,
                    "backend": "mooncake"
                }
            }
        ]
    }
    }' \
     --compilation-config \
    '{
        "cudagraph_mode": "FULL_DECODE_ONLY",
    }' \
    --additional-config '{"multistream_overlap_shared_expert": true, "enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, "recompute_scheduler_enable": true, "enable_mlapo": true}' \
    --speculative-config '{"num_speculative_tokens": 3, "method":"deepseek_mtp", "enforce_eager":true}'

准备工作完成后,使用以下命令启动服务器:

  1. 预填充节点 — 在 $node_p0_ip$node_p1_ip$node_p2_ip$node_p3_ip 上运行,使用 --dp-rank-start 0/1/2/3

    python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 0 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081
    python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 1 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081
    python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 2 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081
    python launch_online_dp.py --dp-size 4 --tp-size 8 --dp-size-local 1 --dp-rank-start 3 --dp-address $node_p0_ip --dp-rpc-port 16591 --vllm-start-port 9081
    
  2. 解码节点 — 在 $node_d0_ip$node_d1_ip$node_d2_ip$node_d3_ip 上运行,使用 --dp-rank-start 0/2/4/6

    python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 0 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900
    python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 2 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900
    python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 4 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900
    python launch_online_dp.py --dp-size 8 --tp-size 4 --dp-size-local 2 --dp-rank-start 6 --dp-address $node_d0_ip --dp-rpc-port 16600 --vllm-start-port 9900
    

对于此 8 节点 A2 布局的请求转发,请在下面的请求转发命令中使用 4 个预填充主机(每个 1 个端点)和 4 个解码器主机(每个 2 个端点)。

要设置请求转发,请在任意机器上运行以下脚本。您可以在仓库的示例中获取代理程序:load_balance_proxy_server_example.py

unset http_proxy
unset https_proxy

python load_balance_proxy_server_example.py \
    --port 8000 \
    --host 0.0.0.0 \
    --prefiller-hosts \
      $node_p0_ip \
      $node_p1_ip \
      $node_p2_ip \
      $node_p3_ip \
    --prefiller-ports \
      9081 9081 \
      9081 9081 \
    --decoder-hosts \
      $node_d0_ip \
      $node_d0_ip \
      $node_d1_ip \
      $node_d1_ip \
      $node_d2_ip \
      $node_d2_ip \
      $node_d3_ip \
      $node_d3_ip \
    --decoder-ports \
      9900 9901 9900 9901 \
      9900 9901 9900 9901

关键参数说明(除预填充-解码分离外):

该8节点A2布局将全局P/D拓扑分布到8个Atlas 800 A2节点上:4个预填充节点各承载1个DP rank(每个rank 8张卡,DP4 TP8),4个解码节点各承载2个DP rank(每个rank 4张卡,DP8 TP4)。launch_online_dp.py脚本与预填充-解码分离中的相同。

预填充节点特定配置(A2):

  • --additional-config '{"enable_sparse_sfa_c8": true, "enable_sparse_li_c8": true, ...}':此场景中启用了两个SFA C8优化(而A3共置场景中为enable_sparse_sfa_c8: false)。

解码节点特定配置(A2):

  • additional_config.enable_mlapo=true:在解码节点上进行MLAPO融合,用于内存带宽受限的令牌生成。
  • --max-num-batched-tokens 256:解码节点上的小批量令牌限制。

多连接器KV传输配置(--kv-transfer-config):

  • "kv_connector": "MultiConnector":组合多个KV传输连接器。
  • MooncakeConnectorV1:预填充节点与解码节点之间的Mooncake KV缓存传输(与预填充-解码分离中的角色相同)。
  • AscendStoreConnector:KV Cache Pool(Ascend Store)连接器,自v0.23.0起可用——参见KV Cache Pool(Ascend Store)部署指南
  • "kv_load_failure_policy": "recompute":当从KV池加载KV块失败时,请求回退到重计算而不是失败。
  • "load_async": true(解码侧):在解码节点上异步从池中加载KV缓存。
  • "backend": "mooncake":连接器使用的Ascend Store后端。

A2 PD场景的环境变量:

  • VLLM_USE_V1=1:强制使用v1调度器。
  • ASCEND_AGGREGATE_ENABLE=1 / ASCEND_TRANSPORT_PRINT=1:通信聚合和传输调试打印。
  • PYTHONHASHSEED=0:固定哈希种子,用于可复现的分布式调度。
  • MOONCAKE_CONFIG_PATH="/mnt/share/scripts/mooncake.json":Mooncake配置文件路径(每个节点上必须存在)。
  • HCCL_INTRA_ROCE_ENABLE=1:启用通过RoCE的HCCL节点内通信。
  • ACL_OP_INIT_MODE=1:ACL算子初始化模式。
  • VLLM_HOST_IP=$local_ip:解码引擎为跨节点通信通告的主机IP。

请参阅envs.py以了解上述环境变量的进一步说明和限制。

5.2 1M上下文部署

在Atlas 800 A3(64GB x 16)上使用1M上下文窗口服务GLM-5.2以及量化GLM-5.2(W4A8C8)权重的推荐配置:

模式 硬件 并行配置 上下文长度
单节点共置 1个Atlas 800 A3(64GB x 16) DP1 PP1 TP16 PCP1 DCP16 1024000
双节点共置 2个Atlas 800 A3(64GB x 16) DP4 PP1 TP8 PCP1 DCP8 1024000
1P1D PD 分离部署 1 个预填充节点(2 台 A3)+ 1 个解码节点(2 台 A3) 预填充 DP4 PP1 TP8 PCP1 DCP8,解码 DP4 PP1 TP8 PCP1 DCP8 1024000

1M上下文场景仅在Atlas 800 A3上验证;A2系列未针对1M上下文进行验证。

Warning

DCP 和稀疏 Flash Attention C8(enable_sparse_sfa_c8,也称为 sfa_c8)是 v0.23.0 中的实验性功能。在此版本中同时启用它们存在已知问题,包括性能下降,因此不建议这样做。以下 1M 部署示例启用了 DCP,并保持 enable_sparse_sfa_c8 为禁用状态。

5.2.1 单节点1M部署

推荐命令:

export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1

vllm serve <MODEL_PATH> \
  --seed 1024 \
  --host 0.0.0.0 \
  --port 9000 \
  --served-model-name glm-52 \
  --max-model-len 1024000 \
  --max-num-batched-tokens 16384 \
  --gpu-memory-utilization 0.80 \
  --api-server-count 1 \
  --max-num-seqs 32 \
  --data-parallel-size 1 \
  --pipeline-parallel-size 1 \
  --tensor-parallel-size 16 \
  --prefill-context-parallel-size 1 \
  --decode-context-parallel-size 16 \
  --cp-kv-cache-interleave-size 128 \
  --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY", "cudagraph_capture_sizes": [4, 16, 128]}' \
  --additional-config '{"enable_dsa_cp": true, "ascend_compilation_config": {"enable_npugraph_ex": true}, "multistream_overlap_shared_expert": true, "enable_sparse_li_c8": true, "enable_cpu_binding": true,"weight_nz_mode":1}' \
  --speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}' \
  --quantization ascend \
  --enable-expert-parallel \
  --safetensors-load-strategy prefetch

关键参数说明(除单节点部署外):

1M特定环境变量:

  • additional_config.weight_nz_mode=1:为C8量化张量启用NZ格式内存布局,这是1M上下文部署所必需的。
  • VLLM_WORKER_MULTIPROC_METHOD=spawn:为多进程工作器使用spawn启动方法(此场景下必需)。

1M特定vllm serve参数:

  • --data-parallel-size 1 / --pipeline-parallel-size 1 / --tensor-parallel-size 16:单节点并行布局DP1 PP1 TP16
  • --prefill-context-parallel-size 1 / --decode-context-parallel-size 16:解码阶段使用16的解码上下文并行(DCP);预填充使用PCP 1。
  • --cp-kv-cache-interleave-size 128:上下文并行的KV缓存交错大小。

5.2.2 双节点共置1M部署

两个共部署节点的推荐命令:

nic_name="<NIC_NAME>"
local_ip="<CURRENT_NODE_IP>"
node_0_ip="<NODE0_IP>"
# Node 0: data_parallel_start_rank=0, server_role_args="--api-server-count 1"
# Node 1: data_parallel_start_rank=2, server_role_args="--headless"
data_parallel_start_rank=0
server_role_args="--api-server-count 1"

export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1

vllm serve <MODEL_PATH> \
  --seed 1024 \
  --host 0.0.0.0 \
  --port 9000 \
  --served-model-name glm-52 \
  --max-model-len 1024000 \
  --max-num-batched-tokens 16384 \
  --gpu-memory-utilization 0.75 \
  ${server_role_args} \
  --max-num-seqs 8 \
  --data-parallel-size 4 \
  --data-parallel-size-local 2 \
  --data-parallel-start-rank $data_parallel_start_rank \
  --data-parallel-address $node_0_ip \
  --data-parallel-rpc-port 16591 \
  --pipeline-parallel-size 1 \
  --tensor-parallel-size 8 \
  --prefill-context-parallel-size 1 \
  --decode-context-parallel-size 8 \
  --cp-kv-cache-interleave-size 128 \
  --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
  --additional-config '{"enable_dsa_cp": true, "ascend_compilation_config": {"enable_npugraph_ex": true}, "multistream_overlap_shared_expert": true,"enable_sparse_li_c8": true, "enable_cpu_binding": true,"weight_nz_mode":1}' \
  --speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}' \
  --quantization ascend \
  --enable-expert-parallel \
  --safetensors-load-strategy prefetch

关键参数说明(除单节点1M部署外):

多节点配置:

  • --data-parallel-size 4 / --data-parallel-size-local 2 / --data-parallel-start-rank:节点0使用data_parallel_start_rank=0并带server_role_args="--api-server-count 1";节点1使用data_parallel_start_rank=2并带server_role_args="--headless"
  • --data-parallel-address $node_0_ip / --data-parallel-rpc-port 16591:数据并行主节点IP和RPC端口,两个节点上相同。
  • --tensor-parallel-size 8 / --decode-context-parallel-size 8DP4 TP8 DCP8布局——每个节点承载2个DP rank × TP8。

5.2.3 PD分离1M部署

两个预填充节点的推荐命令:

nic_name="<NIC_NAME>"
local_ip="<CURRENT_PREFILL_NODE_IP>"
node_p0_ip="<PREFILL_NODE0_IP>"
# Prefiller node 0: data_parallel_start_rank=0, server_role_args="--api-server-count 1"
# Prefiller node 1: data_parallel_start_rank=2, server_role_args="--headless"
data_parallel_start_rank=0
server_role_args="--api-server-count 1"

export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name

export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1
export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480

vllm serve <MODEL_PATH> \
  --seed 1024 \
  --host 0.0.0.0 \
  --port 9081 \
  --served-model-name glm-52 \
  --max-model-len 1024000 \
  --max-num-batched-tokens 16384 \
  --gpu-memory-utilization 0.75 \
  ${server_role_args} \
  --max-num-seqs 8 \
  --data-parallel-size 4 \
  --data-parallel-size-local 2 \
  --data-parallel-start-rank $data_parallel_start_rank \
  --data-parallel-address $node_p0_ip \
  --data-parallel-rpc-port 16591 \
  --pipeline-parallel-size 1 \
  --tensor-parallel-size 8 \
  --prefill-context-parallel-size 1 \
  --decode-context-parallel-size 8 \
  --cp-kv-cache-interleave-size 128 \
  --enforce-eager \
  --additional-config '{"enable_dsa_cp": true, "ascend_compilation_config": {"enable_npugraph_ex": true}, "multistream_overlap_shared_expert": true,"enable_sparse_li_c8": true, "enable_cpu_binding": true, "recompute_scheduler_enable": true,"weight_nz_mode":1}' \
  --speculative-config '{"num_speculative_tokens": 1, "method": "deepseek_mtp", "enforce_eager": true}' \
  --quantization ascend \
  --enable-expert-parallel \
  --safetensors-load-strategy prefetch \
  --kv-transfer-config \
  '{"kv_connector": "MooncakeConnectorV1",
    "kv_role": "kv_producer",
    "kv_port": "30000",
    "engine_id": "0",
    "kv_connector_extra_config": {
      "use_ascend_direct": true,
      "prefill": {
        "dp_size": 4,
        "tp_size": 8
      },
      "decode": {
        "dp_size": 4,
        "tp_size": 8
      }
    }
  }'

两个解码节点的推荐命令:

nic_name="<NIC_NAME>"
local_ip="<CURRENT_DECODE_NODE_IP>"
node_d0_ip="<DECODE_NODE0_IP>"
# Decoder node 0: data_parallel_start_rank=0, server_role_args="--api-server-count 1"
# Decoder node 1: data_parallel_start_rank=2, server_role_args="--headless"
data_parallel_start_rank=0
server_role_args="--api-server-count 1"

export HCCL_IF_IP=$local_ip
export GLOO_SOCKET_IFNAME=$nic_name
export TP_SOCKET_IFNAME=$nic_name
export HCCL_SOCKET_IFNAME=$nic_name
export HCCL_OP_EXPANSION_MODE="AIV"
export OMP_PROC_BIND=false
export OMP_NUM_THREADS=20
export HCCL_BUFFSIZE=768
export HCCL_TRANSFER_TIMEOUT=600
export HCCL_EXEC_TIMEOUT=3600
export HCCL_CONNECT_TIMEOUT=3600
export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True
export VLLM_WORKER_MULTIPROC_METHOD=spawn
export TASK_QUEUE_ENABLE=1
export VLLM_MOONCAKE_ABORT_REQUEST_TIMEOUT=480

vllm serve <MODEL_PATH> \
  --seed 1024 \
  --host 0.0.0.0 \
  --port 9900 \
  --served-model-name glm-52 \
  --max-model-len 1024000 \
  --max-num-batched-tokens 128 \
  --gpu-memory-utilization 0.93 \
  ${server_role_args} \
  --max-num-seqs 32 \
  --data-parallel-size 4 \
  --data-parallel-size-local 2 \
  --data-parallel-start-rank $data_parallel_start_rank \
  --data-parallel-address $node_d0_ip \
  --data-parallel-rpc-port 16600 \
  --pipeline-parallel-size 1 \
  --tensor-parallel-size 8 \
  --prefill-context-parallel-size 1 \
  --decode-context-parallel-size 8 \
  --cp-kv-cache-interleave-size 128 \
  --compilation-config '{"cudagraph_mode": "FULL_DECODE_ONLY"}' \
  --additional-config '{"ascend_compilation_config": {"enable_npugraph_ex": true},"multistream_overlap_shared_expert": true,"enable_sparse_li_c8": true, "enable_cpu_binding": true, "recompute_scheduler_enable": true,"weight_nz_mode":1}' \
  --speculative-config '{"num_speculative_tokens": 3, "method": "deepseek_mtp", "enforce_eager": true}' \
  --quantization ascend \
  --enable-expert-parallel \
  --safetensors-load-strategy prefetch \
  --kv-transfer-config \
  '{"kv_connector": "MooncakeConnectorV1",
    "kv_role": "kv_consumer",
    "kv_port": "30100",
    "engine_id": "1",
    "kv_connector_extra_config": {
      "use_ascend_direct": true,
      "prefill": {
        "dp_size": 4,
        "tp_size": 8
      },
      "decode": {
        "dp_size": 4,
        "tp_size": 8
      }
    }
  }'

推荐代理命令:

unset http_proxy
unset https_proxy

python load_balance_proxy_server_example.py \
  --host 0.0.0.0 \
  --port 8000 \
  --prefiller-hosts <PREFILL_NODE0_IP> \
  --prefiller-ports 9081 \
  --decoder-hosts <DECODE_NODE0_IP> \
  --decoder-ports 9900

关键参数说明(除预填充-解码分离单节点1M部署外):

预填充节点(1M):

  • --additional-config '{"recompute_scheduler_enable": true, ...}':此场景中预填充和解码节点均启用重计算调度器。
  • --kv-transfer-config:Mooncake连接器作为kv_producer,使用prefill: dp4 tp8 / decode: dp4 tp8(与1M P/D拓扑匹配,不同于sub-1M PD场景中的dp32 tp1解码)。

解码节点(1M):

  • --max-num-batched-tokens 128:解码节点存储从预填充节点接收的大型1M KV缓存。
  • --kv-transfer-config:Mooncake连接器作为kv_consumerkv_port: 30100)。

6 功能验证

服务器启动后,您可以使用输入提示查询模型:

curl http://<node0_ip>:<port>/v1/completions \
    -H "Content-Type: application/json" \
    -d '{
        "model": "glm-52",
        "prompt": "The future of AI is",
        "max_completion_tokens": 50,
        "temperature": 0
    }'

7 精度评估

这里提供两种精度评估方法。

7.1 使用AISBench

  1. 有关详细信息,请参阅使用 AISBench

  2. 执行后,您可以获取结果。

7.2 使用Language Model Evaluation Harness

尚未测试。

8 性能评估

8.1 使用AISBench

有关详细信息,请参阅使用 AISBench 进行性能评估

8.2 使用vLLM Benchmark

更多详细信息请参考 vllm benchmark

9 性能调优

9.1 推荐配置

注意:以下配置在特定测试环境中验证通过,仅供参考。最佳配置取决于最大输入/输出长度、前缀缓存命中率、精度要求以及部署机器比例等因素。建议参考调优指南根据实际情况进行调优。

下表提供了不同部署场景下的推荐参数配置。所有场景按用途(低延迟、高吞吐、长上下文)分类,并对应部署章节中记录的部署模式。

9.1.1 表1:场景概览

*Total NPUs表示所有节点使用的NPU总数。1个节点 = 1台Atlas 800 A3服务器(64GB × 16 NPU)或1台Atlas 800 A2服务器(64GB × 8 NPU)。

场景 部署模式 *NPU总数 权重版本 关键考虑因素
Low Latency
(64k input)
Dual-Node Co-Located (A3), Multi-Node Co-Located Deployment 32 (A3) w4a8c8 dp2 tp16, MTP3, max-num-seqs 8, max-model-len 135000, DSA CP
Low Latency
(128k input)
Dual-Node Co-Located (A3), Multi-Node Co-Located Deployment 32 (A3) w4a8c8 dp2 tp16, MTP3, max-num-seqs 8, max-model-len 135000, DSA CP
High Throughput
(64k input)
Dual-Node Co-Located (A3), Multi-Node Co-Located Deployment 32 (A3) w4a8c8 dp4 tp8, fused MC2, MTP3, max-num-seqs 16, max-model-len 66000, DSA CP
高吞吐 PD分离(A3),预填充-解码分离 4节点 (A3) w4a8c8 P:dp4 tp8(max-num-seqs 64, max-num-batched-tokens 8192, MTP1);D:dp32 tp1(max-num-seqs 32, max-num-batched-tokens 164, MTP5),max-model-len 133120,专用P/D节点,Mooncake KV传输
长上下文
(1M)
PD分离(A3),PD分离1M部署 4节点 (A3) w4a8c8 P/D:dp4 tp8, DCP8, max-model-len 1040000, Mooncake KV传输

9.1.2 表2:详细节点配置

TP/DP列显示部署脚本中配置的每节点值(一个承载2个TP8 DP rank或1个TP16 DP rank的节点使用16个NPU)。

注意: max-model-lenmax-num-seqs需要根据实际使用场景进行设置。其他设置请参考部署章节。

场景 配置 NPU(每节点) TP DP(每节点) Max Num Seqs Max Num Batched Tokens Max Model Len MTP Spec Num
Low Latency 64k (A3) Dual-Node (per node), Multi-Node Co-Located Deployment 16 16 1 8 8192 135000 3
Low Latency 128k (A3) Dual-Node (per node), Multi-Node Co-Located Deployment 16 16 1 8 8192 135000 3
High Throughput 64k (A3) Dual-Node (per node), Multi-Node Co-Located Deployment 16 8 2 16 8192 66000 3
High Throughput (A3) PD — Server-P Node, Prefill-Decode Disaggregation 16 8 2 64 8192 133120 1
High Throughput (A3) PD — Server-D Node, Prefill-Decode Disaggregation 16 1 16 32 164 133120 5
Long Context 1M (A3) PD — Server-P Node, PD Disaggregation 1M Deployment 16 8 2 8 16384 1040000 1
Long Context 1M (A3) PD — Server-D Node, PD Disaggregation 1M Deployment 16 8 2 32 128 1040000 3

在PD解码节点上,--max-num-batched-tokens配置为(MTP Spec Num + 1) × Max Num Seqs——每个序列在每个解码步骤生成一个目标token加上推测的MTP token。

完整的启动命令和详细参数说明,请参考部署章节中的部署示例和关键参数说明。

9.1.3 表3:性能相关参数调优指南

参数 低延迟 高吞吐 长上下文 描述
--max-num-batched-tokens 较低(4096–8192) 预填充较高(8192) 预填充较高(16384) 控制每步的批处理大小。较低的值降低每步延迟;较高的值提升预填充吞吐。
--gpu-memory-utilization 0.92–0.95 0.90–0.95 0.75–0.93 NPU内存比例。1M场景必须为巨大的KV缓存预留内存,因此使用较低的值(预填充/共置节点上为0.75–0.80)。
num_speculative_tokens (MTP) 3–5 3–5 1(预填充)/ 3(解码) MTP推测数量。较高的值以草稿模型KV缓存内存为代价提升解码吞吐。PD模式下预填充节点使用1
enable_dsa_cp 可选 启用(预填充节点) 启用(预填充节点) DSA上下文并行加速长上下文预填充。
enable_sparse_sfa_c8 / enable_sparse_li_c8 false / true true / true (PD) false / true enable_sparse_sfa_c8 是针对 C8 量化模型的实验性 SFA 优化;由于已知问题,在 v0.23.0 中请勿将其与 DCP 结合使用。enable_sparse_li_c8 是独立的,仍然推荐启用。
enable_balance_scheduling 启用(单节点) 启用 PD模式下禁用 在v1调度器中提升输出吞吐并降低TPOT。某些场景下TTFT可能劣化;预填充-解码分离时不推荐使用。
additional_config.enable_mlapo 1(A2 P/D节点) 融合算子,显著提升性能但消耗更多NPU内存。在A3上仅用于解码节点。
cudagraph_mode FULL_DECODE_ONLY FULL_DECODE_ONLY(解码) FULL_DECODE_ONLY(解码) 仅对解码阶段进行图捕获。PD模式下的预填充节点改用--enforce-eager

9.2 调优指南

通用性能调优方法请参考公开性能调优文档

有关详细的特性描述和配置选项,请参阅特性矩阵

有关环境变量的描述和约束,请参阅 envs.py

10 常见问题解答

  • 问:如何为 GLM-5.2 启用函数调用?

答:请在 vLLM 启动命令中添加以下配置

--tool-call-parser glm47 \
--reasoning-parser glm45 \
--enable-auto-tool-choice \