分离式预填充#

为什么需要分离式预填充?#

该功能旨在优化大规模推理任务中的每个输出令牌时间(TPOT)首令牌时间(TTFT)。其动机有两个方面:

  1. 调整P节点和D节点的并行策略与实例数量 通过使用分离式预填充策略,该功能允许系统灵活调整P(预填充器)和D(解码器)节点的并行化策略(如数据并行(dp)、张量并行(tp)和专家并行(ep))及实例数量。这有助于更好地调优系统性能,特别是针对TTFTTPOT

  2. 优化TPOT 在没有分离式预填充策略的情况下,预填充任务会在解码过程中插入,导致效率低下和延迟。分离式预填充通过允许更好地控制系统TPOT来解决此问题。通过有效管理分块预填充任务,系统避免了确定最佳块大小的挑战,并提供了对生成输出令牌时间更可靠的控制。


使用方法#

vLLM Ascend 当前支持两种类型的连接器来处理KV缓存管理:

  • MooncakeConnector:D节点从P节点拉取KV缓存。

  • MooncakeLayerwiseConnector:P节点以逐层方式将KV缓存推送到D节点。

有关逐步部署和配置,请参考以下指南: https://docs.vllm.ai/projects/ascend/en/latest/tutorials/features/pd_disaggregation_mooncake_multi_node.html


工作原理#

1.设计方法#

在分离式预填充架构下,全局代理接收外部请求,将预填充转发至P节点,解码转发至D节点;KV缓存(键值缓存)通过点对点(P2P)通信在P节点和D节点之间交换。

2.实现设计#

我们的设计图如下所示,分别展示了拉取和推送方案。 替代文本 替代文本

Mooncake连接器#

  1. 请求被发送到代理的_handle_completions端点。

  2. 代理调用select_prefiller选择一个P节点并转发请求,配置kv_transfer_params参数为do_remote_decode=Truemax_completion_tokens=1min_tokens=1

  3. P节点调度器完成预填充后,update_from_output调用调度连接器的request_finished以延迟KV缓存释放,构造kv_transfer_params参数为do_remote_prefill=True,并返回给代理。

  4. 代理调用select_decoder选择一个D节点并转发请求。

  5. 在D节点上,调度器将请求标记为RequestStatus.WAITING_FOR_REMOTE_KVS,预分配KV缓存,调用kv_connector_no_forward拉取远程KV缓存,然后通知P节点释放KV缓存并继续解码以返回结果。

Mooncake逐层连接器#

  1. 请求被发送到代理的_handle_completions端点。

  2. 代理调用select_decoder选择一个D节点并转发请求,配置kv_transfer_params参数为do_remote_prefill=True并设置metaserver端点。

  3. 在D节点上,调度器使用kv_transfer_params将请求标记为RequestStatus.WAITING_FOR_REMOTE_KVS,预分配KV缓存,然后调用kv_connector_no_forward向元服务器发送请求并等待KV缓存传输完成。

  4. 代理的metaserver端点接收请求,调用select_prefiller选择一个P节点,并转发请求,设置kv_transfer_params参数为do_remote_decode=Truemax_completion_tokens=1min_tokens=1

  5. 处理过程中,P节点调度器逐层推送KV缓存;所有层推送完成后,释放请求并通知D节点开始解码。

  6. D节点执行解码并返回结果。

3.接口设计#

以MooncakeConnector为例,系统组织为三个主要类:

  • MooncakeConnector:提供核心接口的基类。

  • MooncakeConnectorScheduler:用于在引擎核心内调度连接器的接口,负责管理KV缓存传输需求和完成。

  • MooncakeConnectorWorker:用于管理工作进程中KV缓存注册和传输的接口。

4.规格设计#

该功能灵活且支持多种配置,包括使用MLA和GQA模型的设置。它与A2和A3硬件配置兼容,并支持跨多个P和D节点的相等TP设置及某些不等TP设置场景。

功能

状态

A2

🟢 功能正常

A3

🟢 功能正常

相等TP配置

🟢 功能正常

不等TP配置

🟢 功能正常

MLA

🟢 功能正常

GQA

🟢 功能正常

  • 🟢 功能正常:完全可用,持续优化中。

  • 🔵 实验性:实验性支持,接口和功能可能发生变化。

  • 🚧 开发中:正在积极开发中,即将支持。

  • 🟡 已计划:已排入未来实现计划(部分可能有开放的 PR/RFC)。

  • 🔴 无计划/已弃用:vLLM 暂无计划或已弃用。


DFX 分析#

1.配置参数验证#

通过检查 kv_connector 类型是否受支持来验证 KV 传输配置。传输失败时,输出清晰的错误日志以辅助诊断。

2.端口冲突检测#

启动前,通过尝试绑定对已配置端口(如 rpc_port、metrics_port、http_port/metaserver)执行端口占用检查。若端口已被占用,则快速失败并记录错误日志。

3.PD 比例验证#

在非对称 PD 场景下,根据预期和调度约束验证 P 与 D 的 tp 比例,以确保正确可靠的运行。


限制#

  • 不支持异构 P 节点和 D 节点,例如在 A2 上运行 P 节点、在 A3 上运行 D 节点。

  • 在PD分离部署中,P节点不支持非默认的max_num_partial_prefills值。请将其保持为默认值1;其他值将被忽略并重置为1

  • 在非对称 TP 配置中,仅支持 P 节点的 TP 度数高于 D 节点且 P 的 TP 数量是 D 的 TP 数量的整数倍的情况(即 P_tp > D_tp 且 P_tp % D_tp = 0)。