跳转至主要内容
Ctrl+K

You are viewing the stable release (v0.23.0) documentation. Click here to view the latest developer preview documentation.

vllm-ascend - Home vllm-ascend - Home

快速入门

  • 快速入门
  • 安装
  • 模型教程
    • Qwen3-Dense(Qwen3-0.6B/1.7B/4B/8B/14B/32B)
    • Qwen-VL-Dense(Qwen3-VL-8B/32B)
    • Qwen3-30B-A3B
    • Qwen3-235B-A22B
    • Qwen3-VL-30B-A3B-Instruct
    • Qwen3-VL-235B-A22B-Instruct
    • Qwen3-Coder-30B-A3B
    • Qwen3-Embedding
    • Qwen3-VL-Embedding
    • Qwen3-Reranker
    • Qwen3-VL-Reranker
    • Qwen3-Next
    • Qwen3-Omni-30B-A3B-Thinking
    • Qwen3.5-27B 与 Qwen3.6-27B
    • Qwen3.5-Dense (Qwen3.5-2B/4B/9B)
    • Qwen3.5-397B-A17B
    • Qwen3.6-35B-A3B
    • DeepSeek-V3 与 3.1
    • DeepSeek-V3.2
    • DeepSeek-V4-Flash
    • DeepSeek-V4-Pro
    • DeepSeek-R1
    • DeepSeek-OCR-2
    • GLM-4.5/4.6/4.7
    • GLM-5 与 GLM-5.1
    • GLM-5.2
    • Kimi-K2-Thinking
    • Kimi-K2.5
    • Kimi-K2.6
    • Kimi-K3
    • PaddleOCR-VL
    • MiniMax-M2
    • Hunyuan-A13B-Instruct
    • Hy3-preview
    • Minitron-8B-Base
    • LLaVA-OneVision-Qwen2-0.5B-OV
    • gpt-oss-120b
    • Mixtral-8x7B-Instruct-v0.1
    • Qwen3-ASR-1.7B
    • Qwen2.5-Math-RM-72B
    • InternVL3.5(38B/241B-A28B)
  • 功能教程
    • PD-Colocated 与 Mooncake 多实例
    • 预填充-解码分离部署 (Qwen2.5-VL)
    • 预填充-解码分离部署(DeepSeek)
    • 长序列上下文并行(Qwen3-235B-A22B)
    • 长序列上下文并行(DeepSeek)
    • 动态分块流水线并行(DeepSeek-V3.1)
    • 后缀推测解码
    • Ray 分布式推理(Qwen3-235B-A22B)
  • 常见问题解答

用户指南

  • 功能与模型
    • 支持的模型
    • 支持的功能
    • 功能矩阵
  • 配置指南
    • 环境变量
    • 附加配置
  • 特性指南
    • 图模式指南
    • CPU 绑定
    • AI QoS 特性
    • 量化指南
    • 休眠模式指南
    • 结构化输出指南
    • LoRA适配器指南
    • 专家并行负载均衡器 (EPLB)
    • Netloader 使用指南
    • RFork 使用指南
    • 动态批处理
    • 解耦编码器
    • KV缓存池(昇腾存储)部署指南
    • 逐层KV池
    • KV缓存CPU卸载指南
    • 重新计算CPU卸载指南
    • 外部数据并行
    • 大规模专家并行场景下的分布式DP服务器
    • UCM 存储部署指南
    • 细粒度张量并行
    • 层分片线性算子指南
    • 推测解码指南
    • 上下文并行指南
    • 权重预取指南
    • 序列并行
    • 批次不变性
    • LMCache-Ascend 部署指南
    • 动态分块流水线并行
    • Flash Attention 3
  • 部署指南
    • 使用 Volcano Kthena
    • 使用MindIE-Motor部署vLLM-Ascend
  • 版本发布说明

开发者指南

  • 贡献指南
    • 测试
    • 文档编写指南
    • 多节点测试
    • Nightly CI 测试
    • E2E CI 测试
  • 设计文档
    • vLLM Ascend 中的补丁
    • CPU 绑定
    • 准备模型前向传播的输入
    • 分离式预填充
    • 专家并行负载均衡器(EPLB)
    • ACL 图
    • KV缓存池
    • 添加自定义aclnn算子
    • 上下文并行(CP)
    • 动态分块流水线并行(CPP)
    • 量化适配指南
    • Npugraph_ex
  • 准确率
    • 使用EvalScope
    • 使用 lm-eval
    • 使用AISBench
    • 使用 OpenCompass
  • 性能与调试
    • 性能基准测试
    • 优化与调优
    • 服务性能分析指南
    • MSProbe 调试指南

社区

  • 治理
  • 提交者与贡献者
  • 问题工作流指南
  • 斜杠命令
  • 版本管理策略
  • 用户案例
    • LLaMA-Factory
  • Repository
  • Suggest edit
  • .md

功能教程

功能教程#

本节提供 vLLM Ascend 不同功能的教程。

功能教程

  • PD-Colocated 与 Mooncake 多实例
  • 预填充-解码分离部署 (Qwen2.5-VL)
  • 预填充-解码分离部署(DeepSeek)
  • 长序列上下文并行(Qwen3-235B-A22B)
  • 长序列上下文并行(DeepSeek)
  • 动态分块流水线并行(DeepSeek-V3.1)
  • 后缀推测解码
  • Ray 分布式推理(Qwen3-235B-A22B)

上一页

InternVL3.5(38B/241B-A28B)

下一页

PD-Colocated 与 Mooncake 多实例

作者: the vllm-ascend team

© Copyright 2025, vllm-ascend team.