跳转至
vLLM Ascend (中文)
模型教程
正在初始化搜索引擎
vllm-project/vllm-ascend
首页
快速开始
用户指南
开发者指南
社区
vLLM Ascend (中文)
vllm-project/vllm-ascend
首页
快速开始
快速开始
概览
快速开始
安装指南
模型教程
模型教程
Qwen3-Dense(0.6B/1.7B/4B/8B/14B/32B)
Qwen-VL-Dense(8B/32B)
Qwen3-30B-A3B
Qwen3-235B-A22B
Qwen3-VL-30B-A3B-Instruct
Qwen3-VL-235B-A22B-Instruct
Qwen3-Coder-30B-A3B
Qwen3-Embedding
Qwen3-VL-Embedding
SigLIP2
Qwen3-Reranker
Qwen3-VL-Reranker
Qwen3-Next
Qwen3-Omni-30B-A3B-Thinking
Qwen3.5-27B & Qwen3.6-27B
Qwen3.5-Dense (2B/4B/9B)
Qwen3.5-397B-A17B
Qwen3.6-35B-A3B
Qwen3.8-2.4T-A95B
Qwen3.8-27B
DeepSeek-V3 & 3.1
DeepSeek-V3.2
DeepSeek-V4-Flash
DeepSeek-V4-Pro
DeepSeek-R1
DeepSeek-OCR-2
Gemma4
GLM-4.x(4.5/4.6/4.7)
GLM-5 & GLM-5.1
GLM-5.2
GLM-5.3 (Experimental)
GLM-5.3-Flash
Kimi-K2-Thinking
Kimi-K2.5
Kimi-K2.6
Kimi-K3
PaddleOCR-VL
MiniMax-M2
MiniMax-M3
Hunyuan-A13B-Instruct
Hy3-preview
Hy4-preview (Experimental)
Minitron-8B-Base
LLaVA-OneVision-Qwen2-0.5B-OV
gpt-oss-120b
Mixtral-8x7B-Instruct-v0.1
Qwen3-ASR-1.7B
Cohere Transcribe
Qwen2.5-Math-RM-72B
InternVL3.5(38B/241B-A28B)
Dots3 Note
功能教程
功能教程
PD 共置(Mooncake,多实例)
PD 分离(Mooncake,单节点)
PD 分离(Mooncake,多节点)
动态分块流水线并行
后缀推测解码
Ray
常见问题
用户指南
用户指南
特性与模型
特性与模型
支持的模型
支持的特性
特性矩阵
配置
配置
环境变量
附加配置
Score 编码器缓存管理器
特性指南
特性指南
图模式
CPU 绑定
AI QoS
量化
休眠模式
结构化输出
LoRA
专家并行负载均衡
NetLoader
RFork
EPD 分离
KV 池
分层与稀疏KV缓存卸载指南
KV Cache CPU 卸载
重计算CPU卸载指南
大规模 EP
UCM 部署
细粒度 TP
推测解码
上下文并行
序列并行
批次不变性
LMCache Ascend 部署
流水线并行
动态分块流水线并行
Flash 注意力
ShortRequestFirst 预填充调度
批处理作业感知调度器
vLLM-Ascend 强化学习
部署指南
部署指南
使用 Volcano Kthena
使用 MindIE Motor
发布说明
开发者指南
开发者指南
贡献
贡献
测试
文档编写
多节点测试
夜间 CI 测试
端到端 CI 测试
设计文档
设计文档
补丁
CPU 绑定
ModelRunner 输入准备
分离式预填充
分层与稀疏KV缓存卸载设计
Model Runner V1 EPLB 架构
Model Runner V2 EPLB 架构
ACL 图
KV Cache 池指南
添加自定义 ACLNN 算子
上下文并行
平衡调度重构
动态分块流水线并行
量化
NPUGraph 扩展
评估
评估
使用 EvalScope
使用 lm_eval
使用 AISBench
使用 OpenCompass
性能与调试
性能与调试
性能基准测试
优化与调优
服务性能分析指南
msprobe 指南
社区
社区
治理
贡献者
Issue 工作流指南
Slash 命令
版本策略
用户故事
用户故事
LLaMA-Factory
模型教程
¶
本节提供 vLLM Ascend 不同模型的教程。
回到页面顶部