vllm.models.kimi_k3.nvidia.ops.cute_dsl ¶
Modules:
-
gemm_rs_ar–SM100 BF16 GEMM with fused tensor-parallel reduce-scatter/all-reduce.
-
kda_skinny_gemm–Kimi-K3 TP8 skinny GEMMs for the KDA F_A/beta and F_B projections.
-
latent_moe_tail–CuTe DSL kernels for KimiK3LatentMoETailOp.