Skip to content

vllm.model_executor.warmup.kimi_k3_triton_warmup

Warm up Kimi-K3 Triton kernels.

Functions:

kimi_k3_triton_warmup(worker)

Warm Kimi-K3 Triton kernels reachable by this server.

Source code in vllm/model_executor/warmup/kimi_k3_triton_warmup.py
@torch.inference_mode()
def kimi_k3_triton_warmup(worker: Worker) -> None:
    """Warm Kimi-K3 Triton kernels reachable by this server."""
    if not current_platform.is_cuda():
        return

    layer = _get_kda_layer(worker)
    if layer is None:
        return

    _warm_attn_res(worker)
    _warm_recurrent_kda(layer, worker.model_config.dtype)