vllm.models.qwen4_exp.nvidia.ops.qsa_indexer ¶
Triton kernels for Qwen4Exp QSA index selection.
Functions:
-
expand_qsa_block_indices–Expand compressed blocks and compact the causal tail of the open group.
-
qsa_select_paged_decode–Score and select compressed blocks for a request-major decode batch.
-
qsa_select_paged_prefill–Score and select compressed prefill blocks in bounded chunks.
-
warmup_qsa_mqa_paged_decode–Compile every reachable decode specialization without launching it.
expand_qsa_block_indices(block_indices, query_positions, visible_blocks, compress_ratio, token_topk, out) ¶
Expand compressed blocks and compact the causal tail of the open group.
Source code in vllm/models/qwen4_exp/nvidia/ops/qsa_indexer.py
qsa_select_paged_decode(q, k_cache, page_table, visible_blocks, token_topk, compress_ratio, decode_query_len, block_indices) ¶
Score and select compressed blocks for a request-major decode batch.
Parameters:
-
(q¶Tensor) –Query tensor shaped
[num_requests * decode_query_len, heads, head_dim]. -
(k_cache¶Tensor) –Compressed key cache shaped
[blocks, page_size, 1, head_dim]. -
(page_table¶Tensor) –Request block table shaped
[num_requests, max_pages]. -
(visible_blocks¶Tensor) –Number of visible compressed blocks per query.
-
(token_topk¶int) –Number of logical tokens selected per query.
-
(compress_ratio¶int) –Number of logical tokens represented by a cache row.
-
(decode_query_len¶int) –Number of query tokens per request.
-
(block_indices¶Tensor) –Compressed-index output buffer.
Source code in vllm/models/qwen4_exp/nvidia/ops/qsa_indexer.py
qsa_select_paged_prefill(q, k_cache, page_table, query_start_loc, visible_blocks, token_topk, compress_ratio, max_query_len, block_indices, max_seq_len) ¶
Score and select compressed prefill blocks in bounded chunks.
Parameters:
-
(q¶Tensor) –Packed prefill query tensor shaped
[num_tokens, heads, head_dim]. -
(k_cache¶Tensor) –Compressed key cache shaped
[blocks, page_size, 1, head_dim]. -
(page_table¶Tensor) –Block table shaped
[num_requests, max_pages]. -
(query_start_loc¶Tensor) –Packed prefill query offsets with a terminal offset. Offsets may share the base of a larger backing tensor.
-
(visible_blocks¶Tensor) –Number of visible compressed blocks per query.
-
(token_topk¶int) –Number of logical tokens selected per query.
-
(compress_ratio¶int) –Number of logical tokens represented by a cache row.
-
(max_query_len¶int) –Maximum number of query tokens in one request.
-
(block_indices¶Tensor) –Compressed-index output buffer.
-
(max_seq_len¶int) –Longest context length in the batch this step.
Source code in vllm/models/qwen4_exp/nvidia/ops/qsa_indexer.py
warmup_qsa_mqa_paged_decode(k_cache, page_table, *, num_heads, head_dim, max_decode_query_len, max_num_reqs, max_num_batched_tokens) ¶
Compile every reachable decode specialization without launching it.