vllm_omni.config ¶
Configuration module for vLLM-Omni.
Modules:
| Name | Description |
|---|---|
composable_parallel | Composable parallel strategies for vLLM-Omni. |
config_factory | Config factories for vllm-omni, e.g., StageConfigFactory. |
endpoint_policy | Endpoint restriction policy for omni pipelines. |
environment_variable_inventory | Reviewed inventory of environment variables used by vLLM-Omni. |
lora | |
model | |
omni_config | Structured vLLM-Omni configuration classes. |
pipeline_registry | Pipeline registry and factory for vllm-omni. |
resolver | |
server_settings | |
stage_config | Stage configuration system for vLLM-Omni. |
yaml_util | Centralized OmegaConf wrapper for vLLM-Omni. |
PIPELINE_WIDE_ENGINE_FIELDS module-attribute ¶
StageConfigType module-attribute ¶
StageConfigType: TypeAlias = (
VllmOmniARStageConfig
| VllmOmniGenerationStageConfig
| VllmOmniDiffusionStageConfig
)
BaseVllmOmniStageConfig ¶
Common structured config contract shared by all Omni stage realizations.
cache_config class-attribute instance-attribute ¶
cache_config: OmniStageCacheConfig = field(
default_factory=OmniStageCacheConfig
)
compilation_config class-attribute instance-attribute ¶
connector_config class-attribute instance-attribute ¶
connector_config: OmniStageConnectorConfig = field(
default_factory=OmniStageConnectorConfig
)
load_config class-attribute instance-attribute ¶
load_config: OmniStageLoadConfig = field(
default_factory=OmniStageLoadConfig
)
model_config class-attribute instance-attribute ¶
model_config: OmniStageModelConfig = field(
default_factory=OmniStageModelConfig
)
parallel_config class-attribute instance-attribute ¶
parallel_config: OmniStageParallelConfig = field(
default_factory=OmniStageParallelConfig
)
pooling_config class-attribute instance-attribute ¶
pooling_config: OmniStagePoolingConfig = field(
default_factory=OmniStagePoolingConfig
)
quantization_config class-attribute instance-attribute ¶
runtime_config class-attribute instance-attribute ¶
runtime_config: OmniStageRuntimeConfig = field(
default_factory=OmniStageRuntimeConfig
)
scheduler_config class-attribute instance-attribute ¶
scheduler_config: OmniStageSchedulerConfig = field(
default_factory=OmniStageSchedulerConfig
)
DeployConfig dataclass ¶
Loaded from deploy/
Top-level fields (trust_remote_code, distributed_executor_backend, dtype, quantization, enable_prefix_caching, enable_chunked_prefill, data_parallel_size, pipeline_parallel_size) are pipeline-wide: they apply uniformly to every stage. Fields that legitimately vary per stage live in the individual StageDeployConfig entries under stages:.
distributed_executor_backend class-attribute instance-attribute ¶
distributed_executor_backend: str | None = None
duplex_session class-attribute instance-attribute ¶
duplex_session: DuplexSessionRuntimeConfig = field(
default_factory=DuplexSessionRuntimeConfig
)
enable_chunked_prefill class-attribute instance-attribute ¶
enable_chunked_prefill: bool | None = None
enable_prefix_caching class-attribute instance-attribute ¶
enable_prefix_caching: bool | None = None
pipeline_parallel_size class-attribute instance-attribute ¶
pipeline_parallel_size: int | None = None
stages class-attribute instance-attribute ¶
stages: list[StageDeployConfig] = field(
default_factory=list
)
OmniModelConfig ¶
Bases: ModelConfig
Configuration for Omni models, extending the base ModelConfig.
This configuration class extends the base vLLM ModelConfig with omni-specific fields for multi-stage pipeline processing.
Attributes: hf_config: The model's HF Transformers config (default: None) hf_text_config: The sub text_config of the model's hf_config (default: None) stage_id: Identifier for the stage in a multi-stage pipeline (default: 0) async_chunk: If set to True, perform async chunk session_mode: Request lifecycle mode, either turn-based or duplex model_stage: Stage type identifier, e.g., "thinker" or "talker" (default: "thinker") model_arch: Model architecture name (default: "Qwen2_5OmniForConditionalGeneration") worker_type: Model Type, e.g., "ar" or "generation" engine_output_type: Optional output type specification for the engine. Used to route outputs to appropriate processors (e.g., "image", "audio", "latents"). If None, output type is inferred. stage_connector_config: Stage connector configuration dictionary. Contains "name" (connector name), "extra" (extra connector config). task_type: Model-defined startup task type. Each model validates its supported values and applies the corresponding behavior.
The correct way to initialize this class is via vLLM config, as most of the logic for handling values is in the ModelConfig's post_init.
Example: >>> config = OmniModelConfig.from_vllm_model_config( ... vllm_config, ... stage_id=0, ... model_stage="thinker", ... model_arch="Qwen2_5OmniForConditionalGeneration" ... )
custom_process_next_stage_input_func class-attribute instance-attribute ¶
custom_process_next_stage_input_func: str | None = None
pooling_output_decoder class-attribute instance-attribute ¶
pooling_output_decoder: str | None = None
requires_full_payload_input class-attribute instance-attribute ¶
requires_full_payload_input: bool = False
retains_state_across_chunks class-attribute instance-attribute ¶
retains_state_across_chunks: bool = False
sampling_extra_args_keys class-attribute instance-attribute ¶
stage_connector_config class-attribute instance-attribute ¶
stage_connector_config: dict[str, Any] = field(
default_factory=lambda: {
"name": "SharedMemoryConnector",
"extra": {},
}
)
subtalker_sampling_params class-attribute instance-attribute ¶
supports_native_mrv2_data_plane class-attribute instance-attribute ¶
supports_native_mrv2_data_plane: bool = False
add_defaults_to_omni_kwargs classmethod ¶
Because we init the OmniModelConfig with new to sidestep expensive validation, we need to be careful to ensure fields with default factories are initialized, otherwise we will get an AttributeError when we use it.
To work around this issue, we explicitly add defaults to the omni_kwargs dict provided to ensure all fields are defined correctly.
NOTE: omni_kwargs are mutated in place.
from_vllm_model_config classmethod ¶
Create OmniModelConfig from an existing vLLM ModelConfig and additional Omni specific kwargs.
NOTE: The validation and post_init for ModelConfig is expensive; to avoid calling it a second time, we explicitly retrieve defaults from dataclass attributes for values not passed to omni_kwargs, and use that to initialize a new instance. This is significantly faster than creating the OmniModelConfig directly from the ModelConfig, and saves us from having to pass all kwargs to the OmniModelConfig.
OmniStageCacheConfig ¶
Bases: _TrackExplicitConfigFields, CacheConfig
Per-stage engine cache and memory behavior.
This is separate from _DiffusionConfigProjection.cache_config, which configures vLLM-Omni diffusion-specific cache backends such as TeaCache and Cache-DiT.
disable_hybrid_kv_cache_manager class-attribute instance-attribute ¶
disable_hybrid_kv_cache_manager: bool | None = None
enable_prefix_caching class-attribute instance-attribute ¶
enable_prefix_caching: bool | None = None
gpu_memory_utilization class-attribute instance-attribute ¶
gpu_memory_utilization: float | None = Field(
default=None, gt=0.0, le=1.0
)
OmniStageConnectorConfig ¶
OmniStageDiffusionParallelConfig ¶
Bases: OmniStageParallelConfig
Diffusion-stage distributed parallelism behavior.
allgather_degree class-attribute instance-attribute ¶
allgather_degree: int = Field(default=1, ge=1)
cfg_parallel_size class-attribute instance-attribute ¶
cfg_parallel_size: int = Field(default=1, ge=1)
hsdp_replicate_size class-attribute instance-attribute ¶
hsdp_replicate_size: int = Field(default=1, ge=1)
sequence_parallel_size class-attribute instance-attribute ¶
sequence_parallel_size: int = Field(
default=1, ge=1, init=False
)
OmniStageLoadConfig ¶
Bases: _TrackExplicitConfigFields, LoadConfig
vLLM loading behavior plus Omni stage-specific tokenizer inputs.
OmniStageModelConfig ¶
Bases: _TrackExplicitConfigFields
Per-stage model behavior and resolved model-engine inputs.
active_stream_window class-attribute instance-attribute ¶
active_stream_window: int = Field(default=0, ge=0)
allowed_local_media_path class-attribute instance-attribute ¶
allowed_local_media_path: str | None = None
allowed_media_domains class-attribute instance-attribute ¶
default_sampling_params class-attribute instance-attribute ¶
duplex_max_sessions class-attribute instance-attribute ¶
duplex_max_sessions: int = Field(default=1, ge=1)
enable_broadcast_weight_load class-attribute instance-attribute ¶
enable_broadcast_weight_load: bool = False
enable_flashinfer_autotune class-attribute instance-attribute ¶
enable_flashinfer_autotune: bool | None = None
enable_multithread_weight_load class-attribute instance-attribute ¶
enable_multithread_weight_load: bool = True
interleave_mm_strings class-attribute instance-attribute ¶
interleave_mm_strings: bool | None = None
limit_mm_per_prompt class-attribute instance-attribute ¶
logits_processors class-attribute instance-attribute ¶
max_cudagraph_capture_size class-attribute instance-attribute ¶
max_cudagraph_capture_size: int | None = Field(
default=None, ge=0
)
mm_processor_cache_type class-attribute instance-attribute ¶
mm_processor_cache_type: str | None = None
mm_processor_kwargs class-attribute instance-attribute ¶
num_weight_load_threads class-attribute instance-attribute ¶
num_weight_load_threads: int = Field(default=4, ge=1)
override_generation_config class-attribute instance-attribute ¶
requires_full_payload_input class-attribute instance-attribute ¶
requires_full_payload_input: bool = False
served_model_name class-attribute instance-attribute ¶
subtalker_sampling_params class-attribute instance-attribute ¶
OmniStageParallelConfig ¶
Bases: _TrackExplicitConfigFields, ParallelConfig
Common per-stage distributed parallelism behavior.
data_parallel_rank class-attribute instance-attribute ¶
data_parallel_rank: int | None = Field(default=None, ge=0)
data_parallel_rpc_port class-attribute instance-attribute ¶
data_parallel_rpc_port: int | None = None
OmniStageRuntimeConfig ¶
OmniStageSchedulerConfig ¶
Bases: _TrackExplicitConfigFields, SchedulerConfig
Per-stage request scheduling behavior.
enable_chunked_prefill class-attribute instance-attribute ¶
enable_chunked_prefill: bool | None = None
max_model_len class-attribute instance-attribute ¶
max_model_len: int | None = Field(default=None, ge=-1)
PipelineConfig dataclass ¶
Complete pipeline topology for a model (frozen).
default_deploy_config_name class-attribute instance-attribute ¶
default_deploy_config_name: str | None = None
diffusers_class_aliases class-attribute instance-attribute ¶
duplex_runtime_extension class-attribute instance-attribute ¶
duplex_runtime_extension: str | None = None
duplex_serving_adapter class-attribute instance-attribute ¶
duplex_serving_adapter: str | None = None
endpoint_restrictions class-attribute instance-attribute ¶
endpoint_restrictions: tuple[EndpointRestriction, ...] = ()
hf_config_predicate class-attribute instance-attribute ¶
stage_cli_aliases class-attribute instance-attribute ¶
StageConfig dataclass ¶
Per-stage config (legacy path). Used by both new and legacy loaders.
TODO(@lishunyang12): replace with ResolvedStageConfig once all models are migrated.
custom_process_input_func class-attribute instance-attribute ¶
custom_process_input_func: str | None = None
input_sources class-attribute instance-attribute ¶
runtime_overrides class-attribute instance-attribute ¶
sampling_constraints class-attribute instance-attribute ¶
yaml_engine_args class-attribute instance-attribute ¶
yaml_extras class-attribute instance-attribute ¶
yaml_runtime class-attribute instance-attribute ¶
StageDeployConfig dataclass ¶
Per-stage deployment knobs.
Only fields whose value legitimately varies across stages of the same pipeline live here (e.g. max_num_seqs on thinker vs talker, devices for GPU placement). Pipeline-wide settings (trust_remote_code, distributed_executor_backend, dtype, quantization, prefix/chunked prefill, DP/PP sizes) are declared at the top level of DeployConfig and propagated to every stage.
auxiliary_text_encoder class-attribute instance-attribute ¶
auxiliary_text_encoder: str | None = None
compilation_config class-attribute instance-attribute ¶
default_pooling_params class-attribute instance-attribute ¶
default_sampling_params class-attribute instance-attribute ¶
diffusers_call_kwargs class-attribute instance-attribute ¶
diffusers_load_kwargs class-attribute instance-attribute ¶
diffusion_attention_backend class-attribute instance-attribute ¶
diffusion_attention_backend: str | None = None
diffusion_attention_config class-attribute instance-attribute ¶
diffusion_compile_dynamic class-attribute instance-attribute ¶
diffusion_compile_dynamic: bool | None = None
diffusion_compile_granularity class-attribute instance-attribute ¶
diffusion_compile_granularity: str | None = None
diffusion_kv_cache_dtype class-attribute instance-attribute ¶
diffusion_kv_cache_dtype: str | None = None
diffusion_kv_cache_skip_layers class-attribute instance-attribute ¶
diffusion_kv_cache_skip_layers: str | None = None
diffusion_kv_cache_skip_steps class-attribute instance-attribute ¶
diffusion_kv_cache_skip_steps: str | None = None
diffusion_offload_config class-attribute instance-attribute ¶
diffusion_quantization_config class-attribute instance-attribute ¶
diffusion_quantization_config: str | None = None
disable_hybrid_kv_cache_manager class-attribute instance-attribute ¶
disable_hybrid_kv_cache_manager: bool | None = None
dlo_host_registration_limit_gib class-attribute instance-attribute ¶
dlo_host_registration_limit_gib: float | None = None
enable_broadcast_weight_load class-attribute instance-attribute ¶
enable_broadcast_weight_load: bool | None = None
enable_cache_dit_summary class-attribute instance-attribute ¶
enable_cache_dit_summary: bool | None = None
enable_diffusion_pipeline_profiler class-attribute instance-attribute ¶
enable_diffusion_pipeline_profiler: bool | None = None
enable_distributed_layerwise_offload class-attribute instance-attribute ¶
enable_distributed_layerwise_offload: bool | None = None
enable_expert_parallel class-attribute instance-attribute ¶
enable_expert_parallel: bool | None = None
enable_flashinfer_autotune class-attribute instance-attribute ¶
enable_flashinfer_autotune: bool | None = None
enable_layerwise_offload class-attribute instance-attribute ¶
enable_layerwise_offload: bool | None = None
enable_multithread_weight_load class-attribute instance-attribute ¶
enable_multithread_weight_load: bool | None = None
engine_extras class-attribute instance-attribute ¶
gpu_memory_utilization class-attribute instance-attribute ¶
gpu_memory_utilization: float | None = None
host_weight_runtime_mode class-attribute instance-attribute ¶
host_weight_runtime_mode: str | None = None
host_weight_runtime_root class-attribute instance-attribute ¶
host_weight_runtime_root: str | None = None
input_connectors class-attribute instance-attribute ¶
max_generated_image_size class-attribute instance-attribute ¶
max_generated_image_size: int | None = None
max_num_batched_tokens class-attribute instance-attribute ¶
max_num_batched_tokens: int | None = None
mm_processor_cache_gb class-attribute instance-attribute ¶
mm_processor_cache_gb: float | None = None
num_weight_load_threads class-attribute instance-attribute ¶
num_weight_load_threads: int | None = None
output_connectors class-attribute instance-attribute ¶
sequence_parallel_size class-attribute instance-attribute ¶
sequence_parallel_size: int | None = None
subtalker_sampling_params class-attribute instance-attribute ¶
tts_max_instructions_length class-attribute instance-attribute ¶
tts_max_instructions_length: int | None = None
StageExecutionType ¶
StagePipelineConfig dataclass ¶
Fixed topology for one stage (frozen, not user-configurable).
async_chunk_process_next_stage_input_func class-attribute instance-attribute ¶
async_chunk_process_next_stage_input_func: str | None = None
custom_process_input_func class-attribute instance-attribute ¶
custom_process_input_func: str | None = None
custom_process_next_stage_input_func class-attribute instance-attribute ¶
custom_process_next_stage_input_func: str | None = None
execution_type class-attribute instance-attribute ¶
execution_type: StageExecutionType = (
StageExecutionType.LLM_AR
)
requires_full_payload_input class-attribute instance-attribute ¶
requires_full_payload_input: bool = False
requires_multimodal_data class-attribute instance-attribute ¶
requires_multimodal_data: bool = False
retains_state_across_chunks class-attribute instance-attribute ¶
retains_state_across_chunks: bool = False
sampling_constraints class-attribute instance-attribute ¶
stage_input_payload_keys class-attribute instance-attribute ¶
stage_output_payload_keys class-attribute instance-attribute ¶
supports_native_mrv2_data_plane class-attribute instance-attribute ¶
supports_native_mrv2_data_plane: bool = False
StageType ¶
VllmOmniARStageConfig ¶
VllmOmniConfig ¶
Top-level structured Omni config built once from registry inputs.
orchestrator_config class-attribute instance-attribute ¶
orchestrator_config: VllmOmniOrchestratorConfig = field(
default_factory=VllmOmniOrchestratorConfig
)
strategy_omni_lb_policy class-attribute instance-attribute ¶
strategy_omni_lb_policy: str | None = None
from_pipeline_config classmethod ¶
from_pipeline_config(
pipeline_cfg: PipelineConfig,
*,
user_deploy_config: DeployConfig | None = None,
deploy_config_path: str | None = None,
cli_overrides: dict[str, Any] | None = None,
strategy_specs: Mapping[Any, Any] | None = None,
) -> VllmOmniConfig
Create a structured config from a resolved pipeline and deploy YAML.
VllmOmniDiffusionStageConfig ¶
Bases: BaseVllmOmniStageConfig
Structured config for diffusion stages.
diffusion_config class-attribute instance-attribute ¶
diffusion_config: _DiffusionConfigProjection = field(
default_factory=_DiffusionConfigProjection
)
parallel_config class-attribute instance-attribute ¶
parallel_config: OmniStageDiffusionParallelConfig = field(
default_factory=OmniStageDiffusionParallelConfig
)
VllmOmniGenerationStageConfig ¶
VllmOmniOrchestratorConfig ¶
Configuration consumed by the orchestrator process only.
omni_dp_size_local class-attribute instance-attribute ¶
omni_dp_size_local: int = Field(default=1, ge=1)
omni_heartbeat_timeout class-attribute instance-attribute ¶
omni_heartbeat_timeout: float = Field(default=30.0, gt=0.0)
create_config ¶
create_config(data: Any) -> DictConfig
Wrap a dict (or list) into a DictConfig.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
data | Any | Dict, list, or other structure to wrap. | required |
Returns:
| Type | Description |
|---|---|
DictConfig | OmegaConf DictConfig / ListConfig. |
load_deploy_config ¶
load_deploy_config(path: str | Path) -> DeployConfig
Load a deploy YAML (with optional base_config inheritance).
load_yaml_config ¶
merge_configs ¶
merge_pipeline_deploy ¶
merge_pipeline_deploy(
pipeline: PipelineConfig,
deploy: DeployConfig,
cli_overrides: dict[str, Any] | None = None,
) -> list[StageConfig]
Merge pipeline + deploy + platform overrides → list[StageConfig].