Skip to content

vllm_omni.config

Configuration module for vLLM-Omni.

Modules:

Name Description
composable_parallel

Composable parallel strategies for vLLM-Omni.

config_factory

Config factories for vllm-omni, e.g., StageConfigFactory.

endpoint_policy

Endpoint restriction policy for omni pipelines.

environment_variable_inventory

Reviewed inventory of environment variables used by vLLM-Omni.

lora
model
omni_config

Structured vLLM-Omni configuration classes.

pipeline_registry

Pipeline registry and factory for vllm-omni.

resolver
server_settings
stage_config

Stage configuration system for vLLM-Omni.

yaml_util

Centralized OmegaConf wrapper for vLLM-Omni.

PIPELINE_WIDE_ENGINE_FIELDS module-attribute

PIPELINE_WIDE_ENGINE_FIELDS = _PIPELINE_WIDE_ENGINE_FIELDS

StageConfigType module-attribute

BaseVllmOmniStageConfig

Common structured config contract shared by all Omni stage realizations.

cache_config class-attribute instance-attribute

cache_config: OmniStageCacheConfig = field(
    default_factory=OmniStageCacheConfig
)

cfg_kv_collect_func property

cfg_kv_collect_func: str | None

compilation_config class-attribute instance-attribute

compilation_config: CompilationConfig | None = None

connector_config class-attribute instance-attribute

connector_config: OmniStageConnectorConfig = field(
    default_factory=OmniStageConnectorConfig
)

custom_process_input_func property

custom_process_input_func: str | None

custom_process_next_stage_input_func property

custom_process_next_stage_input_func: str | None

engine_output_type property

engine_output_type: str | None

final_output property

final_output: bool

final_output_type property

final_output_type: str | None

hf_config_name property

hf_config_name: str | None

input_sources property

input_sources: list[int]

is_comprehension property

is_comprehension: bool

load_config class-attribute instance-attribute

load_config: OmniStageLoadConfig = field(
    default_factory=OmniStageLoadConfig
)

model_config class-attribute instance-attribute

model_config: OmniStageModelConfig = field(
    default_factory=OmniStageModelConfig
)

model_stage property

model_stage: str

parallel_config class-attribute instance-attribute

parallel_config: OmniStageParallelConfig = field(
    default_factory=OmniStageParallelConfig
)

pooling_config class-attribute instance-attribute

pooling_config: OmniStagePoolingConfig = field(
    default_factory=OmniStagePoolingConfig
)

profiler_config class-attribute instance-attribute

profiler_config: ProfilerConfig | None = None

prompt_expand_func property

prompt_expand_func: str | None

prompt_transform_func property

prompt_transform_func: str | None

quantization_config class-attribute instance-attribute

quantization_config: _QuantizationConfigType = None

requires_multimodal_data property

requires_multimodal_data: bool

runtime_config class-attribute instance-attribute

runtime_config: OmniStageRuntimeConfig = field(
    default_factory=OmniStageRuntimeConfig
)

sampling_constraints property

sampling_constraints: dict[str, Any]

scheduler_cls property

scheduler_cls: str | None

scheduler_config class-attribute instance-attribute

scheduler_config: OmniStageSchedulerConfig = field(
    default_factory=OmniStageSchedulerConfig
)

stage_id property

stage_id: int

stage_pipeline_config instance-attribute

stage_pipeline_config: StagePipelineConfig

stage_type property

stage_type: StageType

worker_type property

worker_type: str | None

DeployConfig dataclass

Loaded from deploy/.yaml — the only config file users edit.

Top-level fields (trust_remote_code, distributed_executor_backend, dtype, quantization, enable_prefix_caching, enable_chunked_prefill, data_parallel_size, pipeline_parallel_size) are pipeline-wide: they apply uniformly to every stage. Fields that legitimately vary per stage live in the individual StageDeployConfig entries under stages:.

active_stream_window class-attribute instance-attribute

active_stream_window: int = 0

async_chunk class-attribute instance-attribute

async_chunk: bool = True

connectors class-attribute instance-attribute

connectors: dict[str, Any] | None = None

cuda_mps class-attribute instance-attribute

cuda_mps: bool = False

custom_voice_dir class-attribute instance-attribute

custom_voice_dir: str | None = None

data_parallel_size class-attribute instance-attribute

data_parallel_size: int | None = None

distributed_executor_backend class-attribute instance-attribute

distributed_executor_backend: str | None = None

dtype class-attribute instance-attribute

dtype: str | None = None

duplex_session class-attribute instance-attribute

duplex_session: DuplexSessionRuntimeConfig = field(
    default_factory=DuplexSessionRuntimeConfig
)

edges class-attribute instance-attribute

edges: list[dict[str, Any]] | None = None

enable_chunked_prefill class-attribute instance-attribute

enable_chunked_prefill: bool | None = None

enable_prefix_caching class-attribute instance-attribute

enable_prefix_caching: bool | None = None

model_runner class-attribute instance-attribute

model_runner: Literal['v1', 'v2'] = 'v1'

pipeline class-attribute instance-attribute

pipeline: str | None = None

pipeline_parallel_size class-attribute instance-attribute

pipeline_parallel_size: int | None = None

platforms class-attribute instance-attribute

platforms: dict[str, Any] | None = None

quantization class-attribute instance-attribute

quantization: str | None = None

session_mode class-attribute instance-attribute

session_mode: str = 'turn'

stages class-attribute instance-attribute

stages: list[StageDeployConfig] = field(
    default_factory=list
)

trust_remote_code class-attribute instance-attribute

trust_remote_code: bool | None = None

OmniModelConfig

Bases: ModelConfig

Configuration for Omni models, extending the base ModelConfig.

This configuration class extends the base vLLM ModelConfig with omni-specific fields for multi-stage pipeline processing.

Attributes: hf_config: The model's HF Transformers config (default: None) hf_text_config: The sub text_config of the model's hf_config (default: None) stage_id: Identifier for the stage in a multi-stage pipeline (default: 0) async_chunk: If set to True, perform async chunk session_mode: Request lifecycle mode, either turn-based or duplex model_stage: Stage type identifier, e.g., "thinker" or "talker" (default: "thinker") model_arch: Model architecture name (default: "Qwen2_5OmniForConditionalGeneration") worker_type: Model Type, e.g., "ar" or "generation" engine_output_type: Optional output type specification for the engine. Used to route outputs to appropriate processors (e.g., "image", "audio", "latents"). If None, output type is inferred. stage_connector_config: Stage connector configuration dictionary. Contains "name" (connector name), "extra" (extra connector config). task_type: Model-defined startup task type. Each model validates its supported values and applies the corresponding behavior.

The correct way to initialize this class is via vLLM config, as most of the logic for handling values is in the ModelConfig's post_init.

Example: >>> config = OmniModelConfig.from_vllm_model_config( ... vllm_config, ... stage_id=0, ... model_stage="thinker", ... model_arch="Qwen2_5OmniForConditionalGeneration" ... )

active_stream_window class-attribute instance-attribute

active_stream_window: int = 0

architectures property

architectures: list[str]

async_chunk class-attribute instance-attribute

async_chunk: bool = False

codec_frame_rate_hz class-attribute instance-attribute

codec_frame_rate_hz: float | None = None

custom_process_next_stage_input_func class-attribute instance-attribute

custom_process_next_stage_input_func: str | None = None

duplex_max_sessions class-attribute instance-attribute

duplex_max_sessions: int = 1

embedding_size property

embedding_size

enable_sleep_mode class-attribute instance-attribute

enable_sleep_mode: bool = False

engine_output_type class-attribute instance-attribute

engine_output_type: str | None = None

final_output class-attribute instance-attribute

final_output: bool = False

has_sampling_extra_args class-attribute instance-attribute

has_sampling_extra_args: bool = False

hf_config_name class-attribute instance-attribute

hf_config_name: str | None = None

model_arch class-attribute instance-attribute

model_arch: str | None = None

model_stage class-attribute instance-attribute

model_stage: str = 'thinker'

omni_kv_config class-attribute instance-attribute

omni_kv_config: dict | None = None

pooling_output_decoder class-attribute instance-attribute

pooling_output_decoder: str | None = None

registry property

registry

requires_full_payload_input class-attribute instance-attribute

requires_full_payload_input: bool = False

retains_state_across_chunks class-attribute instance-attribute

retains_state_across_chunks: bool = False

sampling_extra_args_keys class-attribute instance-attribute

sampling_extra_args_keys: tuple[str, ...] = ()

session_mode class-attribute instance-attribute

session_mode: str = 'turn'

silence_ban_frames class-attribute instance-attribute

silence_ban_frames: int = 0

stage_connector_config class-attribute instance-attribute

stage_connector_config: dict[str, Any] = field(
    default_factory=lambda: {
        "name": "SharedMemoryConnector",
        "extra": {},
    }
)

stage_id class-attribute instance-attribute

stage_id: int = 0

subtalker_sampling_params class-attribute instance-attribute

subtalker_sampling_params: dict[str, Any] | None = None

supports_native_mrv2_data_plane class-attribute instance-attribute

supports_native_mrv2_data_plane: bool = False

task_type class-attribute instance-attribute

task_type: str | None = None

use_v2_model_runner class-attribute instance-attribute

use_v2_model_runner: bool = False

uses_mrope property

uses_mrope: bool

worker_type class-attribute instance-attribute

worker_type: str | None = None

add_defaults_to_omni_kwargs classmethod

add_defaults_to_omni_kwargs(omni_kwargs)

Because we init the OmniModelConfig with new to sidestep expensive validation, we need to be careful to ensure fields with default factories are initialized, otherwise we will get an AttributeError when we use it.

To work around this issue, we explicitly add defaults to the omni_kwargs dict provided to ensure all fields are defined correctly.

NOTE: omni_kwargs are mutated in place.

draw_hf_text_config

draw_hf_text_config()

from_vllm_model_config classmethod

from_vllm_model_config(
    model_config: ModelConfig, **omni_kwargs
)

Create OmniModelConfig from an existing vLLM ModelConfig and additional Omni specific kwargs.

NOTE: The validation and post_init for ModelConfig is expensive; to avoid calling it a second time, we explicitly retrieve defaults from dataclass attributes for values not passed to omni_kwargs, and use that to initialize a new instance. This is significantly faster than creating the OmniModelConfig directly from the ModelConfig, and saves us from having to pass all kwargs to the OmniModelConfig.

get_inputs_embeds_size

get_inputs_embeds_size() -> int

get_model_arch_config

get_model_arch_config()

OmniStageCacheConfig

Bases: _TrackExplicitConfigFields, CacheConfig

Per-stage engine cache and memory behavior.

This is separate from _DiffusionConfigProjection.cache_config, which configures vLLM-Omni diffusion-specific cache backends such as TeaCache and Cache-DiT.

disable_hybrid_kv_cache_manager class-attribute instance-attribute

disable_hybrid_kv_cache_manager: bool | None = None

enable_prefix_caching class-attribute instance-attribute

enable_prefix_caching: bool | None = None

gpu_memory_utilization class-attribute instance-attribute

gpu_memory_utilization: float | None = Field(
    default=None, gt=0.0, le=1.0
)

kv_cache_memory_bytes class-attribute instance-attribute

kv_cache_memory_bytes: int | None = Field(
    default=None, ge=0
)

mamba_ssm_cache_dtype class-attribute instance-attribute

mamba_ssm_cache_dtype: str | None = None

mm_processor_cache_gb class-attribute instance-attribute

mm_processor_cache_gb: float | None = Field(
    default=None, ge=0.0
)

OmniStageConnectorConfig

Per-stage connector wiring and resolved transfer mode.

async_chunk class-attribute instance-attribute

async_chunk: bool = False

input_connectors class-attribute instance-attribute

input_connectors: dict[str, Any] | None = None

kv_transfer_config class-attribute instance-attribute

kv_transfer_config: KVTransferConfig | None = None

omni_kv_config class-attribute instance-attribute

omni_kv_config: dict[str, Any] | None = None

output_connectors class-attribute instance-attribute

output_connectors: dict[str, Any] | None = None

stage_connector class-attribute instance-attribute

stage_connector: dict[str, Any] = field(
    default_factory=lambda: {
        "name": "SharedMemoryConnector",
        "extra": {},
    }
)

OmniStageDiffusionParallelConfig

Bases: OmniStageParallelConfig

Diffusion-stage distributed parallelism behavior.

allgather_degree class-attribute instance-attribute

allgather_degree: int = Field(default=1, ge=1)

cfg_parallel_size class-attribute instance-attribute

cfg_parallel_size: int = Field(default=1, ge=1)

hsdp_replicate_size class-attribute instance-attribute

hsdp_replicate_size: int = Field(default=1, ge=1)

hsdp_shard_size class-attribute instance-attribute

hsdp_shard_size: int = -1

mask_sp_padding class-attribute instance-attribute

mask_sp_padding: bool = False

ring_degree class-attribute instance-attribute

ring_degree: int = Field(default=1, ge=1)

sequence_parallel_size class-attribute instance-attribute

sequence_parallel_size: int = Field(
    default=1, ge=1, init=False
)

text_encoder_tp_size class-attribute instance-attribute

text_encoder_tp_size: int = Field(default=1, ge=1)

ulysses_a2a_permute class-attribute instance-attribute

ulysses_a2a_permute: bool = False

ulysses_degree class-attribute instance-attribute

ulysses_degree: int = Field(default=1, ge=1)

ulysses_mode class-attribute instance-attribute

ulysses_mode: str = 'strict'

use_hsdp class-attribute instance-attribute

use_hsdp: bool = False

vae_parallel_mode class-attribute instance-attribute

vae_parallel_mode: str = 'tile'

vae_patch_parallel_size class-attribute instance-attribute

vae_patch_parallel_size: int = Field(default=1, ge=1)

OmniStageLoadConfig

Bases: _TrackExplicitConfigFields, LoadConfig

vLLM loading behavior plus Omni stage-specific tokenizer inputs.

config_format class-attribute instance-attribute

config_format: str | None = None

skip_mm_profiling class-attribute instance-attribute

skip_mm_profiling: bool | None = None

skip_tokenizer_init class-attribute instance-attribute

skip_tokenizer_init: bool = False

tokenizer class-attribute instance-attribute

tokenizer: str | None = None

tokenizer_mode class-attribute instance-attribute

tokenizer_mode: str = 'auto'

OmniStageModelConfig

Bases: _TrackExplicitConfigFields

Per-stage model behavior and resolved model-engine inputs.

active_stream_window class-attribute instance-attribute

active_stream_window: int = Field(default=0, ge=0)

allowed_local_media_path class-attribute instance-attribute

allowed_local_media_path: str | None = None

allowed_media_domains class-attribute instance-attribute

allowed_media_domains: list[str] | None = None

attention_backend class-attribute instance-attribute

attention_backend: Any = None

attention_config class-attribute instance-attribute

attention_config: Any = None

code_revision class-attribute instance-attribute

code_revision: str | None = None

codec_frame_rate_hz class-attribute instance-attribute

codec_frame_rate_hz: float | None = None

custom_voice_dir class-attribute instance-attribute

custom_voice_dir: str | None = None

default_sampling_params class-attribute instance-attribute

default_sampling_params: dict[str, Any] | None = None

disable_autocast class-attribute instance-attribute

disable_autocast: bool = False

dtype class-attribute instance-attribute

dtype: Any = 'auto'

duplex_max_sessions class-attribute instance-attribute

duplex_max_sessions: int = Field(default=1, ge=1)

enable_broadcast_weight_load class-attribute instance-attribute

enable_broadcast_weight_load: bool = False

enable_flashinfer_autotune class-attribute instance-attribute

enable_flashinfer_autotune: bool | None = None

enable_multithread_weight_load class-attribute instance-attribute

enable_multithread_weight_load: bool = True

enable_prompt_embeds class-attribute instance-attribute

enable_prompt_embeds: bool | None = None

enable_sleep_mode class-attribute instance-attribute

enable_sleep_mode: bool = False

enforce_eager class-attribute instance-attribute

enforce_eager: bool = False

final_output class-attribute instance-attribute

final_output: bool = False

generation_config class-attribute instance-attribute

generation_config: str | None = None

has_sampling_extra_args class-attribute instance-attribute

has_sampling_extra_args: bool = False

hf_config_path class-attribute instance-attribute

hf_config_path: str | None = None

hf_overrides class-attribute instance-attribute

hf_overrides: Any = None

hf_token class-attribute instance-attribute

hf_token: bool | str | None = None

interleave_mm_strings class-attribute instance-attribute

interleave_mm_strings: bool | None = None

limit_mm_per_prompt class-attribute instance-attribute

limit_mm_per_prompt: dict[str, Any] | None = None

logits_processors class-attribute instance-attribute

logits_processors: list[str | type] | None = None

logprobs_mode class-attribute instance-attribute

logprobs_mode: str | None = None

max_cudagraph_capture_size class-attribute instance-attribute

max_cudagraph_capture_size: int | None = Field(
    default=None, ge=0
)

max_logprobs class-attribute instance-attribute

max_logprobs: int | None = None

media_io_kwargs class-attribute instance-attribute

media_io_kwargs: dict[str, Any] | None = None

mm_processor_cache_type class-attribute instance-attribute

mm_processor_cache_type: str | None = None

mm_processor_kwargs class-attribute instance-attribute

mm_processor_kwargs: dict[str, Any] | None = None

model class-attribute instance-attribute

model: str | None = None

model_arch class-attribute instance-attribute

model_arch: str | None = None

model_subdir class-attribute instance-attribute

model_subdir: str | None = None

moe_backend class-attribute instance-attribute

moe_backend: str = 'auto'

num_weight_load_threads class-attribute instance-attribute

num_weight_load_threads: int = Field(default=4, ge=1)

override_generation_config class-attribute instance-attribute

override_generation_config: dict[str, Any] | None = None

requires_full_payload_input class-attribute instance-attribute

requires_full_payload_input: bool = False

revision class-attribute instance-attribute

revision: str | None = None

seed class-attribute instance-attribute

seed: int | None = None

served_model_name class-attribute instance-attribute

served_model_name: str | list[str] | None = None

session_mode class-attribute instance-attribute

session_mode: str = 'turn'

silence_ban_frames class-attribute instance-attribute

silence_ban_frames: int = 0

subtalker_sampling_params class-attribute instance-attribute

subtalker_sampling_params: dict[str, Any] | None = None

supports_native_mrv2_data_plane class-attribute instance-attribute

supports_native_mrv2_data_plane: bool = False

task_type class-attribute instance-attribute

task_type: str | None = None

tokenizer_revision class-attribute instance-attribute

tokenizer_revision: str | None = None

tokenizer_subdir class-attribute instance-attribute

tokenizer_subdir: str | None = None

trust_remote_code class-attribute instance-attribute

trust_remote_code: bool = False

use_v2_model_runner class-attribute instance-attribute

use_v2_model_runner: bool = False

OmniStageParallelConfig

Bases: _TrackExplicitConfigFields, ParallelConfig

Common per-stage distributed parallelism behavior.

data_parallel_rank class-attribute instance-attribute

data_parallel_rank: int | None = Field(default=None, ge=0)

data_parallel_rpc_port class-attribute instance-attribute

data_parallel_rpc_port: int | None = None

data_parallel_size_local class-attribute instance-attribute

data_parallel_size_local: int | None = Field(
    default=None, ge=0
)

worker_cls class-attribute instance-attribute

worker_cls: str | None = None

world_size_across_dp property

world_size_across_dp: int

OmniStageRuntimeConfig

Per-stage process placement and backend runtime behavior.

additional_config class-attribute instance-attribute

additional_config: dict[str, Any] | None = None

cuda_mps class-attribute instance-attribute

cuda_mps: bool = False

devices class-attribute instance-attribute

devices: str | None = None

distributed_executor_backend class-attribute instance-attribute

distributed_executor_backend: Any = None

env class-attribute instance-attribute

env: dict[str, Any] | None = None

log_level class-attribute instance-attribute

log_level: str = 'info'

log_stats class-attribute instance-attribute

log_stats: bool = False

num_gpus class-attribute instance-attribute

num_gpus: int = Field(default=1, ge=1)

num_replicas class-attribute instance-attribute

num_replicas: int = Field(default=1, ge=1)

worker_cls class-attribute instance-attribute

worker_cls: str | None = None

OmniStageSchedulerConfig

Bases: _TrackExplicitConfigFields, SchedulerConfig

Per-stage request scheduling behavior.

async_scheduling class-attribute instance-attribute

async_scheduling: bool | None = None

enable_chunked_prefill class-attribute instance-attribute

enable_chunked_prefill: bool | None = None

max_model_len class-attribute instance-attribute

max_model_len: int | None = Field(default=None, ge=-1)

max_num_batched_tokens class-attribute instance-attribute

max_num_batched_tokens: int | None = Field(
    default=None, ge=1
)

max_num_seqs class-attribute instance-attribute

max_num_seqs: int | None = Field(default=None, ge=1)

PipelineConfig dataclass

Complete pipeline topology for a model (frozen).

default_deploy_config_name class-attribute instance-attribute

default_deploy_config_name: str | None = None

default_session_mode class-attribute instance-attribute

default_session_mode: str | None = None

diffusers_class_aliases class-attribute instance-attribute

diffusers_class_aliases: tuple[str, ...] = ()

diffusers_class_name class-attribute instance-attribute

diffusers_class_name: str | None = None

duplex_control_enabled class-attribute instance-attribute

duplex_control_enabled: bool = False

duplex_plugin class-attribute instance-attribute

duplex_plugin: str | None = None

duplex_runtime_extension class-attribute instance-attribute

duplex_runtime_extension: str | None = None

duplex_serving_adapter class-attribute instance-attribute

duplex_serving_adapter: str | None = None

endpoint_restrictions class-attribute instance-attribute

endpoint_restrictions: tuple[EndpointRestriction, ...] = ()

hf_architectures class-attribute instance-attribute

hf_architectures: tuple[str, ...] = ()

hf_config_predicate class-attribute instance-attribute

hf_config_predicate: Callable[[Any], bool] | None = None

model_arch class-attribute instance-attribute

model_arch: str = ''

model_type instance-attribute

model_type: str

stage_cli_aliases class-attribute instance-attribute

stage_cli_aliases: dict[str, tuple[int, str]] = field(
    default_factory=dict
)

stages class-attribute instance-attribute

stages: tuple[StagePipelineConfig, ...] = ()

get_stage

get_stage(stage_id: int) -> StagePipelineConfig | None

Look up a stage by its ID.

get_validation_errors

get_validation_errors() -> list[str]

Return list of topology errors (empty if valid).

StageConfig dataclass

Per-stage config (legacy path). Used by both new and legacy loaders.

TODO(@lishunyang12): replace with ResolvedStageConfig once all models are migrated.

custom_process_input_func class-attribute instance-attribute

custom_process_input_func: str | None = None

final_output class-attribute instance-attribute

final_output: bool = False

final_output_type class-attribute instance-attribute

final_output_type: str | None = None

hf_config_name class-attribute instance-attribute

hf_config_name: str | None = None

input_sources class-attribute instance-attribute

input_sources: list[int] = field(default_factory=list)

is_comprehension class-attribute instance-attribute

is_comprehension: bool = False

model_stage instance-attribute

model_stage: str

runtime_overrides class-attribute instance-attribute

runtime_overrides: dict[str, Any] = field(
    default_factory=dict
)

sampling_constraints class-attribute instance-attribute

sampling_constraints: dict[str, Any] = field(
    default_factory=dict
)

scheduler_cls class-attribute instance-attribute

scheduler_cls: str | None = None

session_mode class-attribute instance-attribute

session_mode: str = 'turn'

stage_id instance-attribute

stage_id: int

stage_type class-attribute instance-attribute

stage_type: StageType = StageType.LLM

worker_type class-attribute instance-attribute

worker_type: str | None = None

yaml_engine_args class-attribute instance-attribute

yaml_engine_args: dict[str, Any] = field(
    default_factory=dict
)

yaml_extras class-attribute instance-attribute

yaml_extras: dict[str, Any] = field(default_factory=dict)

yaml_runtime class-attribute instance-attribute

yaml_runtime: dict[str, Any] = field(default_factory=dict)

to_omegaconf

to_omegaconf() -> Any

TODO(@lishunyang12): remove once engine consumes ResolvedStageConfig directly.

StageDeployConfig dataclass

Per-stage deployment knobs.

Only fields whose value legitimately varies across stages of the same pipeline live here (e.g. max_num_seqs on thinker vs talker, devices for GPU placement). Pipeline-wide settings (trust_remote_code, distributed_executor_backend, dtype, quantization, prefix/chunked prefill, DP/PP sizes) are declared at the top level of DeployConfig and propagated to every stage.

allgather_degree class-attribute instance-attribute

allgather_degree: int | None = None

async_chunk class-attribute instance-attribute

async_chunk: bool | None = None

async_scheduling class-attribute instance-attribute

async_scheduling: bool | None = None

auxiliary_text_encoder class-attribute instance-attribute

auxiliary_text_encoder: str | None = None

boundary_ratio class-attribute instance-attribute

boundary_ratio: float | None = None

cache_backend class-attribute instance-attribute

cache_backend: str | None = None

cache_config class-attribute instance-attribute

cache_config: dict[str, Any] | None = None

cfg_parallel_size class-attribute instance-attribute

cfg_parallel_size: int | None = None

compilation_config class-attribute instance-attribute

compilation_config: dict[str, Any] | None = None

config_format class-attribute instance-attribute

config_format: str | None = None

default_pooling_params class-attribute instance-attribute

default_pooling_params: dict[str, Any] | None = None

default_sampling_params class-attribute instance-attribute

default_sampling_params: dict[str, Any] | None = None

devices class-attribute instance-attribute

devices: str | None = None

diffusers_call_kwargs class-attribute instance-attribute

diffusers_call_kwargs: dict[str, Any] | None = None

diffusers_load_kwargs class-attribute instance-attribute

diffusers_load_kwargs: dict[str, Any] | None = None

diffusion_attention_backend class-attribute instance-attribute

diffusion_attention_backend: str | None = None

diffusion_attention_config class-attribute instance-attribute

diffusion_attention_config: dict[str, Any] | None = None

diffusion_compile_dynamic class-attribute instance-attribute

diffusion_compile_dynamic: bool | None = None

diffusion_compile_granularity class-attribute instance-attribute

diffusion_compile_granularity: str | None = None

diffusion_kv_cache_dtype class-attribute instance-attribute

diffusion_kv_cache_dtype: str | None = None

diffusion_kv_cache_skip_layers class-attribute instance-attribute

diffusion_kv_cache_skip_layers: str | None = None

diffusion_kv_cache_skip_steps class-attribute instance-attribute

diffusion_kv_cache_skip_steps: str | None = None

diffusion_load_format class-attribute instance-attribute

diffusion_load_format: str | None = None

diffusion_offload_config class-attribute instance-attribute

diffusion_offload_config: dict[str, Any] | None = None

diffusion_quantization_config class-attribute instance-attribute

diffusion_quantization_config: str | None = None

disable_hybrid_kv_cache_manager class-attribute instance-attribute

disable_hybrid_kv_cache_manager: bool | None = None

dlo_host_registration_limit_gib class-attribute instance-attribute

dlo_host_registration_limit_gib: float | None = None

dlo_resident_layers class-attribute instance-attribute

dlo_resident_layers: int | None = None

dlo_use_allgather class-attribute instance-attribute

dlo_use_allgather: bool | None = None

enable_broadcast_weight_load class-attribute instance-attribute

enable_broadcast_weight_load: bool | None = None

enable_cache_dit_summary class-attribute instance-attribute

enable_cache_dit_summary: bool | None = None

enable_cpu_offload class-attribute instance-attribute

enable_cpu_offload: bool | None = None

enable_diffusion_pipeline_profiler class-attribute instance-attribute

enable_diffusion_pipeline_profiler: bool | None = None

enable_distributed_layerwise_offload class-attribute instance-attribute

enable_distributed_layerwise_offload: bool | None = None

enable_expert_parallel class-attribute instance-attribute

enable_expert_parallel: bool | None = None

enable_flashinfer_autotune class-attribute instance-attribute

enable_flashinfer_autotune: bool | None = None

enable_layerwise_offload class-attribute instance-attribute

enable_layerwise_offload: bool | None = None

enable_multithread_weight_load class-attribute instance-attribute

enable_multithread_weight_load: bool | None = None

enforce_eager class-attribute instance-attribute

enforce_eager: bool | None = None

engine_extras class-attribute instance-attribute

engine_extras: dict[str, Any] = field(default_factory=dict)

env class-attribute instance-attribute

env: dict[str, Any] | None = None

fa_deterministic class-attribute instance-attribute

fa_deterministic: bool | None = None

fastvideo_vsa_topk class-attribute instance-attribute

fastvideo_vsa_topk: int | None = None

flow_shift class-attribute instance-attribute

flow_shift: float | None = None

gpu_memory_utilization class-attribute instance-attribute

gpu_memory_utilization: float | None = None

host_weight_runtime_mode class-attribute instance-attribute

host_weight_runtime_mode: str | None = None

host_weight_runtime_root class-attribute instance-attribute

host_weight_runtime_root: str | None = None

hsdp_replicate_size class-attribute instance-attribute

hsdp_replicate_size: int | None = None

hsdp_shard_size class-attribute instance-attribute

hsdp_shard_size: int | None = None

input_connectors class-attribute instance-attribute

input_connectors: dict[str, str] | None = None

load_format class-attribute instance-attribute

load_format: str | None = None

lora_backend class-attribute instance-attribute

lora_backend: str | None = None

lora_path class-attribute instance-attribute

lora_path: str | list[str] | None = None

lora_scale class-attribute instance-attribute

lora_scale: float | None = None

mamba_ssm_cache_dtype class-attribute instance-attribute

mamba_ssm_cache_dtype: str | None = None

max_generated_image_size class-attribute instance-attribute

max_generated_image_size: int | None = None

max_model_len class-attribute instance-attribute

max_model_len: int | None = None

max_num_batched_tokens class-attribute instance-attribute

max_num_batched_tokens: int | None = None

max_num_seqs class-attribute instance-attribute

max_num_seqs: int | None = None

mm_processor_cache_gb class-attribute instance-attribute

mm_processor_cache_gb: float | None = None

model_class_name class-attribute instance-attribute

model_class_name: str | None = None

num_replicas class-attribute instance-attribute

num_replicas: int = 1

num_weight_load_threads class-attribute instance-attribute

num_weight_load_threads: int | None = None

output_connectors class-attribute instance-attribute

output_connectors: dict[str, str] | None = None

profiler_config class-attribute instance-attribute

profiler_config: dict[str, Any] | None = None

ring_degree class-attribute instance-attribute

ring_degree: int | None = None

sequence_parallel_size class-attribute instance-attribute

sequence_parallel_size: int | None = None

silence_ban_frames class-attribute instance-attribute

silence_ban_frames: int = 0

skip_mm_profiling class-attribute instance-attribute

skip_mm_profiling: bool | None = None

stage_id instance-attribute

stage_id: int

step_execution class-attribute instance-attribute

step_execution: bool | None = None

subtalker_sampling_params class-attribute instance-attribute

subtalker_sampling_params: dict[str, Any] | None = None

tensor_parallel_size class-attribute instance-attribute

tensor_parallel_size: int | None = None

text_encoder_tp_size class-attribute instance-attribute

text_encoder_tp_size: int | None = None

tokenizer_mode class-attribute instance-attribute

tokenizer_mode: str | None = None

tts_max_instructions_length class-attribute instance-attribute

tts_max_instructions_length: int | None = None

ulysses_a2a_permute class-attribute instance-attribute

ulysses_a2a_permute: bool | None = None

ulysses_degree class-attribute instance-attribute

ulysses_degree: int | None = None

ulysses_mode class-attribute instance-attribute

ulysses_mode: str | None = None

use_hsdp class-attribute instance-attribute

use_hsdp: bool | None = None

vae_fast_path class-attribute instance-attribute

vae_fast_path: str | None = None

vae_parallel_mode class-attribute instance-attribute

vae_parallel_mode: str | None = None

vae_patch_parallel_size class-attribute instance-attribute

vae_patch_parallel_size: int | None = None

vae_use_slicing class-attribute instance-attribute

vae_use_slicing: bool | None = None

vae_use_tiling class-attribute instance-attribute

vae_use_tiling: bool | None = None

video_output_transport class-attribute instance-attribute

video_output_transport: dict[str, Any] | None = None

StageExecutionType

Bases: str, Enum

Merged StageType + WorkerType — 3 combinations today.

DIFFUSION class-attribute instance-attribute

DIFFUSION = 'diffusion'

LLM_AR class-attribute instance-attribute

LLM_AR = 'llm_ar'

LLM_GENERATION class-attribute instance-attribute

LLM_GENERATION = 'llm_generation'

StagePipelineConfig dataclass

Fixed topology for one stage (frozen, not user-configurable).

async_chunk_process_next_stage_input_func class-attribute instance-attribute

async_chunk_process_next_stage_input_func: str | None = None

cfg_kv_collect_func class-attribute instance-attribute

cfg_kv_collect_func: str | None = None

custom_process_input_func class-attribute instance-attribute

custom_process_input_func: str | None = None

custom_process_next_stage_input_func class-attribute instance-attribute

custom_process_next_stage_input_func: str | None = None

engine_output_type class-attribute instance-attribute

engine_output_type: str | None = None

execution_type class-attribute instance-attribute

extras class-attribute instance-attribute

extras: dict[str, Any] = field(default_factory=dict)

final_output class-attribute instance-attribute

final_output: bool = False

final_output_type class-attribute instance-attribute

final_output_type: str | None = None

hf_config_name class-attribute instance-attribute

hf_config_name: str | None = None

inline_diffusion class-attribute instance-attribute

inline_diffusion: bool = False

input_sources class-attribute instance-attribute

input_sources: tuple[int, ...] = ()

model_arch class-attribute instance-attribute

model_arch: str | None = None

model_path_resolver class-attribute instance-attribute

model_path_resolver: str | None = None

model_stage instance-attribute

model_stage: str

model_subdir class-attribute instance-attribute

model_subdir: str | None = None

omni_kv_config class-attribute instance-attribute

omni_kv_config: dict[str, Any] | None = None

owns_tokenizer class-attribute instance-attribute

owns_tokenizer: bool = False

prompt_expand_func class-attribute instance-attribute

prompt_expand_func: str | None = None

prompt_transform_func class-attribute instance-attribute

prompt_transform_func: str | None = None

requires_full_payload_input class-attribute instance-attribute

requires_full_payload_input: bool = False

requires_multimodal_data class-attribute instance-attribute

requires_multimodal_data: bool = False

retains_state_across_chunks class-attribute instance-attribute

retains_state_across_chunks: bool = False

sampling_constraints class-attribute instance-attribute

sampling_constraints: dict[str, Any] = field(
    default_factory=dict
)

scheduler_cls class-attribute instance-attribute

scheduler_cls: str | None = None

stage_id instance-attribute

stage_id: int

stage_input_payload_keys class-attribute instance-attribute

stage_input_payload_keys: tuple[str, ...] = ()

stage_output_payload_keys class-attribute instance-attribute

stage_output_payload_keys: tuple[str, ...] = ()

supports_native_mrv2_data_plane class-attribute instance-attribute

supports_native_mrv2_data_plane: bool = False

sync_process_input_func class-attribute instance-attribute

sync_process_input_func: str | None = None

tokenizer_subdir class-attribute instance-attribute

tokenizer_subdir: str | None = None

StageType

Bases: str, Enum

Type of processing stage in the Omni pipeline.

DIFFUSION class-attribute instance-attribute

DIFFUSION = 'diffusion'

LLM class-attribute instance-attribute

LLM = 'llm'

VllmOmniARStageConfig

Bases: BaseVllmOmniStageConfig

Structured config for autoregressive LLM stages.

VllmOmniConfig

Top-level structured Omni config built once from registry inputs.

orchestrator_config class-attribute instance-attribute

orchestrator_config: VllmOmniOrchestratorConfig = field(
    default_factory=VllmOmniOrchestratorConfig
)

pipeline_config instance-attribute

pipeline_config: PipelineConfig

stage_configs instance-attribute

stage_configs: tuple[StageConfigType, ...]

strategy_omni_lb_policy class-attribute instance-attribute

strategy_omni_lb_policy: str | None = None

from_pipeline_config classmethod

from_pipeline_config(
    pipeline_cfg: PipelineConfig,
    *,
    user_deploy_config: DeployConfig | None = None,
    deploy_config_path: str | None = None,
    cli_overrides: dict[str, Any] | None = None,
    strategy_specs: Mapping[Any, Any] | None = None,
) -> VllmOmniConfig

Create a structured config from a resolved pipeline and deploy YAML.

stage_by_id

stage_by_id(stage_id: int) -> StageConfigType

VllmOmniDiffusionStageConfig

Bases: BaseVllmOmniStageConfig

Structured config for diffusion stages.

diffusion_config class-attribute instance-attribute

diffusion_config: _DiffusionConfigProjection = field(
    default_factory=_DiffusionConfigProjection
)

parallel_config class-attribute instance-attribute

VllmOmniGenerationStageConfig

Bases: BaseVllmOmniStageConfig

Structured config for generation LLM stages.

VllmOmniOrchestratorConfig

Configuration consumed by the orchestrator process only.

batch_timeout class-attribute instance-attribute

batch_timeout: int = Field(default=10, ge=0)

deploy_config_path class-attribute instance-attribute

deploy_config_path: str | None = None

init_timeout class-attribute instance-attribute

init_timeout: int = Field(default=600, ge=1)

omni_dp_size_local class-attribute instance-attribute

omni_dp_size_local: int = Field(default=1, ge=1)

omni_heartbeat_timeout class-attribute instance-attribute

omni_heartbeat_timeout: float = Field(default=30.0, gt=0.0)

omni_lb_policy class-attribute instance-attribute

omni_lb_policy: str = 'random'

omni_master_address class-attribute instance-attribute

omni_master_address: str | None = None

omni_master_port class-attribute instance-attribute

omni_master_port: int | None = None

parallel_stage_init class-attribute instance-attribute

parallel_stage_init: bool = False

ray_address class-attribute instance-attribute

ray_address: str | None = None

stage_init_timeout class-attribute instance-attribute

stage_init_timeout: int = Field(default=300, ge=1)

worker_backend class-attribute instance-attribute

worker_backend: str = 'multi_process'

create_config

create_config(data: Any) -> DictConfig

Wrap a dict (or list) into a DictConfig.

Parameters:

Name Type Description Default
data Any

Dict, list, or other structure to wrap.

required

Returns:

Type Description
DictConfig

OmegaConf DictConfig / ListConfig.

load_deploy_config

load_deploy_config(path: str | Path) -> DeployConfig

Load a deploy YAML (with optional base_config inheritance).

load_yaml_config

load_yaml_config(path: str | Any) -> DictConfig

Load a YAML file and return it as a DictConfig.

Parameters:

Name Type Description Default
path str | Any

Path to the YAML file.

required

Returns:

Type Description
DictConfig

OmegaConf DictConfig with attribute-style access.

merge_configs

merge_configs(*cfgs: Any) -> dict

Deep-merge multiple configs and return a plain dict.

Parameters:

Name Type Description Default
*cfgs Any

DictConfig or dict objects to merge (left to right).

()

Returns:

Type Description
dict

Plain dict with merged, resolved values.

merge_pipeline_deploy

merge_pipeline_deploy(
    pipeline: PipelineConfig,
    deploy: DeployConfig,
    cli_overrides: dict[str, Any] | None = None,
) -> list[StageConfig]

Merge pipeline + deploy + platform overrides → list[StageConfig].

to_dict

to_dict(obj: Any, *, resolve: bool = True) -> Any

Convert a DictConfig (or similar) to a plain dict.

Parameters:

Name Type Description Default
obj Any

OmegaConf container to convert.

required
resolve bool

Whether to resolve interpolations (default True).

True

Returns:

Type Description
Any

Plain dict.