Skip to content

vllm_omni.config.omni_config

Structured vLLM-Omni configuration classes.

This module is additive for Phase 2 of RFC #4021. VllmOmniConfig.from_pipeline_config builds the structured view from an already-resolved pipeline and deploy config so parity can be proven before later PRs cut consumers over to these classes.

StageConfigType module-attribute

logger module-attribute

logger = init_logger(__name__)

BaseVllmOmniStageConfig

Common structured config contract shared by all Omni stage realizations.

cache_config class-attribute instance-attribute

cache_config: OmniStageCacheConfig = field(
    default_factory=OmniStageCacheConfig
)

cfg_kv_collect_func property

cfg_kv_collect_func: str | None

compilation_config class-attribute instance-attribute

compilation_config: CompilationConfig | None = None

connector_config class-attribute instance-attribute

connector_config: OmniStageConnectorConfig = field(
    default_factory=OmniStageConnectorConfig
)

custom_process_input_func property

custom_process_input_func: str | None

custom_process_next_stage_input_func property

custom_process_next_stage_input_func: str | None

engine_output_type property

engine_output_type: str | None

final_output property

final_output: bool

final_output_type property

final_output_type: str | None

hf_config_name property

hf_config_name: str | None

input_sources property

input_sources: list[int]

is_comprehension property

is_comprehension: bool

load_config class-attribute instance-attribute

load_config: OmniStageLoadConfig = field(
    default_factory=OmniStageLoadConfig
)

model_config class-attribute instance-attribute

model_config: OmniStageModelConfig = field(
    default_factory=OmniStageModelConfig
)

model_stage property

model_stage: str

parallel_config class-attribute instance-attribute

parallel_config: OmniStageParallelConfig = field(
    default_factory=OmniStageParallelConfig
)

pooling_config class-attribute instance-attribute

pooling_config: OmniStagePoolingConfig = field(
    default_factory=OmniStagePoolingConfig
)

profiler_config class-attribute instance-attribute

profiler_config: ProfilerConfig | None = None

prompt_expand_func property

prompt_expand_func: str | None

prompt_transform_func property

prompt_transform_func: str | None

quantization_config class-attribute instance-attribute

quantization_config: _QuantizationConfigType = None

requires_multimodal_data property

requires_multimodal_data: bool

runtime_config class-attribute instance-attribute

runtime_config: OmniStageRuntimeConfig = field(
    default_factory=OmniStageRuntimeConfig
)

sampling_constraints property

sampling_constraints: dict[str, Any]

scheduler_cls property

scheduler_cls: str | None

scheduler_config class-attribute instance-attribute

scheduler_config: OmniStageSchedulerConfig = field(
    default_factory=OmniStageSchedulerConfig
)

stage_id property

stage_id: int

stage_pipeline_config instance-attribute

stage_pipeline_config: StagePipelineConfig

stage_type property

stage_type: StageType

worker_type property

worker_type: str | None

OmniStageCacheConfig

Bases: _TrackExplicitConfigFields, CacheConfig

Per-stage engine cache and memory behavior.

This is separate from _DiffusionConfigProjection.cache_config, which configures vLLM-Omni diffusion-specific cache backends such as TeaCache and Cache-DiT.

disable_hybrid_kv_cache_manager class-attribute instance-attribute

disable_hybrid_kv_cache_manager: bool | None = None

enable_prefix_caching class-attribute instance-attribute

enable_prefix_caching: bool | None = None

gpu_memory_utilization class-attribute instance-attribute

gpu_memory_utilization: float | None = Field(
    default=None, gt=0.0, le=1.0
)

kv_cache_memory_bytes class-attribute instance-attribute

kv_cache_memory_bytes: int | None = Field(
    default=None, ge=0
)

mamba_ssm_cache_dtype class-attribute instance-attribute

mamba_ssm_cache_dtype: str | None = None

mm_processor_cache_gb class-attribute instance-attribute

mm_processor_cache_gb: float | None = Field(
    default=None, ge=0.0
)

OmniStageConnectorConfig

Per-stage connector wiring and resolved transfer mode.

async_chunk class-attribute instance-attribute

async_chunk: bool = False

input_connectors class-attribute instance-attribute

input_connectors: dict[str, Any] | None = None

kv_transfer_config class-attribute instance-attribute

kv_transfer_config: KVTransferConfig | None = None

omni_kv_config class-attribute instance-attribute

omni_kv_config: dict[str, Any] | None = None

output_connectors class-attribute instance-attribute

output_connectors: dict[str, Any] | None = None

stage_connector class-attribute instance-attribute

stage_connector: dict[str, Any] = field(
    default_factory=lambda: {
        "name": "SharedMemoryConnector",
        "extra": {},
    }
)

OmniStageDiffusionParallelConfig

Bases: OmniStageParallelConfig

Diffusion-stage distributed parallelism behavior.

allgather_degree class-attribute instance-attribute

allgather_degree: int = Field(default=1, ge=1)

cfg_parallel_size class-attribute instance-attribute

cfg_parallel_size: int = Field(default=1, ge=1)

hsdp_replicate_size class-attribute instance-attribute

hsdp_replicate_size: int = Field(default=1, ge=1)

hsdp_shard_size class-attribute instance-attribute

hsdp_shard_size: int = -1

mask_sp_padding class-attribute instance-attribute

mask_sp_padding: bool = False

ring_degree class-attribute instance-attribute

ring_degree: int = Field(default=1, ge=1)

sequence_parallel_size class-attribute instance-attribute

sequence_parallel_size: int = Field(
    default=1, ge=1, init=False
)

text_encoder_tp_size class-attribute instance-attribute

text_encoder_tp_size: int = Field(default=1, ge=1)

ulysses_a2a_permute class-attribute instance-attribute

ulysses_a2a_permute: bool = False

ulysses_degree class-attribute instance-attribute

ulysses_degree: int = Field(default=1, ge=1)

ulysses_mode class-attribute instance-attribute

ulysses_mode: str = 'strict'

use_hsdp class-attribute instance-attribute

use_hsdp: bool = False

vae_parallel_mode class-attribute instance-attribute

vae_parallel_mode: str = 'tile'

vae_patch_parallel_size class-attribute instance-attribute

vae_patch_parallel_size: int = Field(default=1, ge=1)

OmniStageLoadConfig

Bases: _TrackExplicitConfigFields, LoadConfig

vLLM loading behavior plus Omni stage-specific tokenizer inputs.

config_format class-attribute instance-attribute

config_format: str | None = None

skip_mm_profiling class-attribute instance-attribute

skip_mm_profiling: bool | None = None

skip_tokenizer_init class-attribute instance-attribute

skip_tokenizer_init: bool = False

tokenizer class-attribute instance-attribute

tokenizer: str | None = None

tokenizer_mode class-attribute instance-attribute

tokenizer_mode: str = 'auto'

OmniStageModelConfig

Bases: _TrackExplicitConfigFields

Per-stage model behavior and resolved model-engine inputs.

active_stream_window class-attribute instance-attribute

active_stream_window: int = Field(default=0, ge=0)

allowed_local_media_path class-attribute instance-attribute

allowed_local_media_path: str | None = None

allowed_media_domains class-attribute instance-attribute

allowed_media_domains: list[str] | None = None

attention_backend class-attribute instance-attribute

attention_backend: Any = None

attention_config class-attribute instance-attribute

attention_config: Any = None

code_revision class-attribute instance-attribute

code_revision: str | None = None

codec_frame_rate_hz class-attribute instance-attribute

codec_frame_rate_hz: float | None = None

custom_voice_dir class-attribute instance-attribute

custom_voice_dir: str | None = None

default_sampling_params class-attribute instance-attribute

default_sampling_params: dict[str, Any] | None = None

disable_autocast class-attribute instance-attribute

disable_autocast: bool = False

dtype class-attribute instance-attribute

dtype: Any = 'auto'

duplex_max_sessions class-attribute instance-attribute

duplex_max_sessions: int = Field(default=1, ge=1)

enable_broadcast_weight_load class-attribute instance-attribute

enable_broadcast_weight_load: bool = False

enable_flashinfer_autotune class-attribute instance-attribute

enable_flashinfer_autotune: bool | None = None

enable_multithread_weight_load class-attribute instance-attribute

enable_multithread_weight_load: bool = True

enable_prompt_embeds class-attribute instance-attribute

enable_prompt_embeds: bool | None = None

enable_sleep_mode class-attribute instance-attribute

enable_sleep_mode: bool = False

enforce_eager class-attribute instance-attribute

enforce_eager: bool = False

final_output class-attribute instance-attribute

final_output: bool = False

generation_config class-attribute instance-attribute

generation_config: str | None = None

has_sampling_extra_args class-attribute instance-attribute

has_sampling_extra_args: bool = False

hf_config_path class-attribute instance-attribute

hf_config_path: str | None = None

hf_overrides class-attribute instance-attribute

hf_overrides: Any = None

hf_token class-attribute instance-attribute

hf_token: bool | str | None = None

interleave_mm_strings class-attribute instance-attribute

interleave_mm_strings: bool | None = None

limit_mm_per_prompt class-attribute instance-attribute

limit_mm_per_prompt: dict[str, Any] | None = None

logits_processors class-attribute instance-attribute

logits_processors: list[str | type] | None = None

logprobs_mode class-attribute instance-attribute

logprobs_mode: str | None = None

max_cudagraph_capture_size class-attribute instance-attribute

max_cudagraph_capture_size: int | None = Field(
    default=None, ge=0
)

max_logprobs class-attribute instance-attribute

max_logprobs: int | None = None

media_io_kwargs class-attribute instance-attribute

media_io_kwargs: dict[str, Any] | None = None

mm_processor_cache_type class-attribute instance-attribute

mm_processor_cache_type: str | None = None

mm_processor_kwargs class-attribute instance-attribute

mm_processor_kwargs: dict[str, Any] | None = None

model class-attribute instance-attribute

model: str | None = None

model_arch class-attribute instance-attribute

model_arch: str | None = None

model_subdir class-attribute instance-attribute

model_subdir: str | None = None

moe_backend class-attribute instance-attribute

moe_backend: str = 'auto'

num_weight_load_threads class-attribute instance-attribute

num_weight_load_threads: int = Field(default=4, ge=1)

override_generation_config class-attribute instance-attribute

override_generation_config: dict[str, Any] | None = None

requires_full_payload_input class-attribute instance-attribute

requires_full_payload_input: bool = False

revision class-attribute instance-attribute

revision: str | None = None

seed class-attribute instance-attribute

seed: int | None = None

served_model_name class-attribute instance-attribute

served_model_name: str | list[str] | None = None

session_mode class-attribute instance-attribute

session_mode: str = 'turn'

silence_ban_frames class-attribute instance-attribute

silence_ban_frames: int = 0

subtalker_sampling_params class-attribute instance-attribute

subtalker_sampling_params: dict[str, Any] | None = None

supports_native_mrv2_data_plane class-attribute instance-attribute

supports_native_mrv2_data_plane: bool = False

task_type class-attribute instance-attribute

task_type: str | None = None

tokenizer_revision class-attribute instance-attribute

tokenizer_revision: str | None = None

tokenizer_subdir class-attribute instance-attribute

tokenizer_subdir: str | None = None

trust_remote_code class-attribute instance-attribute

trust_remote_code: bool = False

use_v2_model_runner class-attribute instance-attribute

use_v2_model_runner: bool = False

OmniStageParallelConfig

Bases: _TrackExplicitConfigFields, ParallelConfig

Common per-stage distributed parallelism behavior.

data_parallel_rank class-attribute instance-attribute

data_parallel_rank: int | None = Field(default=None, ge=0)

data_parallel_rpc_port class-attribute instance-attribute

data_parallel_rpc_port: int | None = None

data_parallel_size_local class-attribute instance-attribute

data_parallel_size_local: int | None = Field(
    default=None, ge=0
)

worker_cls class-attribute instance-attribute

worker_cls: str | None = None

world_size_across_dp property

world_size_across_dp: int

OmniStagePoolingConfig

Typed inputs owned by vLLM pooling stages.

default_pooling_params class-attribute instance-attribute

default_pooling_params: PoolingParams | None = None

pooling_output_decoder class-attribute instance-attribute

pooling_output_decoder: str | None = None

runner class-attribute instance-attribute

runner: str | None = None

OmniStageRuntimeConfig

Per-stage process placement and backend runtime behavior.

additional_config class-attribute instance-attribute

additional_config: dict[str, Any] | None = None

devices class-attribute instance-attribute

devices: str | None = None

distributed_executor_backend class-attribute instance-attribute

distributed_executor_backend: Any = None

env class-attribute instance-attribute

env: dict[str, Any] | None = None

log_level class-attribute instance-attribute

log_level: str = 'info'

log_stats class-attribute instance-attribute

log_stats: bool = False

num_gpus class-attribute instance-attribute

num_gpus: int = Field(default=1, ge=1)

num_replicas class-attribute instance-attribute

num_replicas: int = Field(default=1, ge=1)

worker_cls class-attribute instance-attribute

worker_cls: str | None = None

OmniStageSchedulerConfig

Bases: _TrackExplicitConfigFields, SchedulerConfig

Per-stage request scheduling behavior.

async_scheduling class-attribute instance-attribute

async_scheduling: bool | None = None

enable_chunked_prefill class-attribute instance-attribute

enable_chunked_prefill: bool | None = None

max_model_len class-attribute instance-attribute

max_model_len: int | None = Field(default=None, ge=-1)

max_num_batched_tokens class-attribute instance-attribute

max_num_batched_tokens: int | None = Field(
    default=None, ge=1
)

max_num_seqs class-attribute instance-attribute

max_num_seqs: int | None = Field(default=None, ge=1)

VllmOmniARStageConfig

Bases: BaseVllmOmniStageConfig

Structured config for autoregressive LLM stages.

VllmOmniConfig

Top-level structured Omni config built once from registry inputs.

orchestrator_config class-attribute instance-attribute

orchestrator_config: VllmOmniOrchestratorConfig = field(
    default_factory=VllmOmniOrchestratorConfig
)

pipeline_config instance-attribute

pipeline_config: PipelineConfig

stage_configs instance-attribute

stage_configs: tuple[StageConfigType, ...]

strategy_omni_lb_policy class-attribute instance-attribute

strategy_omni_lb_policy: str | None = None

from_pipeline_config classmethod

from_pipeline_config(
    pipeline_cfg: PipelineConfig,
    *,
    user_deploy_config: DeployConfig | None = None,
    deploy_config_path: str | None = None,
    cli_overrides: dict[str, Any] | None = None,
    strategy_specs: Mapping[Any, Any] | None = None,
) -> VllmOmniConfig

Create a structured config from a resolved pipeline and deploy YAML.

stage_by_id

stage_by_id(stage_id: int) -> StageConfigType

VllmOmniDiffusionStageConfig

Bases: BaseVllmOmniStageConfig

Structured config for diffusion stages.

diffusion_config class-attribute instance-attribute

diffusion_config: _DiffusionConfigProjection = field(
    default_factory=_DiffusionConfigProjection
)

parallel_config class-attribute instance-attribute

VllmOmniGenerationStageConfig

Bases: BaseVllmOmniStageConfig

Structured config for generation LLM stages.

VllmOmniOrchestratorConfig

Configuration consumed by the orchestrator process only.

batch_timeout class-attribute instance-attribute

batch_timeout: int = Field(default=10, ge=0)

deploy_config_path class-attribute instance-attribute

deploy_config_path: str | None = None

init_timeout class-attribute instance-attribute

init_timeout: int = Field(default=600, ge=1)

omni_dp_size_local class-attribute instance-attribute

omni_dp_size_local: int = Field(default=1, ge=1)

omni_heartbeat_timeout class-attribute instance-attribute

omni_heartbeat_timeout: float = Field(default=30.0, gt=0.0)

omni_lb_policy class-attribute instance-attribute

omni_lb_policy: str = 'random'

omni_master_address class-attribute instance-attribute

omni_master_address: str | None = None

omni_master_port class-attribute instance-attribute

omni_master_port: int | None = None

parallel_stage_init class-attribute instance-attribute

parallel_stage_init: bool = False

ray_address class-attribute instance-attribute

ray_address: str | None = None

stage_init_timeout class-attribute instance-attribute

stage_init_timeout: int = Field(default=300, ge=1)

worker_backend class-attribute instance-attribute

worker_backend: str = 'multi_process'

extract_diffusion_stage_config_kwargs

extract_diffusion_stage_config_kwargs(
    kwargs: Mapping[str, Any],
    *,
    stage_id: int | str,
    include_engine_adapter_metadata: bool = False,
) -> dict[str, Any]

Take the diffusion-owned payload from resolved mixed stage arguments.

normalize_and_validate_diffusion_engine_ingress_kwargs

normalize_and_validate_diffusion_engine_ingress_kwargs(
    kwargs: Mapping[str, Any], *, stage_id: int | str
) -> dict[str, Any]

Normalize and validate raw diffusion input without inserting defaults.