vllm_omni.config.omni_config ¶
Structured vLLM-Omni configuration classes.
This module is additive for Phase 2 of RFC #4021. VllmOmniConfig.from_pipeline_config builds the structured view from an already-resolved pipeline and deploy config so parity can be proven before later PRs cut consumers over to these classes.
StageConfigType module-attribute ¶
StageConfigType: TypeAlias = (
VllmOmniARStageConfig
| VllmOmniGenerationStageConfig
| VllmOmniDiffusionStageConfig
)
BaseVllmOmniStageConfig ¶
Common structured config contract shared by all Omni stage realizations.
cache_config class-attribute instance-attribute ¶
cache_config: OmniStageCacheConfig = field(
default_factory=OmniStageCacheConfig
)
compilation_config class-attribute instance-attribute ¶
connector_config class-attribute instance-attribute ¶
connector_config: OmniStageConnectorConfig = field(
default_factory=OmniStageConnectorConfig
)
load_config class-attribute instance-attribute ¶
load_config: OmniStageLoadConfig = field(
default_factory=OmniStageLoadConfig
)
model_config class-attribute instance-attribute ¶
model_config: OmniStageModelConfig = field(
default_factory=OmniStageModelConfig
)
parallel_config class-attribute instance-attribute ¶
parallel_config: OmniStageParallelConfig = field(
default_factory=OmniStageParallelConfig
)
pooling_config class-attribute instance-attribute ¶
pooling_config: OmniStagePoolingConfig = field(
default_factory=OmniStagePoolingConfig
)
quantization_config class-attribute instance-attribute ¶
runtime_config class-attribute instance-attribute ¶
runtime_config: OmniStageRuntimeConfig = field(
default_factory=OmniStageRuntimeConfig
)
scheduler_config class-attribute instance-attribute ¶
scheduler_config: OmniStageSchedulerConfig = field(
default_factory=OmniStageSchedulerConfig
)
OmniStageCacheConfig ¶
Bases: _TrackExplicitConfigFields, CacheConfig
Per-stage engine cache and memory behavior.
This is separate from _DiffusionConfigProjection.cache_config, which configures vLLM-Omni diffusion-specific cache backends such as TeaCache and Cache-DiT.
disable_hybrid_kv_cache_manager class-attribute instance-attribute ¶
disable_hybrid_kv_cache_manager: bool | None = None
enable_prefix_caching class-attribute instance-attribute ¶
enable_prefix_caching: bool | None = None
gpu_memory_utilization class-attribute instance-attribute ¶
gpu_memory_utilization: float | None = Field(
default=None, gt=0.0, le=1.0
)
OmniStageConnectorConfig ¶
OmniStageDiffusionParallelConfig ¶
Bases: OmniStageParallelConfig
Diffusion-stage distributed parallelism behavior.
allgather_degree class-attribute instance-attribute ¶
allgather_degree: int = Field(default=1, ge=1)
cfg_parallel_size class-attribute instance-attribute ¶
cfg_parallel_size: int = Field(default=1, ge=1)
hsdp_replicate_size class-attribute instance-attribute ¶
hsdp_replicate_size: int = Field(default=1, ge=1)
sequence_parallel_size class-attribute instance-attribute ¶
sequence_parallel_size: int = Field(
default=1, ge=1, init=False
)
OmniStageLoadConfig ¶
Bases: _TrackExplicitConfigFields, LoadConfig
vLLM loading behavior plus Omni stage-specific tokenizer inputs.
OmniStageModelConfig ¶
Bases: _TrackExplicitConfigFields
Per-stage model behavior and resolved model-engine inputs.
active_stream_window class-attribute instance-attribute ¶
active_stream_window: int = Field(default=0, ge=0)
allowed_local_media_path class-attribute instance-attribute ¶
allowed_local_media_path: str | None = None
allowed_media_domains class-attribute instance-attribute ¶
default_sampling_params class-attribute instance-attribute ¶
duplex_max_sessions class-attribute instance-attribute ¶
duplex_max_sessions: int = Field(default=1, ge=1)
enable_broadcast_weight_load class-attribute instance-attribute ¶
enable_broadcast_weight_load: bool = False
enable_flashinfer_autotune class-attribute instance-attribute ¶
enable_flashinfer_autotune: bool | None = None
enable_multithread_weight_load class-attribute instance-attribute ¶
enable_multithread_weight_load: bool = True
interleave_mm_strings class-attribute instance-attribute ¶
interleave_mm_strings: bool | None = None
limit_mm_per_prompt class-attribute instance-attribute ¶
logits_processors class-attribute instance-attribute ¶
max_cudagraph_capture_size class-attribute instance-attribute ¶
max_cudagraph_capture_size: int | None = Field(
default=None, ge=0
)
mm_processor_cache_type class-attribute instance-attribute ¶
mm_processor_cache_type: str | None = None
mm_processor_kwargs class-attribute instance-attribute ¶
num_weight_load_threads class-attribute instance-attribute ¶
num_weight_load_threads: int = Field(default=4, ge=1)
override_generation_config class-attribute instance-attribute ¶
requires_full_payload_input class-attribute instance-attribute ¶
requires_full_payload_input: bool = False
served_model_name class-attribute instance-attribute ¶
subtalker_sampling_params class-attribute instance-attribute ¶
OmniStageParallelConfig ¶
Bases: _TrackExplicitConfigFields, ParallelConfig
Common per-stage distributed parallelism behavior.
data_parallel_rank class-attribute instance-attribute ¶
data_parallel_rank: int | None = Field(default=None, ge=0)
data_parallel_rpc_port class-attribute instance-attribute ¶
data_parallel_rpc_port: int | None = None
OmniStagePoolingConfig ¶
Typed inputs owned by vLLM pooling stages.
OmniStageRuntimeConfig ¶
OmniStageSchedulerConfig ¶
Bases: _TrackExplicitConfigFields, SchedulerConfig
Per-stage request scheduling behavior.
enable_chunked_prefill class-attribute instance-attribute ¶
enable_chunked_prefill: bool | None = None
max_model_len class-attribute instance-attribute ¶
max_model_len: int | None = Field(default=None, ge=-1)
VllmOmniARStageConfig ¶
VllmOmniConfig ¶
Top-level structured Omni config built once from registry inputs.
orchestrator_config class-attribute instance-attribute ¶
orchestrator_config: VllmOmniOrchestratorConfig = field(
default_factory=VllmOmniOrchestratorConfig
)
strategy_omni_lb_policy class-attribute instance-attribute ¶
strategy_omni_lb_policy: str | None = None
from_pipeline_config classmethod ¶
from_pipeline_config(
pipeline_cfg: PipelineConfig,
*,
user_deploy_config: DeployConfig | None = None,
deploy_config_path: str | None = None,
cli_overrides: dict[str, Any] | None = None,
strategy_specs: Mapping[Any, Any] | None = None,
) -> VllmOmniConfig
Create a structured config from a resolved pipeline and deploy YAML.
VllmOmniDiffusionStageConfig ¶
Bases: BaseVllmOmniStageConfig
Structured config for diffusion stages.
diffusion_config class-attribute instance-attribute ¶
diffusion_config: _DiffusionConfigProjection = field(
default_factory=_DiffusionConfigProjection
)
parallel_config class-attribute instance-attribute ¶
parallel_config: OmniStageDiffusionParallelConfig = field(
default_factory=OmniStageDiffusionParallelConfig
)
VllmOmniGenerationStageConfig ¶
VllmOmniOrchestratorConfig ¶
Configuration consumed by the orchestrator process only.
omni_dp_size_local class-attribute instance-attribute ¶
omni_dp_size_local: int = Field(default=1, ge=1)
omni_heartbeat_timeout class-attribute instance-attribute ¶
omni_heartbeat_timeout: float = Field(default=30.0, gt=0.0)