Skip to content

vllm_omni.model_executor.models.minimax_h3.conditioning

MiniMax H3 validated text and unified encoder-conditioning contracts.

MINIMAX_H3_CONDITION_LABELS_KEY module-attribute

MINIMAX_H3_CONDITION_LABELS_KEY = (
    "_minimax_h3_condition_labels"
)

MINIMAX_H3_ENCODER_LAYOUT_KEY module-attribute

MINIMAX_H3_ENCODER_LAYOUT_KEY = 'minimax_h3_encoder_layout'

MINIMAX_H3_ENCODER_REQUEST_KEY module-attribute

MINIMAX_H3_ENCODER_REQUEST_KEY = (
    "minimax_h3_encoder_request"
)

MINIMAX_H3_PRESENTATION_TASK_KEY module-attribute

MINIMAX_H3_PRESENTATION_TASK_KEY = (
    "_minimax_h3_presentation_task"
)

MINIMAX_H3_TEXT_CONDITIONING_SCHEMA module-attribute

MINIMAX_H3_TEXT_CONDITIONING_SCHEMA = (
    "minimax_h3.text_conditioning/v1"
)

MINIMAX_H3_TEXT_HIDDEN_SIZE module-attribute

MINIMAX_H3_TEXT_HIDDEN_SIZE = 5120

STAGE_SCHEMA_VERSION module-attribute

STAGE_SCHEMA_VERSION = 2

MiniMaxH3EncoderConditioning dataclass

audio_condition class-attribute instance-attribute

audio_condition: Tensor | None = None

audio_condition_lengths class-attribute instance-attribute

audio_condition_lengths: tuple[int, ...] = ()

audio_edit_clean_rows class-attribute instance-attribute

audio_edit_clean_rows: Tensor | None = None

audio_edit_mask class-attribute instance-attribute

audio_edit_mask: Tensor | None = None

audio_edit_source_t class-attribute instance-attribute

audio_edit_source_t: int = 0

audio_t instance-attribute

audio_t: int

height instance-attribute

height: int

hidden_states instance-attribute

hidden_states: Tensor

keyframe_frame_indices class-attribute instance-attribute

keyframe_frame_indices: tuple[int, ...] = ()

latent_t instance-attribute

latent_t: int

num_frames instance-attribute

num_frames: int

ref_blocks class-attribute instance-attribute

ref_blocks: tuple[dict[str, Any], ...] = ()

task instance-attribute

task: str

token_tags instance-attribute

token_tags: Tensor

video_edit_clean_rows class-attribute instance-attribute

video_edit_clean_rows: Tensor | None = None

video_edit_mask class-attribute instance-attribute

video_edit_mask: Tensor | None = None

visual_condition class-attribute instance-attribute

visual_condition: Tensor | None = None

visual_condition_shapes class-attribute instance-attribute

visual_condition_shapes: tuple[
    tuple[int, int, int], ...
] = ()

width instance-attribute

width: int

from_components classmethod

Combine local encoder results without a stage-wire round trip.

from_omni_payload classmethod

from_omni_payload(
    payload: Mapping[str, Any],
) -> MiniMaxH3EncoderConditioning

to_omni_payload

to_omni_payload() -> dict[str, Any]

MiniMaxH3EncoderMediaConditioning dataclass

audio_condition class-attribute instance-attribute

audio_condition: Tensor | None = None

audio_condition_lengths class-attribute instance-attribute

audio_condition_lengths: tuple[int, ...] = ()

audio_edit_clean_rows class-attribute instance-attribute

audio_edit_clean_rows: Tensor | None = None

audio_edit_mask class-attribute instance-attribute

audio_edit_mask: Tensor | None = None

audio_edit_source_t class-attribute instance-attribute

audio_edit_source_t: int = 0

audio_t instance-attribute

audio_t: int

height instance-attribute

height: int

keyframe_frame_indices class-attribute instance-attribute

keyframe_frame_indices: tuple[int, ...] = ()

latent_t instance-attribute

latent_t: int

num_frames instance-attribute

num_frames: int

ref_blocks class-attribute instance-attribute

ref_blocks: tuple[dict[str, Any], ...] = ()

task instance-attribute

task: str

video_edit_clean_rows class-attribute instance-attribute

video_edit_clean_rows: Tensor | None = None

video_edit_mask class-attribute instance-attribute

video_edit_mask: Tensor | None = None

visual_condition class-attribute instance-attribute

visual_condition: Tensor | None = None

visual_condition_shapes class-attribute instance-attribute

visual_condition_shapes: tuple[
    tuple[int, int, int], ...
] = ()

width instance-attribute

width: int

to_omni_components

to_omni_components() -> tuple[Tensor, Tensor, Tensor]

MiniMaxH3EncoderMediaInput dataclass

audio_edit class-attribute instance-attribute

audio_edit: tuple[Tensor, int] | None = None

audio_edit_mask class-attribute instance-attribute

audio_edit_mask: Tensor | None = None

audio_mode class-attribute instance-attribute

audio_mode: str = 'native'

audio_t instance-attribute

audio_t: int

audios class-attribute instance-attribute

audios: tuple[tuple[Tensor, int], ...] = ()

height instance-attribute

height: int

images class-attribute instance-attribute

images: tuple[Tensor, ...] = ()

keyframe_frame_indices class-attribute instance-attribute

keyframe_frame_indices: tuple[int, ...] = ()

latent_t instance-attribute

latent_t: int

num_frames instance-attribute

num_frames: int

task instance-attribute

task: str

video_audios class-attribute instance-attribute

video_audios: tuple[tuple[Tensor, int] | None, ...] = ()

video_edit class-attribute instance-attribute

video_edit: Tensor | None = None

video_edit_mask class-attribute instance-attribute

video_edit_mask: Tensor | None = None

videos class-attribute instance-attribute

videos: tuple[Tensor, ...] = ()

width instance-attribute

width: int

from_mm_tensors classmethod

from_mm_tensors(
    values: Sequence[Tensor], metadata: Mapping[str, Any]
) -> MiniMaxH3EncoderMediaInput

to_metadata

to_metadata() -> dict[str, Any]

to_mm_tensors

to_mm_tensors() -> list[Tensor]

MiniMaxH3TextConditioning dataclass

minimax_h3.text_conditioning/v1 semantic payload.

hidden_states instance-attribute

hidden_states: Tensor

token_tags instance-attribute

token_tags: Tensor

from_omni_payload classmethod

from_omni_payload(
    payload: Mapping[str, Any],
) -> MiniMaxH3TextConditioning

Validate and adapt the existing OmniPayload stage-wire view.

from_payload classmethod

from_payload(
    payload: Mapping[str, Any],
) -> MiniMaxH3TextConditioning

Validate the semantic payload consumed by the diffusion stage.

to_payload

to_payload() -> dict[str, Tensor]