Skip to content

vllm_omni.diffusion.models.minimax_h3.packed_tokens

minimax_h3_pack_audio_latent

minimax_h3_pack_audio_latent(latent: Tensor) -> Tensor

Pack audio VAE latent [audio_channel, latent_dim, T] into rows.

minimax_h3_patchify_video_latent

minimax_h3_patchify_video_latent(
    latent: Tensor, *, patch_size: Sequence[int]
) -> Tensor

Pack video latent [B,C,T,H,W] into DiT token rows.

minimax_h3_unpack_audio_tokens

minimax_h3_unpack_audio_tokens(
    rows: Tensor, *, audio_t: int, audio_channel: int
) -> Tensor

Unpack DiT audio token rows into audio VAE latent [C,latent_dim,T].

minimax_h3_unpatchify_video_tokens

minimax_h3_unpatchify_video_tokens(
    rows: Tensor,
    *,
    latent_shape: Sequence[int],
    patch_size: Sequence[int],
) -> Tensor

Unpack DiT video token rows into latent [B,C,T,H,W].