vllm_omni.diffusion.models.minimax_h3.packed_tokens ¶ minimax_h3_pack_audio_latent ¶ minimax_h3_pack_audio_latent(latent: Tensor) -> Tensor Pack audio VAE latent [audio_channel, latent_dim, T] into rows. minimax_h3_patchify_video_latent ¶ minimax_h3_patchify_video_latent( latent: Tensor, *, patch_size: Sequence[int] ) -> Tensor Pack video latent [B,C,T,H,W] into DiT token rows. minimax_h3_unpack_audio_tokens ¶ minimax_h3_unpack_audio_tokens( rows: Tensor, *, audio_t: int, audio_channel: int ) -> Tensor Unpack DiT audio token rows into audio VAE latent [C,latent_dim,T]. minimax_h3_unpatchify_video_tokens ¶ minimax_h3_unpatchify_video_tokens( rows: Tensor, *, latent_shape: Sequence[int], patch_size: Sequence[int], ) -> Tensor Unpack DiT video token rows into latent [B,C,T,H,W].