Skip to content

vllm_omni.diffusion.models.ltx2.ltx2_latents

Shared latent layout and normalization primitives for LTX pipelines.

LTXAVState dataclass

Packed video and audio latents carried between denoise steps.

audio instance-attribute

audio: Tensor

video instance-attribute

video: Tensor

clear_audio_padding

clear_audio_padding(
    latents: Tensor, num_frames: int
) -> Tensor

Keep SP-only audio padding outside the logical sampler state.

create_conditioned_noised_state

create_conditioned_noised_state(
    latents: Tensor,
    clean_latents: Tensor,
    denoise_mask: Tensor,
    noise_scale: float | Tensor,
    generator: Generator | list[Generator] | None = None,
) -> Tensor

Match the official conditioned Gaussian noisier operation order.

create_noised_state

create_noised_state(
    latents: Tensor,
    noise_scale: float | Tensor,
    generator: Generator | list[Generator] | None = None,
) -> Tensor

denormalize_audio_latents

denormalize_audio_latents(
    latents: Tensor,
    latents_mean: Tensor,
    latents_std: Tensor,
) -> Tensor

denormalize_latents

denormalize_latents(
    latents: Tensor,
    latents_mean: Tensor,
    latents_std: Tensor,
    scaling_factor: float = 1.0,
) -> Tensor

get_sp_padded_audio_latent_length

get_sp_padded_audio_latent_length(
    audio_latent_length: int, sp_size: int
) -> int

normalize_audio_latents

normalize_audio_latents(
    latents: Tensor,
    latents_mean: Tensor,
    latents_std: Tensor,
) -> Tensor

normalize_latents

normalize_latents(
    latents: Tensor,
    latents_mean: Tensor,
    latents_std: Tensor,
    scaling_factor: float = 1.0,
) -> Tensor

official_video_token_layout

official_video_token_layout(latents: Tensor) -> Tensor

Match the token-major view produced by the official LTX patchifier.

pack_audio_latents

pack_audio_latents(latents: Tensor) -> Tensor

pack_latents

pack_latents(
    latents: Tensor,
    patch_size: int = 1,
    patch_size_t: int = 1,
) -> Tensor

prepare_audio_latents

prepare_audio_latents(
    pipeline: Any,
    batch_size: int = 1,
    num_channels_latents: int = 8,
    audio_latent_length: int = 1,
    num_mel_bins: int = 64,
    noise_scale: float = 0.0,
    dtype: dtype | None = None,
    device: device | None = None,
    generator: Generator | list[Generator] | None = None,
    latents: Tensor | None = None,
    latents_normalized: bool = False,
) -> tuple[Tensor, int, int]

prepare_video_latents

prepare_video_latents(
    pipeline: Any,
    batch_size: int = 1,
    num_channels_latents: int = 128,
    height: int = 512,
    width: int = 768,
    num_frames: int = 121,
    noise_scale: float = 0.0,
    dtype: dtype | None = None,
    device: device | None = None,
    generator: Generator | list[Generator] | None = None,
    latents: Tensor | None = None,
) -> Tensor

resolve_video_latent_shape

resolve_video_latent_shape(
    height: int,
    width: int,
    num_frames: int,
    *,
    vae_spatial_compression_ratio: int,
    vae_temporal_compression_ratio: int,
) -> tuple[int, int, int]

resolve_video_latent_statistics

resolve_video_latent_statistics(
    pipeline: Any,
) -> tuple[Tensor, Tensor, float]

Return statistics owned by the active video decoder.

unpack_audio_latents

unpack_audio_latents(
    latents: Tensor, num_mel_bins: int
) -> Tensor

unpack_latents

unpack_latents(
    latents: Tensor,
    num_frames: int,
    height: int,
    width: int,
    patch_size: int = 1,
    patch_size_t: int = 1,
) -> Tensor

unpad_audio_latents

unpad_audio_latents(
    latents: Tensor, num_frames: int
) -> Tensor