vllm_omni.diffusion.models.ltx2.ltx2_latents ¶
Shared latent layout and normalization primitives for LTX pipelines.
LTXAVState dataclass ¶
clear_audio_padding ¶
clear_audio_padding(
latents: Tensor, num_frames: int
) -> Tensor
Keep SP-only audio padding outside the logical sampler state.
create_conditioned_noised_state ¶
create_conditioned_noised_state(
latents: Tensor,
clean_latents: Tensor,
denoise_mask: Tensor,
noise_scale: float | Tensor,
generator: Generator | list[Generator] | None = None,
) -> Tensor
Match the official conditioned Gaussian noisier operation order.
create_noised_state ¶
create_noised_state(
latents: Tensor,
noise_scale: float | Tensor,
generator: Generator | list[Generator] | None = None,
) -> Tensor
denormalize_audio_latents ¶
denormalize_latents ¶
denormalize_latents(
latents: Tensor,
latents_mean: Tensor,
latents_std: Tensor,
scaling_factor: float = 1.0,
) -> Tensor
get_sp_padded_audio_latent_length ¶
normalize_audio_latents ¶
normalize_latents ¶
normalize_latents(
latents: Tensor,
latents_mean: Tensor,
latents_std: Tensor,
scaling_factor: float = 1.0,
) -> Tensor
official_video_token_layout ¶
Match the token-major view produced by the official LTX patchifier.
pack_latents ¶
prepare_audio_latents ¶
prepare_audio_latents(
pipeline: Any,
batch_size: int = 1,
num_channels_latents: int = 8,
audio_latent_length: int = 1,
num_mel_bins: int = 64,
noise_scale: float = 0.0,
dtype: dtype | None = None,
device: device | None = None,
generator: Generator | list[Generator] | None = None,
latents: Tensor | None = None,
latents_normalized: bool = False,
) -> tuple[Tensor, int, int]
prepare_video_latents ¶
prepare_video_latents(
pipeline: Any,
batch_size: int = 1,
num_channels_latents: int = 128,
height: int = 512,
width: int = 768,
num_frames: int = 121,
noise_scale: float = 0.0,
dtype: dtype | None = None,
device: device | None = None,
generator: Generator | list[Generator] | None = None,
latents: Tensor | None = None,
) -> Tensor
resolve_video_latent_shape ¶
resolve_video_latent_shape(
height: int,
width: int,
num_frames: int,
*,
vae_spatial_compression_ratio: int,
vae_temporal_compression_ratio: int,
) -> tuple[int, int, int]
resolve_video_latent_statistics ¶
Return statistics owned by the active video decoder.