Skip to content

vllm_omni.model_executor.models.indextts2.codec

Inference-only EnhancedCodec runtime for IndexTTS 2.5.

Modules:

Name Description
models

Inference-only EnhancedCodec decoder for IndexTTS 2.5.

quantizer

Decode-only factorized residual vector quantizer.

vocos

ConvNeXt Vocos backbone used by the IndexTTS 2.5 codec decoder.

EnhancedCodec

Bases: Module

Subset of EnhancedCodec required for decode(codes).

decoder instance-attribute

decoder = nn.Sequential(
    VocosBackbone(
        input_channels=hidden_size,
        dim=vocos_dim,
        intermediate_dim=vocos_intermediate_dim,
        num_layers=vocos_num_layers,
    ),
    nn.Linear(vocos_dim, hidden_size),
)

downsample_scale instance-attribute

downsample_scale = downsample_scale

hidden_size instance-attribute

hidden_size = hidden_size

num_quantizers instance-attribute

num_quantizers = num_quantizers

quantizer instance-attribute

quantizer = ResidualVQDecoder(
    input_dim=hidden_size,
    num_quantizers=num_quantizers,
    codebook_size=codebook_size,
    codebook_dim=codebook_dim,
)

up instance-attribute

up = nn.Conv1d(
    hidden_size,
    hidden_size,
    kernel_size=3,
    stride=1,
    padding=1,
)

decode

decode(codes: Tensor) -> Tensor

Decode [B,T] or [N,B,T] codes to [B,T*scale,hidden].

load_checkpoint

load_checkpoint(checkpoint_path: str) -> None