Skip to content

vllm_omni.model_executor.models.indextts2.codec.vocos

ConvNeXt Vocos backbone used by the IndexTTS 2.5 codec decoder.

ConvNeXtBlock

Bases: Module

act instance-attribute

act = nn.GELU()

dwconv instance-attribute

dwconv = nn.Conv1d(
    dim, dim, kernel_size=7, padding=3, groups=dim
)

gamma instance-attribute

gamma = nn.Parameter(
    layer_scale_init_value * torch.ones(dim),
    requires_grad=True,
)

norm instance-attribute

norm = nn.LayerNorm(dim, eps=1e-06)

pwconv1 instance-attribute

pwconv1 = nn.Linear(dim, intermediate_dim)

pwconv2 instance-attribute

pwconv2 = nn.Linear(intermediate_dim, dim)

forward

forward(inputs: Tensor) -> Tensor

VocosBackbone

Bases: Module

convnext instance-attribute

convnext = nn.ModuleList(
    [
        ConvNeXtBlock(
            dim=dim,
            intermediate_dim=intermediate_dim,
            layer_scale_init_value=layer_scale,
        )
        for _ in range(num_layers)
    ]
)

embed instance-attribute

embed = nn.Conv1d(
    input_channels, dim, kernel_size=7, padding=3
)

final_layer_norm instance-attribute

final_layer_norm = nn.LayerNorm(dim, eps=1e-06)

norm instance-attribute

norm = nn.LayerNorm(dim, eps=1e-06)

forward

forward(inputs: Tensor) -> Tensor