ConvNeXt Vocos backbone used by the IndexTTS 2.5 codec decoder.
ConvNeXtBlock
Bases: Module
dwconv instance-attribute
dwconv = nn.Conv1d(
dim, dim, kernel_size=7, padding=3, groups=dim
)
gamma instance-attribute
gamma = nn.Parameter(
layer_scale_init_value * torch.ones(dim),
requires_grad=True,
)
norm instance-attribute
norm = nn.LayerNorm(dim, eps=1e-06)
pwconv1 instance-attribute
pwconv1 = nn.Linear(dim, intermediate_dim)
pwconv2 instance-attribute
pwconv2 = nn.Linear(intermediate_dim, dim)
forward
forward(inputs: Tensor) -> Tensor
VocosBackbone
Bases: Module
convnext instance-attribute
convnext = nn.ModuleList(
[
ConvNeXtBlock(
dim=dim,
intermediate_dim=intermediate_dim,
layer_scale_init_value=layer_scale,
)
for _ in range(num_layers)
]
)
embed instance-attribute
embed = nn.Conv1d(
input_channels, dim, kernel_size=7, padding=3
)
final_layer_norm instance-attribute
final_layer_norm = nn.LayerNorm(dim, eps=1e-06)
norm instance-attribute
norm = nn.LayerNorm(dim, eps=1e-06)
forward
forward(inputs: Tensor) -> Tensor