Bases: PretrainedConfig
Minimal HF config for the Moshi temporal LM backbone.
The defaults are measured from the PersonaPlex checkpoint rather than inferred from Moshi's higher-level kwargs.
attention_bias instance-attribute
attention_bias = attention_bias
head_dim instance-attribute
hidden_act instance-attribute
hidden_size instance-attribute
hidden_size = hidden_size
intermediate_size = intermediate_size
keys_to_ignore_at_inference class-attribute instance-attribute
keys_to_ignore_at_inference = ('past_key_values',)
max_position_embeddings instance-attribute
max_position_embeddings = max_position_embeddings
mlp_bias instance-attribute
model_type class-attribute instance-attribute
num_attention_heads instance-attribute
num_attention_heads = num_attention_heads
num_hidden_layers instance-attribute
num_hidden_layers = num_hidden_layers
num_key_value_heads instance-attribute
num_key_value_heads = num_key_value_heads
rms_norm_eps instance-attribute
rms_norm_eps = rms_norm_eps
rope_theta instance-attribute
sliding_window instance-attribute
sliding_window = sliding_window
use_cache instance-attribute
vocab_size instance-attribute