Skip to content

vllm_omni.transformers_utils.configs.sensenova_u1

HuggingFace-style configuration classes for SenseNova-U1.

SenseNovaU1Config

Bases: PretrainedConfig

Top-level composite config for SenseNova-U1.

Nests llm_config and vision_config sub-configs alongside the flow-matching / diffusion parameters. When constructed from a dict (e.g. via from_pretrained), sub-dicts are automatically promoted to their typed config objects.

add_noise_scale_embedding instance-attribute

add_noise_scale_embedding = add_noise_scale_embedding

base_image_seq_len instance-attribute

base_image_seq_len = base_image_seq_len

base_shift instance-attribute

base_shift = base_shift

concat_time_token_num instance-attribute

concat_time_token_num = concat_time_token_num

downsample_ratio instance-attribute

downsample_ratio = downsample_ratio

fm_head_dim instance-attribute

fm_head_dim = fm_head_dim

fm_head_layers instance-attribute

fm_head_layers = fm_head_layers

fm_head_mlp_ratio instance-attribute

fm_head_mlp_ratio = fm_head_mlp_ratio

llm_config instance-attribute

llm_config = llm_config or SenseNovaU1LLMConfig()

max_image_seq_len instance-attribute

max_image_seq_len = max_image_seq_len

max_shift instance-attribute

max_shift = max_shift

model_type class-attribute instance-attribute

model_type = 'sensenova_u1'

noise_scale instance-attribute

noise_scale = noise_scale

noise_scale_base_image_seq_len instance-attribute

noise_scale_base_image_seq_len = (
    noise_scale_base_image_seq_len
)

noise_scale_max_value instance-attribute

noise_scale_max_value = noise_scale_max_value

noise_scale_mode instance-attribute

noise_scale_mode = noise_scale_mode

t_eps instance-attribute

t_eps = t_eps

template instance-attribute

template = template

time_schedule instance-attribute

time_schedule = time_schedule

time_shift_type instance-attribute

time_shift_type = time_shift_type

use_pixel_head instance-attribute

use_pixel_head = use_pixel_head

vision_config instance-attribute

vision_config = vision_config or SenseNovaU1VisionConfig()

SenseNovaU1LLMConfig

Bases: Qwen3Config

Qwen3-based LLM backbone config with 3D RoPE extensions.

max_position_embeddings_hw instance-attribute

max_position_embeddings_hw = max_position_embeddings_hw

model_type class-attribute instance-attribute

model_type = 'sensenova_u1_llm'

rope_theta instance-attribute

rope_theta = rope_theta

rope_theta_hw instance-attribute

rope_theta_hw = rope_theta_hw

SenseNovaU1VisionConfig

Bases: PretrainedConfig

Vision embedding config (2D RoPE + conv patch embed, no transformer).

downsample_ratio instance-attribute

downsample_ratio = (
    downsample_ratio
    if downsample_ratio is not None
    else [0.5]
)

hidden_size instance-attribute

hidden_size = hidden_size

llm_hidden_size instance-attribute

llm_hidden_size = (
    llm_hidden_size
    if llm_hidden_size is not None
    else [_SENSENOVA_U1_LLM_HIDDEN_DEFAULT]
)

max_position_embeddings_vision instance-attribute

max_position_embeddings_vision = (
    max_position_embeddings_vision
)

model_type class-attribute instance-attribute

model_type = 'sensenova_u1_vision'

num_channels instance-attribute

num_channels = num_channels

patch_size instance-attribute

patch_size = patch_size

rope_theta_vision instance-attribute

rope_theta_vision = rope_theta_vision