Skip to content

vllm_omni.diffusion.models.ming_image.condition

Ming-Image query and direct-VLM condition projectors.

MingImageConditioning

Bases: Module

direct_projector instance-attribute

direct_projector = nn.Sequential(
    nn.RMSNorm(direct_input_dim, eps=1e-05),
    nn.Linear(
        direct_input_dim, direct_output_dim, bias=True
    ),
).to(device=device, dtype=dtype)

query_encoder instance-attribute

query_encoder = MingConditionEncoder(
    config,
    thinker_hidden_size=2048,
    device=device,
    dtype=dtype,
    normalize_output=bool(
        mlp_config.get("connector_norm", False)
    ),
    strict_loading=True,
)

forward

forward(
    query_hidden_states: Tensor,
    direct_hidden_states: Tensor,
) -> tuple[Tensor, Tensor]