vllm_omni.model_executor.models.ming_image.model ¶
vLLM-native MLLM stage for inclusionAI Ming-Image.
MingImageDummyInputsBuilder ¶
MingImageForConditionalGeneration ¶
Bases: MingFlashOmniThinkerForConditionalGeneration
Ming-Image MLLM stage with Qwen2.5-VL and direct-state capture.
hf_to_vllm_mapper class-attribute instance-attribute ¶
hf_to_vllm_mapper = WeightsMapper(
orig_to_new_prefix={
"model.": "language_model.",
"linear_proj.": "linear_proj.proj.",
}
)
language_model instance-attribute ¶
language_model = BailingMoeV2ForCausalLM(
vllm_config=vllm_config.with_hf_config(llm_config),
prefix=maybe_prefix(prefix, "llm"),
)
linear_proj instance-attribute ¶
linear_proj = VisionProjector(
vision_dim=thinker_config.vision_config.out_hidden_size,
llm_dim=llm_config.hidden_size,
mlp_depth=getattr(thinker_config, "mlp_depth", 2),
)
make_empty_intermediate_tensors instance-attribute ¶
vision instance-attribute ¶
vision = Qwen2_5_VisionTransformer(
thinker_config.vision_config,
norm_eps=llm_config.rms_norm_eps,
quant_config=vllm_config.quant_config,
prefix=maybe_prefix(prefix, "vision"),
)
forward ¶
forward(
input_ids: Tensor,
positions: Tensor,
intermediate_tensors=None,
inputs_embeds: Tensor | None = None,
**kwargs,
) -> OmniOutput