vllm_omni.diffusion.diffusion_kv.model_runner_backend ¶
DiffusionKVModelRunnerBackend ¶
Native paged-KV state and BlockTable operations for a model runner.
paged_attention_adapter instance-attribute ¶
paged_attention_adapter: (
DiffusionPagedAttentionAdapter | None
) = None
activate_paged_attention_metadata ¶
activate_paged_attention_metadata(
metadata: DiffusionPagedAttentionMetadata,
)
Activate Runner-owned request metadata for an internal denoise loop.
get_diffusion_kv_row ¶
get_diffusion_kv_row(
request_id: str,
sequence_id: int | None,
context_id: str | None = None,
) -> int
Resolve a Scheduler allocation identity to its native table row.
initialize_kv_cache ¶
Allocate and bind native attention KV tensors for this rank.
install_diffusion_kv_metadata ¶
install_diffusion_kv_metadata(
metadata: DiffusionKVMetadata,
) -> bool
Install one Scheduler allocation snapshot into native Worker rows.
refresh_block_table_layout ¶
Refresh native pointer tensors after a CuMem KV-cache wake-up.