Skip to content

vllm_omni.metrics.prometheus

OmniPrometheusMetrics

Label-bound wrapper around the raw Prometheus metrics.

Metric collectors use the vllm_omni: prefix, distinct from the upstream vllm:* families.

inc_image_count

inc_image_count(n_images: int = 1) -> None

inc_requests_failed

inc_requests_failed(reason: str) -> None

observe_image_pixels

observe_image_pixels(n_pixels: int) -> None

observe_kv_wait

observe_kv_wait(
    connector_type: str, kv_wait_s: float
) -> None

observe_num_inference_steps

observe_num_inference_steps(n_steps: int) -> None

observe_queue_wait

observe_queue_wait(queue_wait_s: float) -> None

observe_stage_gen_time

observe_stage_gen_time(
    stage: int, stage_type: str, gen_time_s: float
) -> None

observe_stage_in_queue

observe_stage_in_queue(
    stage: int, in_queue_s: float
) -> None

observe_tokens

observe_tokens(
    prompt_tokens: int, generation_tokens: int
) -> None

request_failed

request_failed() -> None

request_succeeded

request_succeeded(
    e2e_seconds: float, finished_reason: str = "stop"
) -> None

set_peak_memory

set_peak_memory(stage: int, peak_memory_mb: float) -> None

set_running

set_running(n: int) -> None

set_stage_waiting_requests

set_stage_waiting_requests(
    stage: int, n_waiting: int
) -> None

set_waiting

set_waiting(n: int) -> None

OmniRequestCounter

Running-request counter written by the orchestrator thread, read by the client thread.

value instance-attribute

value = 0

decrement

decrement() -> None

increment

increment() -> None