| num_requests_running | Gauge for the number of requests in model execution batches. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| kv_cache_usage_perc | Gauge for KV-cache usage where 1 means 100 percent usage. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| prefix_cache_queries | Counter for prefix cache queries, in queried tokens. | Prefix cache effectiveness metrics, Scheduler and KV pressure metrics +1 | 6/6 | 3 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| prefix_cache_hits | Counter for prefix cache hits, in cached tokens. | Prefix cache effectiveness metrics, Scheduler and KV pressure metrics +1 | 6/6 | 3 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.pydesign/metrics.md |
| prompt_tokens | Counter for the number of prefill tokens processed. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.py |
| prompt_tokens_cached | Counter for cached prompt tokens, local plus external. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.py |
| generation_tokens | Counter for the number of generation tokens processed. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.py |
| request_success | Counter for successfully processed requests, labeled by finished_reason. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 2 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.py |
| iteration_tokens_total | Histogram of the number of tokens per engine step. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.py |
| time_to_first_token_seconds | Histogram of time to first token in seconds. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 2 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| inter_token_latency_seconds | Histogram of inter-token latency in seconds. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| request_time_per_output_token_seconds | Histogram of mean time per output token per request. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| e2e_request_latency_seconds | Histogram of end-to-end request latency in seconds. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| request_queue_time_seconds | Histogram of time spent in the WAITING phase per request. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.pymetrics/stats.py |
| request_prefill_kv_computed_tokens | Histogram of new KV tokens computed during prefill, excluding cached tokens. | Scheduler and KV pressure metrics, vLLM metric identity | 6/6 | 1 | Prometheus | v0.23.0 | 10 hr ago | metrics/loggers.py |