| num_requests_running | Gauge for the number of requests in model execution batches. | vllm/v1/metrics/loggers.py:451-459 |
| num_requests_waiting | Gauge for the number of requests waiting to be processed. | vllm/v1/metrics/loggers.py:461-469 |
| num_requests_waiting_by_reason | Gauge that breaks waiting requests into capacity and deferred reasons. | vllm/v1/metrics/loggers.py:471-491 |
| kv_cache_usage_perc | Gauge for KV-cache usage where 1 means 100 percent usage. | vllm/v1/metrics/loggers.py:519-527 |
| num_preemptions | Counter for cumulative preemptions from the engine. | vllm/v1/metrics/loggers.py:619-626 |
| engine_sleep_state | Gauge for engine sleep state; sleep_state label values awake, weights_offloaded, and discard_all encode sleep levels. | vllm/v1/metrics/loggers.py:493-514 |
| corrupted_requests | Counter for corrupted requests, measured as requests with NaNs in logits. | vllm/v1/metrics/loggers.py:529-540 |