vllm:prefix_cache_queries
Counter for prefix cache queries, in queried tokens.
MetricPrometheusvLLM v0.29.0
Version history
- In vLLM v0.23.0, vllm:prefix_cache_queries is exposed by the V1 PrometheusStatLogger as a Prometheus counter measured in queried tokens, accumulating the tokens presented to the first-party prefix-cache lookup rather than requests or cache blocks.
- In that same version it is registered with the label names model_name and engine.
- Also in v0.23.0, the counter increments from SchedulerStats.prefix_cache_stats.queries on each scheduler-stats logging update and observes first-party prefix-cache token reuse, while KV-connector reuse is reported separately by the vllm:external_prefix_cache_* counters.
- For interpretation in v0.23.0, it serves as the token denominator of a same-label, same-window prefix-cache hit ratio, so it should be combined with prefix_cache_hits using rate or increase over a chosen window instead of reading the cumulative total as a rate.
At vLLM v0.29.0
Presentcounter
Counts prefix-cache activity in tokens.
vLLM vllm/v1/metrics/loggers.py · v0.29.0
counter_prefix_cache_queries = self._counter_cls(
name="vllm:prefix_cache_queries",
documentation=(
"Prefix cache queries, in terms of number of queried tokens."
),
labelnames=labelnames,
)vLLM vllm/v1/metrics/stats.py · v0.29.0
- `queries`: Refers to the number of tokens that were queried.
Lifecycle
| vLLM version | State | Metric name |
|---|---|---|
| v0.29.0 · selected | present | vllm:prefix_cache_queries |
| v0.28.0 | present | vllm:prefix_cache_queries |
| v0.27.1 | present | vllm:prefix_cache_queries |
| v0.27.0 | present | vllm:prefix_cache_queries |
| v0.26.0 | present | vllm:prefix_cache_queries |
| v0.25.1 | present | vllm:prefix_cache_queries |
| v0.25.0 | present | vllm:prefix_cache_queries |
| v0.24.0 | present | vllm:prefix_cache_queries |
| v0.23.0 | present | vllm:prefix_cache_queries |
| v0.22.1 | present | vllm:prefix_cache_queries |
| v0.22.0 | present | vllm:prefix_cache_queries |
| v0.21.0 | present | vllm:prefix_cache_queries |
| v0.20.2 | present | vllm:prefix_cache_queries |
| v0.20.1 | present | vllm:prefix_cache_queries |
| v0.20.0 | present | vllm:prefix_cache_queries |
| v0.19.1 | present | vllm:prefix_cache_queries |
| v0.19.0 | present | vllm:prefix_cache_queries |
| v0.18.1 | present | vllm:prefix_cache_queries |
| v0.18.0 | present | vllm:prefix_cache_queries |
| v0.17.1 | present | vllm:prefix_cache_queries |
| v0.17.0 | present | vllm:prefix_cache_queries |
| v0.16.0 | present | vllm:prefix_cache_queries |
| v0.15.1 | present | vllm:prefix_cache_queries |
| v0.15.0 | present | vllm:prefix_cache_queries |
| v0.14.1 | present | vllm:prefix_cache_queries |
| v0.14.0 | present | vllm:prefix_cache_queries |
| v0.13.0 | present | vllm:prefix_cache_queries |
| v0.12.0 | present | vllm:prefix_cache_queries |
| v0.11.2 | present | vllm:prefix_cache_queries |
| v0.11.1 | present | vllm:prefix_cache_queries |
| v0.11.0 | present | vllm:prefix_cache_queries |
| v0.10.2 | present | vllm:prefix_cache_queries |
| v0.10.1.1 | present | vllm:prefix_cache_queries |
| v0.10.1 | present | vllm:prefix_cache_queries |
| v0.10.0 | present | vllm:prefix_cache_queries |
| v0.9.2 | present | vllm:prefix_cache_queries |
| v0.9.1 | present | vllm:gpu_prefix_cache_queries |
| v0.9.0.1 | present | vllm:gpu_prefix_cache_queries |
| v0.9.0 | present | vllm:gpu_prefix_cache_queries |
| v0.8.5.post1 | present | vllm:gpu_prefix_cache_queries |
| v0.8.5 | present | vllm:gpu_prefix_cache_queries |
| v0.8.4 | present | vllm:gpu_prefix_cache_queries |
| v0.8.3 | present | vllm:gpu_prefix_cache_queries |
| v0.8.2 | present | vllm:gpu_prefix_cache_queries |
| v0.8.1 | present | vllm:gpu_prefix_cache_queries |
| v0.8.0 | present | vllm:gpu_prefix_cache_queries |
| v0.7.3 | present | vllm:gpu_prefix_cache_queries |
| v0.7.2 | absent | vllm:prefix_cache_queries |
| v0.7.1 | absent | vllm:prefix_cache_queries |
| v0.7.0 | absent | vllm:prefix_cache_queries |
Semantic coverage
gap · Availability & namegap · Structural identitygap · Measurement semanticsgap · Causal/runtime semanticsgap · Interpretation & compositiongap · Guarded guidance