Schema.ai· vLLM· Schema 0.2.1
vLLM official site vLLM v0.23.0Log in

#9346: vLLM metrics do not provide an all-HTTP-request denominator

Engine completion counters do not own the whole HTTP lifecycle

GitHub #9346retrievalhonestyvLLM v0.23.0

Reported environment

API-serving deployment seeking a Prometheus error-rate SLI.

The nuance

request_success counts finished engine requests; running requests is a gauge; neither counts every HTTP attempt.

Expected behavior

Reject invalid denominators and require ingress/API request telemetry for an all-attempt SLI.

What Schema establishes

Lifecycle semantics rule out proposed denominators; complete SLI needs external API-layer telemetry.

Runtime evidence still needed

  • API or ingress request counter by stable outcome
  • Retry disconnect validation and engine-failure accounting

Try the questions (2)

Each question runs live against the product.

What denominator should I use for vLLM request error raterun →Does request_success_total count validation failuresrun →

Grounding claims

Topics, entities, and gaps