vllm.entrypoints.openai.engine.protocol ¶
Classes:
-
GenerationError–raised when finish_reason indicates internal server error (500)
-
PromptTokenUsageInfo– -
SpeculativeDecodingMetrics–Per-request speculative-decoding acceptance metrics.
Functions:
-
structured_outputs_from_response_format–Apply
response_formatoverrides tostructured_outputs. -
validate_structural_tag_response_format–Validate structural tags before they are sent to the engine.
GenerationError ¶
Bases: VLLMServerError
raised when finish_reason indicates internal server error (500)
Source code in vllm/entrypoints/openai/engine/protocol.py
PromptTokenUsageInfo ¶
Bases: OpenAIBaseModel
Attributes:
-
multimodal_tokens(dict[str, int] | None) –Prompt tokens contributed by each input modality, keyed by modality name
Source code in vllm/entrypoints/openai/engine/protocol.py
multimodal_tokens = None class-attribute instance-attribute ¶
Prompt tokens contributed by each input modality, keyed by modality name (e.g. image, audio, video). A breakdown of the multimodal placeholder tokens already counted in prompt_tokens; None when the request has no multimodal input.
SpeculativeDecodingMetrics ¶
Bases: OpenAIBaseModel
Per-request speculative-decoding acceptance metrics.
Experimental, subject to change. Only populated for single-sequence requests (n == 1); null for n > 1, mirroring the timing metrics.
Source code in vllm/entrypoints/openai/engine/protocol.py
structured_outputs_from_response_format(structured_outputs, response_format) ¶
Apply response_format overrides to structured_outputs.
Source code in vllm/entrypoints/openai/engine/protocol.py
validate_structural_tag_response_format(response_format) ¶
Validate structural tags before they are sent to the engine.
Engine-side validation reports malformed structural tags as generation failures. OpenAI request parsing should classify them as bad requests.