vllm.v1.worker.gpu.spec_decode.rejection_sampler ¶
Functions:
-
get_max_chunk_logits–Largest number of logits rows one verification chunk may hold.
_iter_request_chunks(cu_num_logits, max_chunk_logits) ¶
Yield maximally packed request ranges without splitting requests.
Source code in vllm/v1/worker/gpu/spec_decode/rejection_sampler.py
get_max_chunk_logits(vocab_size) ¶
Largest number of logits rows one verification chunk may hold.