28.1.5 代码走读:多请求连续到来的一次完整推演#
把前几节拆开讲的run_busy_loop → step → schedule → execute_model → update_from_output放回一条时间轴,用三条先后到达的请求做一次逐迭代的具体推演,就能看清 vLLM 连续批处理最核心的机制,在同一个step的同一次前向里,正在解码的请求(每条 1 个 token)与刚到达请求的预填充分块被拼进同一张扁平张量,靠query_start_loc划出每条请求的边界;预填充与解码从不走两条链路,只是调度器为每条请求填入的num_scheduled_tokens不同。