28.2.5 代码走读:多请求连续到来的一次完整推演#
把 SGLang 的event_loop → get_next_batch_to_run → run_batch → process_batch_result放回一条时间轴,用三条先后到达的请求逐迭代推演,就能看清它与 vLLM 最本质的差异,默认下 SGLang 把预填充批与解码批分成两次前向交替执行:每当有新请求到来且显存允许,调度器就为它单独跑一个预填充批、让正在解码的请求这一步整体让位,预填充产出首 token 后再于下一轮merge_batch并入解码组;预填充与解码不共享同一次前向(除非显式开enable_mixed_chunk)。