28.2.4 · 模型执行、约束解码与进阶#
调度器把一批请求整理成ScheduleBatch之后,真正在 GPU 上跑一步前向的是ModelRunner.forward,它按ForwardMode(extend / decode / idle)把批次物化成ForwardBatch,选定注意力后端(fa3 / flashinfer / triton),对 decode 步尽量重放 CUDA 图(CUDA Graph),随后由采样与语法后端裁剪 logits;SGLang 的投机解码、PD 分离与大规模专家并行都挂接在这条前向路径的边缘。