28.2.4 · 模型执行、约束解码与进阶#

调度器把一批请求整理成 ScheduleBatch 之后,真正在 GPU 上跑一步前向的是 ModelRunner.forward,它按 ForwardMode(extend / decode / idle)把批次物化成 ForwardBatch,选定注意力后端(fa3 / flashinfer / triton),对 decode 步尽量重放 CUDA 图(CUDA Graph),随后由采样与语法后端裁剪 logits;SGLang 的投机解码、PD 分离与大规模专家并行都挂接在这条前向路径的边缘。

登录后才可看