28.2.6 代码走读:扩散语言模型(dLLM / LLaDA2)的请求路径#

与自回归模型预填充一次、逐 token 解码不同,扩散语言模型(diffusion LLM, dLLM)在 SGLang 里以(block)为生成单位,每次向输出尾部追加一个长度为 block_size 的块、块内初始全部填 mask_id,随后在同一批位置上反复前向、每步依算法把一部分 mask 位置替换为预测 token(去噪),块内全部 unmask 后整块提交、再追加下一块;一条 dLLM 请求因此不走常规的 EXTEND/DECODE 交替,而走由 ForwardMode.DLLM_EXTENDSchedulerDllmMixinDllmAlgorithm.run 串起来的块式路径。

登录后才可看