28.2.6 代码走读:扩散语言模型(dLLM / LLaDA2)的请求路径#
与自回归模型预填充一次、逐 token 解码不同,扩散语言模型(diffusion LLM, dLLM)在 SGLang 里以块(block)为生成单位,每次向输出尾部追加一个长度为block_size的块、块内初始全部填mask_id,随后在同一批位置上反复前向、每步依算法把一部分 mask 位置替换为预测 token(去噪),块内全部 unmask 后整块提交、再追加下一块;一条 dLLM 请求因此不走常规的EXTEND/DECODE交替,而走由ForwardMode.DLLM_EXTEND、SchedulerDllmMixin与DllmAlgorithm.run串起来的块式路径。