13.3 工程落地:推理框架怎么跑扩散 LM(以 SGLang 为例)#

扩散 LM 服务化的核心障碍在于双向注意力 + 整段多步重算使自回归模型赖以高效运行的 KV-Cache 基础设施失效。块扩散(Block Diffusion)将其重写为块间自回归 + 块内双向,从而使整块生成的计算形态与 SGLang 已有的 分块预填充(Chunked-Prefill)流水线对齐,几乎无需改动核心引擎即可承载扩散模型。

登录后才可看