11.6 扩散语言模型(dLLM)的投机 / 并行采样#

扩散语言模型 dLLM 不再逐 token 自回归,而是并行去噪 / 解掩码,理论上一步即可填入一整片位置。但它存在两道固有约束:双向注意力使其没有原生 KV-Cache,且一步并行解出过多 token 会因条件独立假设破坏依赖、导致质量崩塌。为此 dLLM 发展出自身的一套投机采样机制,一次并行预测多个位置、仅采纳其中可信的部分、再以无损方式验证,代表工作为 Fast-dLLM、SSD、Spiffy 等[^fastdllm][^ssd][^spiffy]。

登录后才可看