11.4 DFlash:以块扩散一次草拟整块 token#
此前的草稿器(小模型、EAGLE、MTP 串行模块)大多仍以逐 token 自回归(token-by-token autoregressive)方式起草。DFlash 更换了起草引擎,采用轻量的块扩散(block-diffusion)草稿器一次前向即并行草拟整块 token,并通过 KV 注入(KV injection)使草稿严格条件于目标模型的隐藏特征。由此起草延迟显著下降而仍保持无损,在 NVIDIA Blackwell 上配合 TensorRT-LLM 可实现最高约 15× 的推理提速[^dflash][^nv]。