9.2.3 FlashAttention:避免将注意力矩阵物化到显存#

注意力(Attention)的性能瓶颈通常不在浮点算力,而在显存读写。FlashAttention(快速注意力)通过分块(tiling)与在线 softmax(online softmax),在 GPU 片上高速缓存(SRAM)内边计算边累加,始终不将完整的 $N\times N$ 注意力矩阵写回显存(HBM);其输出与朴素实现逐位相等(exact,而非近似),同时更快且更省显存[^fa1]。

登录后才可看