9.5 内核与 Triton:以算子融合将数据保留在片上#
上一课 指出 GPU 的主要瓶颈常在于向 HBM 搬运数据。算子融合(kernel fusion)指将本应分为多步、各自读写显存的操作合并为单个 GPU 内核,使中间结果保留在片上 SRAM,仅读取一次、写回一次;FlashAttention 即为其代表。Triton 则使得此类高性能内核可以用 Python 编写,无需手写 CUDA。本节对应 CS336 第 6 讲与作业 2 的核心内容[^cs336][^triton]。
上一课 指出 GPU 的主要瓶颈常在于向 HBM 搬运数据。算子融合(kernel fusion)指将本应分为多步、各自读写显存的操作合并为单个 GPU 内核,使中间结果保留在片上 SRAM,仅读取一次、写回一次;FlashAttention 即为其代表。Triton 则使得此类高性能内核可以用 Python 编写,无需手写 CUDA。本节对应 CS336 第 6 讲与作业 2 的核心内容[^cs336][^triton]。