16.1 量化(Quantization):用更少的比特#

量化(Quantization)指将权重、激活乃至 KV-Cache 从 FP16 映射到 INT8 / INT4 / FP8 等更低比特的表示,其收益体现在两个方面,降低显存占用,使更大的模型能够部署到显存更小的硬件上;以及减少显存与计算单元之间的数据搬运,而 Decode 阶段受显存带宽约束,因此搬运量的下降直接转化为吞吐提升。

登录后才可看