10.3 量化与淘汰:对已训模型的推理期 KV 压缩#

上一节的架构压缩(MQA / GQA / MLA)需要重新训练,无法作用于权重已冻结的模型。针对已训好、权重冻结的模型,推理期免训练压缩 KV 有两条互补路径:量化Quantization)把每个 KV 数值从 FP16 存为低比特,保留全部 token 且近乎无损;淘汰 / 稀疏Eviction / Sparsity)则不存那些判定为不重要token 的 KV,压缩幅度更大但有损[^kivi][^streaming]。

登录后才可看