10.3 量化与淘汰:对已训模型的推理期 KV 压缩#上一节的架构压缩(MQA / GQA / MLA)需要重新训练,无法作用于权重已冻结的模型。针对已训好、权重冻结的模型,推理期免训练压缩 KV 有两条互补路径:量化(Quantization)把每个 KV 数值从 FP16 存为低比特,保留全部 token 且近乎无损;淘汰 / 稀疏(Eviction / Sparsity)则不存那些判定为不重要token 的 KV,压缩幅度更大但有损[^kivi][^streaming]。登录后才可看登录 Satori 账户