10.2 架构层压缩:在模型架构中减小 KV#
最根本的显存压缩途径是在模型架构(architecture)层面使每个 token 的 KV 更小,从而在推理时无损且不引入额外算力。主线为两个方向:其一是减少 KV 头数,从每个头各持一份的 MHA,到所有头共享一份的 MQA,再到分组共享、当前主流的 GQA;其二是压缩 KV 维度,DeepSeek 的 MLA 将 K、V 压成低秩潜向量缓存,使用时再上投影还原。此外还可令多层共用同一份 KV,即 CLA 与 YOCO[^gqa][^mla]。