10.1 为什么 KV-Cache 是瓶颈,以及优化它的五条战线#

注意力(Attention) 在生成每个 token 时都要回看前面所有 token 的 K、V,将其缓存以避免重算,即为 KV-Cache(键值缓存)。其规模随序列长度、批大小、层数与头数多重膨胀,因而在长上下文与高并发场景下同时占满显存(约束并发数)并压满带宽(每步 decode 都需将其从显存整份读出)。优化 KV-Cache 是提升推理规模与效率的核心问题[^vllm]。

登录后才可看