10.4 显存管理与前缀复用:不缩小 KV,而是管理与复用得更充分#

前几节的思路是让 KV 变小;本节转向另一条战线,在不改变每个 token 的 KV 字节数的前提下,把已分配的这块显存管理复用到极致。核心是三项技术:分页注意力(PagedAttention)以分页机制消除内部碎片,从而在同一张卡上容纳更多并发;前缀缓存 / 基数注意力(Prefix Caching / RadixAttention)让共享同一前缀的请求复用同一份 KV,使系统提示、few-shot 示例、多轮历史与 Agent 公共上下文只需计算一次;vAttention 借助 GPU 原生虚拟内存获得分页在显存上的收益,却无需改写注意力 kernel[^vllm][^sglang][^vattention]。

登录后才可看