9.2.2 PagedAttention:把 KV-Cache 当虚拟内存管理#
借鉴操作系统的分页(paging)机制,将 KV-Cache 切分为固定大小的页,按需分配且不要求物理连续,从而近乎消除显存浪费,使同一硬件能服务更多、更长的并发请求。该机制由 vLLM 提出并实现[^vllm]。
借鉴操作系统的分页(paging)机制,将 KV-Cache 切分为固定大小的页,按需分配且不要求物理连续,从而近乎消除显存浪费,使同一硬件能服务更多、更长的并发请求。该机制由 vLLM 提出并实现[^vllm]。