28.2.3 RadixAttention、调度与显存#
SGLang 把所有请求走过的 token 前缀组织成一棵基数树(radix tree),match_prefix在树上找最长公共前缀、按 token 复用已算好的 KV 块,从叶子按 LRU 驱逐;两级内存池(ReqToTokenPool与TokenToKVPool)把逻辑 token 与物理 KV 显存解耦;调度器则用缓存感知的批构造与重叠调度把命中长前缀的请求优先成批、并让 CPU 侧批准备与 GPU 计算错峰。
SGLang 把所有请求走过的 token 前缀组织成一棵基数树(radix tree),match_prefix在树上找最长公共前缀、按 token 复用已算好的 KV 块,从叶子按 LRU 驱逐;两级内存池(ReqToTokenPool与TokenToKVPool)把逻辑 token 与物理 KV 显存解耦;调度器则用缓存感知的批构造与重叠调度把命中长前缀的请求优先成批、并让 CPU 侧批准备与 GPU 计算错峰。