28.1.3 调度器、KV-Cache 与显存管理#
V1 的调度器不再区分预填充阶段与解码阶段,而是把每个请求抽象为已算 token 数向应算 token 数追赶,在一个 max_num_batched_tokens 的 token 预算(token budget)内先推进正在解码的请求、再补入等待队列的请求,从而把长 prompt 的分块预填充、解码、前缀命中统一进同一段逻辑;KVCacheManager 则把启动期预切好的定长块池,按块哈希做前缀命中与引用计数复用、显存耗尽时抢占回收。