28.2.2 · 请求全生命周期走查#

一条推理请求在 SGLang 运行时中要跨越 HTTP 入口进程 → TokenizerManager → Scheduler → TpModelWorker/ModelRunner → DetokenizerManager 至少四道进程边界,经 ZMQ 消息队列串联;理解这条路径,就理解了 SGLang 为什么能把下一批的 CPU 准备当前批的 GPU 计算重叠起来。

登录后才可看