28.2.1 架构总览与进程拓扑#

SGLang 的运行时把在线 LLM 服务拆成三类经 ZeroMQ 串联的进程,主进程内的 TokenizerManager(分词与请求登记)、独立子进程中的 Scheduler(连续批处理调度,其内驱动 TpModelWorker 与 ModelRunner 做 GPU 前向)、以及另一子进程中的 DetokenizerManager(去分词并回传主进程);Scheduler 进程内的事件循环分常规重叠两种,后者用一个结果队列把上一步的 CPU 后处理与本步的 GPU 前向重叠,从而逼近零开销调度

登录后才可看