28.1.2 请求全生命周期走查#
一条 OpenAI 兼容请求进入 vLLM 后,会先在前端进程里被路由、渲染成 token 序列、组装成 EngineCoreRequest,再经 ZMQ 跨进程送入引擎进程的连续批处理循环被调度、前向、采样,产出的 token 又原路经 ZMQ 回到前端被反分词、按 服务器发送事件(Server-Sent Events, SSE)逐块流回客户端;预填充(prefill)一次要算整段 prompt,而后续每个解码(decode)步只算一个新 token,因为此前所有 token 的键值缓存(Key-Value Cache, KV-Cache)已缓存、无需重算,这是解码步近似 $O(1)$ 的根本原因。