28.1.1 架构总览与 V1 引擎#

vLLM 的 V1 引擎把在线 LLM 服务拆成一个纯粹的调度、执行循环(EngineCore)与一层前端(AsyncLLM),二者跨进程经 ZMQ 解耦,从而让 CPU 侧的分词与去分词同 GPU 侧的前向计算重叠;服务启动时先按 gpu_memory_utilization 圈定显存预算,再以一次假前向探明真实占用,把剩余显存整块切成 KV-Cache 块。

登录后才可看