28.1.4 模型执行、并行与量化接入#

当调度器(Scheduler)决定了本步算哪些请求之后,真正把这份计划落成 GPU 计算的是 GPUModelRunner,它在一次 execute_model() 内先把变长的多请求批次展平成扁平张量、组装注意力元数据(attention metadata)与块表(block table),再选定注意力后端跑前向、按分段 CUDA 图(piecewise CUDA graph)加速解码;而模型本身怎样从一个 HuggingFace 目录变成显存里可执行的 nn.Module,则由 ModelRegistry(按架构名找模型类)与 model_loader(流式加载权重)协作完成;量化与专家并行(Expert Parallelism, EP)则通过替换 linear 层与 MoE 层的 quant_method 无缝插入这条路径。

登录后才可看