20.1 LLM 推理基础:从一次请求看懂性能瓶颈#

LLM 在线推理不是一次普通前向,而是排队与分词 → Prefill 并行处理整段输入 → Decode 逐 token 循环 → 采样与回传的持续状态机;Prefill 更偏计算受限,Decode 更偏显存带宽受限,KV Cache、批处理与调度则共同决定延迟、吞吐和可承载并发。

登录后才可看