9.1 推理为什么慢、贵#
一次大语言模型推理由两个阶段构成,Prefill(预填充) 并行处理输入、受算力约束,Decode(解码) 逐 token 自回归生成、受显存带宽约束;Decode 的瓶颈不在算力,而在于每生成一个 token 都需将全部模型参数从显存读取一遍。KV-Cache 以显存换取重复计算,却使显存成为整套推理服务中最稀缺的资源。
一次大语言模型推理由两个阶段构成,Prefill(预填充) 并行处理输入、受算力约束,Decode(解码) 逐 token 自回归生成、受显存带宽约束;Decode 的瓶颈不在算力,而在于每生成一个 token 都需将全部模型参数从显存读取一遍。KV-Cache 以显存换取重复计算,却使显存成为整套推理服务中最稀缺的资源。