9.3 主流推理框架:谁来实现这些优化#

前两课讨论的优化(连续批处理、PagedAttention、量化、投机解码等)通常无需自行实现,而是由推理框架(inference framework)封装为开箱即用的引擎。工程实践中的关键任务是按部署场景选择合适的框架,而高并发在线服务、单卡极致延迟与本地离线运行三类场景对应着截然不同的取舍。

登录后才可看