25.2 生产观测、发布与反馈:LLM 应用的运维治理#

离线评测(上一节)解决上线前系统是否足够好LLMOps 则解决上线之后的持续问题,如何在质量、成本、稳定性发生退化时第一时间发现、定位、回滚,并将每次事故的教训反馈回系统使其持续改进。

本节要点

  • 为什么一次 LLM 请求需要用 trace + span 组织成一条因果链,每个 span 应记录什么、哪些内容不得记录。
  • LLMOps 与传统 MLOps 的本质差异,以及模型不变、质量仍会漂移这一 LLM 特有现象的成因。
  • 应监控的核心 SLI/SLO(延迟、可用性、成本、任务成功率),以及缓存如何将每请求成本降至约十分之一。
  • 灰度发布(shadow → canary → 放量 → 回滚)为何要把 prompt、模型、工具 schema、检索器打包为可整体回滚的 release manifest。
  • 反馈闭环如何将线上负反馈转化为回归集与训练数据,从而接入第 24 章的数据飞轮,以及为何线上数据不能未经处理直接用于训练。

登录后才可看