25.1 LLM 与 Agent 的评测方法论#

评测传统程序可用单元测试给出对错判定,而评测大模型面对的是开放生成、无唯一答案且需判断主观优劣的任务,因此评测本身成为一套需要防范作弊与偏差的方法学,测试题可能被泄漏(污染),裁判存在可预测的系统性偏差(位置、长度、自我偏好),公开榜单会被针对性优化,Agent 可能在过程错误的情况下偶然给出正确答案。本节阐明如何量化评测,并重点阐明如何设计评测使其结论可信、不被上述机制误导。

登录后才可看