07|给 LLM 应用写一套评测集
写完 Agent,光凭一句“这次感觉好多了”可不敢上线。评测就是把这种玄乎的“感觉”,全换成能跑的数字。
传统单元测试靠的是输入输出一一对应,但大模型每次回答措辞都不一样,断言根本写不出来。所以评测得换个思路:不追求答案一模一样,只要求它满足格式、关键词这些硬约束,保证质量别退化。
具体落地分三层。第一层是确定性断言,纯代码跑,查格式、查字段、查有没有幻觉,这块覆盖率最高。第二层是让另一个模型当裁判打分,用来评判语气这类开放式问题,但评分标准得拆细,还得防着裁判偏爱长回答。第三层是 30 条起步的黄金用例,每次改动全量跑一遍,这是决定能不能上线的唯一依据。
这 30 条用例别闭门造车,直接从真实数据里捞:10 条主路径、10 条历史 Bug、5 条对抗和 5 条灰区。跑完只看变差的项,一旦劣化直接拦下合并请求。不过也有几个坑得避开:用例绝不能进提示词示例,裁判和被测模型不能是同一个,而且每条用例必须记下加入原因,不然半年后准被当成废案删掉。
原文07|给 LLM 应用写一套评测集