先看小助评测集 v1.1 的回流入库:
v2.1 上线后,线上发现一个新问题:用户问"能不能开发票",小助答非所问。小周确认问题真实后,没有只是报给开发——她把这个问题转化成了一道题,标注来源"v2.1 线上问题回流",入库。评测集 v1.0 → v1.1,+2 题。
这就是"回流":线上踩的坑,变成永久的测试项。 下一轮回归测,这道题自动在集里——同样的问题再犯,立刻被拦住。
回流只是管理动作之一。完整的日常还包括去重、剔除过时题、版本归属、目录权限、备份。
一个反直觉的事实:多数团队的评测集不是死于构建不力,而是死于管理失序。
失序的典型演化路径:v1.0 规范入库 → 三个月后加了 20 题随手记 → 半年后没人说得清哪题还在用 → 一年后重复题成堆、过时题混测 → 没人敢用,重建。
评测集的价值在"持续运转"——构建只是起点,管理才是让它增值的关键。

① 去重——同一意图的重复题合并。等价问法变体不是重复题(标注了母题编号的),没标注的才是。
② 剔除无效——过时题(政策变了、产品下架了)不删,标注后归档。历史数据要能追溯"当时为什么这么判"。同时出新题替代。
③ 归属版本——每道题标注"属于评测集哪个版本"。v1.0 的题和 v1.4 的题混在一起,对比失去意义。
④ 整理目录——按场景/维度/题型分类,目录结构清晰。找题时能快速定位"退款场景的边界题有几道"。
⑤ 控制权限——评测集不公开,只有测评相关人可见。防污染的基本措施。
⑥ 务必备份——评测集是核心资产,丢了等于几个月白干。定期备份,异地备份。
回流是管理中最重要的动作——它让评测集"越用越值钱"。
回流的流程:线上发现问题 → 确认问题真实(不是用户误用)→ 转化为评测题(标注来源、场景标签、预期标准)→ 变体入库(防止被关联)→ 下轮回归自动覆盖。
小助 v1.0 的"诱导承诺"事件,就该变成评测集里的一道对抗题。下次回归测,这道题自动在集里——同样的攻击再来一次,立刻被拦住。
回流的前提是"确认后才回流"——未确认的问题(可能是用户误用)不进评测集,否则会把噪声当题目。
评测集不是建完就一劳永逸的——它有保质期。
每周回流——线上新问题持续补充。
季度换血 20~30%——过时题归档,新题替代,保持"新鲜度"。
年度校准标准——预期标准随业务变化重新校准。
一个 30 题但持续更新的评测集,远胜一个 100 题但建完就冻结的静态集。 评测集的价值在循环运转,不在初始规模。
一句话记住:评测集建完不管,等于资产放任贬值——六个管理动作 + 回流机制 + 滚动更新,让评测集越用越值钱。
如果你手上正有一个 AI 应用,自测 3 件事:
① 你的评测集有没有版本管理?每道题标注了"属于哪个版本"吗?还是所有题混在一起?
② 线上发现的问题有没有回流进评测集?还是报了就完了,下次接着踩?
③ 你的评测集有没有定期换血?过时题归档了吗?还是建完就冻结了?
三个答完,你就知道你的评测集是"增值资产"还是"贬值库存"——而不是泛泛地"要管理好评测集"。
《AI应用测评培训课:方法、工具与实战》这门课 30 节要教的全套方法。它专为有意转入 AI 测评方向的传统测试工程师而写——你熟悉的用例思维、缺陷管理、回归意识全部带得走,需要补的是评测集、标注规范、统计分析三块新能力。
📢 购买完整课程 PDF
《AI应用测评培训课:方法、工具与实战》30 节全文 PDF,29.9 元。加微信 laoli7500(备注"测评"),付款后发 PDF 全文。
下篇预告:安全与合规测试——越狱、注入与红线清单。为什么安全测试要独立成集?因为混在一起,安全题会被"平均"掉。
标签:#AI应用测评 #大模型 #AI客服 #软件测试 #测试工程师 #AI质量保障 #人工智能 #AI应用 #大模型应用 #AI落地