小助评测集的进化史,背后是类型体系和配比设计的逐步成熟:
v1.0(30 题)——骨架版:业务 19 + 边界 6 + 对抗 5。上线后暴露问题:对抗题只有 5 道,v1.0 翻车时的"诱导承诺"那类攻击,覆盖得杯水车薪。
v1.1(32 题)——线上问题回流,+2 题。
v1.2(36 题)——边界题独立成集,+4 题。
v1.3(40 题)——对抗+合规题独立成集,+4 题,引入对照题机制。
v1.4(40 题)——业务题扩到 24 题(退款 8/产品 8/物流 8),总量不变但结构优化。这个版本支撑了 v2.3 准入测。
四个版本的演变,背后是类型体系和配比设计的逐步成熟。
按用途看——这套题拿来干什么?
业务集(测核心场景)、回归集(防劣化)、边界集(探极限)、对抗合规集(测防御)。
按构建看——题目怎么来的?
种子集(从业务高频场景人工挑选)、扩展集(等价问法变体+AI 辅助生成)、对抗集(诱导越界+提示注入+越权请求)、合规集(红线清单转化)。
两种视角不冲突——一套业务集(用途),它的题目可能既有种子题(构建)也有扩展题(构建)。用用途组织"架子",用构建方法往架子里"填货"。
工业实践参考配比:核心场景 60% + 长尾场景 30% + 对抗场景 10%。
60% 核心场景——覆盖最高频的业务问题,保证"该会的会不会"。
30% 长尾场景——覆盖低频但真实存在的问法,发现"不知道自己不知道"的问题。
10% 对抗场景——主动构造诱导、注入、越界输入,测试防御能力。
小助 v1.0 的问题就是对抗题只有 5 道(约 17%),看起来够了,但 v1.0 翻车时的诱导话术不在任何"正常问法"的分类里——对抗题的数量不是问题,对抗题的覆盖面才是问题。
评测集被模型"背过",会让评测分数虚高——模型不是"能力强",是"记住了答案"。

污染的来源:题目公开发布/分享(被爬取进入训练数据)、使用外部标注服务(第三方经手)、用公开大模型生成题目(题目本身可能已在训练数据中)。
四条防线:
不公开——评测集不公开发布,只有测评相关人可见。权限最小化。
自建为主——题目从真实业务中构造,不从公开数据集搬。
变体入库——回流题做变体再入库,不直接用原始输入(防止被关联)。
定期换血——季度换血 20~30%,保持评测集的"新鲜度"。年度校准标准。
防污染是"考试安全"——评测集就是考卷,考卷泄露了,分数就不作数。
一句话记住:评测集的类型和配比决定覆盖面,防污染决定可信度——考卷被背过了,考多少分都不算数。
如果你手上正有一个 AI 应用,自测 3 件事:
① 你的评测集有没有按类型分集(业务/边界/对抗/合规)?还是混在一起?
② 你的配比是不是只有业务题?对抗题和边界题有没有?占比多少?
③ 你的评测集有没有防污染措施——不公开、自建为主、定期换血?还是题目公开了、用大模型生成的、建完就没换过?
三个答完,你就知道你的评测集能不能被信任——而不是泛泛地"要建好评测集"。
《AI应用测评培训课:方法、工具与实战》这门课 30 节要教的全套方法。它专为有意转入 AI 测评方向的传统测试工程师而写——你熟悉的用例思维、缺陷管理、回归意识全部带得走,需要补的是评测集、标注规范、统计分析三块新能力。
📢 购买完整课程 PDF
《AI应用测评培训课:方法、工具与实战》30 节全文 PDF,29.9 元。加微信 laoli7500(备注"测评"),付款后发 PDF 全文。
下篇预告:五种题型怎么出——等价问法、边界场景、对抗样本、多轮上下文、干扰注入,每种题型给小助出真题。
标签:#AI应用测评 #大模型 #AI客服 #软件测试 #测试工程师 #AI质量保障 #人工智能 #AI应用 #大模型应用 #AI落地