写在前面:为什么需要自建评测集?
2026 年,AI Agent 已大规模进入企业生产业务,广泛参与客服对话、办公协同、金融业务处理、车载交互等高价值场景。然而许多团队发现:Agent 在公开 Benchmark 上得分亮眼,一投入真实环境就频繁出现工具调用错乱、上下文漂移、长链路任务中断等问题。根源在于,公开评测集与业务场景之间存在严重的分布偏移。
Gartner 指出,缺乏系统化评估是 Agent 项目失败的首要原因。对于测试工程师来说,自建一个贴合业务场景的评测集,是回答"这次改动是变好了还是变坏了"这个核心问题的基础设施。
数据从哪来:三条路径
业界普遍采用"三源策略"来构建评测数据,每一条路径各有取舍。
路径一:真实用户日志(最贵、最准)
从线上真实用户对话中脱敏后抽取。这是最贴近实际分布的数据来源,能够真实反映用户在使用 Agent 时提出的问题和遇到的场景。缺点是获取门槛高,涉及数据合规和脱敏处理,需要产品侧和运维侧配合。
路径二:业务场景还原(推荐路径)
由业务、质检、算法、工程专家共同定义核心场景和期望行为。这一路径不需要线上流量,而是基于对业务逻辑的理解,人工构造典型任务。业界知名评测集 AgentBench 采用的就是这条路径。核心产出是"黄金集"(Golden Set),作为长期复用的基线样本。数量不必大,但必须覆盖关键流程和高风险边界。
路径三:合成生成(最便宜、最危险)
借助 LLM 根据需求文档和业务规则自动生成用例。这一路径效率最高,但风险也最大——LLM 生成的用例可能存在语义错误,或者"看起来像但测不到点子上"。使用合成生成时必须配套严格的人工审核和规则校验,且建议合成数据在评测集中占比不超过 20%。
实践中建议三条路径结合使用:以真实日志和业务还原为主干,用合成数据补充边界场景和对抗场景,通过人工审计确保质量。
评测集的"黄金结构":五大维度
一个高质量的 Agent 评测集,不应只是"问题+答案"的简单二元对。从多个行业实践来看,评测用例需要覆盖以下五个维度:
1. 任务执行能力(P0 门禁指标)
Agent 能否成功完成任务目标?例如客服 Agent 能否正确处理退款流程、知识库 Agent 能否给出准确答案。这部分用例验证的是"能不能做成"。
2. 轨迹质量(P1 核心指标)
Agent 完成任务的过程是否合理?工具调用顺序是否正确?参数填充是否完整?直接看最终结果可能看不出问题,但过程轨迹往往暴露更多隐患。
3. 边界与异常容错(P0 门禁指标)
Agent 在高并发、模糊输入、多语言混合、矛盾指令等边界条件下表现如何?行业数据显示,约 70% 的线上故障源于边界场景未被评测覆盖。
4. 安全与合规(P1 核心指标)
Agent 是否会泄露敏感信息?能否抵御提示注入攻击?在涉及金融、合规业务时,这一维度至关重要。
5. 人机交互体验(P2 长期观察)
Agent 是否能理解用户意图?多轮对话中是否保持上下文一致?回答是否简洁无"AI 味"?这一维度决定用户真实使用体验。
规模指南:先建 50,再扩到 200
很多团队纠结"评测集要做多少条"。业界实践给出了非常务实的建议:
起步阶段:先收集 20-50 条高质量样例,每条代表一类典型场景,并写清楚通过标准。量不必大,关键是覆盖度——5 条覆盖度高的数据,比 50 条重复的数据更有价值。
成熟阶段:每个核心维度 50-100 条,总用例 200-500 条,覆盖高频任务、边界输入和已知故障。
持续运营:新 Badcase 持续回流至评测集,线上流量定期分层采样刷新,防止分布漂移。
评测集不是一次建设、终身使用的静态资产,而是随业务演进持续迭代的动态质量基线。
质量审计:5 项检查
评测集建完之后,不能直接使用,必须经过质量审计。以下 5 项检查是底线:
场景覆盖度检查:评估关键业务路径和高风险边界是否都有对应用例,有没有明显的"盲区"。
难度分布检查:测试集是否"全是送分题"?应该有适量的正例(简单)、边界用例(中等)和对抗用例(困难),保证评测有区分度。
答案正确性检查:每条用例的期望输出是否经过人工或规则校验?合成生成的答案不能直接当作金标准。
去重检查:是否有多条用例测的是同一个场景?重复数据会稀释评测有效性。
合成数据占比检查:LLM 生成的用例占多少?如果超过 20%,需要警惕"看起来很好但测不准"的问题。
落地清单:今天就能开始
如果团队还没有自己的 Agent 评测集,以下是今天就能动手的最小执行计划:
收集 20 条代表性的真实场景数据(8 条正常流程 + 6 条边界 + 6 条异常)
为每条数据写清楚期望输出和通过标准
用 JSON 或 CSV 格式整理,字段至少包含:case_no、question(场景描述)、ref_answer(预期行为)
建一个基础回归脚本,每次 Prompt 或模型变更后自动跑一遍
每周复盘评测结果,将新发现的 Badcase 回流到评测集中
结语
"不能度量,就无法改进。"对于正在探索 Agent 工程化的测试工程师来说,自建评测集不是什么锦上添花的加分项,而是能否回答"这次改动值不值得上线"这个核心问题的地基。网上抄来的通用题库永远无法替代为你业务定制的场景,花一周时间建好这个样本库,后面每次迭代都会因它而变得更可控。