如果你在调 Agent、靠"多试几个 case"判断好坏,先星标关注。这篇如果对你有启发,也欢迎点个赞、收藏一下。
1️⃣ 调了 3 个月,核心路径却没动过
一个团队调了 3 个月 prompt,自认为越来越好。直到上了标准化评测 Harness,才发现核心任务路径的成功率根本没动过。
只是在边角 case 上自我感动。没有过程评测,所有"调优"都是盲调。
这条,踩过的人太多了。我们用"我觉得好多了"代替"数据证明好多了",迟早翻车。
2️⃣ 为什么单点问答分数会骗人
单点问答分数,测的是"某几个固定问题答得对不对"。它漂亮,不代表真实任务跑得通。
Agent 的价值在"完成任务":多步操作、工具调用、异常处理,一环断就整体垮。
只盯问答分数,等于用"会不会背题"判断"能不能干活"。两者差着整个工作流。
3️⃣ Harness 到底测什么
标准化 Harness,是在一个可控的任务环境里,跑完整任务路径,记录:
任务是否真正完成(不是答了几句);工具调用对不对、失败有没有重试;异常分支能不能兜住。
它把"Agent 到底行不行"从一个感觉,变成一组可复现的数字。
4️⃣ 最小可用清单:先跑起来再说
不用一上来造大系统。最小可用版就三步:
定 20–50 个真实任务,覆盖主路径和常见异常;每次改动后全量跑一遍,对比成功率;只接受"核心路径成功率上升"的改动,其余一律回滚。
把这套跑顺,你会发现之前很多"优化"其实在帮倒忙。评测 Harness,是 Agent 从玩具变工具的门槛。
觉得有用的话,点个「在看」,让更多 Agent 开发者看到;也顺手收藏一下,最小清单直接能用。
你们现在怎么评测 Agent?靠人工试几个 case,还是有标准化 Harness?评论区聊聊。
参考来源:
tech-points-library.md AI Agent 知识点库 #7(Agent 评测与 Harness)