Agent 评测容易踩的3个坑
团队第一版 Agent 评测,多半只记个成功或失败。这法子看着省事,其实坑全在里面。
九步全对最后一步错,跟第一步就走偏,在系统里完全一样。更绝的是,靠瞎蒙凑出正确答案也算过。等下次换个输入崩了,你连它当初是怎么蒙对的都不知道。
所以评测得看路径,不能只看答案。具体有七种打法,但高精度必然伴随高成本。真要规模化落地,只能靠混合方案。
起步先用结果加关键步骤检查,每任务写两到五个断言。核心任务再拿人工标的标准轨迹去比对。到了规模化阶段,确定项用规则,模糊项交给大模型裁判。
裁判打分有三个坑:位置偏差、选择过拟合、一致率不等于正确率。好样本总放 B 位置,裁判就学偏了。规则集得做交叉验证,裁判的多轮一致性只能当过滤器。
长任务还得给部分分。按子目标或进度给分,能让退化提前可见。一个版本从完成九个目标掉到七个,任务完成率可能还是零。但部分分会先掉,这时候介入成本最低。
结果告诉你能不能用,轨迹告诉你为什么。
原文Agent 评测容易踩的3个坑