Claude 发了篇挺值得看的文章:怎么做 eval,再让 AI 根据评测结果,一轮轮改提示词、skill 和运行配置。
我们平时改完提示词,试几个例子,感觉顺了就收工。但到底改好了多少,还是刚好把这几道题背熟了?这篇把过程讲得挺细
① 先把题出对
优先用真实对话、故障记录和客服工单;没有的话,先手写 5–10 个例子,再扩展。难题要能解释难在哪里,不能只收集当前模型做错的题。测“该调用工具”,也要测“不该调用工具”,不然 AI 逢题就调,也能拿高分。
② 裁判也得先校准
分类、JSON、代码测试,能用程序判断就用程序。开放式回答再请另一个模型打分,标准写成能逐项核对的要求。人先看几份判卷;同一份答案判两次,如果结果变了,先查裁判。Agent 说“完成了”,还得看文件、数据库或测试结果。
③ 每轮只改一处
题目分成调试时能看的 train 和藏起来的 test。读错题记录,找共同原因,改一处,再测。train 涨了、test 不动,就可能改成了应试高手,哈哈。这里主要改提示词和配置,不是重新训练模型权重。
④ 分数不动,先查哪里卡住
原文有道题只要求处理一种错误,裁判却要求三种。还有些说明明明写了,模型仍按旧 API 写代码,把新旧写法对照表挪到前面才改善。连续两三轮没进展,就停下来给失败分类;改了裁判,前后版本也要按同一标准重评。
⑤ 也可以追求便宜一点
官方拿 44 张客服工单做实验,30 张用于优化,14 张留出。最终留出集准确率从 78.6% 到 90.5%,成本约为原来的五分之一。这是一个小规模内部案例,不能直接套到所有应用。
这套流程已写进 claude-api skill:在 Claude Code 里用 /claude-api build-eval 建评测,已有评测再用 /claude-api hillclimb 优化。
#Claude #ClaudeCode #Agent #AI评测 #提示词 #AI开发 #AIChannel