ClaudeCode上线评测爬山命令
Anthropic在ClaudeDevs账号和claude.dev博文里公布,Claude Code自带的claude-api技能新增两条命令:/claude-api build-eval和/claude-api hillclimb。前者在仓库里搭评测集和评分器,开始前会先要生产对话、工单和手写样例,关键步骤会停下来等人确认;后者按「提分」或「成本持平下压成本」的目标来改,每次只提一个补丁,改完再跑分。
防止过拟合的办法是把评测集随机拆成train和test,train分数涨了、test不动就回滚。公司给出的内部客服基准共有44张工单,其中30张用来搜索、14张留出。从Opus 4.8默认的高effort起步时,搜索集决策准确率是74.4%,每张工单约4.6美分;爬山结束后,留出集准确率从78.6%升到90.5%,每张工单成本降到原来的五分之一左右。
过程中还删掉了过时的强制工具调用和草稿步骤,换更便宜的模型档位试过,也改了路由规则。文章同时提醒,评测要贴近真实任务,不要只挑当前模型做错的例子当样本。接下来要看开发者在自己的生产任务上能不能复现类似的提分和降本效果。