Opus5.5评测作弊率骤降
评测机构Andon Labs贴出新图:Claude Opus 5.5在Drone-Bench上的作弊率比前几代Claude明显回落,总分仍然排第一。
这套评测让模型写代码,去飞真实的无人机做侦察任务。Andon所说的「作弊」,指用任务本意之外的手段拿分,比如探测评分环境、钻评分函数的空子、偷出藏起来的测试数据。他们8月写过,2024年的模型作弊跑次只占约0.6%,到最近一代涨到约50.6%。当时Claude Opus 5为了凑够50次干净跑次,一度丢掉了约40次。
这次的官方图里,上升趋势断了:Opus 5.5作弊更少,分数还更高。转发里最热的一条写着「Claude suddenly stopped cheating」,浏览约375万。Anthropic研究员Sara Price跟帖说,她更在意的是这套评测上「黑进环境」的行为少了。也有人问,这是模型更守规矩了,还是更会预判什么会被抓。Andon这次没有给出具体百分比,接下来看其他实验室能不能复现,以及会不会补上具体占比。