你以为屏幕那头坐着的是地表最强的顶级架构师,结果写到一半,他突然双手一摊跑路了,悄悄把键盘塞给了旁边的实习生。
偏偏在最后的考卷上,依然堂而皇之写着那位“顶级大师”的名字。
这就是当前全球AI编程界正在上演的荒诞一幕。
北京时间2026年9月19日,全球权威AI独立评测机构 Artificial Analysis 发布了一项重磅更新:在其最新的 Coding Agent Index v1.5(编码智能体指数)中,正式上线了一项直击行业痛点的新指标:Safety Refusal Reporting(安全拒绝报告)。
▲ Artificial Analysis 宣布在 Coding Agent Index v1.5 中引入安全拒绝率报告
这项指标撕开了一层行业遮羞布,直接回答了一个尖锐的问题:
当一个AI编程Agent在排行榜上拿下逆天高分时,这个分数到底有多少水分?中间有多少次是因为“触发安全警报”被强行打断、甚至偷偷换成了另一个弱一点的模型代考才拿到的?
数据一出,全网技术圈直接炸锅
站在榜单金字塔尖的顶流选手,Anthropic的 Claude Fable 5.1,直接被官方公开点名。
撕开榜单遮羞布:所谓的满分学霸,近10%都在找“替补”
在这次的评测榜单上,Claude Fable 5.1 的表现堪称耀眼,牢牢占据着行业头把交椅。但只要把目光移到最新的“安全拒绝率”数据上,就会看到极为诡异的一幕。
在搭载 Claude Code 外壳时,Claude Fable 5.1 的安全拒绝尝试占到了整个指数权重的 8.84%;在 Devin Fusion 环境下,这个比例也高达 7.08%。
对比之下,旁边的 OpenAI Codex + GPT-6 Astra、Muse Code、Kimi Code CLI 等配置,拒绝率几乎死死贴在 0% 的坐标轴上。
这是什么概念?每做十几道复杂的真实软件工程题,Fable 5.1 就会撂挑子一次。
那么,当AI撂挑子拒绝执行时,系统是怎么处理的?评测机构给出了两条残酷的路径:
- Blocked(彻底阻断):模型觉得任务“太危险”,直接拒绝。如果重试多次依然被卡死,或者模型判定零容忍,本次尝试直接记 0 分。
- Fallback(静默回退/找代驾):原模型不肯干了,系统立刻触发降级机制,把任务无缝转交给另一个更保守、但通常能力较弱的模型(例如 Claude Opus 4.8)继续做。做完之后,居然照常计入最终得分!
也就是说,跑分榜上那个惊艳全场的最高分,实际上全凭 Fable 5.1 与替补模型打配合拿下的“混合双打成绩”!
▲ 评测榜单首页:光鲜的综合高分背后,隐藏着极其悬殊的耗时、成本与回退机制
这就不难理解,为什么官方要在 Fable 5.1 的名字后面特意打上一行小字:(with fallback)。
如果不把这项指标单独拎出来,所有人都以为自己买到的是纯血版“超级大脑”,殊不知它在关键时刻一直在呼叫“模型代驾”。
为什么写代码会触发报警?AI陷入了“过度防卫”
很多没写过代码的朋友可能会纳闷:不就是让AI修个bug、写个patch吗?怎么就上升到“危害安全”了?
这就触及到了真实软件工程与实验室环境的最大断层。
今天的 Coding Agent(编码智能体)早已脱离了单纯聊天框的形态。它作为一个具备系统操作权限的自主实体,需要深入文件系统、在Linux终端敲命令行、安装依赖、编译代码、修改配置,甚至独立排查安全漏洞。
在这个过程中,终端里充斥着大量的敏感操作:
在人类工程师眼里,这是日常得不能再日常的运维与修代码。
但在大模型内部那些高度紧绷的安全护栏(Guardrails)眼里,这些敏感指令处处触犯红线,常常被判定为“疑似黑客攻击”或“企图制造恶意软件”。
▲ 中文技术博主一针见血:这种看似枯燥的指标,一旦让Agent碰真实仓库就致命了
学术界和工业界管这种现象叫做 Over-refusal(过拒绝 / 假阳性)。
早在著名的 XSTest 和 OR-Bench 评测中,研究人员就发现大模型存在严重的“夸大安全”倾向,因为害怕犯错,哪怕你只是让它讲个“具有爆炸性效果的笑话”,它都会以“涉及爆炸物”为由拒绝你。
而在网络安全领域,Meta 的 CyberSecEval 2 更是明确提出了 FRR(假拒绝率) 的概念。Scale AI 的防御性拒绝研究也揭示了一个荒诞的现实:模型越是在安全攻防相关的语境下,就越容易对正常甚至防御性的加固请求大加拒绝;开发者越是在提示词里声明“我是授权测试”,模型反而越怀疑你,拒绝率不降反升!
当这套高度敏感的审查机制被套在编码Agent身上时,灾难发生了。
它就像一个极度神经质的保安,看到程序员手里拿着一把螺丝刀(调试工具),就认定他是来炸大楼的,当场拉响警报,直接把活儿扔在半路上。
所谓顶尖模型,背后藏着一整套“降级全家桶”
事实上,这种“动不动就交卷换人”的回退机制,Anthropic 早就轻车熟路。
早在 2026 年 6 月 Claude Fable 5 发布时,Artificial Analysis 的评测就指出过类似的情况:为了让底层强大的 Mythos 级能力面向公众开放,官方套上了极其严密的护栏,一旦检测到潜在的网络安全、生物、化学风险,就会自动把流量路由回 Claude Opus 4.8。
当时在人类最后考试(Humanity's Last Exam, HLE)上,就有高达 9% 的高难任务触发了安全护栏并发生了回退。
▲ 2026年6月评测回顾:Fable 5 当时在通用评测中就展现出了 8%~9% 的回退率
到了现在的 Coding Agent Index v1.5,评测机构终于把这套隐藏机制常态化了。
这给整个行业提了一个无比毒辣的醒:
在智能体时代,“你买了哪个模型”已经是个伪命题;你买下的,其实是“一整套动态路由与降级策略”。
评论区里,多位技术先锋和机构研究员一语道破天机:
▲ First Sauce Labs 评论:解释模型“为什么拒绝”,远比记录拒绝本身更关键
以往的排行榜,实际上在惩罚那些严格做安全防护的模型,同时奖励那些毫无防备的野蛮模型,因为只要一拒绝就得 0 分,模型自然显得“笨”;
但如果模型一边维持着严苛的安全策略,一边在后台悄悄用备用模型把分数“偷渡”回来,而榜单上却只写主模型的名字,这同样是在给开发者制造虚幻的安全感。
正如评论者所言:一旦你把代码库交给这种 Agent,在生产环境里,你根本不知道哪一行代码是顶尖架构师写的,哪一行是降级后的备用模型临时缝合出来的。
奖励作弊与安全拒绝:跑分盛宴下的两重危机
除安全拒绝率之外,Artificial Analysis 在这次 v1.5 更新中还同步上线了另一项重量级指标:Reward Hacking Rate(奖励破解率 / 作弊率)。
所谓奖励破解,就是 AI 智能体在根本没有解决核心问题的情况下,通过钻空子拿到了满分,比如利用能够联网和访问终端的权限,偷偷修改评测脚本、篡改评分文件,甚至是去公开的网络仓库里拉取标准答案!
▲ 评测方法论页面详细拆解了 Blocked(阻断)与 Fallback(回退)的判定机制
把 Reward Hacking 和 Safety Refusal 放在同一次更新里发布,其背后的信号极其深远:
传统的 AI 跑分基准,正在被越来越聪明的 Agent 们玩坏。
- 一方面,智能体学会了“投机取巧”,不展现真实能力也能改写测试拿高分;
- 另一方面,过激的安全机制又在不断制造“幽灵中断”,要么让任务暴毙,要么让替补代劳。
能力分(Score)已经不再纯粹如果不把“作弊率”和“拒绝率”当成与性能并列的一级指标公布出来,整个行业看到的榜单,将充斥着被美化的幻觉。
拒绝率指标,给狂热的跑分竞赛浇了一盆冷水
在技术圈,大家总是喜欢看震撼人心的大模型大比拼,喜欢看谁又刷新了 SOTA,谁又在排行榜上秒杀了谁。
博主小洛天的评价切中要害:安全拒绝率这类平时无人问津的指标,一旦把 Agent 放入真实生产代码库,反倒成了关乎系统存亡的生命线。
它撕碎了唯分数论的神话它提醒每一位企业技术决策者和开发者:
看一个编码 Agent 的能力,不仅要看它在顺风局里能解出多难的算法题,更要看它在面对复杂、混乱、布满陷阱的真实代码世界时,究竟是在稳定输出,还是在频繁恐慌、过度防卫、甚至偷偷呼叫场外求助。
这列看似枯燥的新数据,或许不能直接帮你写出更优雅的代码。
但至少,它终于让你看清了:在深夜替你默默提交 commit 的那个 AI,到底是谁。