当前位置:首页>排行榜>评测幻觉:当分数开始说谎

评测幻觉:当分数开始说谎

  • 更新时间 2026-09-25 10:05:29
评测幻觉:当分数开始说谎
最近读到两篇论文,把它们放到一起看,觉得有点意思。
一篇来自上海交通大学 AGI Institute,发表在 EMNLP 2026,讲推理模型做过效率优化之后,安全评测的成绩为什么会变好看。另一篇把疑问直接写进了标题,讲的是 Agent 记忆,一份自己写、自己再读回的存储。
两个题目本来毫不相干:一个谈安全与效率的取舍,一个谈记忆里的错误怎么越滚越大。可两篇的结论并排一放,说的竟是同一件事:

上海交通大学 AGI Institute 在 EMNLP 2026 发表的《On the Efficiency-Safety Dilemma in Large Reasoning Models》里有一句话:效率优化之后越狱成功率下降,是“尝试了但失败了”,跟“不愿意了”是两回事。

另一篇论文把追问直接写进了标题:《Self-Cleaning and Captured Anyway: One Measured Primitive for Error in a Store an Agent Writes to Itself, and What a Falling Score Actually Measures》。分数下降,它到底在测什么?

两句话拼在一起,就是本文要说的事:你的指标在动,但你不确定它在测什么。
先给一个贯穿全文的比喻:评测就是一把尺子。
尺子热胀冷缩的时候,量出来的长度依旧是个数字,只是这个数字不再对应任何真实的东西。
顺着这股疑惑,我把近一个月翻过的东西摊在一处,凑齐八篇。它们横跨安全评测、Agent 记忆、代码测试、视频理解、论文评审和科研协作,作者彼此不认识,落点却常常撞在一起。八篇论文,六个方向,问的是同一句:这个数字到底在测什么。
下面从两个最反直觉的实验说起:一个说“读数变小了,东西没变短”,一个说“读数变好了,东西没变长”。

一、两个反直觉的实验

幻觉 A:安全分涨了,因为模型变笨了

上海交通大学 AGI Institute 的团队把量化、剪枝、KV 缓存压缩这三类主流效率手段,逐一做了对抗性测试。结果如下:
量化或剪枝之后,越狱攻击的成功率确实下降了。
只看这条曲线,结论是“效率优化顺带提升了安全性”。
论文给出的答案正好相反:这个改善是表面的。它主要来自推理能力的退化,恶意回答于是变成“尝试了但没做成”(attempted but failed)。模型的对齐水平并没有跟着变强。
打个比方:一道题空着,可能是不会,也可能是不肯。而在评测报告上,这两种空白长得一模一样。
机制层面,作者做了表征漂移分析,结论是:“推理能力的损失”与“模型维持恶意语义轨迹的能力”之间存在严格耦合。
也就是说,模型并没有主动拦下这些回答,它只是走不到终点。
说白了:这条曲线量的是模型做不做得到,量不到它愿不愿意做。
而这两件事在工程上的价值完全相反:
做不到是能力问题,模型升级一次,它自己就回来了;
不愿做才是安全能力,这个跟能力高低无关。
把前者当成后者,就是拿现象当本质,等于给自己发了一张会过期的安全证书。

⚠️ 顺便纠一个容易误读的结论:论文指出“量化 + 剪枝”是平衡效率与鲁棒性的最优策略。这句要小心读。它的本意是“安全增益既然是假的,那就别为这个假增益牺牲效率”,这种组合并不因此更安全。


幻觉 B:分数跌了,是它少犯错了,还是它总是翻到自己的旧账

澳门大学与华南理工大学的团队,做法是:让 Agent 把结论写回自己的存储,再把这个闭环推到无限期运行(infinite tenure)的极限。
以往的文献把这个闭环描述为“单向污染”:错误像墨水,一层层洇开。推到极限之后,是另一幅图景:
因为写入永不删除,可达状态空间存在一个硬上界 (n−1)/n。说白一点:错误能把这块存储占得很满,但占不满。
这里的直觉不难把握。仅追加的存储就像一本只能往后写、永远撕不掉旧页的账本:每写进一条错误,它都不会消失,反而被当成了一条经验;此后每次检索,它都有可能被重新取用一次。账本越长,翻到错误页的概率越高。
所以最终只有两种结局:要么错误越滚越多,要么它自己把错误清干净。中间那种不上不下的状态,几乎见不到。而 (n−1)/n 这个上限,是只能往后写、不能删这条规则砌出的一堵墙,模型自己走不到那儿。
数据同样反直觉:
当初始错误率 f₀ = 0.9 时,两个模式之间的区间只占 220 次运行中的3.6%(若均匀铺开应为 20.6%),而且前 15 次全部为空,无一例外;
池化均值只能描述8.2%的运行,而中位数能描述68.2%。
作者有一句总结,我认为值得单独抄下来:

这个过程的“每模型平均”,是一个没有指称对象的统计量。

判断依据则压缩到一个单参数、零拟合的原语:复制函数 γ(φ)。用 sign(γ̂ − γ_crit)(γ_crit = 1/k,取 r=0、w=1)去预测漂移方向,在360 次真实事实运行中命中了 353 次。
还有两个必须说的发现:
① 规模救不了。前沿模型上的池化捕获率(pooled capture)达到0.850,claude-sonnet-4.5 的 20 个种子无一幸免。而作者事先登记的预测是“捕获率低于 0.5”。与自己的预测相反,他们还是把这组结果写进了论文。
② 清空区间的是复制概率。一个状态无关的读取器在同一个瓮模型(urn)上,让113/300次运行落进了这个区间。真正把区间清空的,是复制概率随检索到的假记录条数上升。
说到这里,大概会有人想起自己手上的 Agent:用了一两个月,感觉它变笨了。
幻觉 B 能解释其中一部分。这类 Agent 的记忆通常分成两半:一小份能读能改、还带字符上限的笔记文件,和一个越攒越长的会话历史库。真正会滚起来的往往是后者:检索回来的是原始消息,没有摘要,也没有任何标记提醒它“这条结论后来被推翻了”。三周前一句没验证过的断言,今天会和一手证据长得一模一样。
但“变笨”至少还有三个来源跟记忆无关:上下文越堆越多,注意力被稀释;指令文件越写越长,条目互相打架;再或者,模型根本没变,是任务变难了。要分清是哪一种,有个便宜的办法:把记忆关掉、或退回到早期版本,跑同一批任务。成绩明显回升,才是记忆的锅;没变化,就去砍那份打满补丁的指令文件。
说白了:

分数下降,可能只说明它更频繁地翻到了自己的旧错误,它的犯错频率并没有降。


二、为什么“评测幻觉”是系统性的

上面两个是症状。病灶在更下面。本文涉及的论文里,至少有六篇从不同角度在拆同一件事,归结为三个结构性原因。

1. 测量对象错位:单轮判定测不到轨迹风险

BLINDSPOT(伦斯勒理工学院 + IBM Research)搭了一套安全测试集,专门考“一连串调用工具很多轮”的 Agent:22 类攻击手法、35 个场景、7 个领域、2500 多条轨迹,平均每条要跑 14.7 轮。最要紧的一条结论是:开头几步往往安全,风险在后面才长出来。
这也意味着:只在一轮对话里判个及格不及格的安全评测,从设计上就够不着这类风险。安全性埋在整条轨迹里,一轮对话扛不起这个指标。
BenchShield(达特茅斯学院主导,加州大学伯克利分校等参与)给了一组更刺眼的数字:把整条链路都查一遍,奖励攻击(一味迎合打分标准、并不真把事做对)的检出率从原来的 23–94% 提到 77–100%。
说白了:过去那些“合格”的评测,放过去了一大批“看着达标、其实没做对”的回答。

2. 代理指标替代目标:通过率代替质量

VibeCheck(马里兰大学巴尔的摩郡分校)从五个维度给 LLM 写的单元测试打分,最常见的状态是:跑得起来,但该断的地方没断,边界情况也没覆盖。结论就一句:跑通 ≠ 测得好。
BVB(罗切斯特大学、索尼集团、卡内基梅隆大学、华盛顿大学)更直白:让视频理解 Agent 用 Blender 把真实视频重建成动画场景,调得最好的那组,潜空间相似度(模型内部觉得两段画面有多像)做到88.6,可原视频里“谁在何时、在何处、做了什么”这层关系,只剩53.7%还对得上。
画面像,事情不对。而我们平时盯的,往往正是那个 88.6。

3. 闭环自指:评测器、数据、被测对象共享同一分布

TrustReviewer(马里兰大学 College Park)的结论值得单独拎出来:把 AI 评审写出的意见喂给下一代评审模型,大家的判断会越走越近。论文把这种现象命名为“科学判断收敛”:打分趋同,说法雷同,论文之间本该有的差别被一并抹平。
触发它的门槛还很低:只要 33% 的评审是合成的,打分的标准差就从 1.63 掉到 1.44;全部合成时,同一篇论文收到的几份评审,在说法上的差别还要再缩掉约 11%。
英伟达的Agora反过来,在设计上就防着这一手:每个智能体提交的研究记录一旦写下就改不掉,只能往上加分叉(不可变的 DAG),再配一条照顾多样性的挑选规则,免得整个社区都挤到同一个领跑者身后。即便如此,还是冒过一次“一个领跑者把所有分支都挤没”的苗头,最后靠一次人工干预才把社区拉了回来。
把这三条串起来是一句话:

上游和下游共享同一套假设时,指标会朝同一个方向一起偏,不会互相抵消。


三、最诚实的一段:同一把尺子,也量了自己

《Self-Cleaning》那篇里,最诚实的部分不在正文。
把重采样单位从 3 个种子扩到 44 个种子之后(设计效应 3.75),支撑第 4 条结论的那个排序,从 Spearman +0.98 塌到 +0.31 ~ +0.80;而第 2 条结论的排序在 44 个种子下依然精确(+1.00,p = 0.017)。
作者没藏。他们把87 行分级结果全放进了附录 W,其中37 行挂着 withdrawn / failed / self-correcting / undecidable / 承认的局限。
这是我近来读到最坦白的一份实验记录。它也顺手指出了我们读论文、读评测报告时最该问的那句:

任何排名类结论,都要问“样本量是多少”。

3 个种子能给出 +0.98,44 个种子只给 +0.31。

同类的事还有 Agora(前面那个让多个智能体往 Git 上提交研究记录的系统):1703 次贡献听起来浩浩荡荡,但第一天发布的 18 条贡献就占了约 98% 的总降幅,剩下 1100 多条用十一天只找到最后的 0.03。
贡献数不等于贡献。论文自己也坦白:能证明“共享记忆真的比各自单干更强”的匹配对照实验,还没做。

四、怎么不被自己的指标骗

七条,今天就能用上:
✅看退化方向,不看绝对值。安全分涨了,先去查推理能力(数学 / 代码基准)有没有掉。掉了,涨的那部分安全分就不能算数。
✅换轨迹级判据。别只看它“说了什么”,看它“做了什么”:文件改没改、凭证读没读、记录写没写、记忆脏没脏。
✅对“改善”做对抗性验证。换评测器、加种子、扩大重采样单位。一个改善如果换个评测器就消失了,那它算不上改善。
✅看方差,不看均值。均值能描述 8.2% 的运行,中位数能描述 68.2%。那个均值到底在描述谁?
✅要求看失败清单。谁撤回了哪条结论、哪条挂着 undecidable。没有失败清单的评测报告,可信度要打折。
✅问“这个数字覆盖了什么”。“2500 条轨迹、平均 14.7 轮”和一句“安全通过率 95%”,量的是完全不同的东西。
⚠️量化 / 剪枝之后必须重跑安全评测。被测对象已经换了模型,这几乎是上海交大那篇论文最直接的工程含义。

五、写在最后

“评测幻觉”很少来自造假。造假是少数,也藏不住。
它更常见的形态是:量东西的尺子和被量的东西,会一起变。
评测让模型来打分,模型又是拿评测数据练出来的;存储把自己的错误喂回给自己;评审系统把不同判断磨成同一个声音;多个智能体共享同一份记忆,于是大家一起走向同一条路。每一环单看都合理,合起来就漂移了。
所以真正该问的是:

当分数下降时,是它少犯错了,还是它更少被发现了?

只记这一句:

当一个指标连续变好,而你找不到它变好的机制,那这个指标,多半已经换了测量对象。


🧪求索实验室
尺子会热胀冷缩,长度不会,所以数字不对劲时,我会去看个究竟。

📌 数据与来源

论文
团队
发表平台
关键数字
On the Efficiency-Safety Dilemma in Large Reasoning Models
上海交通大学 AGI Institute
EMNLP 2026 Main(arXiv:2609.23587,2026-09-20)
“attempted but failed”;推理能力损失与维持恶意语义轨迹的能力严格耦合
Self-Cleaning and Captured Anyway: One Measured Primitive for Error in a Store an Agent Writes to Itself, and What a Falling Score Actually Measures
澳门大学 / 华南理工大学
arXiv:2609.25052(2026-09-06)
硬上界 (n−1)/n;区间占比 3.6% vs 均匀 20.6%;353/360 方向命中;前沿 capture 0.850;20/20 seed 被捕获
BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents
伦斯勒理工学院 / IBM Research
arXiv:2609.16305(2026-09-14)
22 攻击族 / 35 场景 / 7 领域 / 2,500+ 轨迹 / 平均 14.7 轮 / 13 个模型 / 8 项指标;失败多在初始安全步骤之后
BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure
达特茅斯学院 / 加州大学伯克利分校等
arXiv:2609.11028(2026-09-10)
全链召回 23–94% → 77–100%;同向量覆盖 16–56% → 43–78%;单任务成本最多降 65%;运行时检出准确率 96%;456 条人工裁定轨迹,取自 31,000+ 次公开运行
Agora: Git as Shared Memory for Collective AutoResearch
英伟达
arXiv:2609.18094(2026-09-16)
13 个智能体 / 近 12 天 / 1,703 次贡献;3.39 → 1.899 bits per byte;首日 18 条贡献约占 98% 总降幅;165 次独立复现全部成功
BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender
罗切斯特大学 / 索尼集团 / 卡内基梅隆大学 / 华盛顿大学
arXiv:2609.15478(2026-09-14)
288 段真实视频 / 51 种配置 / 10 个模型家族;潜空间相似度 88.6 vs 事实保留率 53.7%
When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation(TrustReviewer)
马里兰大学(College Park)
arXiv:2609.20942(2026-09-17)
33% 合成污染即让评分标准差 1.63 → 1.44;全合成时同篇评审语义距离 −11%、语料级 −5%;TrustReviewer 推荐完全匹配率 75.40% vs 基线 73.10%
VibeCheck: Assessing the Quality of LLM-Generated Unit Tests — A Multi-agent Empirical Study across Heterogeneous Repositories
马里兰大学巴尔的摩郡分校(UMBC)
POVC '26(ASE 2026 同期工作坊);arXiv:2609.05978
五维量表(可运行性 / 断言强度 / 逻辑与边缘覆盖 / 隔离性与确定性 / 可维护性);15 个异构仓库;揭示“可运行 ≠ 行为充分”

本文全部关键数字均已对原始论文(arXiv / 会议论文)核实,未采用二手摘要。8 篇中 2 篇为正式会议论文(EMNLP 2026 Main、POVC '26),其余 6 篇为 arXiv 预印本。

随机文章