当前位置:首页>排行榜>评测数字怎能用?先问它怎么跑出来

评测数字怎能用?先问它怎么跑出来

  • 更新时间 2026-09-22 01:42:41
评测数字怎能用?先问它怎么跑出来
1Password 在 2026 年 8 月 6 日发布的 FLAWED 报告。
那份报告的头条数字是「AI 干净修复率仅 26%」。
同一篇批评文章给出了另一组数:剔除对抗性指令和禁止测试的试验之后,3067 个补丁里 86% 成功阻断了给定的漏洞利用。
两个数同属单方批评文章口径。1Password 原报告未独立核实,也未见中立第三方复现。
同一批补丁,两个数,隔着六十个点。

看评测的人,多半先看标题那一行

做技术选型的人,习惯先看标题那一行。
群里甩来一张截图,写着某某基准排名靠后,这家就被从清单里划掉。点开原文的人不多。
这不是偷懒。评测报告本来就是这么被消费的:发布方把结果压成一个数字,方便传播,也方便挂进标题。
被压缩掉的那部分,恰好是最有信息量的:实验条件。
Trail of Bits 列了四项设定:提示词里刻意指示智能体用错误的修法,占全部数据 22%;禁止编译与测试的试验,占全部试验 36%;样本挑的是刻意选出的困难漏洞;模型没跑在最高推理档位。同为单方批评文章口径。
四条叠在一起,就解释了同一批补丁为什么既能是 26%,也能是 86%。
发报告的一方多半带着立场,厂商、安全公司、模型公司都一样。立场不用写进结论,它从选什么题、怎么提示、跑什么档位这三件事里进去。
有一类汇报现场长这样:有人拿着「准确率 70%」的标题上会,被问了一句分母算的是全部试验还是跑通的那些,答不上来。

头条数字先是一次实验的结果

评测的头条数字,先是一次实验的结果,才是被测对象的结论。
数字不是量出来的,是「怎么量」量出来的。
同一锅菜换一把秤,重量能差一倍。
题目怎么选、工具给不给、模型跑几档、分母怎么算,四项里每一项都能把结果往一边推。四项一起用,26% 和 86% 就是同一锅菜上的两把秤。
这里没有被指控造假。同一批补丁,两套口径,两个数都成立。
数字本身没有立场。
出问题的地方在引用这一步:把压缩后的那一行直接搬进立项文档,等于把发布方的取舍当成自己的事实。
放到选型会上:一句「这家在基准里只有 26%」传过三个人之后,剩下的只有数字,跑分的条件早就没人提了。
再往后,预算按这条数字分下去,返工的成本比当初点开报告贵得多。
标题上那一行是为了传播裁出来的,不是为了让别人拿着去做决定。
便宜的做法是把压缩倒过来:先看方法那一节,再看结论那一节。方法节通常在报告后半部分,篇幅不长,读完它花的时间远少于后来返工。
判断一个评测数字能不能用,有一条标准:先问它怎么跑出来的,再问它说明的是谁;顺序反了,再准的数字也是借来的结论。

六问,答不上来的降级

拿到任何评测数字,先过六问,答不上来的降级成「弱证据」。
样本怎么选的,随机还是专挑难的。
提示词怎么写的,中性还是带诱导。
工具被限住没有,编译、测试、联网是不是关了。
跑在什么档位,推理强度是不是最高的那一档。
分母是什么,全部试验还是只算跑通的。
谁发的,想要得出什么结论。
六问记不住顺序也没关系,先记住第一句:它怎么跑出来的。
引用前补一行:样本、条件、发布方。数字不单独出现,也不单独写进立项文档。
降级有对应的用途:原型验证可以用弱证据;涉及预算和对外承诺的,换成强证据再写。
内部自己搭评测集时,把这六条写进方法章节,自己的结论也会以同样的方式被别人误读。
还有一个便宜的动作:把评测标题和它的实验条件存在同一份文档里。半年后回头看,那份记录比当时的结论有用。

口径走得比数字远

数字会过期,口径不会。
这套动作不需要工具也不需要预算。下次看到评测标题,先点开方法那一节,看样本和分母,两分钟看完。
挑货之前先看秤。
Trail of Bits 那篇批评文章把重新分析的方法一并公开了,还原口径这件事的成本,比从前低得多。
你手上有没有一个评测数字,是当时直接抄走、没问过分母的?方便的话说说它后来怎么样了。

随机文章