评测数字怎能用?先问它怎么跑出来
1Password 在 2026 年 8 月 6 日发布的 FLAWED 报告。那份报告的头条数字是「AI 干净修复率仅 26%」。同一篇批评文章给出了另一组数:剔除对抗性指令和禁止测试的试验之后,3067 个补丁里 86% 成功阻断了给定的漏洞利用。两个数同属单方批评文章口径。1Password 原报告未独立核实,也未见中立第三方复现。
看评测的人,多半先看标题那一行
群里甩来一张截图,写着某某基准排名靠后,这家就被从清单里划掉。点开原文的人不多。这不是偷懒。评测报告本来就是这么被消费的:发布方把结果压成一个数字,方便传播,也方便挂进标题。Trail of Bits 列了四项设定:提示词里刻意指示智能体用错误的修法,占全部数据 22%;禁止编译与测试的试验,占全部试验 36%;样本挑的是刻意选出的困难漏洞;模型没跑在最高推理档位。同为单方批评文章口径。四条叠在一起,就解释了同一批补丁为什么既能是 26%,也能是 86%。发报告的一方多半带着立场,厂商、安全公司、模型公司都一样。立场不用写进结论,它从选什么题、怎么提示、跑什么档位这三件事里进去。有一类汇报现场长这样:有人拿着「准确率 70%」的标题上会,被问了一句分母算的是全部试验还是跑通的那些,答不上来。头条数字先是一次实验的结果
评测的头条数字,先是一次实验的结果,才是被测对象的结论。题目怎么选、工具给不给、模型跑几档、分母怎么算,四项里每一项都能把结果往一边推。四项一起用,26% 和 86% 就是同一锅菜上的两把秤。这里没有被指控造假。同一批补丁,两套口径,两个数都成立。出问题的地方在引用这一步:把压缩后的那一行直接搬进立项文档,等于把发布方的取舍当成自己的事实。放到选型会上:一句「这家在基准里只有 26%」传过三个人之后,剩下的只有数字,跑分的条件早就没人提了。再往后,预算按这条数字分下去,返工的成本比当初点开报告贵得多。标题上那一行是为了传播裁出来的,不是为了让别人拿着去做决定。便宜的做法是把压缩倒过来:先看方法那一节,再看结论那一节。方法节通常在报告后半部分,篇幅不长,读完它花的时间远少于后来返工。判断一个评测数字能不能用,有一条标准:先问它怎么跑出来的,再问它说明的是谁;顺序反了,再准的数字也是借来的结论。六问,答不上来的降级
拿到任何评测数字,先过六问,答不上来的降级成「弱证据」。六问记不住顺序也没关系,先记住第一句:它怎么跑出来的。引用前补一行:样本、条件、发布方。数字不单独出现,也不单独写进立项文档。降级有对应的用途:原型验证可以用弱证据;涉及预算和对外承诺的,换成强证据再写。内部自己搭评测集时,把这六条写进方法章节,自己的结论也会以同样的方式被别人误读。还有一个便宜的动作:把评测标题和它的实验条件存在同一份文档里。半年后回头看,那份记录比当时的结论有用。口径走得比数字远
这套动作不需要工具也不需要预算。下次看到评测标题,先点开方法那一节,看样本和分母,两分钟看完。Trail of Bits 那篇批评文章把重新分析的方法一并公开了,还原口径这件事的成本,比从前低得多。你手上有没有一个评测数字,是当时直接抄走、没问过分母的?方便的话说说它后来怎么样了。