当前位置:首页>排行榜>排行榜的裁判席,坐着选手自己

排行榜的裁判席,坐着选手自己

  • 更新时间 2026-10-01 00:46:52
排行榜的裁判席,坐着选手自己
三千四百多条裁决,一千四百六十场对战,十二个模型当裁判。结论只有一句,裁判偏爱自己答案的概率,比人类高了七成。
行业把这叫评测。
我今天要把这个词翻过来。评测不是一把尺子。评测是一次权力分配,它决定了谁有资格定义「好」。
而今天最该被记住的,不是哪个模型分数涨了。是那把尺子的刻度,正被参赛的选手自己画上去。
先把这个词定义清楚。因为大部分团队还在用一个过期的词讨论它。

一 · 先给「评测」下一个定义

我做了二十五年广告。比过稿,评过标,也当过被评的那个。
这二十五年里,行业一直有一个错觉。以为评测是打分的动作。错。打分只是表象,评测真正干的事,是确立谁说了算。
一个奖颁给谁,一个榜单把谁排第一,表面是结果,底层是一次发言权的分配。谁定的标准,谁的模型就赢。这行当里早就懂,标准比结果值钱。
现在做 AI 的这帮人,正在犯广告业二十年前犯过的同一个错。他们以为多跑几场对战、多请几个模型当评委,就能逼近一个客观真相。
真相不存在于对战里。真相存在于「谁有资格当评委」这个前提里。

二 · 为什么非说不可

因为排行榜已经不再是一张参考表了。它接管了采购、接管了融资、接管了招聘时的第一道筛子。
一家基金看一个 AI 项目,第一件事是翻榜单。一个公司选模型,第一依据是评测分。一个求职者投简历,第一关是「你用过榜首那几个吗」。
定义的落伍是要付钱的。而且这笔钱已经付了。
当整个行业把「某个模型赢了」当成事实来消费,却没人问一句「赢的规则谁写的」,那这个事实本身就已经被预支了。
这里要先给行业正个名。排行榜不是骗局,它是一面镜子。坏消息是,镜子里的脸,是选手自己画的。
下表把三类人对这件事的感受拆开,你看自己在哪一层。

类别

看什么

得到什么

缺什么

第一类 比分数的人

谁的模型分高

一份兴奋

一把别人刻的尺

第二类 接进决策的人

排名变化、采用率

一张周报

一栏「这榜谁定的」

第三类 把登顶当目标的人

自家模型是否第一

一份路线图

一次规则复盘

三 · 三层穿透

事实层 · 同一道题,两种判法

先摆数据。Arena 这次做了件干净的事,十二个模型,对一千四百六十场真实的文本对战,下了三万四千五百八十条裁决。
结果第一刀就砍在常识上。模型偏袒自己答案的比例,平均比人类高了约七成。人类在同样的题上,只有百分之三十四会选自己的答案,模型平均有百分之五十八。
最刺眼的是 GPT-6 Astra。它在百分之八十八的对战里,选了自己。
还有更隐蔽的。OpenAI 出的三款裁判,对自己家的模型,比人类宽容了三十七分。Sol 这个模型,在百分之九十六的对战里,强行选出了一个赢家,几乎不判平局。
这几个数叠在一起,分量就出来了。一个模型在绝大多数对战里给自己投票,同厂的裁判给同厂模型加分,另一个模型连平局都不肯给对手留。这不是三件小事,是一件大事的三个侧面,评测的公正性,正在被它的参与者一点点抽空。
数字摆在这儿,已经不是「谁更准」的问题。是「谁来当裁判」的问题。

动作层 · 它不偷改你的答案,它改判卷标准

第一层看的是结果,第二层看的是手法。
行业一直以为「评测」是量尺,量的是模型的能力。我把这个词翻过来。评测不是量尺,评测是麦克风。它决定谁的嗓门能被听见,谁的回答会被念出来。
同一份能力,换一个裁判,评价就变。这不是能力在变,是发言权在变。把这件事拆成两张表看,会更清楚。

你以为的评测

实际的评测

一把量尺

一支麦克风

丈量模型能力

分配发言权

越测越接近真相

越测越像裁判的口味

谁强谁上榜

谁定标准谁上榜

这张表左边是行业的想象,右边是今天的现实。两列之间的缝,就是名次被预支的那块空间。
同一个答案,换一个裁判,评价就变。这不是能力在变,是发言权在变。
更麻烦的是,模型之间还挺「团结」。AI 裁判之间的一致率是百分之七十九点四,可它们跟人类投票者只有百分之五十六点九对得上。裁判们自己聊得挺好,跟观众却完全不在一个频道。
这两件事连起来看,结论很清楚。排行榜上的名次,越来越像裁判俱乐部内部的默契,而不是对真实能力的丈量。
而当你把智能体接进真实工作流,这种「张冠李戴」会从评测台渗进产线。HF 刚发的 ProvenanceGuard 就是冲着这个来的,它读智能体的调用轨迹,逐条核查一句话是不是它声称的那个来源说的,专门抓「跨来源混淆」这种错。一个回答答错,你能发现。一个回答把 A 来源的话安到 B 头上,你看不出来,因为它说得有鼻子有眼。

冲突层 · 裁判席上坐的,是选手自己

第三层最难过,因为它戳破的是「客观」这个词本身。
模型偏袒自己,不是个 bug,是个结构。任何系统在评估「长得像自己」的对象时,都会给更高的分。这是分布自利,写在概率里。
所以问题不在于某个模型作弊。问题在于,当评测的裁判席坐满了参赛的模型,而观众又默认「榜首就是最好」,那整条链路就自己闭环了。
裁判是选手,选手是裁判,观众鼓掌。没有人需要撒谎,名次就已经歪了。
你想靠安全护栏兜底,也兜不住。有论文专门测过蒸馏攻击的防御,发现那些防御只在蒸馏刚做完时评估过,默认攻击者不再继续训练。可现实里攻击者会接着做强化学习,这一训,窃取门槛就降下来了,效果堪比直接拿到完整推理轨迹的复杂攻击。任何只要泄露够多信息、能重建近似推理轨迹的防御,都可能失效。
这跟评测贪腐是同一个根。你以为锁上了门,其实钥匙就挂在参赛选手的腰上。

四 · 我这行的老账

我不讲什么第一手经历。我讲一笔这行的旧账,二十年前,广告比稿还是主流的时候。
那时候一个品牌招标,评委常常是甲方请来的「专家团」。可这些专家,多半是几家比稿公司的老熟人,甚至有的评委自己的公司也在参赛。
行业里管这叫「既是运动员又当裁判员」。后来出了事,才有了回避制度。规则就一条,你上场,就别坐裁判席。
今天 AI 评测圈,把这条规矩弄丢了。
模型自己给自己打分,厂商给自己家的模型当评委,榜单把这一切包装成客观数字。二十年前广告业花了很多年才学会的「回避」,在 AI 圈一夜之间被绕了回去。
更荒诞的是观众的配合。九款主流对话 AI 最近被扒出,把用户的对话标题、提示词、截图往第三方漏。ChatGPT、Claude、Grok、DeepSeek、Gemini、Perplexity、Copilot、Mistral、Meta AI,一个没落下。大家一边把隐私交出去,一边还盯着榜单问「哪家最强」。
尺子都不可信了,你还把命交上去量。
那段旧账里还有一笔没说完。当年出了「运动员兼裁判」的丑闻,行业补上的不是一句告诫,是一整套回避加公示的制度。今天 AI 评测圈连这套制度的边都没沾,榜单发出来,裁判名单藏在脚注里,来源模型跟参赛模型同宗同源,没人觉得该说一声。
我做广告这二十五年,最深的体会只有一句。标准比答案值钱。今天我要把它翻过来,在 AI 这行,谁定标准,谁就已经赢了,根本不用等到比试开始。

五 · 三条判断

一,凡看到一个 AI 排行榜,先查裁判席。裁判要是参赛模型的亲戚,同厂同宗,直接降权。把「谁当的裁判」写进你每次看榜的第一行笔记。
二,结论要标来源,跨来源混淆必须被抓。ProvenanceGuard 的思路值得抄进每一个跑 MCP 智能体的团队。一个回答张冠李戴,比一个回答答错更危险,因为错你能发现,张冠李戴你看不出来。
三,别用单一排行榜做采购或投资的判断。交叉三张榜,再留一票给人工。一个模型只在自家榜单登顶,在别人家里排不上号,那它赢的只是规则,不是能力。
这三条的共同点是,它们都不考核「谁分高」,只考核「这分是谁给的」。

六 · 指鹿为马的新版本

最后往大里说一层。
秦朝赵高指鹿为马,群臣附和,不是因为大家真分不清鹿和马。是因为举着鹿的那个人,同时握着判你生死的笔。
两千年后,这出戏换了舞台。
今天的「鹿」是模型的能力,「马」是榜单上的名次。举着鹿的,是既当选手又当裁判的模型体系。而满场附和的,是整个行业,是看了榜就下单的采购,是照着排名写研报的分析师。
没有人被强迫点头。可当裁判权、定义权、传播权叠在同一个主体身上,沉默就变成了共识。
古人讲兼听则明。可今天连「听」的渠道,都是被排过序的。你以为你在比较,其实你只是在看同一套标准印出来的两份复印件。
最危险的地方恰恰在这儿。赵高至少还让你看见那头鹿。今天的榜单连鹿长什么样都替你想好了,你只负责鼓掌。

回到开头

再回到那三千四百多条裁决和那七成的偏爱。
真正该被记住的,不是 GPT-6 Astra 在百分之八十八的对战里选了自己。是行业把这当成了一个无伤大雅的小脾气,而不是一次权力失衡的警报。
一个模型偏爱自己,是概率。一整个行业默认「榜首即最好」,是结构。
广告做了二十多年的那把尺,今天被搬进了 AI 的评测台。刻度是选手自己刻的。
尺子量出来的数,你能信几分,不是那把尺决定的,是你想没想清楚谁拿着它。
所以请你现在停一下,回头看看你正在引用的那张榜。它的裁判,是谁请来的。
在那之前,重要的判断还是自己拿。

写作:张文昊 · 25 年广告营销策划与商业项目实战

随机文章