现在一个大模型发布,你还会像以前一样,第一时间去看各种排行榜吗?
过去,一个新模型发布,大家可能最先关注的是各种 Benchmark 的成绩
谁排第一?
哪些指标刷新了纪录?
排行榜几乎就是模型能力的代名词。
而现在,更容易先冒出其他问题:
这个第一,还可信吗?
它真的还能代表模型的真实水平吗?
这个“代名词”,到底描述了哪些现实?又隐藏了哪些?
这个转变背后是 AI 评估体系的变化
大模型 Benchmark 排行榜
在 GPT-3、GPT-4 时代,大模型的能力评估相对直接。
学术界和工业界广泛使用一系列公开 Benchmark,从不同维度测试模型能力。
例如:
虽然每项 Benchmark 关注的能力不同,但它们共同构成了一套相对统一的评价体系。
在当时,人们普遍相信:Benchmark 分数越高,模型能力也越强。
因此,每当一家 AI 公司发布新模型,总会附上一份熟悉的报告:
排行榜不仅是评测结果,也成为证明模型能力最直接的方式。
另一种排行榜开始流行
但与此同时,另一类排行榜开始迅速崛起。
最具代表性的,就是 Chatbot Arena(后来更名为 LMArena)。
它采用的并不是传统 Benchmark。
相反,它让用户匿名与两个模型对话,再根据回答质量进行投票。
换句话说,Benchmark 测的是模型能否完成一组标准化任务;而 Arena 测的是,当真实用户面对两个回答时,更愿意选择哪一个。
两者评估的是不同的问题。
也正因如此,Arena 很快获得了大量关注。
不是因为它更加科学,而是因为它更加接近真实使用场景。
对于大多数普通用户来说,他们并不会关心模型在某道数学题上得了多少分,而更关心:
哪个模型回答得更自然? 哪个模型更符合自己的使用习惯?
于是,行业开始同时接受两套评价体系。
一套衡量模型在标准测试中的表现;
另一套衡量真实用户更偏好的回答。
当两套评价体系开始出现分歧
问题也随之出现。
越来越多的时候,两套排行榜并不会给出相同的答案。
有些模型在 Benchmark 上遥遥领先,却未必能获得最高的人类偏好评分。
有些模型更受用户欢迎,却没有最亮眼的 Benchmark 成绩。
与此同时,行业也开始出现越来越多关于评估体系本身的讨论。
例如:
- Benchmark 是否已经被训练数据污染(Benchmark Contamination)?
这些问题至今没有统一答案,但它们都指向同一个事实:
人们开始讨论的,不再只是模型本身,而是排行榜是否仍然值得相信。
其中一个典型案例来自 Meta。
在发布 Llama 4 时,Meta 曾向 Chatbot Arena 提交一个针对人类偏好优化的实验版本进行测试,其表现优于最终公开发布的模型。由于测试版本与正式版本并不一致,再加上当时允许多次提交和选择最佳结果,引发了外界对于 Arena 排行榜公正性的广泛讨论。
这件事也推动了 Arena 后续调整测试和提交流程。 排行榜第一次不再只是"谁排第一"的问题,而开始变成:
这个第一,是怎么来的?
当排行榜变成传播工具
如果持续关注近几年的大模型发布,会发现一个明显的变化:
排行榜正在从一种评估工具,逐渐演变为一种传播工具。
最初,各类 Benchmark 和 Leaderboard 的主要作用,是帮助研究者比较模型能力。
研究人员关注的是不同模型在统一测试集上的表现,通过这些结果分析模型的优势、局限以及技术进展。因此:
但随着大模型进入产业竞争阶段,排行榜开始承担新的角色。
每当新模型发布,官方往往会首先展示一张排行榜:超过了哪些模型、刷新了哪些纪录、排名提升了多少。这些信息不仅面向研究人员,也面向媒体、开发者、投资人和潜在客户。
于是,排行榜的功能逐渐发生了变化:
- 不再只是技术指标,也成为企业向市场、客户和投资人讲述竞争力的重要依据。
换句话说,排行榜仍然具有评估价值,但它已经同时成为一种传播语言。对于很多人来说,一句“某项 Benchmark 排名第一”,远比阅读完整的技术报告更容易理解,也更容易形成市场认知。
为什么排行榜会失灵?
英国经济学家 Charles Goodhart 曾提出一个后来广为流传的规律:
当一个指标成为目标,它就不再是一个好的指标。
这在后来被称为古德哈特定律(Goodhart's Law)。
(听着像 Good Heart ,好心人定律)
它最初源于经济政策研究。Goodhart 发现,当政府把某项经济指标作为政策目标时,市场参与者会主动调整行为去迎合这一指标,使得它逐渐失去反映真实经济状况的能力。
同样的现象,也正在发生在 AI 排行榜上。
最初,各类 Benchmark 和 Leaderboard 只是回答一个简单的问题:
模型是否真的进步了?
但随着排行榜开始影响论文发表、媒体报道、产品宣传、用户选择、企业估值和融资,它的角色发生了变化。
排行榜不再只是衡量能力的工具,它本身也成为了竞争目标。
而当所有参与者都以排行榜为目标时,资源配置也会随之改变:
- 模型设计也会针对 Benchmark 特性进行优化。
最终,排行榜上的分数越来越高,却未必意味着模型在真实世界中的能力提升了同样的幅度。
也就是说,被优化的可能不只是模型,还有排行榜本身所衡量的内容。当越来越多的优化集中于少数公开指标时,这些指标与真实能力之间的对应关系,就可能逐渐减弱。
AI 并不是第一个
几乎每一个成熟行业,都经历过同样的过程。
智能手机时代。越来越多厂商开始针对跑分软件优化。一旦识别到 Benchmark,CPU 就进入特殊性能模式。排行榜越来越高。真实体验,却没有同步提升。后来,Benchmark 不断升级反作弊。厂商继续优化。双方像是在打一场没有终点的军备竞赛。
汽车行业也一样。排放标准最初是为了测量环保水平。后来,一些厂商开始针对测试流程优化。最终,人们开始重新设计测试标准。
大学也是如此。大学排名原本是为了帮助学生了解学校。后来,它开始影响招生、经费和声誉。于是,越来越多学校开始研究:怎样提高排名。而不是:怎样变得更好。
看到这里。你会发现一个共同点:评价体系一旦开始决定资源,它就会反过来塑造行为。
AI 并不是第一个。它只是最新一个。
为什么还需要排行榜?
因为很多事物根本无法被直接比较。
我们很难回答这样的问题:
两所大学,到底哪一所更好? 两款手机,到底哪一家更强? 两个大模型,到底谁更聪明?
这些问题都没有一个简单、客观的答案。
以大模型为例,它的能力至少包括:
这些维度彼此独立,甚至相互权衡。
对于绝大多数用户来说,几乎不可能逐项评估、逐项比较。
于是,人们会寻找一种更简单的比较方式。
我们把复杂的信息压缩成几个指标,再进一步压缩成一个排名。
排行榜,本质上就是一种认知压缩机制。
它不是现实本身,而是现实的一个高度浓缩的映射。
一个数字,让复杂系统变得容易理解;一个排名,让复杂选择变得容易做出。
也正因为如此,即使所有人都知道排行榜并不完美,它依然会长期存在。
AI 把这一机制推向了大众
过去,Benchmark 更多属于研究人员。
只有论文作者、评测机构和少数专家会关注模型在各项测试上的表现。
普通用户几乎不会关心模型内部到底有什么差异。
而今天,情况发生了变化。
每个人都可以直接体验不同的大模型。
每个人都可以:
对比回答。 形成偏好。 参与判断。
排行榜第一次成为一种全民都能理解的语言。
真正改变它的,不是准确性,而是它开始决定资源流向。
它帮助用户快速做选择,帮助媒体快速写标题,帮助企业快速建立品牌认知,也帮助投资人快速形成判断。
正因为如此,它的重要性越来越高,对行业的影响也越来越大。
写在最后
排行榜不会消失。
因为复杂世界,总需要一种简单的比较方式。
但排行榜也不会永远保持中立。
一旦它开始影响论文发表、产品宣传、用户选择和资源流向,它就不再只是记录竞争,而会开始塑造竞争。
当越来越多的人围绕排行榜优化模型时,被优化的不只是模型,还有排行榜本身。 当排行榜开始塑造模型,它就不再只是衡量模型。 因此,一个越来越高的分数,并不一定意味着同样幅度的能力提升。
需要记住:
一个数字,从来都不是能力本身,它只是能力的一个投影。
而复杂世界,也从来无法被完全压缩。
当投影开始影响现实,它便不再忠实于现实。
LZ AI Note 记录现象,追问本质。