当前位置:首页>排行榜>当排行榜开始“训练”模型

当排行榜开始“训练”模型

  • 更新时间 2026-07-08 23:24:48
当排行榜开始“训练”模型

现在一个大模型发布,你还会像以前一样,第一时间去看各种排行榜吗?

过去,一个新模型发布,大家可能最先关注的是各种 Benchmark 的成绩

谁排第一? 

哪些指标刷新了纪录?

排行榜几乎就是模型能力的代名词。

而现在,更容易先冒出其他问题:

这个第一,还可信吗? 

它真的还能代表模型的真实水平吗?

这个“代名词”,到底描述了哪些现实?又隐藏了哪些?

这个转变背后是 AI 评估体系的变化

大模型 Benchmark 排行榜

在 GPT-3、GPT-4 时代,大模型的能力评估相对直接。

学术界和工业界广泛使用一系列公开 Benchmark,从不同维度测试模型能力。

例如:

Benchmark
测什么
典型任务
代表能力
MMLU
综合知识
多选题
知识储备、理解能力
HumanEval
编程
写 Python 函数
代码生成
GSM8K
数学推理
小学应用题
多步推理
BIG-bench
综合能力
数百种任务
泛化能力、复杂推理

虽然每项 Benchmark 关注的能力不同,但它们共同构成了一套相对统一的评价体系。

在当时,人们普遍相信:Benchmark 分数越高,模型能力也越强。

因此,每当一家 AI 公司发布新模型,总会附上一份熟悉的报告:

  • Benchmark 成绩;
  • 与其他模型的对比图;
  • Leaderboard 排名。

排行榜不仅是评测结果,也成为证明模型能力最直接的方式。

另一种排行榜开始流行

但与此同时,另一类排行榜开始迅速崛起。

最具代表性的,就是 Chatbot Arena(后来更名为 LMArena)。

它采用的并不是传统 Benchmark。

相反,它让用户匿名与两个模型对话,再根据回答质量进行投票。

换句话说,Benchmark 测的是模型能否完成一组标准化任务;而 Arena 测的是,当真实用户面对两个回答时,更愿意选择哪一个。

两者评估的是不同的问题。

也正因如此,Arena 很快获得了大量关注。

不是因为它更加科学,而是因为它更加接近真实使用场景。

对于大多数普通用户来说,他们并不会关心模型在某道数学题上得了多少分,而更关心:

哪个模型回答得更自然? 哪个模型更符合自己的使用习惯?

于是,行业开始同时接受两套评价体系。

一套衡量模型在标准测试中的表现;

另一套衡量真实用户更偏好的回答。

当两套评价体系开始出现分歧

问题也随之出现。

越来越多的时候,两套排行榜并不会给出相同的答案。

有些模型在 Benchmark 上遥遥领先,却未必能获得最高的人类偏好评分。

有些模型更受用户欢迎,却没有最亮眼的 Benchmark 成绩。

与此同时,行业也开始出现越来越多关于评估体系本身的讨论。

例如:

  • Benchmark 是否已经被训练数据污染(Benchmark Contamination)?
  • 人类偏好排行榜是否存在投票偏差?
  • 模型是否开始针对特定评测体系进行优化?

这些问题至今没有统一答案,但它们都指向同一个事实:

人们开始讨论的,不再只是模型本身,而是排行榜是否仍然值得相信。

其中一个典型案例来自 Meta。

在发布 Llama 4 时,Meta 曾向 Chatbot Arena 提交一个针对人类偏好优化的实验版本进行测试,其表现优于最终公开发布的模型。由于测试版本与正式版本并不一致,再加上当时允许多次提交和选择最佳结果,引发了外界对于 Arena 排行榜公正性的广泛讨论。

这件事也推动了 Arena 后续调整测试和提交流程。 排行榜第一次不再只是"谁排第一"的问题,而开始变成:

这个第一,是怎么来的?

当排行榜变成传播工具

如果持续关注近几年的大模型发布,会发现一个明显的变化:

排行榜正在从一种评估工具,逐渐演变为一种传播工具。

最初,各类 Benchmark 和 Leaderboard 的主要作用,是帮助研究者比较模型能力。

研究人员关注的是不同模型在统一测试集上的表现,通过这些结果分析模型的优势、局限以及技术进展。因此:

  • Benchmark 用于科学评估;
  • Leaderboard 用于横向参考。

但随着大模型进入产业竞争阶段,排行榜开始承担新的角色。

每当新模型发布,官方往往会首先展示一张排行榜:超过了哪些模型、刷新了哪些纪录、排名提升了多少。这些信息不仅面向研究人员,也面向媒体、开发者、投资人和潜在客户。

于是,排行榜的功能逐渐发生了变化:

  • 不再只是研究工具,也是产品发布的重要素材;
  • 不再只是能力对比,也是媒体报道最容易传播的信息;
  • 不再只是技术指标,也成为企业向市场、客户和投资人讲述竞争力的重要依据。

换句话说,排行榜仍然具有评估价值,但它已经同时成为一种传播语言。对于很多人来说,一句“某项 Benchmark 排名第一”,远比阅读完整的技术报告更容易理解,也更容易形成市场认知。

为什么排行榜会失灵?

英国经济学家 Charles Goodhart 曾提出一个后来广为流传的规律:

当一个指标成为目标,它就不再是一个好的指标。

这在后来被称为古德哈特定律(Goodhart's Law)

(听着像 Good Heart ,好心人定律)

它最初源于经济政策研究。Goodhart 发现,当政府把某项经济指标作为政策目标时,市场参与者会主动调整行为去迎合这一指标,使得它逐渐失去反映真实经济状况的能力。

同样的现象,也正在发生在 AI 排行榜上。

最初,各类 Benchmark 和 Leaderboard 只是回答一个简单的问题:

模型是否真的进步了?

但随着排行榜开始影响论文发表、媒体报道、产品宣传、用户选择、企业估值和融资,它的角色发生了变化。

排行榜不再只是衡量能力的工具,它本身也成为了竞争目标。

而当所有参与者都以排行榜为目标时,资源配置也会随之改变:

  • Prompt 会针对 Benchmark 调整;
  • 数据集会围绕 Benchmark 构建;
  • 训练过程会优先提升 Benchmark 分数;
  • 模型设计也会针对 Benchmark 特性进行优化。

最终,排行榜上的分数越来越高,却未必意味着模型在真实世界中的能力提升了同样的幅度。

也就是说,被优化的可能不只是模型,还有排行榜本身所衡量的内容。当越来越多的优化集中于少数公开指标时,这些指标与真实能力之间的对应关系,就可能逐渐减弱。

AI 并不是第一个

几乎每一个成熟行业,都经历过同样的过程。

智能手机时代。越来越多厂商开始针对跑分软件优化。一旦识别到 Benchmark,CPU 就进入特殊性能模式。排行榜越来越高。真实体验,却没有同步提升。后来,Benchmark 不断升级反作弊。厂商继续优化。双方像是在打一场没有终点的军备竞赛。

汽车行业也一样。排放标准最初是为了测量环保水平。后来,一些厂商开始针对测试流程优化。最终,人们开始重新设计测试标准。

大学也是如此。大学排名原本是为了帮助学生了解学校。后来,它开始影响招生、经费和声誉。于是,越来越多学校开始研究:怎样提高排名。而不是:怎样变得更好。

看到这里。你会发现一个共同点:评价体系一旦开始决定资源,它就会反过来塑造行为。

AI 并不是第一个。它只是最新一个。

为什么还需要排行榜?

因为很多事物根本无法被直接比较。

我们很难回答这样的问题:

两所大学,到底哪一所更好? 两款手机,到底哪一家更强? 两个大模型,到底谁更聪明?

这些问题都没有一个简单、客观的答案。

以大模型为例,它的能力至少包括:

  • 推理能力;
  • 代码能力;
  • 对话质量;
  • 工具调用能力;
  • 长上下文处理能力;
  • 稳定性;
  • 成本与速度……

这些维度彼此独立,甚至相互权衡。

对于绝大多数用户来说,几乎不可能逐项评估、逐项比较。

于是,人们会寻找一种更简单的比较方式。

我们把复杂的信息压缩成几个指标,再进一步压缩成一个排名。

排行榜,本质上就是一种认知压缩机制

它不是现实本身,而是现实的一个高度浓缩的映射。

一个数字,让复杂系统变得容易理解;一个排名,让复杂选择变得容易做出。

也正因为如此,即使所有人都知道排行榜并不完美,它依然会长期存在。

AI 把这一机制推向了大众

过去,Benchmark 更多属于研究人员。

只有论文作者、评测机构和少数专家会关注模型在各项测试上的表现。

普通用户几乎不会关心模型内部到底有什么差异。

而今天,情况发生了变化。

每个人都可以直接体验不同的大模型。

每个人都可以:

对比回答。 形成偏好。 参与判断。

排行榜第一次成为一种全民都能理解的语言

真正改变它的,不是准确性,而是它开始决定资源流向。

它帮助用户快速做选择,帮助媒体快速写标题,帮助企业快速建立品牌认知,也帮助投资人快速形成判断。

正因为如此,它的重要性越来越高,对行业的影响也越来越大。

写在最后

排行榜不会消失。

因为复杂世界,总需要一种简单的比较方式。

但排行榜也不会永远保持中立。

一旦它开始影响论文发表、产品宣传、用户选择和资源流向,它就不再只是记录竞争,而会开始塑造竞争。

当越来越多的人围绕排行榜优化模型时,被优化的不只是模型,还有排行榜本身。 当排行榜开始塑造模型,它就不再只是衡量模型。 因此,一个越来越高的分数,并不一定意味着同样幅度的能力提升。

需要记住:

一个数字,从来都不是能力本身,它只是能力的一个投影。 

而复杂世界,也从来无法被完全压缩。 

当投影开始影响现实,它便不再忠实于现实。

LZ AI Note 记录现象,追问本质。

最新文章

随机文章