当前位置:首页>排行榜>谷歌Meta被锤"刷榜":AI评测还能信吗?

谷歌Meta被锤"刷榜":AI评测还能信吗?

  • 更新时间 2026-09-20 10:58:08
谷歌Meta被锤"刷榜":AI评测还能信吗?

AI 圈这两天最热的话题,是一份关于"刷榜"的指控。

有分析机构指谷歌与 Meta 参与 AI 模型排名欺诈,双方各执一词。评分上的变化同样醒目: Gemini 的分数暴跌 70 分,排名从榜单前二掉到倒数第三。

前二和倒数第三,中间隔着的不是模型能力的差距,是评测方式被改变后的结果。同一款模型,换个评测口径,名次能翻个底朝天。

面对跑分作弊的质疑,还有华裔高管回应称"OpenAI 也一样"。

这句话把讨论引到了另一个层面:如果大家都有类似操作,那刷榜是某一家的道德问题,还是整个评测体系的机制问题?

先说清楚"刷榜"是怎么发生的。

基准测试的基本形式是:给模型一批固定的题目,看它答对多少,然后排名。这套方法在学术界用了很久,逻辑上没问题。

问题出在"固定"这两个字上。

题目是公开的、固定的、可获取的。对模型开发者来说,这意味着可以做针对性优化:把这批题目及其答案纳入训练数据,或者专门调优模型在这类任务上的表现。优化完,榜单分数上去,模型的实际泛化能力提升多少,却是另一回事。

打个比方:如果一场考试提前公布了题库,考生的分数会上升,但这不代表他的知识水平上升了。 AI 评测眼下遇到的,就是题库泄露的问题——而且是系统性的。

所以争议的核心,不是谁作弊,而是评测的设计缺陷。

静态、公开的基准,天然引导模型向"考题"优化,而非向"能力"优化。只要榜单被用作营销素材,这种优化动机就存在。参评者越多、竞争越激烈,向考题优化的收益越大——这是机制在驱动,不是个别公司的道德选择。

这就解释了为什么"OpenAI 也一样"这句话能引起共鸣:如果机制本身奖励应试,参与者普遍"应试化"就是可预期的结果。

那评测是不是没用了?

不是。需要调整的是评测的方式,方向大致有三个。

一是让评测走向隐蔽。题目不公开、定期更换、留出私有测试集。把"可被训练"这个特性从评测里拿掉,分数才能接近真实能力。

二是让评测覆盖多个维度。单一基准容易被针对性优化,多个维度的评测交叉验证,作弊的成本就会上升。一个模型如果在十类不同任务上都表现稳定,它靠"背题"取得这个结果的可能性就小。

三是让评测贴近真实任务。评测的终极标准不是做对考题,而是解决真实问题。把评测放在实际工作场景里——写代码能不能跑通、处理长文档能不能保持准确、多步任务能不能自己完成——这些指标难以被"应试化",也能反映可用性。

对普通使用者来说,这件事有个直接的启发。

榜单可以作为参考,但别把它当结论。选模型时可靠的方式是:拿你自己的任务去试。同一份文档、同一个需求,让几个模型都做一遍,看哪个结果可用。这个过程比看排行榜麻烦,但结论属于你自己,不会被"应试化"的分数干扰。

回到开头那个问题: AI 评测还能信吗?

我的判断是:静态榜单的可信度在下降,但评测本身的价值没有消失。榜单的问题不在于"排名",而在于把可训练的考题当成了能力的度量。改掉这一点,评测依然有用;改不掉,榜单就会继续在"刷分"和"打假"之间循环。

至于谷歌、 Meta 是否存在不当操作,双方各执一词,眼下没有定论。值得留意的不是某个公司的名声,而是整个行业会不会借这个机会,把评测从"分数游戏"往"能力证明"的方向推一把。

随机文章