当前位置:首页>排行榜>高分≠高能:大模型排行榜究竟证明了什么

高分≠高能:大模型排行榜究竟证明了什么

  • 更新时间 2026-09-28 14:45:24
高分≠高能:大模型排行榜究竟证明了什么

资料截至 2026 年 9 月 28 日。不同年份的案例用于说明评测机制,不代表相关模型最新版本的表现。本文依据公开资料整理,未自行运行模型复现实验;厂商自述、独立研究与本文推论在正文中分别标明。

大模型评测中,一个容易被忽略的区别是:分数真实,不等于人们赋予分数的解释也真实。

某个模型可能确实在指定测试中取得高分,测试过程也没有造假,但用户据此期待它能理解复杂需求、稳定完成工程任务、减少人工介入,最后仍然失望。这种落差不必然说明模型作弊,也不必然是用户不会使用。它可能暴露了更基础的问题:评测测到的东西,与用户需要的东西,并不完全相同。

因此,“高分≠高能”值得讨论,但需要明确其含义。它不是说高分毫无价值,也不是说高分模型普遍无能,而是说:

在一组评测上得分更高,不足以保证模型在另一组实际任务上更强;分数的提升,也不能自动解释为通用能力按比例提升。

这个判断既有测量上的理由,也有具体模型和实验的证据。

模型分数首先是一种有条件的测量。题目范围、提示词、工具、推理预算、尝试次数和评分方式,都会限定它的含义。把这些条件去掉,只留下一个数字,再将它称作“智能水平”,就容易把局部证据扩大成整体结论。

以 Artificial Analysis 为例,其当前方法说明明确指出,智能指数主要是英语、文本评测,多模态和多语言能力另测;推理模型的最大输出预算按照各模型支持的上限设置。因此,这个指数具有比较价值,却不是所有能力的覆盖,也不是严格等时间、等计算预算的比较。

这里还要区分“不线性”和“不相关”。80 分不代表能力是 40 分的两倍;模型 A 比 B 高几分,也不保证 A 在某项业务上更好。但这些事实同样不能证明分数与能力毫无关系。要回答相关性究竟多强,需要明确能力指标,收集多模型、跨任务的数据,而不能只凭几次成功或失败推断。

最直接的证据,是实际使用质量发生变化,常规分数却基本不变。

MiMo-V2.6 提供了一个近期案例。小米在 2026 年 9 月 27 日的官方复盘中承认,模型会重复发出相同或高度相似的工具调用,消耗时间与上下文,却没有推进任务。官方认为,训练中的调用数量惩罚门槛过于宽松,使异常行为得以放大。针对性修复后,重复行为明显减少,而整体基准表现基本保持稳定。

这件事不需要被解释成作弊,就已经具有足够的说明力:如果一个影响实际交付的问题被修复,常规成绩却没有明显变化,那么这些成绩至少没有充分反映这一维度的质量。

用户关心的是能否完成工作、多久完成、需要干预几次。评分器可能更关注最终结果是否正确。模型最后成功了,但此前进行了大量无效操作,在某些评分中仍然可以得分;对用户而言,这些操作却是真实成本。

同样需要注意版本边界。小米表示,修复版本于 9 月 25 日进入 API,模型名称没有改变。因此,修复前后的体验不能混在一起评价。这个案例证明的是评分存在盲区,而不是证明问题永远存在,或所有使用者都会遇到。

另一类证据,是能力优势不能稳定地跨任务迁移。

MiMo 官方模型卡中,V2.6 Pro 在 Terminal Bench 2.1 上得分为 89.9,Claude Opus 5 为 89.1;到了 Terminal Bench 4.0,两者分别为 34.9 和 49.0。ProgramBench 上,两者分别为 26.5 和 37.0。

这些是厂商披露的数据,不能整张当成第三方复现结果。两个版本的 Terminal Bench 也不能直接相减,用来声称模型“能力缩水”;缺少误差分析时,微小分差也不能直接认定为稳定优势。但同一张表已经说明:选择不同任务集合,模型的相对表现就可能改变。某项编程评测略高,不足以推出工程能力全面更强。

更完整的工程要求也会暴露高分没有覆盖的短板。2026 年 SWE Atlas 的重构评测要求模型在调整代码结构的同时保持行为正确,并满足相关验收标准。Scale 报告,一些在 SWE-Bench Verified 上超过 80% 的模型,在重构任务上仍不到 50%;该报告中的最佳配置 Claude Opus 4.7 加 Claude Code 得分为 48.57%。

这不是同一把尺子上的分数下降。它说明,“解决一个指定问题”和“完成较大范围的结构调整并避免回归”,虽然都属于编程,却需要不同的能力组合。对修复问题的熟练程度,不能自动替代对系统结构的理解。

更接近“对熟悉评测过度适应”的证据,来自尽量保持难度不变、只更换题目的实验。

2024 年的 GSM1k 研究重新编写了小学数学题,力求在风格、复杂度、人类解题率和解题步骤等方面与 GSM8k 对齐。论文最终版本报告,部分模型在新题上的准确率下降最多约 8 个百分点,并发现了与部分记忆原数据集相一致的证据。

但研究同时指出,许多模型,尤其是前沿模型,过拟合迹象很小;所有受测模型都展现了对新数学题的泛化能力。

这个结果的价值正在于它没有把事情说成非黑即白。一个模型可以既学会了数学,也受益于对特定评测的熟悉。高分可能包含真实能力和评测适应性,两者的比例因模型而异。

因此,“模型在新题上下降”不等于“原先全部靠背题”,但它足以质疑把原分数直接当作一般推理能力的做法。

当评测成为研发目标,它也可能逐渐失去独立检验的作用。

设想两家厂商:A 持续根据某个公开榜单调整训练数据、奖励设计和模型选择;B 围绕另一组能力目标开发,发布时才参加该榜单。即使双方都不直接训练测试题,A 也可能更适应该榜单。

这不意味着 A 没有学到真能力,也不意味着 B 必然更强。它意味着,公开分数混合了不同因素:模型本身的可迁移能力、对特定任务分布的适应,以及模型选择过程带来的影响。这是一种机制假设,不能仅凭分数与体验落差,就将具体厂商归入 A 或 B。

Llama 4 Maverick 的发布争议展示了其中一部分机制。Meta 当时宣传的 Arena 1417 Elo 对应“实验性聊天版本”;发布文章本身就注明了这一点。因此,该成绩不能不加区分地套到公开发布权重上,更不能扩展解释为所有任务上的同等优势。

《The Leaderboard Illusion》则讨论了私有变体测试和选择性披露带来的偏差,报告识别到 Meta 在发布前测试了 27 个私有变体。

不过,扎实的论证必须包含另一方的回应。Arena 对论文中的若干事实与效应大小提出异议,强调持续收集新用户投票会削弱选择偏差,并指出部分广泛传播的增益数字来自模拟或 Arena-Hard,不能直接当作真人 Arena 的实测结论。

这场争论支持我们认真审查评测与研发之间的反馈关系,却不支持将“某厂商分数虚高多少”当作已经确定的事实。

用户看到的能力,还包含模型之外的系统成本。

2026 年 9 月的 HarnessTax 研究比较了七个模型与三种 Agent 框架的组合。在所测试的两个基准上,相同模型经常获得相近的成功率,却产生显著不同的成本。例如,Claude Fable 5 在 SWE-bench Lite 的抽样任务上,使用 Claude Code 与 Pi 的成功率分别为 97.8% 和 96.7%,对应平均成本约为 1.33 美元和 0.67 美元。

研究样本和任务范围有限,不能外推到所有工作。但它提醒我们:实际使用效果是模型与工具系统共同产生的。高分未必意味着高效率,使用体验落后也未必全部来自模型权重本身。

这同样说明,仅比较“最终成功率”,可能漏掉用户最在意的那部分差异。

讨论到这里,很自然会遇到一个反问:把真实任务拿来测试,它们不也成了另一组 benchmark 吗?

确实如此。不存在一种只要贴上“真实任务”标签,就能永久免于过拟合和代表性问题的评测。一个内部任务集如果长期不变,并被反复用于优化,也会逐渐成为开发用的验证集。

所以,关键不在于找到一组“绝对真实”的题,而在于验证:已测任务上的优势,能否延续到未参与开发决策的新任务上。

新任务还必须具有代表性。仅仅换题、提高难度,或者挑出模型最容易失败的例子,都不能自动建立更公平的能力评价。更有解释力的做法,是固定比较条件、持续引入实际会发生的任务,同时记录成功率、成本、人工接管、失败恢复和结果稳定性。

据此,“高分低能”可以成为一个客观描述,但必须限定范围:某模型在评测 A 上高分,却在目标任务集合 B 中持续表现较差。这个现象不需要先证明作弊才成立。进一步声称模型“整体能力低下”,则需要覆盖更广的证据;声称厂商故意操纵评测,还需要训练数据、执行记录或结果披露方面的直接证据。

现有材料已经足以支持一个明确立场:排行榜提供了能力证据,但没有自动获得代表全部能力的资格。 成绩真实、评测独立、方法公开,都能提高可信度,却不能单独保证分数对某项实际工作具有足够的预测力。

用户也不必在“完全相信榜单”和“认定厂商作弊”之间二选一。可以承认模型的高分确实取得,同时指出这些分数没有充分预测它在具体工作中的表现。

一个模型是否更强,最终要看:当题目、环境和执行要求改变以后,它原有的优势还能保留多少;当工作出现意外时,它能否继续推进;当所有时间、费用和人工修正都被计入后,它是否仍然值得信赖。高分是这些问题的线索,而不是它们的答案。

References

[1] Artificial Analysis. Artificial Analysis Intelligence Benchmarking Methodology.: https://artificialanalysis.ai/methodology/intelligence-benchmarking
[2] Xiaomi MiMo Team. Diagnosing and Mitigating Tool-Call Repetition in MiMo-V2.6.: https://mimo.xiaomi.com/blog/mimo-v2-6-tool-call-repetition
[3] XiaomiMiMo. MiMo-V2.6-Pro-RL Model Card.: https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL
[4] Scale AI. SWE Atlas — Refactoring.: https://labs.scale.com/leaderboard/sweatlas-refactoring
[5] Zhang, H., et al. A Careful Examination of Large Language Model Performance on Grade School Arithmetic.: https://arxiv.org/abs/2405.00332v4
[6] Meta. The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation.: https://ai.meta.com/blog/llama-4-multimodal-intelligence/
[7] Singh, S., et al. The Leaderboard Illusion.: https://arxiv.org/abs/2504.20879
[8] Arena Team. Our Response to 'The Leaderboard Illusion' Writeup.: https://arena.ai/blog/our-response
[9] Pan, M. Z., Yang, S., Arabzadeh, N., Chiang, W.-L., Stoica, I., & Zaharia, M. HarnessTax: How Much Does the Harness Matter for Coding Agents?: https://arena.ai/blog/coding-agents-harness-tax

随机文章