一图看懂AI|大模型排行榜为什么会变
同一个模型,在一张大模型排行榜上位居前列,换到另一张榜单却可能落后好几名。这不一定是谁测错了。大模型排行榜不是给模型测量一个固定不变的“智力值”,而是在特定题目、运行条件和评分规则下,对部分能力进行抽样测量。榜单改变的可能不只是模型,还包括测试题、提示词、是否允许使用工具、回答采样方式、评分器以及汇总分数的方法。只看最后的名次,很容易把一次测量结果误解成模型能力的绝对排序。【一句话先说清】选择测试范围 → 固定运行条件 → 收集模型回答 → 按规则评分 → 汇总为总分 → 估计不确定性。只要其中一个环节发生变化,分数和名次就可能变化。判断榜单是否有参考价值,关键不是只看谁排第一,而是看它在什么条件下测了什么。01|榜单首先决定“考什么”大模型能够写作、推理、编程、调用工具,也可能处理图像、语音和长文档。任何一张榜单都不可能覆盖全部能力,只能选择一部分任务作为样本。有的榜单主要测知识问答和数学题,有的侧重代码,有的收集真实用户对两份回答的偏好,还有的测试模型能否完成多轮工具任务。因此,“综合榜第一”通常只是“在这组任务和权重下总分最高”,并不等于所有场景都最好。HELM提出用多场景、多指标评价语言模型,并明确指出,完整评测还应说明哪些场景和指标没有被覆盖。[1]02|题目分布会改变模型的优势榜单选择哪些题、各种题占多少,都会影响最终排序。如果编程题权重提高,代码能力强的模型更占优势;如果题目以英文知识问答为主,结果不一定能代表中文写作或企业文档处理;如果问题来自真实用户,热门使用场景可能比冷门专业任务获得更多权重。这就像两场考试都叫“综合能力测试”,一场数学题多,一场写作题多,考生排名自然可能不同。所以,比较两个榜单之前,应先看它们的测试范围和样本来源是否相同。03|同一道题,也可能有不同考法模型收到的不只有题目,还包括系统提示词、示例、输出格式和可用工具。同一道选择题,可以要求模型只输出选项,也可以要求先推理再作答;代码任务可以只看生成结果,也可以允许模型运行代码、读取报错并继续修改。长任务是否提供上下文压缩,也可能改变完成率。OpenAI的评测指南强调,测试应反映真实使用分布,并记录评测条件。生成式AI具有可变性,同一输入也可能产生不同输出,因此传统的一次性测试并不足够。[2]研究还发现,提示词的组成和措辞可能影响模型排序。这类结果提醒我们:评测脚手架不是无关紧要的包装,它本身就是测量条件的一部分。[3]04|“谁更好”取决于怎样评分不同任务使用的评分方式并不一样。有标准答案的题目可以计算正确率;代码可以运行测试用例;摘要、写作和对话质量则可能交给人工或LLM裁判评价。偏好榜单通常让评审比较回答A和回答B,再把大量胜负结果换算成模型得分。Chatbot Arena采用匿名两两比较收集用户偏好,并使用统计模型估计模型之间的相对表现。[4]但评分方式测到的不是同一种东西。正确率更关注答案是否命中标准,偏好投票还可能受到表达风格、篇幅和用户群体影响。因此,知识榜与聊天偏好榜出现不同排序并不奇怪。05|总分如何汇总,也会改变名次一些榜单会计算多个任务的平均分,一些会为不同任务设置权重,还有一些根据模型之间的两两胜负关系生成相对评分。在两两比较榜单中,一个模型面对了哪些对手、获得多少有效投票,以及怎样处理平局,都可能影响评分估计。Arena后来使用Bradley–Terry模型汇总比较结果,并为评分计算置信区间;投票较少的新模型通常会有更宽的不确定区间。[5]这意味着榜单上的一个数字并不是从模型内部读出的固定属性,而是数据经过统计模型汇总后的估计值。06|相邻名次不一定真的分出了高下如果第一名得分为1260,第二名为1258,看起来前者更高,但两分差距可能小于测量的不确定性。更可靠的榜单会同时展示置信区间或误差范围。如果两个模型的区间大幅重叠,就不应仅凭名次断言其中一个稳定更强。样本数量也很重要。题目或投票越少,少数异常结果越容易改变排名;多运行几次、扩大样本并报告波动范围,通常比只公布一次总分更有解释力。07|模型名字相同,版本也可能不同同一个产品名称背后,可能对应不同的模型快照、系统提示词、推理预算或服务配置。在线模型还可能更新。榜单如果没有记录评测日期、模型版本、参数配置和运行代码,后来的人即使使用相同题目,也未必能复现原来的结果。因此,一个可检查的榜单至少应该让读者知道:测的是哪个版本、何时测试、怎样调用、运行了多少次,以及失败和缺失结果如何处理。【看大模型排行榜时,先检查这5件事】1. 测了什么:任务是否覆盖你的真实使用场景;2. 怎样运行:提示词、工具、上下文和采样参数是否一致;3. 谁来评分:标准答案、人工偏好还是LLM裁判;4. 差距多大:是否提供样本量、置信区间或重复运行结果;5. 能否复现:模型版本、时间、代码和数据是否公开。如果你关心的是中文合同审阅,就不应该仅凭英文数学榜选择模型;如果你需要稳定调用工具,也不能只看一次性问答的正确率。榜单适合帮助你缩小候选范围,但最终选择仍应回到自己的任务、数据、成本和风险上。【分析一张排行榜时,可以这样提问】请不要只复述模型名次。先说明这张榜单测试的任务范围、数据来源、模型版本、运行条件、评分方法和样本量,再检查是否提供置信区间或重复运行结果。请区分“分数更高”“统计差异明确”和“更适合我的使用场景”这三种结论;缺少信息时请明确标注无法判断。这样的提问不能把一张榜单变成完整评测,但能避免把很小的分差、不同的考试条件或不完整的信息直接解释成能力定论。【最后一句】大模型排行榜排出的不是模型永恒的高低,而是模型在一套特定考试设计中的测量结果。【资料来源】[1] Stanford CRFM:Holistic Evaluation of Language Modelshttps://crfm.stanford.edu/2022/11/17/helm.html[2] OpenAI:Evaluation best practiceshttps://developers.openai.com/api/docs/guides/evaluation-best-practices[3] An Investigation of Prompt Variations for Zero-shot LLM-based Rankershttps://arxiv.org/abs/2406.14117[4] Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preferencehttps://proceedings.mlr.press/v235/chiang24b.html[5] Arena.ai:Chatbot Arena评分系统更新https://arena.ai/blog/chatbot-arena-update一图看框架,一文读细节;关注我们,更多AI主题持续更新。