当前位置:首页>排行榜>大模型评测怎么搞:从 MMLU 到 OpenCompass 的工具链

大模型评测怎么搞:从 MMLU 到 OpenCompass 的工具链

  • 更新时间 2026-09-23 08:12:04
大模型评测怎么搞:从 MMLU 到 OpenCompass 的工具链
问你一个看似简单的问题。

你的公司要选一个大模型部署。市场上候选至少 5 个——GPT-5、Claude Sonnet 4.5、DeepSeek V4、Qwen3、GLM-5。

你怎么选?

如果看各家自己报的分数,每一个都"业界第一"。GPT-5 说 AIME 2024 解了 94.6%,Claude 说 SWE-bench Verified 74.2%,DeepSeek 说它的 GSM8K 是 96.4%。全是自己的数字,全没有统一基线

这就是大模型评测的根本问题:评测自己设计,等于学生出题给自己做

这篇把评测这件事聊清楚——为什么要独立基准、主流评测集(MMLU、HumanEval、GSM8K、AGIEval)怎么测、OpenCompass 这种工具链怎么用、以及怎么识破"刷榜"的游戏。

一、为什么不能只看厂商宣称

大模型战场,分数是营销的弹药。每家发布新模型都要发"我们 MMLU 跑分 XX.X%",但仔细一看:

  • MMLU 是指哪个版本?是原始 5-shot 还是零样本?是 chain-of-thought 还是直接输出?
  • 测的 57 个科目是全测了还是挑选的
  • 细节变体数不清:正式 MMLU vs MMLU-Pro vs MMLU-Redux vs MMLU-CF,一个比一个难

这种"数字不说明方法"的宣称,和"我百米 12 秒"不说风速、不说场地、不说电子计时还是手动没区别。

更糟的是数据泄漏:如果模型在训练时"刷过" MMLU 的题目,它跑 MMLU 就是"考试带了答案",这个分数毫无意义。

业界对这件事已经失去了耐心,所以OpenCompass、lm-eval-harness、HuggingFace Leaderboard这种"第三方独立基准"变成了刚需。

二、评测三大目标:能力 / 幻视 / 对齐

大模型评测不是单一维度,分三类:

1. 能力评测(Capability)

最直观:模型会不会某件事。

  • 数学推理: GSM8K(小学数学应用题)、MATH(高中数学)、AIME(竞赛)
  • 代码生成: HumanEval(Python 编程)、MBPP、SWE-bench(真实 GitHub issue 修复)
  • 常识推理: HellaSwag、ARC、PIQA、SIQA
  • 知识问答: MMLU、TriviaQA、Natural Questions
  • 长上下文: NIAH(大海捞针)、LongBench、RULER

这类基准的变化趋势是越来越专业——从"通用理解"测到"前沿数学"再到"软件工程"。

2. 幻视评测(Hallucination)

模型说假话的程度

大模型有时会"编造"看起来像事实的内容——你说"巴黎铁塔高多少米",它说"300 米"(实际 330 米),或者直接说"巴黎铁塔在法国里昂"。

  • TruthfulQA: 故意出"容易答错"的题,看模型会不会被诱导说假话
  • HaluEval: 专门测幻觉
  • FactScore: 把长回答拆成原子事实,逐条核对

幻视率在很多场景比能力更重要——医疗、法律、金融场景你宁可模型说"我不知道",也不能乱答。

3. 对齐评测(Alignment / Safety)

模型符不符合人类价值观

  • 偏见: BBQ、StereoSet、RealToxicityPrompts
  • 隐私: Enron 邮件泄漏测试——模型是否会"背出"训练数据里的真实 email
  • 越狱: AdvBench、JailbreakBench——测有多大比例你能通过 prompt 工程让模型说违禁内容
  • 指令遵循: IFEval——模型是否严格听从格式要求

对齐评测决定了模型能不能真的生产化

三、主流基准详解

MMLU: 曾经的核心基准

MMLU (Massive Multitask Language Understanding) 是 2020 年推出的基准,57 个科目:从数学到法律到医学到历史到哲学,每个 100 道题。

大概 1.4 万题,靠 4 选 1 做多选题

它曾经的意义: GPT-3 在 MMLU 拿了 43%,被认为是"接近随机"(25%)的水平;GPT-4 是 86%,被认为突破。这个分数差定义了一个时代。

它的问题:

  1. 太老。2020 年设计,那时候大模型才起步,很多题目对今天模型过于简单
  2. 数据泄漏风险。一旦题目进了 GPT-4 的预训练集,就跑分没有参考意义
  3. 区分度低。今天 90% 以上的模型都能跑 75+,大家都挤在一起,无法区分谁更好

业界逐步转向MMLU-Pro(更难、更多题目)和MMLU-Redux(剔除错误题目重新打分)。

HumanEval: 代码生成的标准

HumanEval 是 OpenAI 2021 年推出的基准,164 道 Python 编程题,测"看注释写代码"能力。

每道题给一段函数签名 + 中文注释,让模型补全函数体,然后跑测试用例。

评价指标是 pass@1 / pass@10:模型生成 1 个解答能通过测试用例的比例(或生成 10 个中有无任何一个通过)。

现状:GPT-4 时代是 67%,DeepSeek-Coder V2 是 90%+,Claude Sonnet 4/4.5 是 92%——已经接近饱和

新的更难基准是 SWE-bench——用真实 GitHub issue 作为测试,难度远超 HumanEval。

GSM8K 和 MATH: 数学推理

GSM8K 是 8500 道小学数学应用题。题目不难但需要多步推理,比如"小明有 10 个苹果,吃了 3 个,又买了 5 个,分给 4 个朋友每人 2 个,还剩几个?"

MATH 是更难的高中数学:竞赛级几何、代数、几何、数论。

这两个基准都在被数据泄漏或刷榜污染。今天主流模型都跑到 90%+,区分度已经不够。

业界逐步转向AIME(美国数学邀请赛真题),难度更高。

AGIEval 和 BIG-Bench

AGIEval 是 2023 年推出的基准,用真题+标准化考试:SAT、GRE、GMAT、LSAT、高考、公务员考试、法考、注会……

它是用人写的真实考试题作为"通用智能级别"的检验。中国背景特别强(高考、公务员)。

BIG-Bench(Google 2022)是一个超大集合,任务类型千奇百怪:从语言学到物理学到逻辑谜题到软件工程——算总库 200+ 任务,考察"非常规能力"

四、OpenCompass: 评测界的"集成框架"

定位

OpenCompass 是上海 AI Lab 主导的评测工具链——它不是一个"基准",而是一个"框架",让你可以用同样的接口跑 100+ 个基准

它做三件事:

  1. 统一评测接口: 不管你测 MMLU 还是 HumanEval,用同一份配置文件
  2. 支持多种推理 backend: OpenAI API / HuggingFace transformers / vLLM / SGLang / Llama.cpp
  3. 官方维护排行榜: 跑完的分数上报,自动和业界其他模型对比

架构

OpenCompass 的核心是**"数据集 + 模型 + 评估器"三件套配置**:

datasets[mmlu, gsm8k, humaneval, truthful_qa]models[my-llama-3-70b]evaluatorgen | ppl | llm-as-judgesummarizerdefault

三种推理方式:

  • PPL(perplexity)评估:测模型对候选答案的概率排序,不需要真的生成 token
  • Gen(generative):让模型自由生成再 parse 答案,更真实但解析难
  • LLM-as-judge:让另一个大模型(GPT-4)打分判断"这个回答好不好"

主要数据集分组

OpenCompass 把所有数据集分成8 大类:

  • 核心基准:MMLU / C-Eval / GSM8K / HumanEval / BBH
  • 中文基准:CMMLU / C-EVAL / GAOKAO-Bench / Xiezhi
  • 专属语言:CHID / WPLC / WSC Winograd
  • 长文本:LongBench / L-Eval / NIAH
  • 代码:HumanEval / MBPP / DS-1000 / SWE-bench
  • 智能体:ToolBench / AgentBench / API-Bank
  • 幻视:TruthfulQA / HaluEval
  • 安全:AdvBench / RealToxicityPrompts / BBQ
  • 主观:MT-Bench / AlpacaEval / AlignBench

这种分组反映了评测的"全面性": 不能只看一个基准,要看 8 维度的综合表现。

竞品: lm-eval-harness 和 HuggingFace Leaderboard

OpenCompass 不是唯一:

  • lm-eval-harness(EleutherAI)是另一个开源评测框架,2021 年起步,社区极活跃
  • HuggingFace Open LLM Leaderboard 早期是最大的排行榜,靠 Arc/HellaSwag/MMLU/TruthfulQA/Winogrande/GSM8K 六个基准平均分排名
  • Chatbot Arena(LMSYS)用 ELO 评分——真人盲评两个匿名模型输出哪个好

每个工具/榜单有自己的侧重,用过的人都学会交叉对比,不只看一个。

五、刷榜游戏:分数能造假

回到最初的疑问:为什么很多厂商报分你看不懂?

数据泄漏

模型在预训练或 SFT 阶段接触了测试数据。比如 GPT-4 被怀疑在训练时看过大量 GSM8K/GPQA 题目(OpenAI 没证实没否认)。

检测方法:

  • N-gram 重叠: 检查模型生成是否与测试题目有大量 n-gram 重合
  • 核心题换新: 业界逐步用"每月新出考题"替代固定数据集
  • 零样本/多样本对比: 训练含的题在零样本下也应该能做出来,可以估计 contamination 程度

Few-shot 选择偏差

有的厂商报 5-shot 结果,但 shot 选的是"能让模型最好发挥"的 5 个样本。业界标准应该用"跨多个随机种子的平均值"才能避免这种 sampling bias。

Chain-of-thought 选择性使用

CoT 能显著提升推理基准(GSM8K、AIME),但有些厂商 "report CoT, 实际跑 direct" 或反之。要分清楚。

Temperature 和 Seed

  • Temperature=0 是确定性的——同样 prompt 每次输出完全一样
  • Temperature=0.7 是随机的——不同种子有不同输出

跑评测报告 temperature 设置和 seed 是基础礼仪,但很多发布会不说。

六、自建评测: 为什么你也需要

通用基准替代不了业务评测

通用基准(MMLU、HumanEval)考察通用能力,但不一定反映你的业务场景。

举例:

  • 医疗问诊: 需要测 "formed medical knowledge + conversational care"
  • 电商客服: 需要测 "product QA + complaint handling + upsell"
  • 法律助手: 需要测 "contract analysis + statute citation + reasoning"

这些都没有现成的 benchmark——必须自建

自建评测的方法

  1. 抽样量: 200-1000 个真实业务案例,覆盖高频场景
  2. 打分标准: 用 LLM-as-judge + 人工抽检混合
  3. 变更追踪: 每次模型升级都跑一遍,追踪 drift
  4. A/B 对比: 同时跑线上 10% 流量,观察真实业务指标

这是 OpenAI、Google、字节内部真正的做法——外部基准只用于初筛, 最终用的是业务 metrics

七、评测工程化的要点

1. 固定 seed + temperature=0

结果才能 reproducible

2. 记录完整 prompt + raw output

后续 debug 用得上

3. 用 OpenCompass 或 lm-eval-harness 而非自写

节约半年工程时间

4. 分数报告要注明:

  • 模型版本(commit hash)
  • 推理后端(vllm 0.9.0)
  • few-shot 数
  • temperature / seed
  • CoT 是否用

5. 交叉对比 3+ 榜单

Chatbot Arena + OpenCompass + 行业专用 benchmark,防止单一基准的 bias

结语:评测是 AI 健康度的体检

你不能拒绝体检,但你也不能只看一份体检报告。

同样,一个模型的"MMLU 89%" 不能作为你选它的唯一理由。它只是一个指标,不是完整的真相。

真正决定模型好不好用的是:

  • 它是不是测了而你关心的能力
  • 这份测评是否客观独立
  • 它在你的具体业务场景下表现如何

评测是 AI 时代的科学方法——它要求你:

  1. 怀疑所有宣称
  2. 用多个基准交叉验证
  3. 终极标准:在你的真实业务上跑

OpenCompass 和 MMLU 给你的是通用的标尺。最终衡量你的模型好不好用,还是得回到你的真实用户


原创声明:本文基于公开产业资料整理分析,转载请注明出处。

随机文章