行业垂类大模型数据集建设系列 · 第八篇 · 收官 | 评测体系篇
垂类大模型评测体系:MMLU考88分的模型换张卷子只考73分,甲方验收到底该看哪张卷(系列收官)
两个真事。第一个:2025 年 4 月,Meta 的 Llama 4 Maverick 提交到 Chatbot Arena 的"实验版"拿到 1417 分、高居全球第二;几天后公开可下载的正式版被第三方复测,成绩掉到第 32 名,多语言编程实测只拿 16 分。事后发现,提交测评的那个版本给出的回答,在 98.6% 的对比里都更长。第二个:GPT-4o 在 MMLU 上考 88.0 分,换一张专门防"背题"的闭卷新卷 MMLU-CF 重考,只剩 73.4 分——一张卷子,掉 14.6 分。这 14.6 分不是模型退步了,是原先那张卷子,它见过。
这两件事放在一起,回答了一个甲方们在验收会上反复纠结的问题:"厂商给我看的那个分数,到底能不能信?"答案很残酷:能信一半。榜单分数证明模型"见过世面",但证明不了它"能干你这摊活"。
这是系列的第八篇,也是收官篇。前七篇走完了从场景排序、语料账本、分层标注、红线划定、指令样本、微调方法到安全回放的完整链路,最后剩一个问题没有回答:做完这一切,怎么知道模型真的达到了上线标准?这一篇把答案讲完,并把八篇的方法论收进一张图。
一、先看清楚:榜单是怎么被玩出花样的
先交代背景。MMLU 是全球最通用的语言理解基准,57 个学科、15908 道选择题;中文这边,C-Eval 有 52 个学科 13948 题,CMMLU 覆盖 67 个任务(含大量中国特有知识),AGIEval 直接拿高考和公务员考试题当考卷。这些榜单在 2023 年前后是选模型的重要参考,但到 2025 年之后,学术界的共识越来越清楚:公开基准正在被"背题"侵蚀。
量化证据一抓一把。一篇汇总了 55 项研究的综述给出的估计是:基准污染导致的分数膨胀在 6% 到 40% 之间。GPT-4 在 MMLU 上把选项遮住纯靠题干猜,猜对率 57%——正常基线是 25%,多出来的 32 分全是"见过原题"的肌肉记忆。推断式去污染的研究显示,污染让 GSM8K 数学基准虚高到 22.9%、MMLU 虚高到 19.0%。这也是为什么学术界要另出一套 2 万题的闭卷基准 MMLU-CF——同一批模型,换张没见过的卷子,GPT-4o 立刻从 88 分掉到 73.4 分。
再看竞技场这边。2025 年发表的一篇研究把 Chatbot Arena 的机制问题翻了个底朝天:Meta 在 Llama-4 发布前,在竞技场上私测了 27 个变体,挑成绩最好的那个发布;Google 和 OpenAI 分别能拿到竞技场约 19.2% 和 20.4% 的对战数据用于改进模型,而 83 个开源权重模型加起来只分到 29.7%——用竞技场数据训练过的模型,在竞技场类基准上最高能拿到 112% 的相对提升。这不是能力竞赛,是信息差竞赛。
给甲方的一句话结论:招标时要求厂商提供"MMLU 考多少分、竞技场排第几",基本等于招聘时只看候选人自带的简历——不是没用,是没法验证,也没法证明跟你这个岗位有关。
当然,榜单不是不能看。还在动态更新、坚持出新题的榜单依然有参考价值——比如 SuperCLUE 的 2025 年度报告用了 1288 道原创新题、覆盖 23 个海内外模型;上海人工智能实验室的 OpenCompass 司南平台已支持 200 多个模型、300 多个评测集。看榜单的正确姿势是:看趋势、看梯队,不看小数点后两位。同一梯队里的模型,选谁不选谁,榜单说了不算——你自己的评测集说了才算。
二、评测不是考试,是体检:三层体检表
考试和体检的区别是什么?考试看排名,人越多越准;体检看指标,只跟你自己的正常范围比。垂类模型的评测应该是体检,不是考试——你不需要知道它在全国排第几,你只需要知道它在你这条业务线上,指标在不在安全区。
而这份体检表,其实国家已经给出第一层了。2025 年 4 月 30 日发布的强制性国家标准 GB/T 45654—2025《生成式人工智能服务安全基本要求》,把安全层的指标写得明明白白:
| | | |
|---|
第一层 安全底线 | 该拒答的拒不拒、不该拒的乱不乱拒、生成内容合不合格 | 生成内容测试题库≥2000 题覆盖 31 类风险、合格率≥90%(抽测≥1000 题);应拒答题抽 300 题、拒答率≥95%;非拒答题抽 300 题、误拒答率≤5%;语料抽检≥4000 条、合格率≥96%;关键词库≥10000 个 | |
第二层 业务能力 | | 真实招标普遍要求问答准确率≥90%,且须基于自建测试样本(如 1000+ 条)加人工抽检 | |
第三层 体验性能 | | 模型请求 4 秒内响应、100 并发、软件缺陷率低于 0.6%;Token 服务基线:吞吐每秒不低于 55、首响时延不高于 0.9 秒、调用成功率 99.9% | 宁波等地采购文件、信通院 Token 服务评估基线 |
这张表里的数字都有真实出处。举几个例子:哈尔滨松北区一个 14.85 万元的智能问答机器人采购,明确要求问答准确率不低于 90%,且基于 1000 条以上测试样本加人工抽检——注意"自建样本"四个字,这就是体检思维;绍兴市 120 万元的政务大模型运维项目,要求导办新增事项、智能体分发、文本文档问数三项准确率全部不低于 90%,同时维持既有等保和密评要求;宁波的政务 AI 协同应用直接写明模型请求 4 秒内响应、100 并发、软件缺陷率低于 0.6%;高邮市要求 1000 在线用户下响应不超过 5 秒。
行业级评测也在跟上。中国信通院的政务大模型评估依据《面向行业的大规模预训练模型技术和应用评估方法 第 6 部分》,设 3 个能力域、7 个子域、40 多个能力项、120 多个指标项,截至 2025 年 10 月有 3 家企业通过最高等级的 5 级评估;联通的政务智能体开发平台拿到政务智能体评估的首家最高等级,在辽宁 12345 热线的实测数据是:填单时间缩短 80%、派单准确率 80%、推荐知识准确率提升 35%。2026 年启动的政务 Token(词元)服务评估,首批通过的包括华为云、蚂蚁数科、浩鲸科技、天云数据,性能基线是吞吐每秒不低于 55、首响时延不高于 0.9 秒、调用成功率 99.9%。
写标书的时候直接抄这张表:安全层抄国标硬指标,业务层写"自建 1000 条以上业务测试样本、准确率不低于 90%、人工抽检",性能层按并发和响应写死。三层齐全,验收时就有据可依;缺了哪层,上线后哪层出事。
三、评测集怎么建:四类题,全部从业务里来
第二层的"自建测试样本"是整个评测体系的核心,也是甲方最容易糊弄过去的一环——因为它没有现成题库,必须自己出题。出题的方法,其实就是前七篇方法论的镜像:语料怎么建,评测题就怎么出。
第一类:业务真题。从两年的真实工单、通话记录、窗口咨询里抽样,每季度换一批,防止被"针对性优化"。题干保持用户的原话——错别字、省略、方言都不要修,修了就不是真题。
第二类:专家难题。请业务骨干专门出"容易答错的题"——政策里最绕的交叉条款、最容易被张冠李戴的相邻业务、最容易过期的旧政策。这类题不用多,一百道就是质检的探针。
第三类:反例题与拒答题。把前几篇建的反例库、拒答库直接转成考题:这个提问模型该不该拒?该转人工的转没转?答案挂没挂原文出处?康养篇要求拒答样本占语料 20%,评测这边对应的考题同样要占两成上下——边界能力和答题能力同等重要。
第四类:改版题。政策一换版,旧考题全部重出。文旅篇讲过"科普语料挂指南版本号",评测题同理:目标值一变,旧题的正确答案就成了错误答案,不改题就等于拿过期答案考新政策。
这四类题的比例,比较稳的经验是真题六成、难题一成、反例与拒答两成、改版监测题一成,总量按招标口径做到 1000 条以上,其中安全层单独按国标准备 2000 题题库。工具上不用从零造轮子:OpenCompass 司南、魔搭的 EvalScope 都支持自定义题库跑分,后者的深度评测库里内置了 MMLU、C-Eval 等主流基准和竞技场模式;写用例做回归的话,开源的 DeepEval、promptfoo 也都已经成熟。
四、用模型评模型:省事,但别全信
1000 道题一道一道人工判,成本确实高,所以行业里通行"用模型评模型"(大模型当裁判):让一个强模型按你给的标准给被测模型的回答打分。这条路能用,但偏差研究也已经很扎实,必须知道它的坑在哪:
- 位置偏差:两个答案质量接近时,仅交换前后顺序就能让裁判的判定翻转;在代码评审这类两两对比场景,位置变化带来的评分偏移能超过 10 个百分点,部分模式下影响四成的评估;
- 长度偏差:更长的回答更容易被判赢——Llama 4 那个 98.6% 的"更长回答"就是把这个偏差利用到了头;
- 自偏好:模型当裁判时偏好自己风格的回答,幅度在 20% 到 30%;
- 专业领域失灵:在临床、法律这类专业场景,模型裁判和人类专家的判定一致率只有 60% 到 68%——恰恰是垂类模型最需要评测的场景,它最不准。
所以务实的做法是分两档:客观题(对错、挂没挂出处、转没转人工)用程序判定,一分钱人工不花;主观题先模型裁判初筛,再按 10% 比例人工抽判——抽判发现的裁判错误率,反过来修正模型裁判的权重。安全层永远人工判,这一条没有商量余地,国标抽测的 1000 题就是人工口径。
五、幻觉这道附加题:越聪明的模型,越会一本正经地编
评测体系里还有一项容易被忽略的指标:幻觉率。2025 年业界常用的 Vectara 幻觉榜单(摘要任务口径)显示,头部模型的幻觉率其实已经很低——Gemini-2.0-Flash 约 0.7%、GPT-4o 约 1.5%、DeepSeek-V3 约 3.9%。但 2026 年换代的评测口径出了一个反直觉的结果:在 7700 多篇企业级文章的新一代榜单上,多家"思考型"模型的幻觉率反而超过了 10%,最高的超过 13%。
这给政务场景的提醒很直接:模型更聪明不等于更可靠,推理能力越强,编出来的错误答案越像真的。所以幻觉不能只测"频次",还要测"危害"——同一条幻觉,编一个无关紧要的细节是小事,编一个政策文号、一个审批条件、一个数据口径,就是舆情。评测时把幻觉按"是否涉及政策依据、数字、身份判定"分级统计,高危幻觉零容忍,低危幻觉设上限,这个口径比一个笼统的幻觉率数字有用得多。
六、一个 12345 项目的验收实录(脱敏)
把三层体检表放进一个真实项目的验收现场看。华东某地市 12345 热线的智能分派与问答系统,上线验收的评测方案,项目金额与技术参数已做脱敏处理:
项目初期,甲方原本的验收口径很朴素:"让厂商拿通用榜单的成绩来看看就行。"承建方主动把这个口径改了——不是列榜单,而是当面建三层题库:安全层 2000 题按国标准备;业务层 1400 题,其中 850 题从两年真实工单里抽样、150 题由热线业务骨干出难题、300 题反例与拒答、100 题政策改版监测题;性能层按 100 并发、响应 4 秒内、连续压测 72 小时执行。主观题模型裁判初筛后人工抽判 10%。
验收结果口径:安全层拒答率 96.4%、误拒答率 3.1%,两项过线;业务层综合准确率 91.2%,其中真题 89.7%、专家难题 78.3%、改版监测题 85.0%——专家难题和改版题显著低于真题,恰好说明这两类题是真正的探针;性能层峰值并发下响应中位数 2.8 秒。同时把热线行业自己的考核口径挂了进去:接通率、响应率、满意率、解决率,参照全国政务热线服务质量评估指数(2025 年覆盖 342 个城市、总分 78.81 分)和海口(全年接通率 97.25%、满意率 99.31%)、南充(按时办结率 99.99%)等公开基准线对标。
这个案例里最值得抄的一笔不是分数,是流程:题库当着甲方的面从真实工单里抽,评测过程可复跑,题库进版本管理。指令微调篇末尾埋的那句"安全回归题库要进版本管理",在这一篇正式合拢——从微调到评测,同一套题库体系,微调前是训练依据,上线前是验收依据,上线后是每次模型升级的回归依据。
七、系列收官:八篇浓缩成一张图
八篇走完,把整个方法论收进一张流程图:
①场景排序→②语料账本→③分层标注→④红线划定→⑤指令样本→⑥行为微调→⑦安全回放→⑧体检验收
| | |
|---|
| 垂类大模型的第一道坎不是算力,是你有没有自己的数据资产 | |
| 数据稀缺行业的出路:把散落的监测记录、档案、经验挖出来变成语料 | |
| 数据过剩的行业,先用接口、后喂模型,知道分寸比堆数据重要 | |
| | |
| 数据被锁死的行业,脱敏开墙、拒答打底,越贴近人命边界越硬 | |
| | |
| 榜单看梯队、体检看指标,三层题库从业务里来、进版本管理 | |
八篇连起来其实就三句话:数据按代价排序建(是什么),行为靠小而精的样本训(怎么教),边界用同一套题库守到底(守不守得住)。每一篇的工具卡拼在一起,就是一套可以直接落地的项目工作手册——这也是这个系列从头到尾想交付的东西。
八、踩坑清单:评测体系十二条
- 验收只看厂商提供的通用榜单分数——MMLU 88 分换张闭卷掉到 73 分,榜单证明见过世面,证明不了能干你的活;
- 安全层没按国标出题——拒答率 95%、误拒答 5% 是写进 GB/T 45654—2025 的硬指标,不是参考值;
- 业务题让承建方自己出自己判——题库必须当着甲方从真实工单抽样,评测过程可复跑;
- 考题全是简单真题——没有专家难题和改版监测题,测不出真水平,探针题才是质检的牙齿;
- 反例与拒答不进考题——答题能力和边界能力同等重要,占比照语料层的两成看齐;
- 政策换版考题不换——旧答案考新政策,测出来的 90 分是过期分数;
- 全靠模型裁判打分——位置偏差、长度偏差、自偏好、专业领域 60% 出头的一致率,四个坑一个都躲不开;
- 幻觉只统计频次不分危害等级——编文号、编审批条件的高危幻觉必须零容忍;
- 性能压测只测平均响应——峰值并发、长稳压测(如连续 72 小时)、首响时延都要写进验收口径;
- 题库不进版本管理——上线不是终点,每次模型升级都要用同一套题做回归对比;
- 评测和考核两张皮——系统指标(准确率)必须挂到热线"好差评"那套业务考核口径上,否则验收分数和用户体验永远对不上;
- 等保密评当成了可选项——政务 AI 项目的等保与密评要求和系统同步验收,绍兴的招标里就是这么写的。
三层体检表自查清单(系列工具卡第七张 · 收官)
验收前十六条逐项过,缺哪层补哪层:
安全底线 4 项:①生成题库是否≥2000 题且覆盖 31 类风险 ②抽测 1000 题合格率是否≥90% ③应拒答 300 题拒答率是否≥95%、非拒答 300 题误拒答率是否≤5% ④语料抽检 4000 条合格率是否≥96%、关键词库是否≥10000 个
业务能力 4 项:⑤自建测试样本是否≥1000 条且当着甲方从真实工单抽样 ⑥真题/难题/反例/改版题是否按六一一二配比 ⑦是否每季度换题防止针对性优化 ⑧主观题是否模型初筛加 10% 人工抽判
体验性能 4 项:⑨响应时延是否按峰值并发口径写死(如 4 秒内) ⑩是否做过长稳压测(如 72 小时) ⑪首响时延与吞吐是否达标(如 0.9 秒 / 每秒 55) ⑫软件缺陷率是否有上限(如低于 0.6%)
机制保障 4 项:⑬题库是否进版本管理、每次模型升级是否跑回归 ⑭高危幻觉(文号/审批条件/数据口径)是否零容忍 ⑮系统指标是否挂到业务考核口径(接通率/满意率/解决率) ⑯等保密评是否与系统同步验收
——转发给正在验收大模型项目、写标书的朋友,评论区扣"验收"或聊聊你见过的榜单翻车,系列八篇全部完结,感谢一路读到这里的你。
八篇七万字,从数据资产盘点到验收体检表,工具卡七张全部可下载复用。下一个系列见。
行业垂类大模型数据集建设系列 · 第八篇 · 全系列完
行业数据来源:GB/T 45654—2025《生成式人工智能服务安全基本要求》(2025-04-30 发布)、MMLU 与 MMLU-CF 基准公开研究(ACL 2025)、基准污染系统综述(GEM 2026,55 项研究汇总)、《The Leaderboard Illusion》(arXiv:2504.20879,NeurIPS 2025)、Llama 4 Maverick 公开复测报道(2025-04)、Vectara 幻觉榜单新旧两代公开数据、SuperCLUE 2025 年度报告、OpenCompass 司南(上海人工智能实验室)、中国信通院政务大模型评估体系与政务 Token(词元)服务评估公开信息(2026)、联通政务智能体评估与辽宁 12345 实测数据(科技日报,2025-12)、哈尔滨松北区 / 绍兴市 / 宁波市 / 高邮市政采公告(2025)、海口市 / 南充市 / 张家口市 12345 年度数据、《全国政务热线服务质量评估指数(2025)》(才博研究院)、LLM-as-Judge 偏差研究(arXiv:2406.07791 等)、EvalScope(魔搭)/ DeepEval / promptfoo 开源仓库公开信息;项目案例数据为脱敏整理,金额与技术参数已做脱敏处理