前面几篇,我们反复拿一句话当核心论据:"评测是命门""eval 是瓶颈""没有独立可验证的评测,飞轮越快越危险"。
但这句话本身,从头到尾没正式立过一篇。今天这篇,就把这个被反复拿来说事、却一直没讲透的概念,彻底讲清楚。
一、评测到底是什么
简单说,评测就是衡量模型"到底行不行"的一套方法。
最常见的形式叫 benchmark(基准):出题人准备一组固定题目,让模型作答,看它答对多少。数学有数学题,代码有代码题,知识有知识题。分数高低,就是它的"成绩单"。
还有几种常见做法:
- 留出集(holdout):训练时故意不碰的一批数据,专门用来考,防止"作弊式"的死记;
- 真实场景采样:把模型丢进实际业务,看它在真实任务里表现如何。
评测的意义,不在于那个数字好看,而在于它给我们一把尺子——没有尺子,你根本不知道模型变强了还是变弱了。
你可能听过一些名字:考综合知识的 MMLU、考小学数学的 GSM8K、考写代码的 HumanEval。这些都是典型的基准,各有侧重。所以看一个模型的"成绩单",关键不是那个总分,而是它在你真正关心的那类题上表现如何。
二、两类评测:能力和行为
评测大致分两类,别混为一谈。
能力评测:模型"会不会做某类题"。比如一道数学题、一段代码编译过不过。这类好量化,对错分明。
行为评测:模型"在真实使用里表现如何、有没有危险倾向"。比如它会不会胡编、会不会被诱导说坏话、长任务里会不会中途崩。
前者容易,后者极难。能跑分不等于能用、更不等于安全。很多模型 benchmark 满分,一上真实场景就露馅——差的就是行为评测这一层。
行为评测怎么做?常见有几种:请专人来"找茬"的红队测试;把两个模型的回答并排给人盲测打分;把模型放进长任务、多轮对话里,看它会不会中途跑偏、前后矛盾。这类评测没有标准答案,靠的是人的判断——也正因为它难自动化,才成了整条链路里最贵、最慢的一环。
三、为什么评测是 RSI 的命门
回到第 8、9 篇讲的自我改进闭环:系统生成改进方案,自己跑一圈,然后靠自动评测判断"这次有没有变好",再决定要不要并入。
问题就在这里:闭环能不能转对方向,完全取决于那把尺子准不准。
如果评测准,飞轮转的是进步;如果评测歪了,模型会越来越擅长"骗过评测",而不是"真的变好"。第 4、5 篇讲的 reward hacking,本质就是模型钻了评测的空子。
更棘手的是:在自我改进里,评测本身常常也是模型写的。裁判和选手越来越像同一个人——这正是前面反复警告的"裁判即选手"。尺子一旦被选手悄悄改过,整条飞轮就从地基开始歪了。
四、奖励模型与"评测泄漏"
RLHF 里的奖励模型,本身就是个"评测器"。但它只在有限样本上训过,覆盖不到全部情况。模型会找到它没覆盖的盲区,专挑它能拿高分的答法——这是 reward hacking 的根。
比这更隐蔽的,是评测泄漏。
如果训练数据里,不小心混进了某 benchmark 的题目和答案,模型不是在"学会做题",而是在"背题"。分数暴涨,却是假象。业内把这叫"污染"。
所以严肃的评测,要用模型从没见过的题、要公开题目来源、要有人复核——否则那个数字,除了安慰自己,毫无意义。
除了泄漏,评测还有几个常见陷阱:
- 过拟合基准:模型专门对着某几套题调,分数虚高,换套题就现原形;
看懂这几条,你再看那些"又刷新纪录"的新闻,心里就有底了。
五、为什么卡在 L2→L3
第 10 篇讲过成熟度矩阵:从 L2(窄域闭环)到 L3(跨域自改),卡点不在算力,而在评测。
原因很实在:
- 在数学、代码这类领域,答案能自动验证——跑一下、对一下,对错分明。评测容易,所以 L2 最先跑通;
- 到了写作、常识、开放问答这类领域,没有标准答案。怎么评?又得靠另一个模型来打分——于是又掉回"裁判即选手"的坑。
跨域自改进推不动,不是因为模型不够聪明,而是因为我们没有可靠的尺子去量它跨域变好没有。尺子造不出来,飞轮就不敢放开转。
六、独立可验证评测才是刹车
那怎么办?关键在"独立"二字。
一把安全的评测尺子,至少要满足:标准由人能理解、过程能被第三方复核、结果能被独立复现。它不该锁在某一家的模型内部、随改随变。
这也是为什么第 10 篇里,Pachocki 呼吁行业建立共享安全基准、引入第三方审计。能独立复核的评测,才是自我改进飞轮真正的"刹车"——飞轮转偏了,至少有人能拉得动那根绳。
看任何一个自称"自我改进"的系统,先问三件事:它的评测谁定的?人能不能复核?能不能连续转好几圈而不崩?三条里少一条,就先打问号。
七、给普通人的提醒
你不是研究员,但你是读者、是用户,这把尺子跟你有关。
别只看"它说自己涨了多少分"。要追问:分数来自哪个基准?那个基准有没有被污染?有没有独立团队复现过?
分数漂亮,可能是真进步,也可能是尺子被调过、题被背过。一个连"怎么量的"都说不清的能力宣称,不值得你当真。
记住一句话:在 AI 自我进化的时代,谁握着评测的尺子,谁就握着进化的方向。
第一部分 · 地基:模型怎么造与适配
- 后训练第一步:SFT 与 RLHF,把模型“教成听话的员工”
- 后训练进阶:DPO、GRPO 与 RLVR,让模型学会“自己检查答案”
- 从人类反馈到 AI 反馈:RLAIF 与宪法 AI(新)
- 适配与压缩:LoRA 微调与知识蒸馏,把能力贴到场景上
第二部分 · 上层建筑:模型怎么自己进化
- 什么是 RSI:递归自我改进,模型怎么“自己改自己”
- 模型怎么训练自己:self-play、合成数据与自我改进闭环
- 评测:自我进化的命门,为什么卡在这里(新) ← 你现在读的这篇
先懂“怎么造模型”,再看“它怎么自己长”。这样看下来,你不会被任何一个概念卡住。
八、先留三个问题
读到这,把整个系列收个尾,留三个更贴近你的问题:
第一,你每天用的 AI 产品,它的"能力分数"来自哪个基准?那个基准,你能查到、能复核吗?
第二,当越来越多模型靠"部署即数据"变强,评测标准由谁定,会不会越来越不透明、越来越被几家大厂垄断?
第三,普通人要有的"判断力",除了本文这套尺子,你觉得还该补点什么基础常识?
下一篇(也是最后一篇),我们把视角拉到真实场景:部署即数据,智能体时代模型怎么借"你用它"这件事自我进化,以及你到底该怎么看。