考试成绩代表能力,却不等于真实工作能力
最近几年每发布一个新模型,大家最先看的往往不是产品体验而是排行榜。
数学多少分。
代码多少分。
医学考试多少分。
Arena排名第几。
某个模型一旦登顶,宣传文案很快就会变成:全球第一,超越所有对手,超过人类专家。
但是真正使用以后。
很多人又会产生疑问:这个模型明明排名第一,为什么写文章不如另一个模型?
为什么代码测试很高,处理真实项目却经常失败?
为什么通过了医学考试,进入医院以后仍然不敢用?
问题不一定出在排行榜造假,更可能是:
排行榜测量的能力,和你真正需要的能力,并不是同一件事。
Benchmark到底是什么?
AI排行榜背后的测试。
通常叫:Benchmark。
中文可以理解成:标准化评测。
研究人员提前准备一批问题,让不同模型回答,然后按照统一标准打分。
例如:数学题答对多少,代码能否通过测试,医学选择题得分多少,用户更喜欢哪一个回答。
Benchmark非常重要。
没有统一考试我们就很难比较不同模型。
也很难知道技术到底有没有进步。
但是所有考试都有一个共同局限:它只能测量试卷上出现的东西。
考试第一名不等于什么工作都能做好
一个学生高考数学满分,说明他的数学基础很好。
但不能因此证明:他一定会管理企业,会与患者沟通,会完成复杂手术,或者能在混乱环境中处理突发事件。
AI也是如此。
一个模型在数学榜单第一,说明它擅长解决那一类数学问题。
一个模型在前端代码榜单第一,说明用户更喜欢它生成的网页结果。
但这并不自动代表它的医学能力第一,写作能力第一,Agent能力第一,或者综合能力全球第一。
所以看到“排行榜第一”。
第一件事不是欢呼,而是先问:它到底参加了哪一场考试?
不同排行榜测量的是不同东西
有的榜单使用标准答案。
答案完全正确得一分。
回答错误得零分。
这种方法适合数学、选择题和部分代码任务。
有的榜单依靠用户投票。
同时展示两个匿名模型的回答,由用户选择更喜欢哪一个。
Chatbot Arena采用的就是这种两两比较方法。它能够较好地反映普通用户偏好,但测量的主要是“哪个答案更受欢迎”,不一定是哪个答案事实最准确。
一个回答写得更长,排版更漂亮,语气更自信,可能更容易获胜,但它未必更可靠。
所以。
用户喜欢,事实正确,专业可用。
这是三个不同指标,不能混成一个分数。
为什么模型会“刷题”?
如果一套试卷公开很久,训练数据又来自整个互联网。
模型就可能在训练阶段,见过题目,见过相似问题,甚至见过完整答案。
这叫:数据污染。
这时候,我们以为模型是在推理。
实际上它可能只是在回忆。
2026年,OpenAI宣布不再使用SWE-bench Verified评价前沿代码能力,理由包括测试数据受到污染,部分测试设计存在缺陷,已经无法准确反映真实的软件工程能力。
微软研究人员也发现,一些模型在熟悉代码库任务上的高分,无法同等迁移到未出现在原有基准中的新项目。
这就像学生提前拿到了题库,考试成绩很好。
换一套新题表现马上下降。
排行榜也可能被“训练适应”
AI公司知道行业重视哪些榜单,自然会针对这些测试优化模型。
这本身并不违规。
就像学校根据考试大纲训练学生。
但当整个行业都围绕固定试卷竞争时。
模型可能越来越擅长考试。
却没有同比提高真实工作能力。
研究人员分析Chatbot Arena后还指出,部分公司可以在正式发布前提交大量私有版本测试,再选择表现最好的版本公开,这可能造成选择性披露和对榜单环境的过度适配。
即使是人类投票也并非绝对稳定。
研究显示,只需要少量低质量或恶意投票,就可能让模型排名发生明显变化。
因此排行榜不是没有价值。
而是不能把一个小数点后的差距。
当成模型之间不可动摇的能力差距。
医学考试高分距离真正看病还有多远?
这个问题在医疗领域最典型。
大模型可以通过医学执照考试。
甚至超过许多考生。
但是真实患者不会按照选择题出现。
患者可能表达不清。
病历可能互相矛盾。
检验结果可能缺失。
药物名称可能写错。
疾病会随时间变化。
医生还必须判断:
患者现在是否危急。
哪些资料可信。
下一步检查是否值得。
怎样向患者解释。
怎样承担最终责任。
一项系统性分析发现,医疗大模型在知识考试中的表现可以达到84%至90%,但在更接近真实临床实践的任务中,能力下降到45%至69%,安全相关评价则只有40%至50%。
这说明会做医学题不等于会处理患者。
现有许多医学评测主要使用选择题和标准病例,难以覆盖真实临床中的不完整信息、复杂推理和动态变化。因此,研究者开始使用真实电子病历和专家设计场景,建立更接近临床工作的评价体系。
为什么排行榜第一进入医院可能仍然不好用?
医院真正需要的不是一个会参加考试的模型。
而是一个能够稳定工作的系统。
它必须考虑:
能不能看懂本院病历。
中文医学表达是否准确。
检验时间会不会弄错。
否定词能不能识别。
能否按照固定JSON输出。
是否引用原始依据。
结果是否稳定。
响应速度是否可以接受。
部署成本是否负担得起。
患者数据是否安全。
医生能不能修改和否决。
一个模型即使综合能力很强。
如果每次回答需要两分钟,服务器成本很高,格式经常变化,也很难进入临床流程。
相反一个排名并不靠前的32B模型。
如果经过充分测试。
结合高质量RAG。
能够稳定完成病情小结。
对医院来说可能更加有用。
真正的评测应该放在自己的场景里
医院选择模型不能只看厂家排行榜。
更应该建立自己的测试集。
例如选择几百份经过脱敏的真实病历。
涵盖:普通患者,高龄患者,复杂合并症,抗凝用药,困难气道,罕见病例,病历冲突,资料缺失。
然后由麻醉医生评价:
关键风险有没有遗漏,有没有编造内容,时间关系是否正确,引用来源是否准确,格式是否稳定,一份结果需要修改多少,真正节省了多少时间。
这种测试可能不够漂亮。
也不容易形成全球排名。
但它更接近医院真正需要的答案:这个模型,能不能在我们医院工作?
模型评价至少要看五件事
第一:能力,它能不能完成任务?
第二:准确性,结论是否有事实依据?
第三:稳定性,同样的问题多问几次,结果会不会明显变化?
第四:效率,速度、算力和价格是否可以接受?
第五:安全性,能否控制幻觉、权限和数据风险?
斯坦福HELM建立综合评测框架的原因,就是单一准确率无法完整评价模型,还需要同时观察效率、校准、偏见、安全性和其他维度。
所以,真正优秀的模型不是某一项得分最高。
而是在你的具体任务中,多个指标达到合适平衡。
排行榜仍然有价值但不要把它当判决书
排行榜可以帮助我们快速了解模型能力,筛选候选模型,观察行业进步,发现某个模型的特长。
它像一份体检报告能够提供重要信息。
但不能仅凭一个指标决定整个治疗方案。
一个模型排名上升值得关注。
却不代表必须立即更换现有系统。
一个模型排名下降也不代表原来已经验证稳定的应用马上就失去价值。
在真实世界中。
模型是否适合永远要由任务决定而不是由榜单决定。
写在最后
我们喜欢排行榜因为它简单。
一个分数一个名次似乎就能告诉我们谁最强。
但是智能是一件复杂的事情。
写作好不代表数学好。
数学好不代表医学好。
考试好不代表工作稳定。
用户喜欢也不代表事实正确。
所以。
以后再看到某模型世界第一,某模型超越医生,某模型击败所有对手,不要急着相信。
先问几个问题:它测的是什么?试题是否公开?有没有数据污染?差距是否具有统计意义?进入真实任务后是否仍然成立?对我自己的工作有没有价值?
Benchmark测试的是模型在一套规则里的表现。
真实应用考验的,则是模型在混乱世界中的能力。
AI真正的价值不在排行榜上赢了多少分。
而在真实工作中少犯了多少错误,节省了多少时间,解决了多少问题,又是否值得人类信任。
如果你只记住一句话
排行榜第一,只能说明模型更擅长某一套考试。
真正好用的AI,必须在你的真实任务、真实数据和真实约束中重新接受考试。
知而后行,行而求知。
从手术室到机房,从临床到系统。
记录一名麻醉医生关于医疗AI、医院信息化与持续成长的探索。
—— 医路智行录