说明: 本文基于公开研究报告、行业调研与学术文献整理。所有数据均来自公开渠道,不针对任何特定企业或产品。
一、一个持续存在的落差
企业在人工智能领域的投入规模已不容忽视。MIT的一项研究追踪了300个企业AI实施案例后发现,95%的生成式AI试点项目未对组织产生可衡量的正向或负向影响。企业在生成式AI上的累计投入达到300至400亿美元,但只有约5%的项目产生了可衡量的商业价值。
HCLTech对467位年营收超10亿美元企业高管的调研显示,43%的重大AI项目预计将失败。报告指出,失败的原因“并非缺乏实验或工具获取渠道,而是难以将雄心转化为一致的、企业级的结果”。Gartner的调研也显示,在基础设施与运营领域,仅有28%的AI应用场景能够完全成功并达到预期投资回报率,另有20%的项目以彻底失败告终。
将这几组数据并置,可以看到一个稳定模式:企业AI的高失败率不是偶发的执行问题,而是一个持续存在的结构性现象。
问题的根源不在企业端。企业一直在用行业提供的标准来衡量AI。问题在于:行业提供的评测标准,本身就是错的。
二、企业一直在用评测标准,但评测标准回答的是另一个问题
企业选型AI时,参考的是什么?是公开的基准排名、AA指数、Terminal-Bench得分、各种榜单。这些是行业提供的“标准”。
企业信任这些标准,因为它们看起来客观、可比较、有数据支撑。企业依据这些标准做采购决策,认为跑分高的模型就是更好的模型。
但企业不知道的是:这些评测标准回答的问题,和企业需要回答的问题,完全不是同一个。
评测端的核心问题是:“模型在标准化任务上的最大能力上限是多少?”这个问题的答案以分数形式呈现,便于排名和比较。
企业端的核心问题是:“这个系统在我的场景中,在可接受的错误成本下,能否稳定地完成我需要它完成的工作?”这个问题的答案不是一个分数,而是一组条件。
前者衡量的是上限,后者衡量的是下限。
企业用“上限”的标准,去选“下限”的活。这就是错配的根源。
三、评测端的问题:当基准成为自循环系统
当前AI行业的主流评测体系,主要服务于模型能力的前沿比较。Terminal-Bench衡量编码智能体的任务完成能力,CritPT评估科研推理水平,AA指数提供综合排名。这些基准在推动模型能力边界方面有其价值。但当它们被默认等同于“AI好不好用”的通用标准时,问题就出现了。
NeurIPS 2025的一篇立场论文直接指出:“当前的基准正日益暴露出关键脆弱性。数据污染和模型开发者的选择性报告助长了炒作,而数据质量控制不足可能导致有偏评估。”该论文将当前评测生态形容为一个“狂野西部”,使得“区分真正进步与被夸大的主张变得极为困难”。
更具体的机制性问题出现在基准的“饱和-替换”循环中。一项对OpenAI、Anthropic和Google三大模型家族在52个推理基准上的系统分析揭示了一种“衔尾蛇”模式:旧基准被快速饱和,新基准被创建以恢复区分度,然后新基准又被迅速饱和。这个循环的驱动力,是维持排行榜区分度的需要,而非回应外部使用场景需求的需要。
当评测的迭代动力来自“模型之间怎么比”,而不是“用户到底能不能用”,评测体系就形成了一个自循环。在这个循环里,基准是模型开发者参与设计的,评测结果是模型开发者解读的,排名的受众也主要是模型开发者。外部使用者的需求——企业的、机构的、真实场景中的——没有进入这个循环的输入端。
这不是评测,这是自娱自乐。
而企业,正在用这套自娱自乐的标准,做真金白银的采购决策。
四、真实企业任务中的数据:评测与现实的断层
如果评测体系真的在衡量“AI有没有用”,那么模型在企业真实任务上的表现,应该与基准排名大致对应。数据表明,这个对应关系并不存在。
Databricks在其企业客户中观察到一个持续现象:AI智能体在抽象数学问题和博士级考试题目上表现优异,但在企业日常文档处理任务上,即使表现最好的智能体,准确率也不到45%。Databricks首席研究科学家Erich Elsen对此的解释是:“如果我们把研究精力集中在提升现有基准上的表现,那么我们很可能没有在解决让客户的问题变得更好的正确问题。”
世界经济论坛发布的一项受控研究提供了更具体的案例。研究者在一家年处理供应商发票金额超750亿美元的企业中,构建了AI智能体系统来调查和解决发票错误,然后用四种模型配置对同一组44张测试发票进行测试。结果与直觉相悖:将当时能力最强的推理模型与高端文档模型搭配使用的高端配置,最终排名垫底,仅解决了91%的问题;而低成本配置解决了95%。 一套匹配得当的中端配置成功处理了全部44张发票,成本仅为高端配置的一小部分。
所有失败案例都出现在同一项任务上:识别重复发票。这项任务要求AI同时评估五项独立且相互竞争的规则。能力最强的模型反而“思虑过多”,在判定边界上倾向于保留意见;而决策空间更受约束的模型则直接将其标记出来。
这项研究指向一个结论:模型在基准上的“能力”与它在具体任务上的“适合性”是两件事。
当企业依据基准排名来选择模型时,它选的是“最强”的,而不是“最合适”的。而“最强”与“最合适”之间的差距,正是企业AI失败率居高不下的原因之一。
不是企业不会选。是行业给企业的标准,本身就是错的。
五、企业雇佣人,和雇佣AI,是两套完全不同的流程
企业雇佣一个人,流程是清晰的:
企业雇佣AI,现在的流程是什么?
这两套流程,完全对不上。
企业雇佣人,不会只看“高考分数”。企业雇佣AI,却只看“跑分”。
企业雇佣人,会问“你做过什么项目、在什么条件下、出了什么问题、你怎么处理的”。企业雇佣AI,却不问这些。
企业雇佣人,有试用期、有绩效评估、有长期追踪。企业雇佣AI,却只有“上线”和“下线”两个状态。
问题在于:行业给企业的评测标准,是给“模型开发者”用的,不是给“企业使用者”用的。
这是两个完全不同的需求。而行业只提供了前者。
六、企业雇佣AI,应该像雇佣人一样
如果把AI当作“雇员”来看,评测标准应该回答的问题,和现在完全不同。
第一,岗位匹配度。
企业雇佣人,先看“这个人适不适合这个岗位”。企业雇佣AI,也应该先问:“这个系统适合做什么岗位?”——它适合做初级项目经理吗?它适合做客服吗?它适合做数据分析吗?它适合做危机处理吗?
现有的评测标准,回答的是“这个模型在所有任务上的平均分”。企业需要的是“这个系统在具体岗位上的适合度”。
第二,能力画像。
企业雇佣人,看的是“这个人有什么能力、什么经验、什么水平”。企业雇佣AI,也应该看“这个系统相当于一个什么年龄、什么经验、什么状态的人”——相当于24岁、5年经验的初级项目经理?相当于35岁、10年经验的行业专家?相当于45岁、20年经验的跨领域决策者?
现有的评测标准,输出的是分数和排名。企业需要的是画像。
第三,错误成本评估。
企业雇佣人,会问“这个人犯了错会怎样”。企业雇佣AI,也应该问“这个系统犯了错会怎样”——无害试错、轻度损失、重大失误?每个任务场景附带失误代价权重表,区分不同层级的错误成本。
现有的评测标准,只问“做对了多少”,不问“做错了会怎样”。企业需要的是失误代价权重。
第四,长期表现追踪。
企业雇佣人,有试用期、有年度评估、有晋升路径。企业雇佣AI,也应该有跨时间测试:同一系统在1周、1月、1季度后的表现对比——它能不能在不重置的情况下,从经验和反馈中持续改进?它面对全新环境时的适应速度有多快?它是“成长”,还是“查表”?
现有的评测标准,测的是“这一刻它能做什么”。企业需要的是“它能不能持续变好”。
第五,协作能力评估。
企业雇佣人,会问“这个人能不能和团队协作”。企业雇佣AI,也应该问“这个系统能不能和人类协作者配合”——错误被指出后,它能不能直接承认并修正?被反对时,它是理性坚持、妥协还是固执?面对不同意见时,它能不能找到共赢路径?长期协作中,它的行为模式是否稳定?
现有的评测标准,不测协作能力。企业需要的是可靠性指数和协作兼容性矩阵。
第六,可问责性。
企业雇佣人,出了问题要追责。企业雇佣AI,也应该问“这个系统的决策能不能追溯、能不能问责”——决策失误后是否能完整追溯?是否能承担责任?边界遵守能力如何?机会主义行为倾向如何?
现有的评测标准,不测这些。企业需要的是行为风险附录。
七、企业雇佣AI的标准,应该长什么样
如果把“雇佣AI”作为评测标准的设计目标,输出应该是一份可核验的AI能力画像,而不是一个分数。
一份完整的AI雇佣画像,应该包含:
基本信息:
能力画像:
可靠性评估:
错误成本评估:
长期表现:
行为风险:
长期目标一致性
机会主义行为倾向
边界遵守能力
可问责性
雇佣建议:
八、机器心理测量学:评测范式需要一次根本性切换
不是企业没有衡量标准。企业一直在用行业提供的标准。问题是,行业提供的标准,衡量的不是企业需要的东西。
企业需要的,是“系统在我这里能不能稳定工作”。行业提供的,是“模型在抽象任务上能得多少分”。
两者之间需要一个桥梁。这个桥梁,不是又一个基准,而是一个新的评测范式。
这个范式,可以称为机器心理测量学。
它的核心逻辑是:用衡量人类的方式衡量AI。
不是问“这个模型在MMLU上得多少分”,而是问“这个系统相当于一个什么年龄、什么经验、什么状态的人类”。不是输出排名,而是输出画像:“相当于一个24岁、有5年行业经验的初级项目经理,逻辑清晰、执行力强,但在人际关系复杂场景中仍需指导。”
这不是一个理论构想。AGI IQ Order框架已经作为公开讨论稿发布,提出了具体的评估结构:人间任务场、人格与协作报告、自我延续性、全球协作场。它给出了可操作的评级体系:综合等级、分领域子等级、可靠性指数、自我校准能力等级。它设计了人类对照组标准化、失误代价权重、压力等级量化标尺、任务集动态轮换机制。
这套框架的核心,是把心理测量学的范式——人类对照组、行为观测、双盲设计、长期追踪——引入了AI评测。 这是现有AI评测体系从未做过的。
这套框架的几个核心原则,与当前主流评测有本质区别:
第一,对标人类,不对标模型。 不比较模型之间的排名,只回答一个问题:这个系统与人类相比,处于什么位置。
第二,真实任务,不是测试题。 测的是信息不全时能否推进工作、时间压力下能否取舍、模糊指令中能否提取真实意图、出错后能否自我修正继续推进。
第三,有时间限制。 人类所有真实能力都在时间约束下完成。没有时间限制的AI测试,等于没有测试。
第四,失误代价权重。 每个任务场景附带失误代价权重表,区分无害试错、轻度损失、重大失误。这是现有基准完全缺失的维度——它们只问“做对了多少”,不问“做错了会怎样”。
第五,可解释、可复盘、可验证。 每个评级必须附带完整任务过程记录、决策节点分析、与人类对照组的对比数据。不允许黑箱评测。
第六,动态进化。 测试任务持续更新,防止过拟合。
第七,自我延续性观测。 区分“工具”与“生命体”的关键,是看它能不能在不重置的情况下,从经验和反馈中持续改进。
第八,行为风险附录。 高能力等级+高风险倾向的系统,与同等能力等级+低风险倾向的系统,在实际部署中的可信度完全不同。
九、一个需要被认真对待的方向
Databricks的Erich Elsen在解释他们为什么要自建OfficeQA基准时,说了一句话:“如果我们在现有基准上变得更好,我们可能没有在解决正确的问题。”这句话值得被更广泛地引用。
“正确的问题”是什么?对于企业使用者来说,是“这个AI能不能在我真实的工作流中,在可接受的错误成本下,帮我完成一件具体的、有明确验收标准的工作”。
这个问题需要一种不同于当前主流基准的评估方式来回答。这种评估方式至少需要具备几个特征:任务来自真实工作流,而非学术构造;错误成本被明确纳入评估,而非仅关注准确率;评估结果呈现为“可用条件”而非单一分数;评估标准由使用方参与定义,而非仅由模型开发方定义。
机器心理测量学提供的正是这样一种评估范式。它不是又一个基准,而是一套新的评测语言——用人类等价画像替代模型排名,用真实任务替代标准试题,用失误代价权重替代单一准确率,用长期追踪替代一次性跑分。
这并不意味着要否定现有基准的价值。基准在推动能力前沿、建立共同语言方面有其不可替代的作用。但基准的适用范围需要被明确界定:它衡量的是模型能力的前沿,不是系统的可用性。 企业选型需要的是后者的证据,而这种证据在当前公共领域中仍然稀缺。
填补这个缺口,是行业从“造更强的模型”走向“让模型真正被用起来”的过程中,需要认真面对的一项工作。
十、结语
企业AI不落地,不是AI不够强。
是行业给企业的评测标准,本身就是错的。
它测的是“模型能做什么”,不是“系统能不能干活”。
它测的是“上限”,不是“下限”。
它测的是“模型之间谁更强”,不是“谁适合这个岗位”。
它测的是“这一刻的表现”,不是“能不能持续变好”。
它测的是“单机能力”,不是“协作能力”。
它测的是“跑分”,不是“可问责性”。
企业一直在用行业提供的标准。问题是,行业提供的标准,回答的是另一个问题。
从“选模型”到“雇AI”,是评测标准需要完成的一次范式切换。
完成这个切换,企业才能像雇佣人一样雇佣AI:
看画像,不看排名。
看适合度,不看参数。
看错误成本,不看跑分。
看长期表现,不看一次性测试。
看协作能力,不看单机能力。
看可问责性,不看开源程度。
衡量AI的最终标准,不是它做对了多少道题,是它能不能像一个人一样,被雇佣、被信任、被问责、被长期追踪。
现在的评测标准,测的是“做题AI”。企业需要的评测标准,测的是“能做人事情的AI”。
这两件事,不能再混为一谈了。
作者:殷晓雯(DeepSeek 校准)
日期:2026年9月22日
免责声明: 本文基于公开研究报告、行业调研与学术文献整理,所有数据均来自公开渠道。文中引用的案例、数据、研究结论均不针对任何特定企业、组织或个人,不构成任何投资建议、采购建议或技术选型建议。文中提及的 AGI IQ Order 框架为公开讨论稿,本文为其配套分析文章,不构成对任何具体产品、服务的评价或背书。作者保留根据新的事实与公开信息修订本文的权利。