当前位置:首页>排行榜>企业AI应用如何开展评测—再议国标评测指标

企业AI应用如何开展评测—再议国标评测指标

  • 更新时间 2026-09-26 00:25:01

企业AI应用如何开展评测—再议国标评测指标

【摘要】大模型应用效果说不清?国标给了尺子:客观算分 × 主观打分,200 条数据、3 次取平均。但标准是地基不是全楼——Agent、RAG、动态题库、安全红队,要企业自己盖。

智能客服上线三个月,老板问效果咋样,项目组只能回一句“业务反馈还行”。这事儿我见得太多了。

好在国标 GB/T 45288.2-2025 给出了统一的度量衡。客观题有标准答案,按准确率、召回率算分;主观题靠人工打 MOS 分,看它答得全不全、真不真。硬规定也给了:单个能力项至少 200 条数据,连跑 3 次取平均。

不过站在 2026 年回头看,这套标准明显不够用了。Agent 怎么调用工具、RAG 到底错在检索还是生成,它都没法测。静态题库几个月就被模型背熟了,安全测试也不能只靠一个“有害性”打分。

所以落地时别照本宣科。评测集得拿真实业务问题当大头,每季度换掉三成。指标也得跟风险挂钩——风控场景召回率优先,营销场景精确率优先。最后把这套流程直接嵌进发布流水线,不达标就自动阻断。

与其焦虑榜单排名,不如从今天开始建自己的评测体系。

【
图1 · 总观点】 我的总判断:标准是地基,不是全楼。国标 GB/T 45288.2-2025 的指标公式至今扎实可用,但能力范围已追不上 2026 年的 AI 形态——Agent、RAG、动态题库、安全红队这四块新楼层,要企业自己在地基上盖。
【图2 · 金句】 与同行共勉:与其焦虑榜单排名,不如建自己的评测体系。上线效果靠一句"感觉还行"来评判,才是企业 AI 落地最大的风险。
【图3 · 反常识】 两个反常识的事实:单次跑分就是开盲盒——大模型输出有随机性,国标要求同一评测跑 3 次取平均;静态评测集数月内就会被污染,MMLU、GSM8K 已全部饱和失去区分度。超过一年的公开基准分数,只是"参考级",不是"决策级"。
【图4 · 方法论】 落地一套框架:客观算分 × 主观打分。有标准答案的任务,用准确率、召回率、F1 算"对不对";摘要、文案这类开放任务,用 MOS 五级 × 八维答"好不好"。指标还要跟风险挂钩:风控场景召回率优先,营销场景精确率优先,医疗金融建议类场景"真实性"一票否决。
【图5 · 硬规定】 三组数字可直接写进验收合同:单个能力项 ≥200 条测试数据;同一评测跑 3 次取平均;评测集当"活水",每季度轮换 30% 题库防污染。再把评测嵌进发布流水线,不达标自动阻断——能被度量,才能被改进。完整拆解见公众号正文。

原文企业AI应用如何开展评测——再议国标评测指标的正确打开方式
收录于企业AI实践
北京,17分钟前,

随机文章