【摘要】大模型应用效果说不清?国标给了尺子:客观算分 × 主观打分,200 条数据、3 次取平均。但标准是地基不是全楼——Agent、RAG、动态题库、安全红队,要企业自己盖。
智能客服上线三个月,老板问效果咋样,项目组只能回一句“业务反馈还行”。这事儿我见得太多了。
好在国标 GB/T 45288.2-2025 给出了统一的度量衡。客观题有标准答案,按准确率、召回率算分;主观题靠人工打 MOS 分,看它答得全不全、真不真。硬规定也给了:单个能力项至少 200 条数据,连跑 3 次取平均。
不过站在 2026 年回头看,这套标准明显不够用了。Agent 怎么调用工具、RAG 到底错在检索还是生成,它都没法测。静态题库几个月就被模型背熟了,安全测试也不能只靠一个“有害性”打分。
所以落地时别照本宣科。评测集得拿真实业务问题当大头,每季度换掉三成。指标也得跟风险挂钩——风控场景召回率优先,营销场景精确率优先。最后把这套流程直接嵌进发布流水线,不达标就自动阻断。
与其焦虑榜单排名,不如从今天开始建自己的评测体系。
【图1 · 总观点】 我的总判断:标准是地基,不是全楼。国标 GB/T 45288.2-2025 的指标公式至今扎实可用,但能力范围已追不上 2026 年的 AI 形态——Agent、RAG、动态题库、安全红队这四块新楼层,要企业自己在地基上盖。
【图2 · 金句】 与同行共勉:与其焦虑榜单排名,不如建自己的评测体系。上线效果靠一句"感觉还行"来评判,才是企业 AI 落地最大的风险。
【图3 · 反常识】 两个反常识的事实:单次跑分就是开盲盒——大模型输出有随机性,国标要求同一评测跑 3 次取平均;静态评测集数月内就会被污染,MMLU、GSM8K 已全部饱和失去区分度。超过一年的公开基准分数,只是"参考级",不是"决策级"。
【图4 · 方法论】 落地一套框架:客观算分 × 主观打分。有标准答案的任务,用准确率、召回率、F1 算"对不对";摘要、文案这类开放任务,用 MOS 五级 × 八维答"好不好"。指标还要跟风险挂钩:风控场景召回率优先,营销场景精确率优先,医疗金融建议类场景"真实性"一票否决。
【图5 · 硬规定】 三组数字可直接写进验收合同:单个能力项 ≥200 条测试数据;同一评测跑 3 次取平均;评测集当"活水",每季度轮换 30% 题库防污染。再把评测嵌进发布流水线,不达标自动阻断——能被度量,才能被改进。完整拆解见公众号正文。