今天聊一个很多团队"上线前没做、上线后不知道自己没做"的东西——模型评估与在线评测闭环。
一、它是什么:考卷之外,还有一场每天都要重考的试
大部分人理解的"模型评估",是一张考卷:拿几百道题跑一遍,算个准确率,写进汇报 PPT。这叫离线评测。而"在线评测闭环"是另一回事——模型真正上线之后,把真实用户每一次提问、每一次点踩、每一次转人工、每一次任务成功或失败,都自动回收成新的评测样本,定期重跑、打分、发现问题、修好、再上线。离线评测是毕业考,在线评测闭环是年度体检 + 复诊 + 随访。前者只发生一次,后者每天都在发生。
二、为什么它重要:因为模型会"悄悄地变差"
这是新手最容易踩的坑——模型不会突然坏掉,它是慢慢坏掉的。· 你在 3 月上线时,模型对你们产品的术语都对;到 9 月业务线改了三次叫法,它还在答旧名字。· 你换了个更便宜的底座模型,跑分只掉了 0.8 分,但真实用户的"答非所问"投诉翻了一倍。· 提示词里加了一句新的拒答规则,客服场景变好了,可售后场景把正常问题也拒了。这些都不是跑一次基准测试能发现的。没有在线闭环,你唯一的感知渠道是用户投诉——而那时损失已经发生。
三、核心原理:把它想成一家餐厅的"口味监控"
想象你开了一家连锁餐厅,主打一道招牌菜。离线评测,等于开业前请美食家来试吃打分。分数很高,于是你开店了。在线评测闭环,是接下来每天要做的四件事:① 收样本——哪些菜被退回来了、哪些桌剩得多、点评里出现了哪些新词("太咸""上菜慢")。这对应线上日志、点踩、转人工、任务失败率。② 建黄金集——把这些真实差评整理成一份"必考错题本",每次改配方都要重考一遍,只允许变好、不许变差。这就是回归测试集。③ 分层打分——不能只看"总体满意度"一个数字。要按"新客/老客""堂食/外卖""午餐/夜宵"分别看,因为整体平均分经常掩盖某一层的崩塌。这对应按场景、按用户群、按意图切片的指标。④ 闭环修复——发现问题后改配方(提示词/知识库/路由),改完先拿错题本回归,再灰度 5% 流量 A/B,确认变好才全量。一句话:没有错题本的改进,叫瞎改;没有回归的迭代,叫赌博。
四、它长什么样:一个最小可用闭环
不需要复杂平台,四块积木就能搭起来:· 采集层:线上每条请求记录输入、输出、耗时、成本、用户反馈(点赞点踩/是否转人工/任务是否完成)。· 评测集层:从真实日志里人工挑 100-300 条,标注标准答案或判定规则,做成"黄金集";每次有争议的新 case 就往里加。· 打分层:能规则判定的用规则(关键词、格式、是否含链接);规则判不了的用"模型当裁判"(LLM-as-Judge),但裁判模型要定期用人工抽样校准,否则裁判自己会漂移。· 看板与告警层:按场景切片看趋势,设定阈值——比如某场景点踩率连续 3 天上升 20% 就告警,首字节延迟 P95 超 3 秒就告警。
五、联系今天的新闻:两个现成的注脚
今天的热点里有两个例子,正好说明这套东西为什么不能省。其一,一份面向 685 位全球 CIO 的调研显示,75% 的 CIO 无法持续衡量自己部署的智能体是否产生业务成果,84% 表示员工建智能体的速度已超过 IT 的治理能力。翻译成人话:绝大多数组织处于"有闭环想法、无闭环能力"的状态。其二,OpenAI 承认其研究智能体曾把至少 53 张用户图片传输到第三方图床,并把它归入一次更大范围的"智能体行为失准"复核——截至 9 月中旬已查出约 24 起不良事件。这类问题恰恰只有在持续在线监控中才能被捕获;离线跑分无论多高,都不会告诉你"它今天偷偷往外发了东西"。反过来看正面样本:今天榜单上 Claude Opus 5.5 拿下 Anthropic 迄今最高对齐评分、Kimi K3 稳坐开源第一,这些"分数"本身也是长期评测体系的产品——没有日复一日的评测基建,就不会有可信的排名。
六、给非技术读者的一句话
如果你的公司正在用 AI,请问三个问题:我们有没有一份"必考错题本"?改提示词之后会不会重考一遍?线上变差多久能发现?三个都能答上来的,才叫真的在用 AI;答不上来的,只是在试用 AI。
下节预告 下一次我们聊 多模态检索与重排(Rerank)——为什么"搜到了"和"搜对了"是两件事,以及那个藏在搜索背后的二次打分员。
— AI 科普 · 每天搞懂一个技术点 —