当前位置:首页>排行榜>模型评测靠人盯必漏,智能化进阶闭环

模型评测靠人盯必漏,智能化进阶闭环

  • 更新时间 2026-09-22 01:44:05
模型评测靠人盯必漏,智能化进阶闭环

模型评测靠人盯必漏,智能化进阶闭环

我见过最勤快的团队,每周五下午人工跑一遍评测集,把得分贴到群里。听起来尽责,其实漏洞有 3 个:周三、周四连发两版,周五才跑,中间回归全没拦;人一忙就忘了跑,月底发现模型早退了;最致命的是,跑出来的 badcase 没人整理,下周还是同一批老问题。

闭环的“闭”不是流程画个圈,是变更发生就自动转、转完自动判、判完自动补。先别急着上自愈,评测集、评分卡、裁判、难负四件套得先就绪。POC 阶段人工跑通,有集子后每天定时跑看趋势,进了门禁再接 CI/CD,线上再上 LLM 自愈。

触发得接变更事件,模型、Prompt、知识库一改就拉起流水线。千万别只挂定时跑,周三周四连发版,周五只看最终态,中间退了永远不知道。流水线还得把裁判版本钉死,不然分数变了你都不知道是模型退步还是裁判松了。

低于阈值直接阻断,但别只报总分,得按维度聚类出一份掉分榜。之前我只报总分,一次掉分排查了 200 条 badcase,才发现是运费险政策变了。加了归因,半天活儿几分钟搞定。拦下的 badcase 直接喂给难负构造,自动生成新样例回流进集,形成自增长飞轮。不过自动生成的必须人工抽检 10%,免得标错的样本污染评测集。

线上才是真战场。盯紧用户举报率这些真实指标,发现分布漂移就自动拉回评测集。连续 N 轮掉分再升级人工。智能闭环不是无人闭环,是大部分自动跑、异常才找人。

原文模型评测靠人盯必漏,智能化进阶闭环
北京,2小时前,

随机文章