AI 评测不是做一套题:如何让它真正运行起
AI评测不是做一次考试,而是持续判断系统何时值得信任。
先定成功标准:别急着挑指标。得先说清谁在用、想干啥、怎样算成功、绝对不能出啥错,以及能花多少钱。
评测分五层:从测试数据、模型能力、系统组件,一路测到完整任务和线上真实影响。底层全过,不代表产品真能用。
评分器规则优先:能用代码和业务规则的,就别让大模型去猜。模型裁判容易偏爱特定位置或风格的答案,最好让人和程序一起交叉验证。
多次运行看稳定性:AI每次结果可能不一样。关键任务得多跑几次,看首次成功率、连续成功率和失败后能不能恢复。
别搞综合分:安全红线一旦踩雷直接毙掉。质量、延迟和成本再单独比较,一个总分掩盖不了越权泄露这种致命伤。
线上线下闭环:线上发现的新错误,脱敏后进离线测试集。修复后再放小流量验证,这才是AI持续进化的关键。
原文AI 评测不是做一套题:如何让它真正运行起来?(下)