政企 Agent 评测:从"能不能做"到"敢不敢上
上个月去一家省级政务云厂商,总监挺兴奋地给我看大屏:他们的政务 Agent 在 GAIA 榜单拿了 60 多分。我问他一句:“那你敢让它在你们市的 12345 热线独立派单吗?”他沉默了几秒,说“还在灰度”。
这几秒沉默,比那个 60 分更说明问题。互联网那套考卷测的是能力上限,政企要的是上岗资格。把通用榜分数直接拿来验收,就像用科目一满分判断一个人会不会开公务车——不代表他不会在十字路口把领导甩出去。
政企评测得看四件事。前两件是能不能做、稳不稳。后两件才是命门:敢不敢用、值不值这个钱。技术方自己定的成功标准,居然只是“接口返回 200”,结果 Agent 把错误请求也返回了 200,上线一个月才被业务方发现。
强流程场景里,偏离审批链路的“聪明路径”一律判失败。一笔补贴跳过二级审批直接发了,哪怕数字对、群众满意,在政务系统里也是违规。评测报告不是 QA 测试单,它是要拿去给审计和网信办交差的治理凭证。
下次有人拿 GAIA 分数汇报,你先别鼓掌。问他三句:这分能拿去给等保测评老师看吗?能给审计看吗?能给市民看吗?
原文政企 Agent 评测:从"能不能做"到"敢不敢上岗"