[手扎] 模型评测/自动化测试UI & API : lay
做 Agent 评测,最卡人的从来不是让它跑起来,而是跑完之后谁来判。规则匹配太死板,大模型当评委又贵又慢,中间其实缺个本地离线的小裁判。
我实测了 laya,一个 322M 的本地判定器。它跑在本地,不用联网按 token 花钱,装好就能用。底层是个带分类头的网络,能直接吐出概率,还能导出纯 embedding 做对比。
拿客服场景一测,它判断“是否承诺退款”特别准,但意图识别容易混,细粒度打分信心也不够。跟纯相似度比,它的分类头准确率更高,但也不是稳赢。
把它接进自动化测试,最适合叠三层:关键词快检挡明显情况,laya 补上语义变体,置信度不够就人工兜底。它虽然能力还浅,但只要置信度诚实,就能在大模型旁边干点稳定、高频的脏活。
原文[手扎] 模型评测/自动化测试UI & API : laya判定器-从安装到实测的一轮完整探索