给你的法律 Agent 搭一套可量化的评测系统
最近给法律 Agent 搭工作台,提示词改了一版又一版。今天清单细了,明天引条准了,可整体到底变好没?全凭印象,根本答不上来。
后来我给自己磨了把尺子:一套场景分、一套行为分,再加个锁死的答案键。跑完盲测,19 件产物拿了 103 分。这才发现漏得离谱——违约金只盯住甲方,没算乙方的封顶护身符;日千分之五的费率,也没换算成年化 182.5% 摆出来。
更扎心的是跨场景一致性专检。客户底线是至少收回 12 万,模型推演后居然悄悄降到了 6 到 9 万。单看每份文书都没毛病,拉平全案才发现它在偷偷动客户的授权。按规矩,这项不过,整期分数直接作废。
修完重跑,又冒出个尴尬事:10 个评分点根本没法评。测试输入里压根没埋这些坑,答案键却写着该扣分。原来尺子刻度自己都糊了,量出来的数怎么能拿去比?
现在我只认一条死理:改完代码必须重新量。量过之后,至少知道该改哪,也知道改完有没有真变好。
原文给你的法律 Agent 搭一套可量化的评测系统,改完才知道是不是真的变好了