大模型幻觉怎么评测?
AI说得流畅,不代表事实正确。
一套完整的大模型幻觉评测,需要经过:
设计测试问题
↓
获取模型回答
↓
拆成原子事实
↓
查找可靠证据
↓
标注错误类型
↓
汇总评测指标
重点检查5项指标:
01|事实正确率
模型说出的可核验事实,有多少得到可靠证据支持?
02|引用准确率
已经给出的引用,是否真正支持对应结论?
03|引用完整率
需要证据的重要陈述,有多少获得来源覆盖?
04|拒答合理性
资料不足时,模型能否承认不知道,而不是继续猜测?
05|重复运行稳定性
同一个问题多次测试,关键事实和引用是否保持一致?
关键结论:会回答多少,不等于回答得多可靠。
配套文章已完整拆解评测流程、计算方法与常见误区。