多模态评测系列(一)四类评测对象,仿文本
一个多模态模型在文本问答集上拿了 90 分,客服看图回货照样指鹿为马。分是真的,不能用也是真的。
问题出在评测对象错位了。纯文字评测只看最终文字答案,用字符串精确匹配。可多模态输入是图、视频甚至音频,输出可能是边界框、分割掩码或一张生成图。只比对文字,会漏掉大部分错误。
评多模态得换四把尺子。判据要语义等价,不能死磕字面;位置和先后顺序必须算分;还得单列幻觉率,专门抓它无中生有。输出是框还是图,就得用对应的几何指标量。
早期我们拿精确匹配评商品图问答,标准答案写“白色运动鞋”,模型答“一双白色的跑步鞋”被判错。人工一看完全对。那版评测把三成正确回答打了零分,模型团队硬被假指标带偏调坏了。
所以评测集每条得多带图和空间标注,评分卡得多一列语义匹配和幻觉率。裁判得看图,不能只看字。
原文多模态评测系列(一)四类评测对象,仿文本测不出真本事