VLM 效果差,先查数据与评测
专栏:前沿直译
VLM 效果不理想时,常见操作是更换更大底座、延长训练或调整学习率。在实际项目中,更常见的原因是:问题尚未被正确定义,数据和评测环节先出现了偏差。
下面将「效果差」拆成可排查的问题结构。
一、先区分「差」的类型
至少可分成 4 类,不宜混在一起讨论:
- 2. 短图问答尚可,复杂图/多图较差(视觉编码与融合问题)
- 3. 回答流畅,但事实错误较多(幻觉/拒答校准问题)
- 4. 离线指标较高,线上表现较差(评测与真实分布不一致)
类型不同,后续优化方向也不同。
二、数据侧的高发问题
1)图文对齐质量不足
常见情况:
结果是:模型更容易学到共现统计,而不是可靠的视觉理解。
2)指令数据覆盖不足
数据规模看起来很大,但实际可能出现:
规模不等于覆盖。覆盖不足时,能力分布会不均衡。
3)捷径标注过多
例如:
此时模型可能主要表现为「会做题的语言模型」,而非稳定依赖视觉输入。
4)长尾与安全数据缺失
医疗、单据、小语种、模糊图、对抗样本、敏感内容等分布不足时,常见现象是:演示场景表现好,边界场景下降明显。
三、评测侧的高发问题
1)评测集泄漏
训练语料或指令数据中混入评测题,或存在高度相似改写。常见表现:公开榜表现好,更换同分布新集后下降明显。
2)只看综合分
若缺少分项观察,短板容易被平均分掩盖。常见分项包括:
3)自动指标与人工判断不一致
生成式任务中,BLEU/CIDEr 等指标较高,并不必然对应更高可用性。多模态场景通常更依赖:正确性、完整性、是否真正使用图像、是否编造内容。
4)评测协议不固定
温度、提示词、是否允许工具、是否多轮等因素变化时,分数波动可能很大。协议不固定时,难以判断提升来自模型能力,还是来自评测变松。
四、较常见的排查顺序
一个可复用的顺序是:
- 1. 抽取 50–100 条失败案例,按类型归类(幻觉/看错/推理失败/指令跟随失败)
- 2. 核对训练数据中同类样本占比,判断是否存在系统性缺失
- 3. 做捷径测试:遮挡图像、打乱图像、仅保留文本,观察准确率变化
- 4. 建立最小分项评测集(每类 100–300 题通常已可用于早期迭代)
若前三步已能解释大部分失败,优先改数据与评测,通常比直接换底座更有效。
五、对工作产出的含义
在面试或项目汇报中,较有信息量的描述通常包括:
相比「会跑开源训练脚本」,「问题定义 + 证据链」在多模态岗位中通常更关键。
六、一个可落地的检查动作
若当前正在做 VLM,可建立一版失败案例记录:
20 个真实坏例 + 错误类型标签 + 对应数据缺口假设
该记录通常能直接决定后续实验优先级。