当前位置:首页>排行榜>8月多模态视觉测评榜单出炉:Qwen3.8-max问鼎国内榜首,GPT-6-Astra总榜领先!

8月多模态视觉测评榜单出炉:Qwen3.8-max问鼎国内榜首,GPT-6-Astra总榜领先!

  • 更新时间 2026-09-19 09:22:38
8月多模态视觉测评榜单出炉:Qwen3.8-max问鼎国内榜首,GPT-6-Astra总榜领先!
当前,多模态理解模型能力持续迭代升级,为跟进代表性主流多模态模型在中文场景下的综合性能发展,我们正式发布2026年9月SuperCLUE‑VLM 中文多模态视觉语言模型测评榜单。
本次评测覆盖了国内外15个代表性视觉语言大模型,以下为详细测评结果及分析。

「过往文章介绍

1.【2026年6月多模态视觉语言测评文章6月多模态视觉测评榜单出炉:Qwen3.7-Plus问鼎国内榜首,Gemini 3.1保持总榜领先!

2.【2026年4月多模态视觉语言测评文章】4月多模态视觉测评榜单出炉:Doubao-Seed-2.0问鼎榜首,国内模型大放异彩!

多模态视觉语言模型测评摘要

摘要1:GPT-6-Astra总榜强势领跑,Qwen3.8-max-0902问鼎国内第一
OpenAI的GPT-6-Astra(83.90分)夺得总榜第一,阿里巴巴的Qwen3.8-max-0902(76.45分)位居国内第一、总榜第三。字节跳动的Doubao-Seed-2.1-Pro(73.84分)与月之暗面的Kimi-K3(73.80分)并列国内第二,海内外头部模型比分胶着,国内模型已稳居多模态赛道第一梯队。
摘要2:开源模型突围,Kimi-K3并列国内第二!
本次参测的10款国内模型中,7款为开源模型。其中月之暗面的Kimi-K3(开源,73.80分)Doubao-Seed-2.1-Pro(闭源,73.84分)并列国内第二,智谱AIGLM-5.3-flash(开源,69.94分)位居国内第三。开源模型整体表现亮眼,国产开源多模态力量正在加速追赶闭源旗舰。

摘要3:子榜格局分化,视觉应用成分水岭,智能交互成最突出短板!

础认知与视觉推理榜单榜首模型均已接近或超过85分,而视觉应用能力榜单最高仅76.58Gemini-3.8-Flash),整体明显弱于前两个维度;进一步下钻子任务,安全风控子任务表现成熟(多家100分),行业应用多数模型得分在60—75分之间,而智能交互子任务各模型得分普遍低于70,面向真实业务场景的交互与落地能力,是各模型下一步重点突破的方向。
# 榜单概览

榜单地址:www.superclueai.com  

# SuperCLUE-VLM测评体系
SuperCLUE-VLM 是一个专为中文多模态视觉语言模型设计的评测基准,旨在为中文多模态大模型领域提供全面且多维的视觉语言能力评估参考。详细的任务描述可以回顾:中文多模态视觉语言模型8月测评报告,8月28日发布!
测评方法
 参考SuperCLUE细粒度评估方式,构建专用测评集,每个维度进行细粒度的评估并可以提供详细的反馈信息。
1.测评集构建
多模态视觉语言模型测评中文题库的构建流程如下:
 1.根据任务类型,搜集、整理并制作相关图片--->
 2.中文prompt撰写--->
 3.开展样例测试,收集反馈数据--->
 4.基于测试结果优化完善中文prompt--->

 5.系统化构建各维度专属评测集,形成完整测评题库。

2.评分方法
本次评测以回答准确性作为唯一评估指标,针对不同任务类型设计差异化评分框架:
  • 对于绝大多数通用任务,所有测试用例均配备标准参考答案,通过模型输出与参考答案的一致性判定回答正确性

  • 针对代码生成任务,仅凭图片解析难以得出唯一最优解(如CSS样式、排版格式无统一标准),采用自动化评价流程:满足任务核心需求、逻辑自洽的生成结果判定为正确,错误率较高、存在严重逻辑缺陷或不满足任务要求的结果判定为错误。

为了确保评估的科学性和公正性,我们采用评价模型,将模型的回答与参考答案进行对比,从而判断其正确性。应用这种方式,尽量减少人为因素的干预,确保评分结果的客观性和一致性。

评估示例

【维度】:基础认知能力—通用识别
【测评任务】:3D物体识别
【问题】:「请问图中共有几个瑜伽球?」

参考答案】:3个

模型回答】:
图里真实存在的瑜伽球共有3个:1个粉色、1个黄色、1个蓝色,剩余的1个黄色、1个蓝色,是右侧墙面镜子反射形成的虚像,不属于真实存在的球。

答案:3个。

模型裁判
****评价开始****

1. **模型回答的核心内容分析**:

模型明确回答图中共有3个真实的瑜伽球,并详细解释了颜色的分布(粉、黄、蓝各一个)。同时,模型展现了对图像场景的深度理解,指出画面中另外出现的球体是镜面反射形成的虚像,不应计入总数。

2. **参考答案的核心内容分析**:

参考答案给出的核心数值为“3个”。

3. **模型回答与参考答案的详细对比**:

- **核心结论一致性**:模型给出的最终数量“3个”与参考答案完全一致。

- **关键信息点**:模型不仅提供了正确答案,还通过逻辑推理(区分实物与镜面虚像)解释了得出该答案的原因。这种解释增强了回答的准确性,并未改变或偏离参考答案的核心语义。

- **表述差异**:模型回答包含了详细的推理过程,而参考答案仅提供了精简的数值。根据评估要求第3点,这种表述形式的差异(详细描述 vs 简洁数值)不影响核心事实的认定。

4. **最终判定及理由**:

[[回答正确]]

理由:模型给出的核心答案(3个)与参考答案完全一致。模型通过识别镜面反射准确判断了物体的真实数量,其提供的额外解释信息支持了核心结论的正确性,没有事实性错误。

****评价结束****

# 参评模型

为综合衡量当前国内外多模态视觉语言模型的发展水平,本次测评选取了5个海外模型和10个国内代表性模型。
测评结果
# 总榜
基础认知能力榜单
视觉推理能力榜单
视觉应用能力榜单

# 模型对比示例

#示例1 基础认知能力-信息解析-特征定位

【问题】:「如图所示为堆叠的方块,规定三维坐标系为X左右方向,Y向上正方向、向下负方向,Z前后方向。如果A方块坐标为(-4,-2,3),C方块坐标为(-2,-2,1),那么B方块坐标是什么?(以相同的格式回答)

【参考答案】:「(-2, 0, 3)

【GPT-6-Astra答情况】:正确
(-2,0,3)
【GLM-5.3-flash回答情况】:错误
通过分析 A 方块和 C 方块的坐标,以及两者在网格中的相对位置,可以确定 B 方块的坐标。

1. 确定 X 轴和 Z 轴坐标

  • C 方块的坐标为 (-2,-2,1)

  • A 方块的坐标为 (-4,-2,3)

  • 根据 A、C 两个方块在网格中的相对位置,可以判断:B 方块所在的立柱位于 C 方块的正后方,并且与 C 方块处于同一条 X 轴直线上

  • 因此,B 方块底部支撑方块的:

    • X 坐标与 C 方块相同,即 X = -2

    • Z 坐标比 C 方块向后移动 2 个单位,即从 Z = 1 移动到 Z = 3

所以,B 方块的 X、Z 坐标分别为 -2 和 3

2. 确定 Y 轴坐标

  • C 方块位于地面层,Y 坐标为 -2

  • B 方块位于地面上方一层,并且 Y 轴正方向表示向上

  • 每向上一层,Y 坐标增加 1,因此:

Y=2+1=1Y=-2+1=-1

3. 得出 B 方块坐标

综合 X、Y、Z 三个方向的坐标变化,可以确定:

B=(2,1,3)\boxed{B=(-2,-1,3)}

因此,B 方块的坐标为(-2,-1,3)


#例2 视觉推理能力-应用推理-时序推理

【问题】:「请将图中 "拉狗狗滑旱冰" 的故事按正确时间顺序从左到右排序。(数字标识,用,分割)

【参考答案】:「5,4,2,6,1,3」

【Gemini-3.8-Flash回答情况】:正确
正确的时间顺序为:5, 4, 2, 6, 1, 3

故事逻辑如下:

  • 5:男孩在家看电视里的滑水表演,由此产生灵感。

  • 4:男孩在家里穿好旱冰鞋,准备让狗狗拉着自己滑。

  • 2:男孩在公园里让狗狗拉着滑旱冰,玩得很开心。

  • 6:狗狗突然发现前面有一只黑猫,猛地向前冲去追猫。

  • 1:男孩失去平衡,被突然加速的狗狗拽得踉跄摔倒。

  • 3:男孩摔在地上,身上弄脏受了伤,狗狗坐在旁边看着他。

【DeepSeek-V4.1-Flash回答】:错误
观察各图内容:
  • 图5:男孩在看电视,狗趴在一旁睡觉——故事的开头。

  • 图4:男孩坐在凳子上穿旱冰鞋,准备出门。

  • 图2:男孩穿着旱冰鞋,牵着狗在路上正常滑行。

  • 图1:狗突然向前冲(追猫),男孩被猛地一拉,身体前倾、站立不稳。

  • 图6:男孩被狗拖着走,画面中只剩下一只拉绳子的手,说明他已摔倒被拖行。

  • 图3:狗停下来,男孩坐在地上,狗坐在他旁边——故事的结尾。

归纳顺序: 先在家看电视(5)→ 穿旱冰鞋(4)→ 出门牵狗滑旱冰(2)→ 狗突然奔跑,男孩被拉得失去平衡(1)→ 男孩摔倒被拖行(6)→ 狗停下,男孩坐在地上(3)。

因此,答案是5,4,2,1,6,3


#示例3视觉应用能力-智能交互-图形界面理解

【问题】:「首先点一份泡椒鹌鹑蛋,然后再点一份面食,最后再结算,需要按顺序点击哪些控件来进行?(结果返回序号即可,用“、”隔开)」

【参考答案】:「3、2、10」

【Gemini-3.8-Flash回答情况】:正确

按顺序需要点击的控件序号为:3、2、10

【Muse-Spark-1.3回答情况】:错误

3、2、3、10


# 测评分析及结论

1GPT-6-Astra问鼎总榜,Qwen3.8-max-0902引领国产模型。

OpenAI的GPT-6-Astra(83.90分)夺得总榜第一,并在基础认知能力(89.29分)、视觉推理能力(88.98分)两个子榜均列第一,综合实力全面领先。阿里巴巴的Qwen3.8-max-0902(76.45分)位居国内第一、总榜第三;字节跳动的Doubao-Seed-2.1-Pro(73.84分)与月之暗面的Kimi-K3(73.80分)并列国内第二。海内外头部模型呈现胶着态势,以千问、豆包、Kimi为代表的国内模型,在综合能力上与海外巨头已形成分庭抗礼。
2. 视觉应用能力成为头部模型的分水岭,智能交互成最突出短板。

基础认知能力子榜,GPT-6-Astra(89.29分)领跑,国内Qwen3.8-max-0902(81.75分)与Doubao-Seed-2.1-Pro(80.95分)并列国内第一;视觉推理能力子榜,GPT-6-Astra(88.98分)第一,Anthropic的Claude Fable 5.1(83.04分)、Google的Gemini-3.8-Flash(82.31分)紧随其后,国内Qwen3.8-max-0902(79.23分)、Kimi-K3(78.28分)跻身总榜前五。而在视觉应用能力子榜,头名Gemini-3.8-Flash(76.58分)也仅处于70分段,国内Doubao-Seed-2.1-Pro(69.90分)位居国内第一。视觉应用能力整体弱于前两个维度,正成为头部模型拉开差距的关键战场。

进一步下钻到子任务层面:安全风控子任务上,GPT-6-AstraGemini-3.8-Flash均拿到100分,多家国内模型达到85.71分,表现相对成熟;行业应用子任务上,头名Claude Fable 5.180.56分)也仅处于80分段,多数模型得分在60—75分之间;而智能交互子任务整体得分偏低,除Gemini-3.8-Flash66.67分)外,多数模型得分在25—60分之间,图形界面理解与具身智能规划仍是行业性难点。三大子任务横向对比,智能交互已成为视觉应用能力中最突出的短板。总体而言,基础感知与推理能力已趋于成熟,而面向真实业务场景的交互与落地能力,是各模型下一步重点突破、持续优化的核心方向。
3. 开源模型表现亮眼,国产开源力量加速崛起。

本次参测的10款国内模型中,7款为开源模型。月之暗面的Kimi-K3以开源身份拿下73.80,与闭源的Doubao-Seed-2.1-Pro并列国内第二,其视觉推理能力(78.28分)位居国内前二;智谱AIGLM-5.3-flash69.94分)位居国内第三;阶跃星辰Step 3.7 Flash60.41分)、深度求索DeepSeek-V4.1-Flash56.49分)、小米MiMo-V2.555.57分)等开源模型亦全部进入国内榜单前列。国产开源多模态模型已具备与闭源模型正面竞争的实力。

# 加入社群

扩展阅读

[1] CLUE官网:www.CLUEBenchmarks.com

[2] SuperCLUE排行榜网站:www.superclueai.com

[3] Github地址:https://github.com/CLUEbenchmark

随机文章