阿里把 Qwen3.8-Max 推上了视觉排行榜第二。它身后只差 13 分,就是 Anthropic 的 Fable 5。可这 13 分到底意味着多大差距,榜本身没说清楚。

图注:Vision Arena 排行榜截图。Fable 5(High)以 1318 分居首。Qwen3.8-Max 1305 分排第二,第三名 Opus 4.7 Thinking 1303 分。13 分差距落在 1250 到 1340 刻度里,肉眼几乎贴在一起。
排行榜用 ELO 计分。这套尺子是相对的:分差 100 分,大约对应 64 对 36 的胜率。
照这个算法,13 分对应的人对人胜率大约是 52 比 48。让两者正面对决一百次,前者赢 52 次,后者赢 48 次。
这已经接近抛硬币。评论区有人直接算出了这个数字,比官方的「仅差 13 分」更诚实。
ELO 测的是相对强弱,不是绝对能力,靠两两对决慢慢攒分,样本有限时误差本就不小。
所以别被排名顺序带节奏。第二名和第一名之间,不是一座山,是一道门槛。
榜单实拍显示,Fable 5(High)以 1318 分居首。Qwen3.8-Max 1305 分排第二,第三名 Opus 4.7 Thinking 1303 分。
前三名挤在 15 分以内。往下看,Anthropic 的 Opus 4.6、4.7,Google 的 Gemini 3,Meta 的 Muse Spark 都在榜上。OpenAI 的 GPT-5.5、5.6,xAI 的 Grok-4.5 也进了前二十。
这不是一家独大,而是一群模型贴在一起跑。Fable 5 领先,但领先得并不宽。
往前看一代,Qwen3.7-Max 在同榜的位置低得多。这一跳直接从后面蹿到了第二。
市场把这张榜当成了信号。阿里股价在消息后一度涨了 5.4%。
Qwen3.8-Max 是阿里要开源权重的旗舰模型。参数规模 2.4 万亿,开发者能下载下来自己改。
它支持图像、视频和文档输入输出,在 7 月 19 日世界人工智能大会的预览版登场,定位就是「仅次于 Fable 5」。
Fable 5 是闭源前沿参考模型,不开放权重。开放权重模型第一次贴到闭源最前沿的身位,这件事比 13 分更值得记住。
Qwen 系列一直走开放权重路线。此前开源旗舰最高也就是追到闭源后面一截,这一次,它把距离压到了 13 分。
但它的开源权重还没放出确切日期和许可证条款。阿里只说计划开源,具体何时、何种授权,仍是空白。
旁注:预览版发布时,没有放出完整的模型卡和基准文档。多家媒体指出,直到 Vision Arena 打分前,还没有独立榜单给过它分数。目前「第二」只立在一张榜上。
Vision Arena 测的是人类在视觉任务上的偏好,还切了「风格可控」这一档。榜单左上角写明,分数是在风格控制开启下算的。
打分来自真实用户给两张模型输出投票,谁赢谁加分,不是做题得分。它是一个真实信号,但只覆盖「人觉得哪张图更好看、哪段视觉理解更对」这一类任务。
这类榜会公布置信区间,前三名的区间往往重叠,统计意义上算平手。所以 13 分更像「同一档」,不是「差一档」。
阿里还说 Qwen3.8 整体逼近 Fable 5,这个说法目前还是自家陈述,没有被独立验证。看榜可以,别把榜当成全部能力。
榜单下面,反应分成两路。一路在高呼加速度,「碾压还会继续,直到士气崩掉」是其中一种情绪。
另一路在算账:13 分约等于 52 对 48,几乎平手。算账的人,比只喊庆祝的人更早看清这块牌子的分量。
还有人提醒,预览版不等于正式版,正式发布后分数可能还会动。这份克制,刚好接住了排行的热度。
如果你要的是能下载、能改、价格激进的开源权重,Qwen3.8-Max 现在就是第一梯队的选择。
比价数据里,它的预览期入门价远低于 Fable 5 的每百万词元 10 美元输入、50 美元输出。
要最高分闭源加成熟接口,Fable 5 仍是头名。两者只差 13 分,小到你的真实任务该自己跑一遍再定。
排行榜替你筛人,不替你做决定。把候选拉到你的真实任务上,看返工率和花销,比盯分数更实在。
所以这张榜真正的价值,是提醒你该自己跑一遍了。
来源:Arena.ai 官方 Vision Arena 排行榜。Quartz。SiliconANGLE。