当前位置:首页>排行榜>大模型智商排行榜:Claude Opus 5 登顶,Grok 4.6 空降前三

大模型智商排行榜:Claude Opus 5 登顶,Grok 4.6 空降前三

  • 更新时间 2026-08-14 19:57:20
大模型智商排行榜:Claude Opus 5 登顶,Grok 4.6 空降前三

数据统计时间:2026年8月14日

什么是"智商"?

这里的"智商"指 Artificial Analysis Intelligence Index,一个综合性的语言模型智能评估指数。该指数综合了 9 个权威评测基准,覆盖四大能力维度:

维度
权重
包含评测
智能体(Agent)
34%
GDPval-AA v2(真实知识工作)、𝜏³-Banking(金融客服)
编程(Coding)
24%
Terminal-Bench v2.1(终端操作)、SciCode(科学计算)
科学推理
24%
HLE(人类终极考试)、GPQA Diamond(研究生级问答)、CritPt(前沿物理)
通用能力
18%
AA-LCR(长文本推理)、AA-Omniscience(知识准确性)

指数不是跑几个选择题,而是让模型真正干活——写代码、处理客服、做物理题、读长文档——然后综合打分。分数越高代表模型越"聪明"。


TOP 25 排行

排名
模型
智能指数
速度(tok/s)
1
Claude Opus 5 (max)
63
53
1
Claude Opus 5 (xhigh)
63
53
3
Claude Fable 5 (with fallback)
62
62
4
Claude Opus 5 (high)
61
52
4
GPT-5.6 Sol (max)
61
62
4
Grok 4.6 (high)
61
65
7
Kimi K3 (max)
60
40
8
GPT-5.6 Sol (xhigh)
59
60
8
Claude Opus 5 (medium)
59
53
10
Qwen3.8 Max
58
47
10
Qwen3.8 2.4T A95B
58
50
12
GPT-5.6 Sol (high)
57
56
12
Muse Spark 1.2 (xhigh)
57
--
12
GPT-5.6 Terra (max)
57
115
15
Gemini 3.7 Flash (high)
56
340
15
Grok 4.5 (high)
56
60
15
GPT-5.6 Sol (medium)
56
62
18
Claude Sonnet 5 (max)
55
66
19
Gemini 3.7 Flash (medium)
53
274
19
DeepSeek V4 Pro 0813 (max)
53
83
19
GPT-5.6 Terra (xhigh)
53
97
19
GLM-5.2 (max)
53
116
23
Claude Opus 5 (low)
52
52
23
GPT-5.6 Luna (max)
52
155
23
DeepSeek V4 Flash 0731 (max)
52
120

TOP 7 模型详情

1️⃣ Claude Opus 5 (max / xhigh) — 63 分,登顶

指标
max
xhigh
智能指数
63
63
输出速度
53 tok/s
53 tok/s

Anthropic 的旗舰模型,两种推理档位并列第一。

3️⃣ Claude Fable 5 (with fallback) — 62 分

指标
数据
智能指数
62
输出速度
62 tok/s

上月的第一名,本月被同门 Opus 5 反超 1 分。

4️⃣ GPT-5.6 Sol (max) — 61 分

指标
数据
智能指数
61
输出速度
62 tok/s

OpenAI 的编程旗舰,与 Opus 5 (high) 和 Grok 4.6 并列第四。

4️⃣ Grok 4.6 (high) — 61 分,空降

指标
数据
智能指数
61
输出速度
65 tok/s

本月最大黑马。 xAI 的 Grok 4.6 发布后直接进入第一梯队,追平 GPT-5.6 Sol(61 分)。8 月 12 日 Artificial Analysis 发文称其"回到智能前沿,并在成本效率上领先"。

7️⃣ Kimi K3 (max) — 60 分

指标
数据
智能指数
60
输出速度
40 tok/s

国产模型最高分。


榜单主要变化

Grok 4.6 空降前三

xAI 的 Grok 4.6(high 模式)拿 61 分,追平 GPT-5.6 Sol。此前 4.5 版本的成绩是 56 分,这一代涨了 5 分。速度 65 tok/s。

Qwen3.8 系列进入前十

阿里 Qwen3.8 Max 和 Qwen3.8 2.4T A95B 均拿 58 分,并列第十,是继 Kimi K3 之后国产模型的新势力。

DeepSeek V4 Pro 0813 正式版上线

DeepSeek V4 Pro 的 8 月 13 日版本(0813)正式评测上线,拿 53 分,比 7 月的 V4 Pro Preview(44 分)涨了 9 分。V4 Flash 0731 保持 52 分。

Gemini 3.7 Flash 更新

Google 的 Gemini 3.7 Flash(high 模式)拿 56 分,从中档的 50 分左右上涨。它最突出的数据是速度——340 tok/s,全球第一,是第二名(Gemini 3.7 Flash medium 274 tok/s)之后断崖式领先。medium 档也有 53 分、274 tok/s。

MiniMax-M3 不在本榜单前列

上月在榜的 MiniMax-M3(45 分)本次未进入前 25 显示范围。

最新文章

随机文章