数据统计时间:2026年8月14日
什么是"智商"?
这里的"智商"指 Artificial Analysis Intelligence Index,一个综合性的语言模型智能评估指数。该指数综合了 9 个权威评测基准,覆盖四大能力维度:
| | |
|---|
| 智能体(Agent) | | GDPval-AA v2(真实知识工作)、𝜏³-Banking(金融客服) |
| 编程(Coding) | | Terminal-Bench v2.1(终端操作)、SciCode(科学计算) |
| 科学推理 | | HLE(人类终极考试)、GPQA Diamond(研究生级问答)、CritPt(前沿物理) |
| 通用能力 | | AA-LCR(长文本推理)、AA-Omniscience(知识准确性) |
指数不是跑几个选择题,而是让模型真正干活——写代码、处理客服、做物理题、读长文档——然后综合打分。分数越高代表模型越"聪明"。
TOP 25 排行
| | | |
|---|
| | 63 | |
| | 63 | |
| Claude Fable 5 (with fallback) | 62 | |
| | 61 | |
| | 61 | |
| | 61 | |
| | 60 | |
| | 59 | |
| | 59 | |
| | 58 | |
| | 58 | |
| | 57 | |
| | 57 | |
| | 57 | |
| | 56 | |
| | 56 | |
| | 56 | |
| | 55 | |
| Gemini 3.7 Flash (medium) | 53 | |
| DeepSeek V4 Pro 0813 (max) | 53 | |
| | 53 | |
| | 53 | |
| | 52 | |
| | 52 | |
| DeepSeek V4 Flash 0731 (max) | 52 | |
TOP 7 模型详情
1️⃣ Claude Opus 5 (max / xhigh) — 63 分,登顶
Anthropic 的旗舰模型,两种推理档位并列第一。
3️⃣ Claude Fable 5 (with fallback) — 62 分
上月的第一名,本月被同门 Opus 5 反超 1 分。
4️⃣ GPT-5.6 Sol (max) — 61 分
OpenAI 的编程旗舰,与 Opus 5 (high) 和 Grok 4.6 并列第四。
4️⃣ Grok 4.6 (high) — 61 分,空降
本月最大黑马。 xAI 的 Grok 4.6 发布后直接进入第一梯队,追平 GPT-5.6 Sol(61 分)。8 月 12 日 Artificial Analysis 发文称其"回到智能前沿,并在成本效率上领先"。
7️⃣ Kimi K3 (max) — 60 分
国产模型最高分。
榜单主要变化
Grok 4.6 空降前三
xAI 的 Grok 4.6(high 模式)拿 61 分,追平 GPT-5.6 Sol。此前 4.5 版本的成绩是 56 分,这一代涨了 5 分。速度 65 tok/s。
Qwen3.8 系列进入前十
阿里 Qwen3.8 Max 和 Qwen3.8 2.4T A95B 均拿 58 分,并列第十,是继 Kimi K3 之后国产模型的新势力。
DeepSeek V4 Pro 0813 正式版上线
DeepSeek V4 Pro 的 8 月 13 日版本(0813)正式评测上线,拿 53 分,比 7 月的 V4 Pro Preview(44 分)涨了 9 分。V4 Flash 0731 保持 52 分。
Gemini 3.7 Flash 更新
Google 的 Gemini 3.7 Flash(high 模式)拿 56 分,从中档的 50 分左右上涨。它最突出的数据是速度——340 tok/s,全球第一,是第二名(Gemini 3.7 Flash medium 274 tok/s)之后断崖式领先。medium 档也有 53 分、274 tok/s。
MiniMax-M3 不在本榜单前列
上月在榜的 MiniMax-M3(45 分)本次未进入前 25 显示范围。