7 月底再问「谁第一」,答案已经不能只甩一个名字。闭源侧 Opus 5 把 Intelligence Index 顶到 61,开源侧 Kimi K3 权重落地后打到 57。两边只差 4 分,是 Artificial Analysis 自己写的「自 2 月 GLM-5 以来最小差距」。
今天是 2026 年 7 月 29 日。本文主轴是 Artificial Analysis 的 Intelligence Index(综合推理、知识、agent 等任务的独立评测),数字来自该站实时榜与其官方 X 说明。人类偏好 Arena、厂商自家表、编码专项榜会另说,混成一张「总冠军」表会骗人。
Artificial Analysis LLM Leaderboard 页面摘要,Intelligence 区点名 Opus 5 / Fable 5 / Sol综合智能榜,现在长什么样
按 AA 榜「当前模型 + 推理档」排序,旗舰一档可以压成下面这张简化表(同模型不同 effort 在原榜会占多行,这里只取代表档)。
| | | | |
|---|
| | 61 | | |
| Claude Fable 5(max,含 fallback) | 60 | | |
| GPT-5.6 Sol | 59 | | |
| Kimi K3 | 57 | 开源权重 | |
| | | | |
| Grok 4.5 | 54 | | |
| GLM-5.2 | 51 | | |
| DeepSeek V4 Pro | 44 | | |
Intelligence Index 一览示意,闭源前三与 Kimi K3读表时有三条硬注意。
第一,effort 就是另一张榜。 Opus 5 的 max / xhigh / high / medium / low 在 AA 上从 61 一路掉到 51 附近。Sol 同样有 max 到 low。你只订「Opus 5」却用默认档,体感和「榜一」可能对不上。
第二,Price 列是「每任务成本」一类合成指标,不是单纯 $/MTok。 榜上 Fable、Sol max 往往又贵又慢(端到端响应时间很长),Opus 5 high 一类档位在智能略降的同时把任务成本压下来,这正是 Anthropic 想卖的「半价追尖端」叙事。
第三,开源≠随便商用。 Kimi K3 权重公开,AA 标注为 Commercial Use Restricted。大营收 MaaS、超大 MAU 产品要另谈授权或品牌露出,写进对比时别写成纯 MIT。
开源这条线,真正的变化是「贴身」
AA 在 7/27–28 连续发帖,口径很清楚。Kimi K3 权重放出后,开源权重第一落到 57,闭源顶尖在 59–61。闭源与开源只差 4 分。
此前开源常见对标是 GLM-5.2(约 51)、DeepSeek V4 Pro(约 44)。K3 一跳,把「开源只能打第二梯队」的说法往前推了一大截。代价也写在账单上。2.8T MoE、推荐 64 卡级 supernode、API 输出并不便宜。多数团队会先用托管 API / Day-0 云,而不是本地起全量。
Qwen3.7 Max 不要写进开源榜。 带 Max/Plus/Turbo 的阿里商业档是闭源 API。开源的是 Qwen3 系 dense/MoE 权重线。综合榜混排时最容易踩这个坑,读者会当场抓包。
人类偏好 Arena,未必跟 AA 同一张脸
LMArena 一类盲测榜更看「人觉得顺不顺」。公开摘要里常见 Fable 5、Sol、K3 在文本或 WebDev 上互有胜负。Opus 5 上线晚,Arena 票数与稳定名次可能滞后于 AA 跑分。
所以会出现很拧巴的产品事实。
- 人感 / 编码专项 仍有人把 Fable 或 Sol 当主力
- 开源可下载 只有 K3 这类权重线能进「自托管」讨论
没有一张表能同时回答「最聪明、最好用、最便宜、能私有化」。
AA 自己还在同一页面上拆了 Output Speed、Latency、Cost per Task、Context Window。智能第一的模型,延迟和每任务成本往往难看。Flash 线、小参数开源、Scout 一类会在速度与成本榜上翻身。把「智能榜截图」当成唯一选型依据,会系统性高估贵而慢的旗舰。
价格与 API,别只看标价
粗对照(每百万 token 量级,以厂商公开档与媒体汇总为准,写稿日可能已变)。
- Opus 5 与 Opus 4.8 同档思路,输入输出大约 $5 / $25 一带,相对 Fable 常被描述为「半价尖端」
- GPT-5.6 Sol 常见 $5 / $30 量级叙事,具体以 OpenAI 价卡为准
- Kimi K3 官方 API 曾标 cache hit 输入约 $0.30、miss $3、输出 $15(coding 高 cache 时更香)
- Grok 4.5 曾以 $2 / $6 一类性价比档出现在报道里
AA 表上的「Price」列还会把任务长度、重试、thinking token 揉进 per-task 成本。所以会出现 Sol max 智能 59、任务成本却比 Opus high 更难看的情况。选型时至少同时看 标价 + 你的真实轨迹长度。
按场景选,比背名次有用
| | |
|---|
| Opus 5(先 medium/high,再拧 max) | |
| | |
| | |
| | |
| Grok 4.5、Gemini Flash 线、中小开源 | |
| | 例如 DeepsecBench、语音 STS 榜已是另一赛道 |
Grok 4.6 / 4.7 还在马斯克个人时间表上(约 8 月初与之后几周),未进本稿 AA 榜。GPT-6 无官方发版日。下一版排行会重写,但不会取消「多榜 + 多档 effort」这个读法。
语音、图像、安全扫描已经是平行宇宙。例如 AA 的 Speech to Speech 上,阿里 Qwen Audio 实时档可以单独登顶,这和文本 Intelligence 完全不是一张表。做语音客服的人照抄 Opus 5 名次,会选错工具。
这张榜怎么用才不傻
把 Intelligence Index 当地图,不当判决书。
- 先定任务类型(聊天、编码 agent、长文、私有化)。
- 再定预算(token 单价 + 每任务成本 + 延迟)。
- 最后才看名次,并固定 effort / 温度 / harness,做自己的 20 题私有集。
7 月的故事可以压成一句话。闭源仍在最上面几格,但开源已经贴到听得见呼吸。下一波权重或 4.6 一上,4 分差还会再被撕开或抹平。你真正要维护的,是可复现的选型流程,不是截图里的第一行。
既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~