当前位置:首页>排行榜>7月模型排行榜:Opus 5 登顶,Kimi K3 把开源贴到 4 分

7月模型排行榜:Opus 5 登顶,Kimi K3 把开源贴到 4 分

  • 更新时间 2026-07-29 14:00:41
7月模型排行榜:Opus 5 登顶,Kimi K3 把开源贴到 4 分

7 月底再问「谁第一」,答案已经不能只甩一个名字。闭源侧 Opus 5 把 Intelligence Index 顶到 61,开源侧 Kimi K3 权重落地后打到 57。两边只差 4 分,是 Artificial Analysis 自己写的「自 2 月 GLM-5 以来最小差距」。

今天是 2026 年 7 月 29 日。本文主轴是 Artificial Analysis 的 Intelligence Index(综合推理、知识、agent 等任务的独立评测),数字来自该站实时榜与其官方 X 说明。人类偏好 Arena、厂商自家表、编码专项榜会另说,混成一张「总冠军」表会骗人

Artificial Analysis LLM Leaderboard 页面摘要,Intelligence 区点名 Opus 5 / Fable 5 / Sol

综合智能榜,现在长什么样

按 AA 榜「当前模型 + 推理档」排序,旗舰一档可以压成下面这张简化表(同模型不同 effort 在原榜会占多行,这里只取代表档)。

档位
模型
Intelligence
开闭源
备注
1
Claude Opus 5(max)
61
闭源
7/24 上线后登顶
2
Claude Fable 5(max,含 fallback)
60
闭源
尖端档,成本更高
3
GPT-5.6 Sol
(max)
59
闭源
OpenAI 旗舰推理线
4
Kimi K357开源权重
2.8T MoE,Kimi K3 License
5
Claude Opus 5(medium)等
56 一带
闭源
effort 下调后仍很强
Grok 4.5
(high)
54
闭源
性价比向,非顶智能
GLM-5.2
(max)
51
智谱线
开源生态常见对照
DeepSeek V4 Pro
(max)
44
DeepSeek 线
价格极低
Intelligence Index 一览示意,闭源前三与 Kimi K3

读表时有三条硬注意。

第一,effort 就是另一张榜。 Opus 5 的 max / xhigh / high / medium / low 在 AA 上从 61 一路掉到 51 附近。Sol 同样有 max 到 low。你只订「Opus 5」却用默认档,体感和「榜一」可能对不上。

第二,Price 列是「每任务成本」一类合成指标,不是单纯 $/MTok。 榜上 Fable、Sol max 往往又贵又慢(端到端响应时间很长),Opus 5 high 一类档位在智能略降的同时把任务成本压下来,这正是 Anthropic 想卖的「半价追尖端」叙事。

第三,开源≠随便商用。 Kimi K3 权重公开,AA 标注为 Commercial Use Restricted。大营收 MaaS、超大 MAU 产品要另谈授权或品牌露出,写进对比时别写成纯 MIT。

开源这条线,真正的变化是「贴身」

AA 在 7/27–28 连续发帖,口径很清楚。Kimi K3 权重放出后,开源权重第一落到 57,闭源顶尖在 59–61。闭源与开源只差 4 分。

此前开源常见对标是 GLM-5.2(约 51)、DeepSeek V4 Pro(约 44)。K3 一跳,把「开源只能打第二梯队」的说法往前推了一大截。代价也写在账单上。2.8T MoE、推荐 64 卡级 supernode、API 输出并不便宜。多数团队会先用托管 API / Day-0 云,而不是本地起全量。

Qwen3.7 Max 不要写进开源榜。 带 Max/Plus/Turbo 的阿里商业档是闭源 API。开源的是 Qwen3 系 dense/MoE 权重线。综合榜混排时最容易踩这个坑,读者会当场抓包。

人类偏好 Arena,未必跟 AA 同一张脸

LMArena 一类盲测榜更看「人觉得顺不顺」。公开摘要里常见 Fable 5、Sol、K3 在文本或 WebDev 上互有胜负。Opus 5 上线晚,Arena 票数与稳定名次可能滞后于 AA 跑分。

所以会出现很拧巴的产品事实。

  • AA 智能第一 更常落在 Opus 5 max
  • 人感 / 编码专项 仍有人把 Fable 或 Sol 当主力
  • 开源可下载 只有 K3 这类权重线能进「自托管」讨论

没有一张表能同时回答「最聪明、最好用、最便宜、能私有化」。

AA 自己还在同一页面上拆了 Output Speed、Latency、Cost per Task、Context Window。智能第一的模型,延迟和每任务成本往往难看。Flash 线、小参数开源、Scout 一类会在速度与成本榜上翻身。把「智能榜截图」当成唯一选型依据,会系统性高估贵而慢的旗舰。

价格与 API,别只看标价

粗对照(每百万 token 量级,以厂商公开档与媒体汇总为准,写稿日可能已变)。

  • Opus 5 与 Opus 4.8 同档思路,输入输出大约 $5 / $25 一带,相对 Fable 常被描述为「半价尖端」
  • GPT-5.6 Sol 常见 $5 / $30 量级叙事,具体以 OpenAI 价卡为准
  • Kimi K3 官方 API 曾标 cache hit 输入约 $0.30、miss $3、输出 $15(coding 高 cache 时更香)
  • Grok 4.5 曾以 $2 / $6 一类性价比档出现在报道里

AA 表上的「Price」列还会把任务长度、重试、thinking token 揉进 per-task 成本。所以会出现 Sol max 智能 59、任务成本却比 Opus high 更难看的情况。选型时至少同时看 标价 + 你的真实轨迹长度

按场景选,比背名次有用

你要干什么
更合理的默认
原因
最难 agent / 长程知识工作
Opus 5(先 medium/high,再拧 max)
顶智能 + 相对 Fable 更友好的任务成本
尖端能力不计成本
Fable 5
仍贴顶,账单更狠
编码 agent / Codex 生态
GPT-5.6 Sol
推理旗舰,工具链熟
要权重、可微调、可私有部署
Kimi K3(云或大集群)
开源第一,许可与算力先算清
省钱高速日常
Grok 4.5、Gemini Flash 线、中小开源
智能榜中游,速度/价格另一套逻辑
安全扫描 / 专项
看专项榜,别只看 Intelligence
例如 DeepsecBench、语音 STS 榜已是另一赛道

Grok 4.6 / 4.7 还在马斯克个人时间表上(约 8 月初与之后几周),未进本稿 AA 榜。GPT-6 无官方发版日。下一版排行会重写,但不会取消「多榜 + 多档 effort」这个读法。

语音、图像、安全扫描已经是平行宇宙。例如 AA 的 Speech to Speech 上,阿里 Qwen Audio 实时档可以单独登顶,这和文本 Intelligence 完全不是一张表。做语音客服的人照抄 Opus 5 名次,会选错工具。

这张榜怎么用才不傻

把 Intelligence Index 当地图,不当判决书

  1. 先定任务类型(聊天、编码 agent、长文、私有化)。
  2. 再定预算(token 单价 + 每任务成本 + 延迟)。
  3. 最后才看名次,并固定 effort / 温度 / harness,做自己的 20 题私有集。

7 月的故事可以压成一句话。闭源仍在最上面几格,但开源已经贴到听得见呼吸。下一波权重或 4.6 一上,4 分差还会再被撕开或抹平。你真正要维护的,是可复现的选型流程,不是截图里的第一行。

既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

最新文章

随机文章