当前位置:首页>排行榜>苹果起诉OpenAI 大模型最新排行榜出炉

苹果起诉OpenAI 大模型最新排行榜出炉

  • 更新时间 2026-07-11 15:28:30
苹果起诉OpenAI 大模型最新排行榜出炉

今日 AI 圈炸裂新闻不断,加上 BenchLM 最新全球大模型排行榜出炉,一文看完


📌 一句话速览

  • Apple 起诉 OpenAI 窃取商业机密
     — 前员工招聘中泄密,涉及未发布产品
  • 马斯克承认 Anthropic 「显然是当前 AI 领导者」
     — 直接与排行榜榜首呼应
  • BenchLM 最新大模型榜:Claude Fable 5(91 分)登顶,国产 GLM-5.2 第 10 名
  • Meta 否认「算力过剩」,筹划云基础设施出租
  • 蚂蚁集团开源高性能推理框架 SGLang

🔥 今日头条

苹果起诉 OpenAI 窃取商业机密

Apple 于周五向美国加州北区联邦法院提起诉讼,指控 OpenAI 窃取商业机密并违反合同。诉状称,OpenAI 高级领导层(包括首席硬件官 Tang Tan)指使前 Apple 员工在招聘过程中窃取机密,包括未发布产品的项目代号、关键硬件规格和路线图信息。

一句话:苹果和 OpenAI 从合作到翻脸,导火索是挖人挖出了商业机密。这场官司的结果可能影响整个 AI 行业的人才流动规则。

马斯克承认 Anthropic 是当前 AI 领导者

马斯克在 X 上发文承认自己此前对 Anthropic 的判断有误,称其「显然是当前 AI 领域的领导者」。他表示没有公司发布过像 Mythos/Fable 这样优秀的模型,并相信 Anthropic 很快会推出 Mythos 2。他还强调,即使作为竞争对手,也承认对方的成就。

这条表态跟今天发布的 BenchLM 排行榜完全一致——Claude Fable 5 以 91 分高居榜首,Claude Mythos 5 以 89 分排第二。连马斯克都认了,Anthropic 这波确实顶。

一句话:连马斯克都公开服气了,Anthropic 的统治力已经不需要质疑。


📱 国内动态

百度搭子在成都 AI Day 发布四项更新

个人版新增浏览器调用、智能路由(平均任务耗时降 20%,Token 利用率提升 25%)、多端共享记忆及强化 PPT 生成。还上架了「一镜」数字人制作、「灵医」报告解读等 Skill。同时发布了行业首个自媒体专业套件和企业版,以及搭子联盟生态计划。

一句话:百度搭子这一轮更新的核心逻辑是「全场景渗透」——个人、自媒体、企业三条线同时打,生态野心很大。

蚂蚁集团开源高性能推理框架 SGLang

蚂蚁集团通过 GitHub 新仓库 inclusionAI/sglang 开源了 SGLang,这是一个面向大语言模型和多模态模型的高性能推理服务框架。继 Meta 之后,国内大厂也在加速推理框架的开源。

一句话:推理框架的军备竞赛升级了,开源生态越来越卷,对开发者是好事。

小红书发布大模型新架构 PIPO

小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone。

一句话:小红书在 AI 底层架构上有真东西,PIPO 这种「压缩-展开」的设计思路挺新颖。

宇树 G1 人形机器人完成首例活体微创手术

一篇新的《自然》论文展示了宇树 G1 人形机器人执行首例由人形机器人完成的活体标准微创手术。加州大学圣地亚哥团队使用 G1,以常规手术器械完成了对两只活猪的腹腔镜胆囊切除术,第二次手术耗时 32 分钟。

一句话:人形机器人做手术不再是概念,32 分钟切完一台胆囊,虽然还得反复校正但方向没错。


🌍 海外前沿

Meta 否认「算力过剩」,筹划云基础设施出租

扎克伯格首次正面回应公司筹划云基础设施业务一事,否认「算力过剩」猜测,称内部算力需求依然旺盛、满负荷运转。但他同时表示当前市场对算力出价极高,将部分 AI 基础设施对外出租在财务上更划算。Meta 正制定代号「Meta Cloud」的云服务计划。

一句话:「算力过剩」是伪命题,把富余算力租出去赚钱才是真——东阳光这种算力租赁公司的市场逻辑又被验证了一次。

Cognition 如何信任 Claude Fable 5 通宵工作

Cognition 研究高级副总裁表示,其 AI 软件工程师 Devin 测试了几乎所有 Claude 模型,Claude Fable 5 是首个能信任其通宵运行的模型。在 Cognition 自建的 Frontier 基准中,Fable 5 在长任务可靠性上遥遥领先。

一句话:能通宵干活的 AI 才是好 AI——Fable 5 的「可靠性」可能是它比分数更重要的一张牌。

DeepSeek-V4 Flash RL 训练登陆 AMD MI355X

DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)在 AMD 硬件上跑通了 RL 训练。

一句话:DeepSeek 在 AMD 上跑通 RL 训练意味着国产模型对非 N 卡生态的适配能力在增强。

GitHub Copilot 审查成本降 20% 的教训

GitHub 在 Copilot 代码审查中尝试用共享代码探索工具替换原有专用工具,结果成本上升、有效评论下降。分析 trace 发现问题不在工具本身,而在于指令设计——通过重写指令最终实现 20% 成本降低。

一句话:工具不重要,指令才重要——这个教训对所有人适用。


🏆 重磅专题:BenchLM 全球大模型最新排行榜 Top 60

数据来源:benchlm.ai(更新至 2026 年 7 月 9 日)|综合评分满分 100,涵盖智能体、编程、推理、多模态、知识等 8 大维度

📌 核心发现

发现
数据
榜首
Claude Fable 5 — 91 分
前十唯一开源国产
GLM-5.2(81 分,第 10 名)
中美格局
Top 10 中美国占 8 席,中国占 2 席
开源占比
Top 60 中开源模型占 25 席(42%)
DeepSeek
8 款模型入榜,上榜最多的开源厂商
80 分以上
12 个(第一梯队)
70 分以上
29 个,60 分以上 46 个

🔍 三大看点

1. 榜首之争:Anthropic 碾压 Claude Fable 5 以 91 分登顶,Anthropic 在前五中占三席。结合今天马斯克公开承认 Anthropic 是领导者,这个榜首含金量又高了一层。OpenAI 这边 GPT-5.4(85 分)排第 6,被夹在 Claude 中间,位置尴尬。

2. GLM-5.2 杀入前十,国产开源之光 GLM-5.2 以 81 分排名第 10,是前十中唯一的开源模型,也是前十中唯二的中国模型(另一个是阿里 Qwen3.7 Max 第 8)。开源可自部署的特性让它在性价比和可控性上有独特优势。Z.AI 家族共 5 款模型在榜,国产阵营中数量和分数都靠前。

3. DeepSeek 的人海战术 DeepSeek 是上榜最多的中国厂商——8 款模型全部在 Top 60 内,从 V4 Pro Max(78 分第 14)到 V3.2(54 分第 56),覆盖了高中低全价位段。不过最高分 78 被阿里 Qwen3.7 Max 的 83 压了一头,旗舰模型还有追赶空间。

🏆 Top 60 完整排名

排名
模型
厂商
综合评分
类型
上下文
1
Claude Fable 5
Anthropic
91
闭源
1M+
2
Claude Mythos 5
Anthropic
89
闭源
1M+
3
Gemini 3.1 Pro
Google
88
闭源
1M
4
Gemini 3 Pro Deep Think
Google
87
闭源
2M
5
Claude Opus 4.8
Anthropic
85
闭源
1M
6
GPT-5.4
OpenAI
85
闭源
1.05M
7
Claude Opus 4.6
Anthropic
83
闭源
1M
8
Qwen3.7 Max
Alibaba(阿里巴巴)
83
闭源
1M
9
GPT-5.3 Codex
OpenAI
82
闭源
400K
10GLM-5.2Z.AI(智谱)81开源1M
11
Gemini 3.5 Flash
Google
80
闭源
1M
12
Gemini 3 Pro
Google
80
闭源
2M
13
GPT-5.5
OpenAI
78
闭源
1M
14
DeepSeek V4 Pro (Max)
DeepSeek(深度求索)
78
开源
1M
15
Qwen3.7 Plus
Alibaba(阿里巴巴)
78
闭源
1M
16
Claude Sonnet 4.6
Anthropic
77
闭源
200K
17
GLM-5 (Reasoning)
Z.AI(智谱)
77
开源
200K
18
Claude Opus 4.7 (Adaptive)
Anthropic
76
闭源
1M
19
GPT-5.2
OpenAI
75
闭源
400K
20
Kimi K2.6
Moonshot AI(月之暗面)
74
开源
256K
21
DeepSeek V4 Pro (High)
DeepSeek(深度求索)
74
开源
1M
22
GPT-5.1
OpenAI
73
闭源
200K
23
Kimi K2.5 (Reasoning)
Moonshot AI(月之暗面)
73
闭源
128K
24
GPT-5.2-Codex
OpenAI
72
闭源
400K
25
GPT-5.1-Codex-Max
OpenAI
72
闭源
400K
26
GPT-5 (high)
OpenAI
72
闭源
128K
27
Claude Opus 4.5
Anthropic
72
闭源
200K
28
DeepSeek V4 Flash (Max)
DeepSeek(深度求索)
72
开源
1M
29
MiniMax M3
MiniMax(稀宇)
71
开源
1M
30
Grok 4.20
xAI
68
闭源
2M
31
GLM-5.1
Z.AI(智谱)
68
开源
203K
32
Qwen3.6-27B
Alibaba(阿里巴巴)
65
开源
262K
33
GPT-5.4 mini
OpenAI
65
闭源
400K
34
Qwen3.6 Plus
Alibaba(阿里巴巴)
64
闭源
1M
35
DeepSeek V4 Flash (High)
DeepSeek(深度求索)
64
开源
1M
36
DeepSeek V4 Pro
DeepSeek(深度求索)
64
开源
1M
37
GLM-5
Z.AI(智谱)
63
开源
200K
38
Kimi K2.5
Moonshot AI(月之暗面)
63
开源
256K
39
Nemotron 3 Ultra
NVIDIA
63
开源
1M
40
GLM-4.7
Z.AI(智谱)
63
开源
200K
41
DeepSeek V3.2 (Thinking)
DeepSeek(深度求索)
62
开源
128K
42
MAI-Thinking-1
Microsoft
61
闭源
256K
43
Claude Sonnet 4.5
Anthropic
60
闭源
200K
44
Grok 4
xAI
60
闭源
128K
45
Gemini 2.5 Pro
Google
60
闭源
1M
46
Qwen3.5 397B
Alibaba(阿里巴巴)
60
开源
128K
47
Qwen3.5-122B-A10B
Alibaba(阿里巴巴)
59
开源
262K
48
Qwen3.5-27B
Alibaba(阿里巴巴)
59
开源
262K
49
Qwen3.6-35B-A3B
Alibaba(阿里巴巴)
58
开源
262K
50
DeepSeek V4 Flash
DeepSeek(深度求索)
57
开源
1M
51
GPT-4.1
OpenAI
57
闭源
1M
52
MiMo-V2-Flash
Xiaomi(小米)
56
开源
256K
53
o1
OpenAI
55
闭源
200K
54
MiniMax M2.7
MiniMax(稀宇)
55
开源
200K
55
o3
OpenAI
54
闭源
200K
56
DeepSeek V3.2
DeepSeek(深度求索)
54
开源
128K
57
Gemini 3 Flash
Google
54
闭源
1M
58
Claude Haiku 4.5
Anthropic
54
闭源
200K
59
o3-mini
OpenAI
53
闭源
200K
60
Qwen3.5-35B-A3B
Alibaba(阿里巴巴)
53
开源
262K

💬 关于 Grok 4.5 补充

Grok 4.5 是 xAI 于 2026 年 7 月 8 日发布的代码+Agent 长任务专家模型,BenchLM 截至 7 月 9 日尚未收录。据公开数据:定价 $2/$6 每 M token,上下文 ~500K,速度 ~80 tok/s。在 AA 智能指数和 Agent 知识工作榜上均排第 4 位。Musk 称其接近 Claude Opus 4.7 但更快更省 token。

综合判断: 通用评分预计在 75-80 分区间(对应 BenchLM #12-#18),但在代码和 Agent 场景下有前 5-8 的实力。具体等 BenchLM 正式收录再看。


📝 榜单数据来源:benchlm.ai(截止 2026 年 7 月 9 日)。综合评分基于 Agentic/Coding/Reasoning/Multimodal/Knowledge/Instruction Following/Multilingual/Math 八大维度加权计算。部分新模型分数为~估算值。仅供参考,不构成任何选择建议。

💬 今日互动

Anthropic 登顶、苹果起诉 OpenAI、DeepSeek 在 AMD 上跑通 RL——今天的几条大新闻里,你觉得哪个对 AI 行业格局影响最大?

随机文章