今日 AI 圈炸裂新闻不断,加上 BenchLM 最新全球大模型排行榜出炉,一文看完
📌 一句话速览
- Apple 起诉 OpenAI 窃取商业机密
- 马斯克承认 Anthropic 「显然是当前 AI 领导者」
- BenchLM 最新大模型榜:Claude Fable 5(91 分)登顶,国产 GLM-5.2 第 10 名
- Meta 否认「算力过剩」,筹划云基础设施出租
- 蚂蚁集团开源高性能推理框架 SGLang
🔥 今日头条
苹果起诉 OpenAI 窃取商业机密
Apple 于周五向美国加州北区联邦法院提起诉讼,指控 OpenAI 窃取商业机密并违反合同。诉状称,OpenAI 高级领导层(包括首席硬件官 Tang Tan)指使前 Apple 员工在招聘过程中窃取机密,包括未发布产品的项目代号、关键硬件规格和路线图信息。
一句话:苹果和 OpenAI 从合作到翻脸,导火索是挖人挖出了商业机密。这场官司的结果可能影响整个 AI 行业的人才流动规则。
马斯克承认 Anthropic 是当前 AI 领导者
马斯克在 X 上发文承认自己此前对 Anthropic 的判断有误,称其「显然是当前 AI 领域的领导者」。他表示没有公司发布过像 Mythos/Fable 这样优秀的模型,并相信 Anthropic 很快会推出 Mythos 2。他还强调,即使作为竞争对手,也承认对方的成就。
这条表态跟今天发布的 BenchLM 排行榜完全一致——Claude Fable 5 以 91 分高居榜首,Claude Mythos 5 以 89 分排第二。连马斯克都认了,Anthropic 这波确实顶。
一句话:连马斯克都公开服气了,Anthropic 的统治力已经不需要质疑。
📱 国内动态
百度搭子在成都 AI Day 发布四项更新
个人版新增浏览器调用、智能路由(平均任务耗时降 20%,Token 利用率提升 25%)、多端共享记忆及强化 PPT 生成。还上架了「一镜」数字人制作、「灵医」报告解读等 Skill。同时发布了行业首个自媒体专业套件和企业版,以及搭子联盟生态计划。
一句话:百度搭子这一轮更新的核心逻辑是「全场景渗透」——个人、自媒体、企业三条线同时打,生态野心很大。
蚂蚁集团开源高性能推理框架 SGLang
蚂蚁集团通过 GitHub 新仓库 inclusionAI/sglang 开源了 SGLang,这是一个面向大语言模型和多模态模型的高性能推理服务框架。继 Meta 之后,国内大厂也在加速推理框架的开源。
一句话:推理框架的军备竞赛升级了,开源生态越来越卷,对开发者是好事。
小红书发布大模型新架构 PIPO
小红书提出 PIPO 架构,通过输入侧压缩器将两个 token 折叠为一个 latent,输出侧 MTP head 将隐藏状态展开为额外 token,实现输入长度减半、每步输出翻倍。基于 Qwen3.5-4B/9B backbone。
一句话:小红书在 AI 底层架构上有真东西,PIPO 这种「压缩-展开」的设计思路挺新颖。
宇树 G1 人形机器人完成首例活体微创手术
一篇新的《自然》论文展示了宇树 G1 人形机器人执行首例由人形机器人完成的活体标准微创手术。加州大学圣地亚哥团队使用 G1,以常规手术器械完成了对两只活猪的腹腔镜胆囊切除术,第二次手术耗时 32 分钟。
一句话:人形机器人做手术不再是概念,32 分钟切完一台胆囊,虽然还得反复校正但方向没错。
🌍 海外前沿
Meta 否认「算力过剩」,筹划云基础设施出租
扎克伯格首次正面回应公司筹划云基础设施业务一事,否认「算力过剩」猜测,称内部算力需求依然旺盛、满负荷运转。但他同时表示当前市场对算力出价极高,将部分 AI 基础设施对外出租在财务上更划算。Meta 正制定代号「Meta Cloud」的云服务计划。
一句话:「算力过剩」是伪命题,把富余算力租出去赚钱才是真——东阳光这种算力租赁公司的市场逻辑又被验证了一次。
Cognition 如何信任 Claude Fable 5 通宵工作
Cognition 研究高级副总裁表示,其 AI 软件工程师 Devin 测试了几乎所有 Claude 模型,Claude Fable 5 是首个能信任其通宵运行的模型。在 Cognition 自建的 Frontier 基准中,Fable 5 在长任务可靠性上遥遥领先。
一句话:能通宵干活的 AI 才是好 AI——Fable 5 的「可靠性」可能是它比分数更重要的一张牌。
DeepSeek-V4 Flash RL 训练登陆 AMD MI355X
DeepSeek-V4 Flash 的强化学习训练现已在 AMD Instinct MI355X GPU 上通过 Miles 框架获得支持,基于 ROCm 软件栈运行。该 2840 亿参数 MoE 模型(每 token 激活 130 亿参数)在 AMD 硬件上跑通了 RL 训练。
一句话:DeepSeek 在 AMD 上跑通 RL 训练意味着国产模型对非 N 卡生态的适配能力在增强。
GitHub Copilot 审查成本降 20% 的教训
GitHub 在 Copilot 代码审查中尝试用共享代码探索工具替换原有专用工具,结果成本上升、有效评论下降。分析 trace 发现问题不在工具本身,而在于指令设计——通过重写指令最终实现 20% 成本降低。
一句话:工具不重要,指令才重要——这个教训对所有人适用。
🏆 重磅专题:BenchLM 全球大模型最新排行榜 Top 60
数据来源:benchlm.ai(更新至 2026 年 7 月 9 日)|综合评分满分 100,涵盖智能体、编程、推理、多模态、知识等 8 大维度
📌 核心发现
| |
|---|
| 榜首 | |
| 前十唯一开源国产 | |
| 中美格局 | |
| 开源占比 | |
| DeepSeek | |
| 80 分以上 | |
| 70 分以上 | |
🔍 三大看点
1. 榜首之争:Anthropic 碾压 Claude Fable 5 以 91 分登顶,Anthropic 在前五中占三席。结合今天马斯克公开承认 Anthropic 是领导者,这个榜首含金量又高了一层。OpenAI 这边 GPT-5.4(85 分)排第 6,被夹在 Claude 中间,位置尴尬。
2. GLM-5.2 杀入前十,国产开源之光 GLM-5.2 以 81 分排名第 10,是前十中唯一的开源模型,也是前十中唯二的中国模型(另一个是阿里 Qwen3.7 Max 第 8)。开源可自部署的特性让它在性价比和可控性上有独特优势。Z.AI 家族共 5 款模型在榜,国产阵营中数量和分数都靠前。
3. DeepSeek 的人海战术 DeepSeek 是上榜最多的中国厂商——8 款模型全部在 Top 60 内,从 V4 Pro Max(78 分第 14)到 V3.2(54 分第 56),覆盖了高中低全价位段。不过最高分 78 被阿里 Qwen3.7 Max 的 83 压了一头,旗舰模型还有追赶空间。
🏆 Top 60 完整排名
| | | | | |
|---|
| | | 91 | | |
| | | 89 | | |
| | | 88 | | |
| | | 87 | | |
| | | 85 | | |
| | | 85 | | |
| | | 83 | | |
| | | 83 | | |
| | | 82 | | |
| 10 | GLM-5.2 | Z.AI(智谱) | 81 | 开源 | 1M |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| Claude Opus 4.7 (Adaptive) | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
| | | | | |
💬 关于 Grok 4.5 补充
Grok 4.5 是 xAI 于 2026 年 7 月 8 日发布的代码+Agent 长任务专家模型,BenchLM 截至 7 月 9 日尚未收录。据公开数据:定价 $2/$6 每 M token,上下文 ~500K,速度 ~80 tok/s。在 AA 智能指数和 Agent 知识工作榜上均排第 4 位。Musk 称其接近 Claude Opus 4.7 但更快更省 token。
综合判断: 通用评分预计在 75-80 分区间(对应 BenchLM #12-#18),但在代码和 Agent 场景下有前 5-8 的实力。具体等 BenchLM 正式收录再看。
📝 榜单数据来源:benchlm.ai(截止 2026 年 7 月 9 日)。综合评分基于 Agentic/Coding/Reasoning/Multimodal/Knowledge/Instruction Following/Multilingual/Math 八大维度加权计算。部分新模型分数为~估算值。仅供参考,不构成任何选择建议。
💬 今日互动
Anthropic 登顶、苹果起诉 OpenAI、DeepSeek 在 AMD 上跑通 RL——今天的几条大新闻里,你觉得哪个对 AI 行业格局影响最大?