清华师徒把全球AI榜单打成接力赛,GLM-5.2刚拿开源编程第一,Kimi K3又靠2.8万亿参数冲上前端榜首,闭源真没...
这两年看大模型,最容易把人看麻的是一堆参数名词和排行榜缩写,今天你第一,明天他反超,普通读者很容易只记住一句“又有新王了”。但这次不太一样,有意思的不只是榜单变了,而是站在榜单两头的人,偏偏还是清华的一对师徒。
先是导师唐杰这边的GLM-5.2,在2026年6月放出狠活:1M上下文、MIT许可开放权重,重点猛攻编程和长程Agent任务。1M上下文说白了,就是能一口气吞下超长代码仓库、长文档和任务轨迹,不用聊两句就“失忆”。而且它不是只会补全几行代码那种助手思路,而是奔着“进仓库、开终端、调工具、连做几小时活”去的。在Z.ai给出的长程任务定位里,GLM-5.2就是冲着这类活来的;官方也明确把它放在长程任务和编码能力升级上。
更关键的是,GLM-5.2当时吃到的不是虚名,而是实打实的“开源侧王冠”。按官方口径,它在多项长程编程基准上是当时排名最高的开源模型。这个“开源”很重要,因为MIT许可开放权重,意味着企业和开发者能拿去下载、微调、自托管,玩法和商业价值都跟纯API模型不是一回事。说白了,导师这一步先把“全球开发者好感度”拿下一截。
结果一个月不到,学生杨植麟这边直接把戏剧性拉满。Kimi K3在2026年7月16日发布,模型总参数约2.8万亿,采用MoE架构,896个专家里每次大约激活16个。这个数字听着像机房都要烧红了,但MoE的逻辑其实很接地气:不是896个专家一起上,而是问题来了再挑最对口的那16个出手,所以总参数很大,不等于每次推理都按满功率烧钱。
真正让Kimi K3爆掉的是前端开发榜。Arena 的 WebDev Code Arena 显示,Kimi K3以1679分来到第1,压过Claude Fable 5;而且相比前代K2.6,它是从第18名一路跳到第1名,直接连升17个位次。这个涨幅,不叫进步,叫掀桌子。
注意,这里必须说人话:GLM-5.2赢的是开源编程、长程工程那张桌子,Kimi K3抢的是前端代码生成这张桌子。不是同一场考试,也不是同一张总榜,所以不能简单粗暴地说谁把谁彻底打趴下了。但从传播效果看,K3这一脚确实把全球注意力踢过去了。
2.8万亿参数,听着吓人,其实是“高手多,但不会一起上班”
Kimi K3另一个让行业兴奋的点,是它不只是榜单好看。Artificial Analysis给它的智能指数是57,模型页显示排名在最前列,价格则是每百万输入token 3美元、输出15美元。翻译一下:能力已经摸到顶级闭源模型那一档门口了,但价格还没站到最高位,属于“不是白菜价,但很有试用冲动”的区间。
不过机哥得把短板先摆桌上。K3不是那种又强又快又便宜的六边形战士。Artificial Analysis给出的数据里,它输出速度偏慢,首token延迟也比较高,属于能打,但不算利索的那种。还有一点更现实:它虽然计划开放权重,可这不等于人人本地都跑得起。大模型世界里,“开放权重”和“个人电脑随便玩”之间,隔着的是集群、卡数和部署成本。
最容易被带节奏的说法,就是“闭源王座要塌了”。有一说一,现在还没到这个程度。Artificial Analysis的结论也很清楚,Kimi K3虽然非常强,能和Opus 4.8、GPT-5.5这一档掰手腕,但整体仍落后于更强的闭源旗舰,比如Fable 5和GPT-5.6 Sol。
但真正值得盯的变化,不是谁今天拿第1,而是差距缩短得太快了。以前开放模型追闭源前沿,常常按年算;现在你回头看这轮节奏,六月GLM-5.2先把开源编程高地拿下,七月Kimi K3马上在另一张关键榜单登顶,整个行业的追赶速度已经压缩到“按月算”。
所以这场“清华师徒局”最精彩的地方,不是八卦,而是说明了一件事:同一条研究脉络,已经长成两条商业路线。唐杰这边更像把模型往长程工程交付、开放权重生态上推;杨植麟这边则把超长上下文、多专家架构和产品落地做成了全球注意力中心。
总的来说,闭源王座今天还没塌,但已经不再稳得让人绝望。老师刚把王冠戴上,学生下一秒就追到身后,这才是2026年大模型竞争最危险也最迷人的地方。
温馨提示:文中部分信息整理自公开资料与网络信息,数据存在更新或偏差,欢迎理性交流与指正,具体请以官方最新公布为准。