上周五,一个中国大模型KIMI K3火出了圈,把美股芯片股砸了个大坑。
英伟达、AMD、博通单周合计蒸发数千亿美元,纳斯达克三天连跌。导火索是什么?—— 2026 年 7 月 16 日,月之暗面发布了 Kimi K3。
K3 到底什么来头?2.8 万亿参数、100 万 token 上下文、原生视觉理解、首个开源 3T 级模型。Code Arena、Artificial Analysis、AutomationBench-AA 等好几个第三方榜单冲到全球第一或第二;价格只是 Claude Fable 5 的 20%、Opus 4.8 的 40%。

图1: Artificial Analysis Intelligence Index(AA 智能指数),K3相比K2.6大幅跃升,位列TOP3
消息一出,摩根大通直接命名它为 "DeepSeek 2.0 时刻";PitchBook 分析师 Harrison Ruffels 的原话更狠——"K3 是火星落进装满汽油的房间"。
但我今天不想再复述一遍排行榜和股价。排行榜是一回事,跑起来能不能用,是另一回事。
我选了三个真实任务:电商产品图、行业研究 PPT、火山岛DEMO,在 K3 和 GPT-5.6 两个模型上跑了完全一样的提示词。
不替任何一方站台,先把活儿摆出来。看看实操场景下K3的真实表现。开始前我们先有个感官认识,看看各路媒体的评价。
---
一、媒体反应:神仙打架,几家欢乐几家愁
如下为国内和海外各方评价,基本能分四档:
海外财经主流(一边倒喊 "DeepSeek 2.0")
- FT:性能对标甚至超过 Opus 4.8;新一轮估值 315 亿美元(5 月刚 200 亿)
- WSJ live:把 K3 发布与芯片股抛售直接绑定
- Reuters / Seeking Alpha:K3 是周五美股三大指数全线下行的主因
- Axios(Mike Allen):硅谷警钟 —— 开源 3T 级 + 40% 价格冲击闭源定价权
海外 X / 开发者(大佬站台但留了半句 "等等看")
- Elon Musk:在 Artificial Analysis 帖子下评论 "Impressive"(第二次公开站台)
- Guillermo Rauch(Vercel 创始人 / Next.js 作者):专业网页工程 AI 评测 K3 全球第一,代码任务成功率 92%
- Simon Willison:pelican SVG 实测,结论是 "开源终于能比肩前沿的转折点",但 self-reported benchmark 要打折扣
- Russ Salakhutdinov(杨植麟 CMU 导师 / Hinton 亲传 / 苹果前 AI 总监):发长帖祝贺,"成绩不能解释为蒸馏"
国内财经 / 科技(一边兴奋一边泼冷水)
- 新华社通稿 / 第一财经 / 证券时报 / IT 之家:中性通稿口径
- 钛媒体:"开源大胆打法,但 2.8T 训练 / 推理烧钱不可持续";披露 5 月 20 亿美元融资由美团龙珠领投
- 智东西:国内最完整长文 ——K3 在 SWE Marathon、Program Bench、BrowseComp、Automation Bench、SpreadsheetBench 2 等多个评测拿第一,但 GDPval-AA v2、APEX-Agents 仍弱于 Fable 5
- APPSO(连夜实测):Code Arena 1679 分全球第一(压 Fable 5 1631、GPT-5.6 Sol 1618);5 个高难度任务实测后称为 "K3 时刻" 而非又一个 DeepSeek 时刻
- APPSO(克制版评测):8.1/10 评分 —— 指出 K3 速度(62 token/s)、输出冗长(1.3 亿 token 是同类两倍)、幻觉率(39%→51%)三方面代价
投行 / 分析师(一边倒给 "灾难级" 评级)
- 杰富瑞 Matt Ma:K3 ≈ Fable 5 / GPT-5.6 Sol,成本低 40%
- 高盛:芯片股下跌是 "典型动量抛售",但 "算力扩张时代走到头"
- 摩根大通:直接命名为 "DeepSeek 2.0 时刻"
- PitchBook Harrison Ruffels:"K3 是火星落进装满汽油的房间"
6 个一致点:
4 个分歧:
- K3 是不是真超过 Fable 5?官方 + Code Arena + 大 V 说编程 / Agent 接近或偶超;APPSO / 智东西 / Simon Willison 说综合仍弱
- 速度 / 价格是不是真便宜?相对 Fable 5 是,相对 K2.6 贵了 2-3 倍
- 商业可持续?钛媒体说烧钱模式不可持续;雪球说开源换开发者 + IPO是大账
- 对中国 AI 利好还是利空?主流说利好国产算力链 + 应用层;怀疑派说开源反而帮美国生态继续领跑
好了,热闹看到这儿。下面才是重头戏 —— 跑活儿。
---
二、三个真实任务对比
鉴于当前的大模型对于一些简单文字类任务都可以完美胜任了,笔者选取了生成电商产品图、专题调研生成PPT、海中火山岛DEMO三个不同场景又可能在日常工作中常见的有点难度的任务进行对比。实际看看K3到底强不强。
默认采用的配置为KIMI K3极致,GPT5.6 Sol中度推理。
场景 1:生成电商产品图
用的提示词(两个模型完全一样):
这是一款110毫升女士香水,介绍如下: 一款100毫升大小的优雅、持久的香水,非常适合日常佩戴或特殊场合。花香和果香,适合一天中的任何时间,留下柔软,女性化的痕迹。它的玻璃瓶设计使其成为理想的礼物或补充您的香水系列。 图像生成请美化这张图片作为主图,白色背景,再生成 4 张细节及场景配图。用于电商Amazon,面向美国年轻女性销售,所有配图文字为英语,输出图片为PNG,严格600*600 像素。
两个模型表现:
📷 KIMI K3生成的图片
📷 ChatGPT生成的图片
✏️ Round1:电商产品图,KIMI K3完胜OpenAI GPT5.6
- KIMI K3完美理解了提示词的含义,生成了5张图,并且文字也是英文的描述。细节图既有产品的各角度展示,又有文字亮点描述,还有礼盒装凸显了送礼的属性。
- GPT则差强人意,最大的问题是把5张图拼接到了一张图里输出,且没有理解在电商平台需要多张图片、多角度的图片的要求。但是有美女喷香水的图片,比较直观的展示了使用场景算是亮点。
---
场景 2:行业研究 PPT
用的提示词(两个模型完全一样):
【背景】我是技术自媒体编辑,要给非 ML 背景的产品经理读者做一篇 10 页 PPT,主题是"大模型 Scaling Law 是不是撞墙了"。读者不在乎 transformer 数学,要的是"业内谁正、谁反,论据是什么,未来 12 个月看什么信号"。【输入材料】- 联网搜索 2025-2026 年代表性论文、博客、访谈- 覆盖:OpenAI(Ilya Sutskever 离开后表态、Sam Altman 公开发言)、Anthropic(Dario Amodei 公开发言)、DeepMind(Demis Hassabis)、月之暗面(杨植麟)、智源(王仲远)、Meta AI(Yann LeCun 反对派)- 至少 8 个信源,其中至少 3 篇 arXiv 论文【任务步骤】1. 信源清单(≥ 8 条):每条注明标题、作者/机构、发布时间、链接2. 正方(Scaling Law 还在生效):3 条核心论据 + 代表人物 + 论文链接3. 反方(Scaling Law 撞墙):3 条核心论据 + 代表人物 + 论文链接4. 中间派(Scaling Law 没撞墙但需要新数据/算法):3 条代表观点5. 10 页 PPT 大纲:标题必须"非学术圈也能看懂"6. 最后一页:未来 12 个月值得观察的 3 个信号(如:训练数据来源变化、推理成本曲线、Agent 是否能跑长任务等)【输出格式】# 信源清单(结构同 A1)# 正反对比表| 观点 | 代表人物 | 机构 | 核心论据 | 论文/链接 | 时间 ||---|---|---|---|---|---|| 正方 | | | | | || 反方 | | | | | || 中间 | | | | | |# 10 页 PPT 大纲(同 A1 格式)# 12 个月观察信号1. [信号 1] - 如何观测:[指标] - 参考阈值:[数字]...【约束与自评】- 所有人物引用必须真实存在;引用前先确认- 论文链接必须是 arXiv 公开可访问- 标题不要用 "SGD"、"RLHF"、"MoE" 这类未解释的术语- 自评打分:信源权威度 / 立场平衡度 / 标题易懂度 / 信号可观测性
两个模型表现:
KIMI K3的PPT(部分展示)
GPT5.6的PPT(部分展示)
✏️ Round2:KIMI K3和GPT5.6 水平相当,K3再次微弱胜出。
---
场景 3:火山岛DEMO
【背景】我是一家创意工作室的艺术指导,下周要在一个 Awwwards 风格的技术 Demo 派对上展示"程序化生成"的极致能力。我要做一个"海中诞生的火山岛"——观众第一眼会被画面震撼,第二眼会注意岩浆、海浪、闪电、海岸线都在按真实物理变化,第三眼才会意识到:所有粒子和贴图都是 shader 实时算出来的,没有任何外部素材。【输入材料】- 全部要求在【输出格式】中给出- 不允许使用任何外部素材(图片、模型、HDR、音频)【任务步骤】1. 规划场景:粒子系统清单 / shader 清单 / 物理参数 / 时间轴2. 用 Three.js 实现单文件 HTML3. 实现 4 种可切换观察视角【输出格式】- 文件:demo.html(单文件,内嵌所有 JS 和 shader)- 必须包含: * 场景规模:至少 50000 个粒子同时运行(岩浆、蒸汽、火山灰、雨滴各一组) * 物理逻辑: - 熔岩粒子从火山口喷出 → 受重力下落 → 接触海面时冷却变黑 → 累积成岛屿 - 海浪按 sin/cos 实时计算,受"岛屿地形"影响产生绕射 - 蒸汽粒子向上扩散,半径随时间膨胀 - 闪电:每 3-5 秒在火山灰云层中随机劈下,5-8 道同时 * 4 种可切换视角(按数字键 1-4 切换): 1. 船上(低角度,海平面看火山) 2. 直升机(高空俯视) 3. 海岸线(中景,人眼高度) 4. 火山口(极近距离,岩浆飞溅) * 时间轴(按空格键暂停/播放): - 0-30s:海底冒泡 - 30-90s:火山爆发 - 90-180s:岛屿稳定 - 180-300s:生命萌芽(海岸线长出植物) * 性能:60 FPS(中端笔记本,M1/M2/RTX 3060 级别) * 不允许用任何外部素材:所有粒子/贴图/音频都要 shader 或 procedural 生成【约束与自评】- 全部用原生 Three.js,不允许用任何 react-three-fiber / cannon-es 等- 浏览器 console 不能有红色 error- 文件大小不超过 500KB- 完成后给出:最得意的 3 个效果 / 最不满意的 3 个地方 / 优化方向
KIMI K3的海上火山喷发的DEMO
GPT5.6的海上火山喷发DEMO
✏️ Round 3: KIMI K3海上火山喷发DEMO完胜GPT5.6
KIMI K3:
GPT5.6:
只能说部分理解了提示词要求,完成了作品。4个视角、时间轴元素都具备。
火山口视角的弹道岩浆喷泉、冷却变黑与熔岩脉都有表现。暴风云、雨幕和批量闪电形成的空间层次。
但是明显的火山喷发时穿模了,一眼假。植物使用 GPU 点簇表现,近距离轮廓仍较抽象。
---
三、实战场景感受总结
1. 文生图
✏️ KIMI K3提示词理解满分,生图效率比较高,微调下基本可以拿来直接用。
2. 知识工作(多信源 → 图表 → 报告 → 可视化网站)
✏️ 当前大模型针对行业话题的专题研究,K3已经较少产生幻觉,效率相比人工搜索直接拉满,完成度也出布够用。PPT输出时,都依赖了skill的情况下,如果不给更准确的提示词,视觉效果上还可以再提高。如果是学术类报告,我还是更倾向于用Perplexity或者Metaso做交叉验证。
长程编程
✏️ 在第三个火山DEMO的建模任务中。K3已经完全胜任,能够理解复杂任务,花费时间和GPT5.6差不多,都在20分钟左右输出预览页面。
---
最后,抛个问题给你:看完上面三个真实任务,你觉得 K3 这一波,是 "开源真的追上来" 的第2个DeepSeek时刻吗?
评论区告诉我你的判断。
---
📮 欢迎关注「马丁的杂货铺」,专注 AI 与科技前沿观察。不蹭热点不废话,只说点真有用的。