当前位置:首页>排行榜>Grok 4.7 测评:价格没涨,但账单悄悄变多了

Grok 4.7 测评:价格没涨,但账单悄悄变多了

  • 更新时间 2026-09-22 08:38:10
Grok 4.7 测评:价格没涨,但账单悄悄变多了

马斯克又放大招了。

昨天凌晨,海外还是 9 月 21 日,马斯克把 Grok 4.7 放出来了。

社区里有人通宵守着,想看这家刚调整完架构的团队,能掏出什么底牌。

我本来也打算等一手实测再动笔,结果一刷,好家伙,料比模型本身还精彩。

这玩意原定 9 月 12 日发,硬是鸽了九天。

鸽的原因,我后面讲,特别离谱。

先说 Grok 4.7 是个啥。

xAI 的旗舰模型,参数干到 2.1 万亿,比上代 4.6 的 1.5 万亿涨了四成。

定位就一句话,编程和知识工作的最强模型

官方口号很冲,速度两倍,价格一半。

价格牌价确实没动,输入每百万 token 两美元,输出六美元,跟 4.6 一模一样。

快速版速度翻倍,价格也翻倍。

回到那个九天跳票。

我寻思了一下,这理由我能笑半天。

强化学习阶段,回复长度惩罚设太重了。

什么后果,模型遇到自己本来能解出来的难题,嫌太长不想写,提前交白卷。

你没听错,一个号称最强编程的模型,训练的时候被罚得不敢多说话,难题直接摆烂。

团队花了九天把毛病修好,新版在困难任务上能坚持更久,输出前还会自己检查一遍。

马斯克甚至被曝亲自守在超算中心门口盯进度。

不是哥们,老板亲自蹲机房,这画面太抓马了。

一个号称最强的模型,训练时被罚得不敢多说话

好,毛病修好了,看成绩单。

我一个一个说,别急。

编程这块,CursorBench 4.0,4.7 的 xhigh 档拿到 46.3%,上代 4.6 是 40.4%,GPT-5.6 Sol 是 41.7%,排第一的是 Fable 5.1 的 51.8%。

涨了,但没到闭嘴的程度。

Terminal-Bench 4.0,这个考数小时连续终端操作,4.7 干到 38.0%,前代才 20.3%,快翻倍。

这块我有点意外,长任务确实是这代的主战场。

电气工程 EEBench,4.7 拿下 64.0%,把 GPT-5.6 Sol 的 39.4% 和 Fable 5.1 的 56.4% 都超了。

法律 Harvey 测试,19.6%,前代 15.8%,Fable 才 6.7%,Sol 只有 2.5%。

你看,工程和法律这类硬专业活,它确实支棱起来了。

医疗 HealthBench,56.7%,比前代强,但还落后 Fable 5.1 的 62.1% 和 Sol 的 60.5%。

编程和工程进步明显,通用医疗还没追上

最让我服的,是 Box 那个保险理赔的案例。

Grok 4.7 在 Box Agent 里核一笔 200 万美元的索赔,对着保单和相关记录翻,揪出 8.2 万美元的重复发票,6.4 万美元漏掉的供应商抵扣,还发现一个能让计算结果差 14.3 万美元的免赔额问题。

它顺手出了一份带引用的审查报告。

这活,以前得人盯着干一下午。

但是,话说回来,上面都是官方自己放的表。

独立机构 Artificial Analysis 上线二十分钟后就甩出报告,画风立刻不一样。

综合智力指数,4.7 拿 46 分,前代 4.6 是 44 分。

就这,涨了两分。

准确率 47% 对 48%,几乎原地不动,幻觉率从 34% 降到 29%,这块倒是实打实好了点。

真正吓人的是后面的数。

4.7 的 xhigh 档,做一道智力题平均吐八万一千个 token。

前代 4.6 平均三万六,GPT-6 Astra 才两万七。

它比前代多出一倍多,比 Astra 多出快两倍。

你敢信???为了多那两分,后台硬是把自己逼成话痨。

说到底,单题账单悄悄变贵了

知识问答上,单题输出花费从 4.6 的两毛二美元,涨到四毛九美元。

贵了快一倍。

还有个坑,提示词一旦过 20 万 token,整段请求费用直接翻倍。

牌价没涨,说的是价目表。

牌价没涨,单题账单悄悄变贵了

说到这,得提那个凌晨的鹈鹕测试。

网上有个开发者,零点十四分拉起 Grok Build,丢给 4.7 一道经典题,用纯 SVG 画一只鹈鹕骑自行车的动画。

这题最早 Simon Willison 提的,Karpathy 他们拿来测过,考的是没有视觉反馈下的空间构图。

4.7 想了六秒,实际折腾十八分钟,交卷时自我描述写得那叫一个漂亮。

长喙伸在前轮前面,喉囊跟着起伏,橙色的蹼踩着踏板。

结果浏览器一打开,我直接笑出声。

嘴叠成上下两层,翅膀后面飘着灰色文字框,两条橙腿一条踩踏板一条在半空踩水。

完美印证了马斯克自己那句,多模态还得修。

纯靠语言模型脑补几何,文字天花乱坠,画面完全脱节。

不过得公平,第一批上手的人,口碑两极分化得厉害。

有人拿它做《帝国时代 II》的演示,有人照平面图搭 Blender 再导出 Three.js 网站,多步骤视觉任务确实能跑。

也有开发者反馈,3D 和前端的物理效果生硬,提示理解不稳,token 还烧得快。

直升机模型有人跑了 45 分钟。

所以视觉和前端这块,别指望它封神

视觉别指望封神,代码工程账完全反过来

代码工程里,账完全反过来。

Cursor 官方那张表我盯了很久。

Fable 5.1 Max 解决率 51.8%,一题平均花 17.28 美元。

Opus 5 Max 46.6%,11.95 美元。

Grok 4.7 Extra High,46.3%,紧贴 Opus,一题只要 6.01 美元。

降到 High 档,43.9% 解决率,4.69 美元。

你品品,花一半的钱,办下 Opus 级别八成的事

日常 coding 重构、测试补全、常规排障,它是真香。

还有个别人不太提的暗器。

这代训练数据里塞了 SpaceX 多年的工程资料,星链卫星遥测、制造记录、故障日志。

别家没有这玩意。

xAI 想让它不止背互联网文字,还能懂硬件和真实物理系统。

EEBench 拿第一,多少跟这个有关。

这条路挺聪明,别人卷通用,它往工程纵深扎。

它是补位,不是让所有人闭嘴的跨代更新

拉远一点看。

大模型这仗,已经从卷谁更聪明,变成卷谁更便宜、更快、更能把活干完。

Grok 4.7 不是一次让所有人闭嘴的跨代更新。

它是 xAI 把 Grok 推回前沿混战区的一次补位。

模型竞争正在进入完成整项工作的阶段,读材料、调工具、出文件、自己复核。

单次问答只是其中一环。

4.7 延长推理、强化自检,就是给这类长流程补课。

马斯克自己也实在,说 4.7 大致跟 Opus 5.0 相当,赶不上 5.1,大跨越留给 4.8 和 4.9。

这种发布前就把预期摁下来的老板,反而让人想再看一眼。

所以回到开头那群通宵守着的人。

如果你日常靠 Cursor、GitHub Copilot 或者终端 Agent 干活,Grok 4.7 值得换上试试。

开 High 档,四块六毛九一题,花一半的钱办下八九成的事。

极端攻坚另说,那种活 Fable 还在它的位置。

但日复一日推进项目的,能省一半账单还不掉链子的模型,往往才是真留下的主力。

随机文章