当前位置:首页>排行榜>GPT-6 Astra 深度评测,有点离谱...

GPT-6 Astra 深度评测,有点离谱...

  • 更新时间 2026-09-22 15:35:16
GPT-6 Astra 深度评测,有点离谱...

OpenAI 在 2026 年 9 月 4 日(北京时间)发布了新一代旗舰模型 GPT-6 Astra,代号在拉丁语里意为星辰。

官方把它定义为全球最智能、对齐最好的模型,明确把重心从聊天问答转向自主完成任务。训练动用了得州 Stargate 超算超过 10 万块 GPU,是 OpenAI 首次大规模用前代模型参与监督训练的旗舰产品。

它不是又一个只会聊天的 bot,定位是 computer-use agent,能操控浏览器、办公软件、开发工具去完成多步骤工作流,再把成品交给你。这种从“给答案”到“交成果”的跳跃,是这一代最该被记住的变化,意味着 AI 竞争的标尺从“谁更会聊”变成了“谁真能把事办成”。

入口都在 OpenAI 自家体系内,认准官网与 API 文档这两个地址,别去第三方镜像折腾。

想第一时间试,直接装 ChatGPT 桌面端最省事,灰度从那里推,比苦等 API 配额更早摸到真实能力,企业用户走 API 还能拿到完整参数和更高额度。

一、核心功能

前面说了它要自己干活,下面看看底子到底有多厚。Astra 最大的变化是操作计算机:你给它一个目标,比如把财报做成演示文稿,它自己拆任务、调工具、边做边查,再交付成品。

它能填在线表单、更新 CRM、整理日历、做网页研究摘要,也能分析科学数据、画图表、建网站并跑前端 QA。

OpenAI 展示的案例里,它能把电子原理图转成可制造 PCB,用 Unity 做游戏原型,在 Blender 建好房再导入虚幻 5 让人走进去体验。找儿科医生人工要 5 小时,它不到 3 分钟。法律平台一次性核查 41 份财报,预埋的 4 处错误一个没漏,这种长链路准确率正是 agentic 模式最值钱的地方。

理解 Astra 得看它的工作方式,它不是单模型硬扛,而是分层协作:上层接住你的目标和授权边界,中间规划并记住跨上下文的信息,下层调度一连串工具去执行,再经安全门控后交付。这套结构决定了它为什么能跑长任务而不中途失忆,也解释了为什么它比单纯大模型更难被对手抄作业。

关键在跨上下文记忆。过去 Codex 靠压缩旧对话,会丢掉为什么某次修复失败。Astra 保留笔记并回查早期消息和工具输出,长任务不丢上下文。reasoning 还新增 xhigh 和 max 两档,复杂工程任务可以拉满算力,代价是更慢更贵,按难度切换即可,不必全程开满浪费预算。

数字最能说明问题,下面这组 OpenAI 自测成绩,是 Astra 相对上代 GPT-5.6 Sol 的代际跃升,部分维度已经接近饱和。需要提醒的是,这些数字多来自 OpenAI 自家评测,第三方尚在复核,读的时候留一分余量,别被接近满分的成绩单冲昏头。

ARC-AGI-3 从 7.8% 跳到 99.9%,几乎打满;FrontierMath Tier 4 到 97.6%;OSWorld 2.0 任务完成率 72.6%,平均耗时从 75 分钟压到 40 分钟,约降 47%。数学、抽象推理、计算机操作三块同时起飞,这才是“代际”二字的底气,不是挤牙膏式的小修小补,而是整段能力的重新排列。

二、上手深度体验

根据官方消息,GPT-6 Astra接下来将面向ChatGPT Plus、Pro、Business和Enterprise等付费用户逐步开放。

(Plus之外还能获得Astra Pro访问权)

具体哪天轮到自己,OpenAI没给准信,只说“未来几天”。

但从已经公开的第一批作品来看,提前玩上的这群人,显然没打算拿GPT-6做普通问答。

他们上来就给它接软件、塞工具、开长期任务。

一句话,往死里蹬。

而最先被玩出花的,就是3D生成。

1.3D生成效果炸裂

从各方实测来看,GPT-6的空间能力明显进步了一大截。

在和Fable 5.1的同题PK中,两者都被要求在Blender里搭建一座海边别墅。

Fable版只是搭出了别墅的基本框架,Astra版则连沙发褶皱、桌面杯具、池边摆件和远处植被都补了出来,细节直接从“样板间”卷到了“拎包入住”。

光盖房子这一项,GPT-6就直接把整个行业卷到了新的高度:

看房源照片、建3D模型、补齐室内陈设,顺手再剪一支房产宣传片,一条龙全搞定。

有网友直接丢给Astra一条Zillow房源链接。

模型根据其中的照片重建出整套房屋,还一次生成了配套宣传视频。

虽然网友也承认,成片仍有一些细节不够准确,但别忘了——

这只是一次生成,还没继续返工

盖一间大别野算啥,整个曼哈顿一周都能给你盖完。

Astra会沿着街道一条条往前施工,逐个补齐建筑与街区细节,中央公园和周边城市轮廓也被完整搭了起来。

关注
重播 分享

好家伙,别的AI盖楼,GPT-6开始搞城市基建了。

建完还不收手,转头又进了电影片场。

Higgsfield让Astra负责一段博物馆戏的空间调度:

先摸清场馆布局,再安排演员阵容、镜头清单和人物走位,确保演员始终留在取景框内,最后交给Seedance 2.5逐镜渲染。

从搭景、走位到出片,一条流水线全串起来了。

关注
重播 分享

房子和城市,考验的还是怎么往空间里摆东西,而拍电影还要算清人怎么动、镜头怎么跟。

没想到这一套Astra也hold住了。

Higgsfield测完后直接给出最高评价:

GPT-6 Astra在空间推理能力方面达到了世界级水平

评论区也看傻了,空间推理明明是大家最没想到会迅速突破的能力,如今却连电影调度都开始接管。

还有网友已经忍不住宣布:

个性化电影时代,来了。

2.打游戏、造游戏,它全包了

既然3D建模能力很强了,游戏这一块GPT-6自然也没落下。

不过在看它怎么造游戏之前,先康康这位AI玩家的战绩。

此前,GPT-5.6 Sol曾经挑战过《宝可梦火红》,花了96小时35分钟才成功通关。

GPT-5.5更是连续奋战218小时,依然没能打完。

到了GPT-6 Astra,通关时间直接压缩到18小时12分钟,速度提升超过5倍

而且整个过程主要依靠游戏截图,没有完整内存信息、攻略和人工提示,模型需要自己识别地图、规划路线、战斗升级,再判断下一步往哪走。

从“磕磕绊绊打不完”,到一天之内登顶冠军。

GPT-6,技惊四座。

更离谱的是,它不光自己打游戏,还能转头给人造游戏。

开发者Matthew Berman让Astra制作了一款《糖豆人》风格的闯关游戏。

选手们同场乱斗,旋转杆、摆锤、冲线淘汰一个不少。

从操作界面到关卡玩法都有模有样,打开浏览器就能直接开跑。

关注
重播 分享

另一位开发者更狠,只用一个提示词,就让Astra配合Tesana Game Maker做出了一款10对10的《光环》风格多人FPS。

地图、武器、阵营对抗和多人联机逻辑一套配齐,完成度直接从“能跑起来”卷到了“真能玩”。

关注
重播 分享

难怪围观网友齐呼:

Astra做出来的游戏不只是能玩,是真的好玩。

还嫌不过瘾,有人干脆把Astra和Fable 5.1拉到一起,同题制作了一款《GTA 6》风格的游戏。

相同提示词下,Fable花了大约2小时,Astra只用了90分钟

两边都搭出了能够驾驶探索的城市,但Astra提前半小时交卷,街道、楼宇、车辆、行人和任务界面也都塞了进去。

而最有赛博味的,还得是Matt Shumer的实验,他说自己遇到了用Astra的第一个“holy shit”时刻。

他让Astra在虚幻引擎里创建了一个世界,然后往里面放了一群人类角色,每一个都由Astra驱动。

规则很简单,这些Agents需要合作才能生存。

第二天,他在卧室里,突然听到客厅传来说话声,以为有人闯进了他的公寓。

走出去一看,是Astra的Agents——它们自己开始互相对话了。

一群AI角色被设定了“生存”目标,然后自发地开始社交。

好好好,以前做游戏是先建模、写代码、设计NPC。

现在只需要告诉GPT-6想玩什么,剩下的世界,开始自己长出来了。

3.网页开发这些基本功,也没落下

前面又是拍电影,又是造游戏,差点让人忘了,写代码、做网页才是GPT系列的传统艺能。

到了Astra,这些基本功自然也没掉链子。

有开发者让它用Three.js制作了一艘“瓶中船”:

17世纪帆船在海浪中上下摇晃,周围还有盘旋的海鸥、迷你港口和珊瑚礁。

结果不仅海浪和船身带有实时物理效果,连展示视频和背景音乐也被一并包办。

还有开发者Peter Gostev,让Astra直接用SVG画了一只孔雀。

尾羽、纹理、光影和开屏动画一应俱全。

以及Astra还能写歌。

网友Schirano把软件Ableton交给它,模型从零创建合成器音色、各个声部和整曲编排,最后交出一首完整音乐。

这已经不是让AI音乐模型吐一段音频那么简单了。

关注
重播 分享

类似案例还有很多,这里就不一一展示了。

至少从目前放出的首批实测来看,无论是3D建模、电影制作、游戏开发,还是写代码、做网页,GPT-6 Astra交出的作品都相当惊艳。

是谁看完了一直在狂刷模型列表!!

4.注意Token消耗啊喂

估计看完以上demo,大家很容易产生一种感觉:

以后做3D、开发游戏、写网页,全靠一句话就行了?

先冷静一下。

这些作品虽然经常被描述成“一条Prompt完成”,但背后并不是只有一个聊天框。

它们通常还接入了Codex、MCP、Blender插件、Unity、Unreal Engine、浏览器测试工具和专门的Agent脚手架。

所以真正变强的是“模型+工具+长时间运行”的整套系统。

而这套系统是真能吃Token啊。。。

社区测试中,一个加拉塔塔楼3D项目运行约41分钟,消耗约9.1万Token。

Berman的《模拟城市》更是连续跑了5天,算下来整个项目可能消耗数千万Token,按GPT-6正式价格计算,费用可能达到数百甚至上千美元。

GPT-6确实强了不少,但可以预想账单也将相当美丽。

只能祈祷赛博义父Tibo多多重置了。

FAQ

把大家最关心的问题集中回答一遍,下面十二条覆盖从能力、价格到部署的大部分疑惑。这些答案基于发布当天的官方信息与早期实测信号,能省你不少翻文档和试错的时间,看完基本能判断自己要不要现在上车。

Q1:GPT-6 Astra 和普通 GPT-5 有什么区别?

A1:核心区别是从问答转向执行。 它能直接操作电脑完成多步骤任务,而不是只给建议。基准上 ARC-AGI-3 从 7.8% 跳到 99.9%,代际差距明显,不是同一代产品的修补。

Q2:普通人现在能用吗?

A2:还不能完全随便用。 发布当天先给 Daybreak 企业用户,随后数日向 Plus、Pro、Business、Enterprise 灰度,等几天才轮到大多数普通用户,企业渠道更早。

Q3:API 怎么调用?

A3:走 OpenAI Responses API,model 填 gpt-6-astra。 把目标当 input 传入即可,模型自行拆解任务,无需手写多步提示词,你只管描述和验收最终结果。

Q4:定价贵不贵?

A4:偏贵,是上代 Sol 的 2.5 倍。 标准价每百万输入 10 美元、输出 50 美元,快速模式再翻倍,长上下文另有阶梯计价,中小团队需先算清任务总成本。

Q5:它真达到 AGI 了吗?

A5:OpenAI 没正式宣布 AGI,只说有理由认为已身处 AGI 时代。 Brockman 把判断权留给读者,强调这是旅程开端而非终点,是否算 AGI 由你自行定义。

Q6:安全吗,会乱来吗?

A6:越权率实测 0%,是迄今最对齐的模型。 无防护措施时 Sol 有 48% 会越界,Astra 把这项压到零,强网安能力反而受限开放,普通用户拿不到完整权限。

Q7:上下文有多长?

A7:105 万 token 输入,最大输出 12.8 万 token。 知识截止 2026 年 4 月 30 日,支持文本与图像输入、纯文本输出,长文档可一次性喂入不截断。

Q8:和 Claude Fable 5.1 比谁强?

A8:Astra 的 agentic 整合更深,Fable 编码与长上下文更强。 两者 API 定价持平,OSWorld 成绩因版本不同不宜直接横比,选谁看你的任务落在哪块。

Q9:为什么思考过程看不懂?

A9:推理更往模型内部藏,外部难追踪决策链。 OpenAI 首席科学家已把可监控性列为后续 Scaling 的重要挑战,透明度问题短期难根本解决。

Q10:有开源或自部署吗?

A10:没有,纯托管闭源,权重不开放。 只能走 ChatGPT、OpenAI API 或 AWS,无法私有化部署到自家硬件,数据出境合规需自行评估。

Q11:快速模式值得开吗?

A11:看任务时效要求。 速度最高 2.5 倍但价格翻倍,紧急交付或长任务赶进度时划算,常规任务用标准档更省,别为一点快感多花钱。

Q12:未来会按任务收费吗?

A12:OpenAI 暗示行业可能转向按任务计费。 当前仍是 token 计价,但官方口径是看单次任务总成本,而非单价高低,任务计费落地后性价比逻辑会变。

GPT-6 Astra 不是一次普通升级,它把 AI 的标尺从会写会答,推到了会干事。computer-use、跨上下文记忆、越权率归零,这三件事叠在一起,确实配得上官方那句欢迎来到 AGI 时代,也值得认真看待而非当营销。

但它不是所有人的立刻选项。2.5 倍定价、灰度开放、思考不透明,都意味着普通人先观望、企业先试点更稳。把任务定义清楚、把边界讲明白,比追逐参数更重要,工具越强越考使用者的功力,别被宣传带节奏。

这一代真正改变的,是我们和工具的关系:从你教它怎么做,变成你告诉它要什么。剩下的问题,交给接下来几个月的真实落地,让独立复测和大众口碑替我们作答,那时候再下最终判断也不迟。

👇点击下方关注 看最新干货!

随机文章