首批GPT-6内测结果好离谱啊。。。

量子位记录 GPT-6 Astra 首批内测者如何用模型完成 3D 建模、电影调度、游戏和音乐制作,也提醒读者“一条 Prompt”背后依赖完整工具链与高昂 Token 成本。

转载说明:本文转载自微信公众号「量子位」,公众号 QbitAI;原文发表于 2026 年 9 月 4 日。原文未显示作者署名,本文保留原文报道内容、主要表述和判断,并清理微信页面导航、关注引导、二维码及装饰性页面残留。
量子位这篇报道记录了 GPT-6 Astra 首批内测者公开的使用结果:有人让它在 15 分钟内做出一款 Mac 应用,也有人让它建 3D 房屋、调度电影镜头、通关游戏、制作游戏和编排音乐。报道真正值得读的地方,在于这些演示共同指向一种工作方式变化:模型开始和软件工具、开发环境及长时间运行任务连在一起,交付的不再只是一段文字或代码。1

先看首批内测者把 Astra 用来做了什么

GPT-6 Astra 的使用资格仍在分批开放。量子位援引官方消息称,ChatGPT Plus、Pro、Business 和 Enterprise 等付费用户将逐步获得访问权限,OpenAI 当时只表示开放会发生在“未来几天”,没有给出更具体的日期。1
已经拿到资格的开发者,很快把 Astra 接入软件、工具和长期任务。开发者 Pietro Schirano 让它先在 Blender 里制作一个 3D iPod,再还原经典界面与交互,最后做成一款用于查看 Codex 线程的 Mac 应用。文章称,这个应用在 15 分钟内完成,菜单、滚轮和 iPod 界面都被做了出来,应用内部则放入 Threads、Projects、Pinned、Recent 等 Codex 内容。1
3D 建模、游戏开发、网页 UI、音乐制作和游戏通关,构成了首批公开案例的主要范围。量子位把这些案例放在一起观察,想说明的是:Astra 的内测用户没有把它当作普通问答模型,而是把它放进了可以调用软件、修改产物并继续执行的工作流里。1

3D 建模:从房屋到整座曼哈顿

在 Blender 海边别墅的同题测试中,Fable 5.1 主要完成了别墅基本框架;Astra 版本继续补出了沙发褶皱、桌面杯具、池边摆件和远处植被。文章用“从样板间到了拎包入住”形容两者在细节上的差别。1
另一个案例来自 Zillow 房源。开发者把房源链接交给 Astra,模型根据其中的照片重建整套房屋,并一次生成配套宣传视频。原文也保留了限制:成片仍有一些细节不够准确,而且案例只完成了一次生成,尚未继续返工。1
文章还提到一个更大的建模任务:Astra 沿着街道逐条推进,补齐曼哈顿的建筑与街区细节,中央公园和周边城市轮廓也被搭了出来。报道用这个案例把任务尺度从“一间房”推到了“整座城市”。1
Astra 也被放进了电影制作流程。Higgsfield 让它负责一段博物馆戏的空间调度:先理解场馆布局,再安排演员阵容、镜头清单和人物走位,确保演员始终处在取景框内,最后交给 Seedance 2.5 逐镜渲染。这个案例要求模型同时处理空间、人物和镜头的变化,原文据此引用 Higgsfield 的评价,称 Astra 的空间推理能力达到世界级水平。1

它开始自己打游戏,也开始造游戏

游戏通关案例提供了一个更容易比较的时间尺度。GPT-5.6 Sol 此前挑战《宝可梦火红》时,用了 96 小时 35 分钟通关;GPT-5.5 连续运行 218 小时仍未完成;Astra 的通关时间则是 18 小时 12 分钟,量子位据此称速度提升超过 5 倍。文章称,Astra 主要依靠游戏截图,没有完整内存信息、攻略或人工提示,需要自己识别地图、规划路线、战斗升级,再判断下一步行动。1
Astra 也被用来制作游戏。开发者 Matthew Berman 让它做一款《糖豆人》风格的闯关游戏,游戏里有同场竞争、旋转杆、摆锤和冲线淘汰等机制,打开浏览器即可运行。另一位开发者让 Astra 配合 Tesana Game Maker 制作一款 10 对 10 的《光环》风格多人 FPS,地图、武器、阵营对抗和多人联机逻辑都被纳入同一个项目。1
还有一次同题比较:Astra 和 Fable 5.1 使用相同提示词制作《GTA 6》风格游戏。文章称,Fable 花了约 2 小时,Astra 用了 90 分钟;两者都做出了可以驾驶和探索的城市,Astra 的城市中还加入了街道、楼宇、车辆、行人和任务界面。1
Matt Shumer 的实验则把重点放在游戏世界里的智能体。Shumer 让 Astra 在虚幻引擎中创建一个世界,再放入一群由 Astra 驱动、必须合作求生的智能体。文章称,第二天 Shumer 在卧室里听见客厅传来声音,走出去后发现这些智能体已经开始互相对话。1
这个案例在报道里承担了一个清晰的转折:过去做游戏,需要先建模、写代码和设计 NPC;现在,操作者可以先给出一个想法,再让模型把部分世界、角色和规则组织起来。具体效果仍然依赖环境和工具,但任务的起点已经从单个素材生成,移向了完整项目的搭建。1

网页、代码和音乐仍然是基本功

网页与代码案例没有脱离传统能力,却把交付范围拉得更长。开发者让 Astra 用 Three.js 制作“瓶中船”:17 世纪帆船在海浪中上下摇晃,周围有海鸥、迷你港口和珊瑚礁,船身与海浪带有实时物理效果,展示视频和背景音乐也一并生成。1
开发者 Peter Gostev 让 Astra 直接用 SVG 绘制孔雀,尾羽、纹理、光影和开屏动画都被放进了作品。另一个案例里,Schirano 把 Ableton 交给 Astra,模型从零创建合成器音色、声部和整曲编排,最后交出一首完整音乐。1
这些案例让“会写代码”变成了更具体的任务链:模型需要理解软件环境,生成或修改项目文件,反复运行并检查结果,再把网页、动画、游戏或音乐交付出来。量子位据此判断,首批实测覆盖的已经不只是 3D 建模,也包括电影制作、游戏开发、网页制作和音乐编排。1

“一条 Prompt”背后其实是一整套系统

看到这些演示,读者很容易把结果理解成“以后做 3D、开发游戏、写网页,全靠一句话就行”。原文随后给出限制:很多“一条 Prompt 完成”的演示,背后接入了 Codex、MCP、Blender 插件、Unity、Unreal Engine、浏览器测试工具和专门的 Agent 脚手架。1
因此,演示中真正发生变化的对象,是“模型 + 工具 + 长时间运行”的整套系统。操作者给出目标之后,模型要调用软件、读取中间结果、修改产物并持续运行;最终效果不能只归因于一个聊天框里的单轮回答。1
成本也随任务长度一起增加。量子位援引第三方测评称,在 Terminal-Bench 4.0 这一复杂 Agent 基准中,GPT-6 Astra Max 档平均每解决一个任务,需要累计处理约 800 万 Token,折算 API 成本约 17 美元。这个数字只对应单个基准任务。1
原文还举了更长的项目:Berman 的《模拟城市》连续运行了 5 天,按文章的估算,整个项目可能消耗数千万 Token;按照 GPT-6 正式价格计算,费用可能达到数百美元甚至上千美元。这个估算取决于项目实际调用量和正式价格,读者应把它看作报道中的成本推算,而不是统一账单。1
Astra 的首批内测结果把两件事同时摆到了读者面前:模型可以把一个想法推进到可运行的项目,长任务也会持续消耗时间、工具调用和 Token。能力边界与账单边界,需要放在同一个测试结果里一起看。1

原文摘录

“他们上来就给它接软件、塞工具、开长期任务。”
——量子位官方公众号原文。1
“所以真正变强的是‘模型+工具+长时间运行’的整套系统。”
——量子位官方公众号原文。1
“GPT-6 确实强了不少,但可以预想账单也将相当美丽。”
——量子位官方公众号原文。1

Fuentes de referencia

  1. 1
    量子位原文

    mp.weixin.qq.com

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado