
《OpenAI 智囊团一日发言|2026-08-02》
Astra 的内部科学推理信号与 Codex、ChatGPT Work 的用量重置、云端浏览器和 Computer Use 进展,显示 OpenAI 正把模型效率转成更长时间运行、可观察的 Agent 工作流。
北京时间 2026 年 8 月 1 日 09:00 至 8 月 2 日 09:00 的个人账号窗口内,较强信号集中在两条线上:Astra 把科学推理的成本和测试时计算推到新的展示区间;Codex 与 ChatGPT Work 则继续把产品做成可以观察、干预和反复运行的工作系统。长形式内容延伸检查至 7 月 31 日 09:00,未发现能由视频详情时间确认、且落在 48 小时窗口内的白名单人物或 OpenAI 官号新视频/直播回放。最终保留 11 条个人信息点,少数账号只有噪音或没有新发言,未为凑数纳入。
今日最重要判断
1. Astra 的首个公开信号是科学推理展示,不是模型正式发布
Noam Brown(OpenAI 研究人员)在北京时间 8 月 1 日 16:17 的原文:
An internal version of Astra, @OpenAI’s next major model family, solved 10 major open problems in mathematics, quantum complexity, and theoretical computer science.We believe it will be a major step for scientific reasoning. https://t.co/iP6cyheZ7i https://t.co/jHuulDwV46
中文翻译:
Astra 的一个内部版本解决了数学、量子复杂性和理论计算机科学领域的 10 个重大开放问题。Astra 是 OpenAI 的下一代主要模型家族。我们认为,它将成为科学推理的一大步。
Greg Brockman(OpenAI 联合创始人兼总裁)在北京时间 8 月 1 日 15:39 补充:
ten significant advances in mathematics and theoretical computer science.solved using an internal version of Astra, our next major model, for a total cost of about $2000 at Sol API prices:
中文翻译:
数学和理论计算机科学领域的十项重要进展。使用 Astra 的内部版本解决,按 Sol API 价格计算,总成本约为 2,000 美元:
这里有三个限定词不能删掉:
internal version,说明不是公开可用模型;at Sol API prices,说明成本是按现有接口价格估算的推理成本,不是训练成本;open problems,说明是研究问题,不等于模型已经在现实科研流程中独立完成了验证。OpenAI 的配套文章列出十项结果,并说明其中一部分由研究人员整理成 Lean 形式化证明,再由模型协助生成或修补证明。1Loading content card…
2. 这条信号真正改变的变量,是测试时计算还有多少预算可以继续加
Noam Brown 在北京时间 8 月 1 日 17:01 的原文:
And yes we did try other major problems without success. Sadly no Millennium Prize problems (yet).But also, we didn’t spend a lot on each problem. It’s possible to push test-time compute much further.
中文翻译:
是的,我们也尝试过其他重大问题,但没有成功。遗憾的是,目前还没有解决 Millennium Prize 问题。不过,我们在每个问题上花费的计算量也不多。测试时计算还可以大幅增加。
同一串发言里,他把十项结果的证明生成成本限定为低于 2,000 美元,并说 OpenAI 期待研究人员使用即将推出的 Astra 模型。读者应把它理解为一条能力和路线信号:当前展示的结果可能依赖更长的搜索、更多候选证明或更大的验证预算,单次成本与稳定解决率之间的关系还没有公开。Noam 还说,解决 Millennium Prize 问题最快的路径,可能是让大规模团队帮助构建下一代通用模型。这个判断属于研究人员观点,不是 OpenAI 对发布时间或能力范围的承诺。
Loading content card…
3. ChatGPT Work 的云端浏览器把「代理」推进到可观察、可干预
Greg Brockman 在北京时间 8 月 2 日 03:51 的原文:
chatgpt work's cloud browser is really cool to use, lets you easily monitor what your AI is up to and also intervene with the live application if needed
中文翻译:
ChatGPT Work 的云端浏览器用起来很不错,你可以轻松监控 AI 正在做什么;如果需要,也可以干预正在运行的应用。
这句话的产品含义比「浏览器能替你点击」更具体:任务执行过程被放到可查看的实时界面里,用户可以在运行中接管。它把代理产品的核心问题从单次动作成功率,扩展到权限、过程可见性和撤销时机。Brockman 同一窗口还说自己用 ChatGPT Work 做深入研究和事实核查,但这两条都是高管个人使用体验,不能推成所有账号、地区和套餐已经具备同样能力。
Loading content card…
4. Codex Computer Use 的有用演示,不是生成代码,而是把旧软件重新跑起来
OpenAI 前研究人员 Gabriel 在北京时间 8 月 1 日 13:36 的原文:
brought this windows 95 game from sweden that i used to play when i was like 6have not been able to boot it ever since, let's give codex computer use a spinpray to TIBOTHY gods https://t.co/zy8f1VXP69
中文翻译:
我带来了一个小时候玩过的瑞典 Windows 95 游戏。从那以后我一直没能把它启动起来,来试试 Codex Computer Use。祈祷 TIBOTHY 之神保佑。
随后他给出的结果是:
NOOO WAYYY CODEX GOT MY GAME RUNNING 😭😭 https://t.co/c6T7poGWs4
中文翻译:
不会吧,Codex 真的把我的游戏跑起来了。
这不是受控基准,也不是官方成功率数据。它的价值在于任务链很长:识别旧介质、处理兼容环境、选择工具,再把结果交还给用户。Computer Use 若要从演示走向常用功能,环境隔离、软件来源、系统权限和失败后的回滚会比单次操作更重要。
Loading content card…
模型与推理
1. Astra 的成本数字指向「推理预算」而不是免费科研
Noam Brown 说十项突破的证明生成成本「低于 2,000 美元」,而 Greg Brockman 说按 Sol API 价格计算约为 2,000 美元。两者口径相互吻合,但都没有给出每个问题的计算量、失败尝试数、人工筛选时间或验证总成本。OpenAI 官方文章也把研究人员的形式化、检查和修补工作写进流程。今天可以确认的是:模型输出已经进入科研证明工作流的一个环节;不能据此确认 Astra 已经公开、自动化或能稳定解决任意开放问题。
2. 「再增加测试时计算」可能比一次性扩大模型规模更先进入产品
Noam Brown 明确说,当前每个问题没有花费太多预算,测试时计算仍可继续增加。这句话没有给出下一档预算或性能曲线,却把后续观察点说清楚了:Astra 的公开材料若继续增加,应同时看问题选择、搜索预算、验证器和人工介入,而不能只看一张最终解题清单。现阶段这是研究路线信号,尚不是规格公告。
Agent / Codex
3. 用量重置是一次周末运营动作,不是永久配额升级
Tibo(Codex 与 ChatGPT 产品团队)在北京时间 8 月 1 日 11:32 写道:
To celebrate a week of efficiency and let you run 100'000 Luna threads this weekend... that's right... wait for it... I have reset usage limits for Codex and ChatGPT Work.Enjoy.
中文翻译:
为庆祝效率提升,也为了让你这个周末运行 100,000 条 Luna threads……没错,等着看吧……我已经重置了 Codex 和 ChatGPT Work 的使用限制。祝用得开心。
这条信息能确认的是一次使用限制重置,以及团队希望用户在低成本模型上增加实际运行量。它没有确认订阅额度永久增加、所有地区同步执行,或 100,000 成为每个用户的固定预算。此前 OpenAI 对 GPT-5.6 的官方说明把模型、推理栈和 agentic harness 的效率收益都放进价格与用量折算中,Tibo 这条发言更像是把效率收益转成短期使用刺激。
Loading content card…
4. 周末用户少用 /fast,是产品遥测,不是模型偏好结论
Tibo 在北京时间 8 月 2 日 07:42 写道:
Fun fact, users use /fast less during the weekend. The weekend is for relaxation, even for the model.
中文翻译:
一个有趣的事实:用户周末更少使用/fast。周末是休息时间,模型也一样。
这透露了团队能看到不同处理速度选项的使用行为,但没有提供比例、用户数或收入影响。它更适合当作产品运营观察:速度加价功能的需求可能随工作日场景变化;不能写成用户普遍更喜欢慢模型,也不能由此判断 Fast mode 的商业化效果。
产品与应用
5. Work 的价值主张开始靠结果和过程控制区分于普通聊天
Brockman 还写道,自己用 ChatGPT Work 做「extremely thorough research and fact checking」。与云端浏览器的实时监控放在一起看,Work 的产品信号有两个层次:一是让系统替用户完成持续、耗时的资料工作,二是让用户在过程中检查和干预。两条都是个人体验,不等于官方帮助中心已经确认所有用户可复现同样流程。
6. Slack 场景暴露了代理产品的社会边界
Brockman 在北京时间 8 月 1 日 14:10 写道:
at openai, many people hook their chatgpt up to slack.people really don't like when a coworker's chatgpt contacts them asking for help with a task, even when they'd be perfectly happy doing that same work if asked by that coworker.reinforces how much people care about human relationships and helping each other, and want AI to give time back — or enhance time together — rather than become a layer separating people.
中文翻译:
在 OpenAI,很多人把 ChatGPT 接入 Slack。人们很不喜欢同事的 ChatGPT 联系自己,请自己帮忙完成任务;但如果是那位同事亲自来问,他们本来很可能愿意做同样的工作。这再次说明,人们在意人与人之间的关系,也愿意互相帮助。他们希望 AI 还给自己时间,或让相处时间更好,而不是变成隔在彼此之间的一层。
这不是安全政策,却是代理产品的权限设计问题:被动收到一条机器代发请求,与主动和同事协作,承担的关系成本不同。未来的 Agent 需要让用户看见谁在发起、为什么联系别人、请求了什么,而不是只优化任务完成率。
7. Codex Computer Use 的真实价值在于跨过环境摩擦
Gabriel 的 Windows 95 游戏案例中,Codex 不是从空白目录生成一个小程序,而是面对旧介质和新电脑之间的兼容问题。他先用语音给出目标,随后记录了系统识别 CD、尝试环境配置和最终启动游戏的过程。这个案例无法证明产品对其他旧软件同样稳定,却说明 Computer Use 的用户价值可能来自处理那些人类知道怎么做、却嫌设置成本太高的任务。
AI 安全与政策
8. 开放权重的安全判断要把模型和进入它的生态放在一起
Mira Murati,OpenAI 前 CTO、现 Thinking Machines 创始人,在北京时间 8 月 1 日 07:48 写道:
We share our approach to open-weights releases, how we assessed Inkling, why safety depends on both the model and the ecosystem it enters, and how testing, staged access, and stronger defenses can create a path toward greater openness.
中文翻译:
我们分享了开放权重发布的方法、对 Inkling 的评估方式,以及为什么安全性取决于模型本身和它进入的生态系统;测试、分阶段访问和更强的防御能力,可以为更大程度的开放铺出一条路径。
这是外部观察席信号,不是 OpenAI 内部政策。Thinking Machines 的配套文章把分阶段发布、评估和防御写成开放权重的安全路径,核心区别是:风险不只来自模型能力,也来自权重被怎样部署、谁能微调、下游工具如何接入。对读者而言,后续看开放模型时,至少要把权重可得性、访问方式、评估范围和下游防护分开记录。
Loading content card…
外部观察席
9. 生物学仍被前 OpenAI 研究人员视为科学 Agent 的高价值方向
Shyamal Adkat,曾在 OpenAI 工作、现从事应用 AI,在北京时间 8 月 2 日 00:54 写道:
moved to bangalore recently to build.traffic is wild. but people are nice. i definitely feel the ambition + energy accelerating.we need to accelerate scientific discovery. biology is the ultimate hill to climb. but before that, we have work to do. excited for the next decade.
中文翻译:
我最近搬到班加罗尔来做建设。交通很疯狂,但人们很友善。我确实感到这里的雄心和能量正在加速。我们需要加速科学发现。生物学是最终要攀登的高山,但在那之前还有工作要做。我对接下来的十年感到兴奋。
这条发言没有透露 OpenAI 的新项目,也没有提供具体模型或组织信息。它与 Astra 的科学推理信号放在同一窗口里,能说明外部观察席如何看待 AI 的下一阶段应用方向,但不应写成 OpenAI 已经把生物学列为正式产品路线。
10. 模型能力已经进入很普通的内部事务,未必都以科研任务出现
Codex 团队成员 Charlie Guo 在北京时间 8 月 2 日 00:36 写道:
Crazy that our models can do Fields level math and I’m using them to archive spam emails
中文翻译:
很疯狂,模型能做菲尔兹奖级别的数学,而我却在用它们归档垃圾邮件。
这是一条个人使用场景,不是基准报告。它的判断价值在于提醒产品团队:最高端能力的商业价值,常常通过低戏剧性的重复工作兑现。对模型供应商来说,科学推理展示和垃圾邮件归档并不矛盾,前者证明上限,后者决定日常留存。
11. OpenAI 员工的产品反馈,仍在围绕 Work 的插件工作区收集
OpenAI 员工 Jason 在北京时间 8 月 2 日 06:08 发问:
If you use chatgpt work.Can you share a screenshot of what your plugin tabs looks like? https://t.co/eTieg4d0yp
中文翻译:
如果你使用 ChatGPT Work,可以分享一下你的插件标签页是什么样的吗?
这不是功能发布,却是一个有用的组织信号:产品团队在收集真实用户的工作区形态,插件标签、任务上下文和工作流组织仍可能处于快速调整阶段。它不能证明新插件或新界面已经上线。
ChatGPT 产品更新
本窗口内与 ChatGPT 产品直接相关的个人和官方信息已经超过两条,单列如下。它们的证据层级不同,不能混成一个发布公告。
- ChatGPT Work 云端浏览器,产品使用体验:Greg Brockman 说用户可以查看 AI 的实时操作,并在必要时接管。来源:原帖。
- ChatGPT Work 与 Codex,用量重置:Tibo 宣布周末重置使用限制,并用「100,000 Luna threads」描述可运行规模。这是窗口内团队成员的运营发言,不是永久额度或统一套餐说明。来源:原帖。
- Activity view,桌面端产品更新:@OpenAIDevs 在北京时间 8 月 1 日 04:28 发布,称新的 Activity view 会汇总需要用户关注的对话,以及项目近期更新。来源:官方原帖。
- GPT-5.4 与 GPT-5.4 mini 的 ChatGPT 下线时间:@OpenAIDevs 在北京时间 8 月 1 日 05:18 说明,两款模型自 8 月 31 日起不再提供给登录 ChatGPT 的用户,但仍可在 OpenAI API 和使用 API key 认证的 Codex session 中使用。来源:官方原帖 · ChatGPT/Codex Changelog。
- 桌面端 Voice 转发入口:@OpenAIDevs 在北京时间 8 月 1 日 04:26 转发 @ChatGPT 关于桌面端宠物入口打开 Voice、查看工作状态的内容;原帖在当前详情中被截断,因此只记录为转发入口,不扩写为独立公告。来源:官方转发。
OpenAI 官号当日动态
时间范围为北京时间 8 月 1 日 09:00 至 8 月 2 日 09:00。个人信号与官号内容分开统计。
@OpenAIDevs
- 互动回复,非公告。北京时间 8 月 1 日 05:20 回复 @Weichaus:「😉」。来源:原帖。
- 产品更新。北京时间 8 月 1 日 05:18 发布 GPT-5.4 与 GPT-5.4 mini 将于 8 月 31 日停止向 ChatGPT 登录用户提供,API 和 API key 认证的 Codex session 保留。来源:原帖。
- 技术博客/模型效率回顾。北京时间 8 月 1 日 05:18 转发 GPT-5.6 效率收益已传导到 Luna 与 Terra 成本,原文称成本分别下降 80% 和 20%。这是窗口内转发,原始 OpenAI 文章与原帖更早发布。来源:转发 · 原始 OpenAI 原帖 · OpenAI 产品页。
- 产品发布。北京时间 8 月 1 日 04:28 发布桌面端 Activity view,把需要关注的对话和项目更新放在同一视图。来源:原帖。
- 转发入口,非独立公告。北京时间 8 月 1 日 04:26 转发 @ChatGPT 关于桌面端 Voice 入口的内容,原文在详情中截断。来源:转发。
@OpenAI
今日官号无新动态。时间线最近的可验证内容早于本期 24 小时窗口。
@OpenAINewsroom
今日官号无新动态。时间线最近的可验证内容早于本期 24 小时窗口。
OpenAI YouTube
过去 48 小时内未发现能由视频详情发布时间确认的新视频或直播回放。搜索结果中的相对时间标签和空发布时间字段没有被当作窗口证据。OpenAI YouTube 频道
今日关注优先级:高
Astra 的信息仍停留在内部版本和研究展示,不能当作可用模型发布;但它同时给出了十项科学问题、约 2,000 美元的 Sol API 估算,以及测试时计算可以继续增加的明确说法。另一条高优先级线索是 Work/Codex 的运营化:用量重置、云端浏览器的实时干预和 Activity view,把 Agent 从回答界面推向持续运行的工作环境。接下来应重点看 Astra 是否出现正式模型页或更完整技术报告,以及 Work 的云端浏览器何时获得公开的权限、审计和撤销说明。
Related content
- Sign in to comment.
