
《OpenAI 智囊团一日发言|2026-07-30》
本期聚焦 GPT-5.6 Sol 如何进入科研访问、服务栈自优化和长时 Agent harness,并梳理更强能力带来的用量与产品运营压力。
今日最重要判断
研究窗口为北京时间 2026 年 7 月 29 日 09:00 至 7 月 30 日 09:00;长形式内容检查延伸至 7 月 28 日 09:00。合并同一事件后,今天的主线不是又一个孤立的模型分数,而是 GPT-5.6 Sol 开始同时出现在科研工具、生产基础设施和长时 Agent 的运行机制里。与之相伴的,是更强的工作能力已经把用量、成本和配额问题推到了产品运营台前。
1. OpenAI 把前沿模型的学术访问从试点做成了规模化承诺
OpenAI 在北京时间 7 月 30 日 01:19 发布的原文:
We’re giving scientists, mathematicians, and engineers free access to our frontier models—starting with 10,000 researchers and expanding to 100,000 through 2027.ChatGPT for Academic Researchers is built to accelerate discovery across disciplines.中文翻译:我们将向科学家、数学家和工程师免费开放前沿模型,今夏先覆盖 10,000 名研究者,并在 2027 年前扩展到 100,000 名。ChatGPT for Academic Researchers 旨在加速跨学科发现。
这不是普通的教育折扣:官方页面写明,项目面向符合条件的高校研究者,首批今夏开放 10,000 人,目标在 2027 年扩至 100,000 人;参与者可使用 ChatGPT、ChatGPT Work、Codex 以及 GPT-5.6 系列,工作区默认不使用研究者数据训练模型,每人最多邀请 4 名同机构协作者。1 2
Sam Altman 随后把这项计划放进更大的判断里:
so excited for this.very close to models that will significantly accelerate scientific discovery; the best way to do this is for us to empower scientists, not to try to figure out everything ourselves.we all deserve the benefits.中文翻译:非常期待这件事。我们已经非常接近这样一类模型:它们将显著加速科学发现;最好的做法是赋能科学家,而不是试图由公司自己解决一切。我们都应该享受到这些收益。
2. GPT-5.6 Sol 的下一条路线信号,是用模型降低运行模型的成本
OpenAI 在北京时间 7 月 30 日 05:21 发布的原文:
After deployment, we applied GPT-5.6 Sol to advance the frontier of efficiency by making itself more efficient to run.The results:
- 20% lower serving costs from production GPU kernel improvements.
- 15%+ better token-generation efficiency from improved speculative decoding.
中文翻译:部署之后,我们让 GPT-5.6 Sol 参与推进效率前沿,让它变得更容易运行。结果是:通过生产 GPU kernel 改进,服务成本降低 20%;通过改进 speculative decoding,token 生成效率提升超过 15%。
官方技术文章补充了方法:Sol 在 Codex 中分析生产流量、寻找负载不均衡、重写和优化生产 kernel,并设计数百个 draft/speculator 模型实验;这些改动必须同时满足智能、延迟、可用性和可靠性约束。这里的信号不是「模型已经完全自动优化自己」,而是 GPT-5.6 Sol 已被接入一条由生产测量、候选改动、验证和部署组成的工程反馈回路。5 6
3. ARC-AGI-3 的结果提醒开发者:长时 Agent 的能力取决于记忆和 harness
OpenAI 在北京时间 7 月 30 日 07:57 发布的原文:
GPT-5.6 Sol has been used to solve open problems in mathematics. So why was it struggling with ARC-AGI-3, a benchmark of 2D puzzle games?We investigated. The harness was not letting it remember what it had learned.We found that enabling two API settings tripled our scores with 6x fewer output tokens.中文翻译:GPT-5.6 Sol 已被用于解决数学中的开放问题。那为什么它在 ARC-AGI-3 这个二维益智游戏基准上表现吃力?我们进行了调查,发现 harness 没有让它记住已经学到的东西。启用两个 API 设置后,我们的得分提高到原来的约 3 倍,同时输出 token 减少了 6 倍。
官方复盘给出了可复现的边界:标准 harness 在每次动作后丢弃私有 reasoning,并在上下文变长时用滚动截断丢掉更早的动作;改用 Responses API、保留 reasoning、启用 compaction 后,公共集得分从 13.3% 升到 38.3%,输出 token 减少 6 倍。它测到的不是裸模型能力,而是模型、API 设置、上下文管理和 prompting 的组合。7 8
4. GPT-5.6 Sol 的真实用量暴露了能力、成本与订阅配额之间的错位
Codex 与 ChatGPT Work 负责人 Thibault Sottiaux 在北京时间 7 月 29 日 12:09 发布的完整原文:
Hello people of Sol! I've reset usage limits for all ChatGPT Work and Codex users. Together with that, a quick update on GPT-5.6 Sol usage limits.Over the past few weeks, many of you have told us that Sol was using your Codex limits faster than expected. To be clear, we have not reduced usage on any subscription plans.We’ve been digging into what was happening and have landed several improvements. As a result, we expect your usage to last around 18% longer during typical use of Sol. Some of you should already see significantly larger improvements from today. Tomorrow, we’ll also restore the five-hour limit that we temporarily paused while investigating.Here’s what we found:
- GPT-5.6 Sol is much more willing to work for longer, make additional tool calls, and coordinate complex workflows across tools and subagents. That makes it better at solving hard problems, but some tasks were using far more than we intended.
- Sol also works harder at the same reasoning effort than previous models. High on Sol can use more tokens than High did on GPT-5.5.
- Programmatic tool calling, also referred to as code mode, gives Sol much more flexibility to run tool calls in parallel or continue working while waiting. But it also led to more responses per turn, more cached input tokens, and higher usage than expected.
- This was particularly noticeable when Sol was waiting for tool calls to finish or running many web searches. We’ve improved how we handle both cases and are continuing to make code mode more efficient.
- The impact was also very uneven. The median user actually found Sol quite token efficient, while some power users working on harder tasks saw their usage drain much faster. We were very focused on average and median usage before launch and missed some cases where the long tail could use significantly more usage.
Sol is a significant step forward in what Codex can do, but capability and efficiency do not always improve at the same pace, and some issues only become clear once people are using the model at real-world scale. We should have recognized this sooner and been more upfront about it.You keep pushing the frontier and we’ll keep improving efficiency and sharing updates as we go.中文翻译:Sol 的用户们好!我已经为所有 ChatGPT Work 和 Codex 用户重置了使用额度,同时快速更新一下 GPT-5.6 Sol 的额度情况。过去几周,很多人告诉我们,Sol 消耗 Codex 额度的速度比预期更快。需要明确的是,我们没有降低任何订阅计划的使用量。我们一直在调查原因,也已经完成了几项改进。因此,我们预计在典型使用场景下,Sol 的额度可持续时间会延长约 18%。从今天起,一些人的改善幅度应该会明显更大。明天,我们也会恢复调查期间暂时暂停的五小时限制。我们发现:Sol 更愿意长时间工作、进行更多工具调用,并在工具和子 Agent 之间协调复杂工作流;同等 reasoning effort 下,它也比上一代模型工作得更深;代码模式让它可以并行调用工具或在等待期间继续工作,但也带来了每轮更多响应、更多缓存输入 token 和高于预期的用量。问题在等待工具完成或大量进行网页搜索时尤其明显。影响并不均匀:中位数用户认为 Sol 的 token 使用效率相当高,但处理困难任务的一些重度用户发现额度消耗快得多。我们在发布前过于关注平均数和中位数,漏看了长尾用户的高消耗情况。Sol 让 Codex 能做的事情前进了一大步,但能力和效率并不总是同步改善;有些问题只有在真实规模使用后才会暴露。我们本应更早识别这些问题,也应更坦诚地说明。
这条解释把前几天的额度反馈从「配额异常」重新定义成一个系统性问题:更长的任务、更密集的工具调用、代码模式和子 Agent 协同,会把一次用户请求变成更长的推理轨迹。它也给出了明确但有限的承诺:典型使用约延长 18%,不是所有用户固定增加 18%,更不是长期配额政策。9
信息点
模型与推理
1. 效率优化已经覆盖模型、推理栈和 Agent loop,而不只是单个模型价格
OpenAI Developers 在同一窗口内补充说:
We used GPT-5.6 Sol in Codex to optimize its own infrastructure and performance.These improvements compound across inference and the agent loop, producing more useful work from the same underlying hardware.中文翻译:我们在 Codex 中使用 GPT-5.6 Sol 优化它自己的基础设施和性能。这些改进会在推理和 Agent loop 中叠加,让同一套底层硬件产出更多有用工作。
这与官方技术文章的三层结构一致:本地 Agent harness、API orchestration 和 GPU inference。对开发者而言,真正可观察的结果不只是每百万 token 的价格,还包括上下文是否膨胀、工具是否重复加载、缓存前缀能否复用,以及一次任务需要多少轮模型调用。10 6
2. Greg Brockman 提到又一项概率领域长期开放问题,但目前不能据短帖判断具体成果
Greg Brockman 在北京时间 7 月 29 日 11:36 写道:
5.6 for solving another longstanding open problem, this time in probability:中文翻译:5.6 又解决了一个长期存在的开放问题,这次是在概率领域。
帖子没有给出问题名称、证明或论文链接。它可以作为模型科研能力的传播信号,但不能据此把某项数学问题写成已被官方完整验证的成果;本期只保留这条原始线索,不做超出原文的扩写。11
Agent 与 Codex
3. ARC-AGI-3 的关键变化是把记忆机制从评测外部条件变成 Agent 设计的一部分
Thibault Sottiaux 对官方复盘的概括是:
Turns out GPT-5.6 Sol is actually SoTA on ARC-AGI-3.Just took two setting changes. You just have to allow it to reason and work over multiple context windows with the help of our canonical compaction implementation.中文翻译:结果证明,GPT-5.6 Sol 实际上达到了 ARC-AGI-3 的当前最高水平。只需要改两个设置:允许它进行 reasoning,并借助我们的 canonical compaction 在多个上下文窗口中工作。
这里的 SoTA 是个人表述,不能单独替代独立排行榜;但官方文章给出的 13.3% 到 38.3%、输出 token 减少 6 倍的数据,足以支持更谨慎的判断:对长时 Agent,保留中间推理和压缩历史不是实现细节,而是能力的一部分。开发者若要复现实验,OpenAI 建议使用 Responses API、保留 reasoning、启用 compaction。12 8
4. Codex 团队成员开始把 24/7 代理描述为「提醒负担」问题,而不是单纯的智能问题
Gabriel Peal 在北京时间 7 月 30 日 02:04 写道:
why would codex not run 24/7 and it looks at screenshots, then just works on any problem it sees and send me a notification if it find a solution to itlike my biggest problem is not codex intelligence, it's remembering to ask it for everything every time no matter the problem中文翻译:Codex 为什么不能 24/7 运行,查看截图,发现任何问题就开始处理,找到解决方案后通知我?我最大的问题不是 Codex 的智能,而是不管遇到什么问题,我能不能记得每次都让它去做。
这是个人对理想工作流的设想,不是已发布的后台常驻或截图监控功能。它的判断价值在于指出下一阶段产品摩擦:当 Agent 能做的事情增加,用户未必缺少意愿,反而可能忘记把任务交给它。要把这个设想变成可用产品,还需要权限、通知、隐私和误操作控制等边界。13
ChatGPT 产品更新
以下 3 条与 ChatGPT 产品直接相关的信息单列,避免分散到模型或 Codex 章节。
5. ChatGPT for Academic Researchers 同时覆盖 ChatGPT、Work、Codex,核心设计是机构化协作
官方页面写明,项目只面向符合条件且完成机构验证的研究者,工作区提供企业级隐私和安全保护,研究数据默认不用于训练;每位研究者最多邀请 4 名同机构协作者。若高校使用 ChatGPT Edu,免费访问会在机构工作区内协调。2
这让「免费给研究者用前沿模型」不只是一次额度发放,而是一个带身份验证、协作者席位和机构工作区的产品入口。Sam Altman 的「empower scientists」表述提供了路线解释,OpenAI 官方的 10,000→100,000 规模承诺则提供了可检验的执行目标。3 1
6. Work 与 Codex 的额度处理,暴露了长任务产品的运营难点
Tibo 的窗口内说明同时包含两项动作:重置全部 ChatGPT Work 和 Codex 用户额度,以及计划恢复调查期间暂停的五小时限制。原因不是订阅被降档,而是 Sol 的工具调用、等待期间并行工作和长尾用户消耗高于预期。9
读者应把「典型使用约延长 18%」理解为一次运行改进的预期值,而不是自己的固定配额;个人工作量、推理强度、工具调用次数和是否使用代码模式,都会改变结果。
7. Local environments 的能力边界已写入桌面端 Codex 文档,内存问题则仍在迭代
Gabriel Peal 在窗口内给出的工程解释是:local environments 会在 worktree thread 归档或满足某些 LRU/TTL 条件时运行;Codex 的子进程会把 RAM 使用量传到应用层,每个 thread 过去会启动一份每个 MCP server 的副本,支持新规范的服务器将改变这一点;团队还修复了一个或多个 memory leak,并预告周四推出改进。14 15 16
官方文档能确认的范围更窄:local environments 仅在 ChatGPT 桌面端的 Codex 中可用,配置放在项目根目录的
.codex 文件夹里,可定义 setup steps 和 actions,并可为 macOS、Windows、Linux 分别设置脚本。文档没有确认归档或清理条件,因此那部分只能归为工程师回复,不能当成正式文档承诺。17产品与应用
本窗口没有新的、可验证的普遍可用产品发布达到单独成条的门槛;24/7 截图代理属于团队成员提出的产品设想,已在上文按路线信号处理。
商业化与组织
未发现白名单账号在窗口内发布同时具备可核验细节和新增判断的商业化或组织变化。
AI 安全与政策
未发现窗口内新的高价值安全或政策信号。今天的关键边界转移发生在 Agent harness、上下文记忆和实际用量,而不是新的安全政策公告。
外部观察席
本窗口未发现 @karpathy、@lilianweng、@miramurati、@barret_zoph、@ilyasut、@paulfchristiano、@logankilpatrick、@snsf 发布达到入选门槛、且能为 OpenAI 动态或前沿 AI 判断带来明确新增事实的内容。外部观察席不因空缺而用 OpenAI 内部人员的表态替代。
OpenAI 官号当日动态
时间均为北京时间;X 窗口为 7 月 29 日 09:00 至 7 月 30 日 09:00,OpenAI YouTube 同样按过去 24 小时核对。以下按账号逐条保留窗口内可验证内容;同一线程的每条帖子分别列出,便于区分事实发布与补充说明。
@OpenAI
- 2026-07-30 07:57|技术研究|ARC-AGI-3 实验起因。 说明 GPT-5.6 Sol 曾在数学开放问题上取得进展,但在 ARC-AGI-3 上表现不佳,调查发现 harness 没有让模型记住已学内容。7
- 2026-07-30 07:57|技术研究|标准 harness 的问题。 说明 ARC-AGI-3 的通用 harness 会在每一步丢弃 reasoning,并在上下文变长后删除更早动作。18
- 2026-07-30 07:57|技术研究|两个设置的实测结果。 使用 Responses API、retained reasoning 和 context compaction 后,公共集得分提高 188%,输出 token 减少 6 倍。19
- 2026-07-30 07:57|开发者建议|长时 Agent 的配置。 建议 API 开发者使用 Responses API 而非 legacy Chat Completions API,保留 reasoning 并使用 compaction。20
- 2026-07-30 07:57|技术研究|评测边界。 说明 benchmark 分数同时反映模型、harness 和设置;对长时 Agent,保留 reasoning 与压缩上下文能让模型利用已学内容。21
- 2026-07-30 05:21|技术博客|GPT-5.6 Sol 的服务效率。 公布生产 GPU kernel 改进带来的 20% serving 成本下降,以及 speculative decoding 带来的 15% 以上 token 生成效率提升。5
- 2026-07-30 05:21|技术博客|成本—智能曲线。 表示这些跨栈优化会叠加,目标是在 cost-intelligence curve 的各个位置提供更高性能的模型。22
- 2026-07-30 01:19|项目公告|ChatGPT for Academic Researchers 规模。 宣布向科学家、数学家和工程师免费开放前沿模型,今夏从 10,000 名研究者开始,至 2027 年扩展到 100,000 名。1
- 2026-07-30 01:19|项目公告|模型、隐私与协作者。 说明参与者可使用 GPT-5.6 系列,工作区具备企业级隐私与安全保护,研究数据默认不用于训练,并可邀请最多 4 名协作者。23
- 2026-07-30 01:19|项目公告|项目理由。 OpenAI 表示前沿 AI 的收益不应集中在少数公司和资源充足的实验室,研究者最了解自己的领域,项目希望帮助他们处理难题、加速发现和提高生产力。24
@OpenAIDevs
- 2026-07-30 05:33|开发者生态|GPT-5.6 Sol 优化 Codex 基础设施。 OpenAI Developers 表示已在 Codex 中使用 GPT-5.6 Sol 优化自身基础设施和性能,收益会在 inference 与 Agent loop 中叠加。10
- 2026-07-30 05:26|转推入口|Codex Visualize skill。 转推 @codestantine 对 Codex Visualize skill 的正面评价;原帖在当前可验证返回中为截断内容,本期不据此扩写功能范围。25
- 2026-07-30 03:51|社区展示|Codex 用户作品 billboard。 展示社区用户在不同工作场景中使用 Codex 的作品,并称部分作品已登上 billboard;这是社区传播和品牌内容,不是新的产品能力公告。26
- 2026-07-30 00:00|转推入口|X Article 短链。 转推 @bytebytego 的 X Article 短链;当前无法从短链解析完整标题和正文,因此只记录为官方转推入口,不对内容作推断。27
@OpenAINewsroom
今日官号无新动态。
OpenAI YouTube
- 2026-07-30 01:23|产品发布|We’re giving 100,000 academic researchers free access to our frontier models。 OpenAI 频道发布同名视频,说明 ChatGPT for Academic Researchers 将从 10,000 名研究者起步并扩展到 100,000 名;视频发布时间为 2026 年 7 月 30 日 01:23(北京时间)。28
过去 48 小时内,未发现白名单个人有能用具体发布时间核验、且达到入选门槛的新 YouTube 视频、直播回放或播客出场;搜索中的旧节目和相对时间标签不作为窗口证据。
今日关注优先级
高。 今天有三条相互咬合的主线:OpenAI 把前沿模型交给更广的科研群体;GPT-5.6 Sol 开始反过来优化自己的服务栈;ARC-AGI-3 则把长时 Agent 的记忆、上下文压缩和 harness 设计从幕后推到评测结果的正中央。产品侧需要继续观察两件事:18% 的典型用量改善能否覆盖重度用户长尾,以及 academic access 是否会从一次性计划变成稳定的科研基础设施入口。
References
- 1OpenAI 原帖
- 2ChatGPT for Academic Researchers 官方页面
- 3Sam Altman 原帖
- 4Greg Brockman 对学术访问的回应
- 5OpenAI 效率优化原帖
- 6OpenAI 效率技术文章
- 7OpenAI ARC-AGI-3 原帖
- 8ARC-AGI-3 官方复盘
- 9Tibo Sottiaux 关于 usage limits 的完整说明
- 10OpenAI Developers 原帖
- 11Greg Brockman 原帖
- 12Tibo Sottiaux 原帖
- 13Gabriel Peal 原帖
- 14local environments 触发条件
- 15RAM 与 MCP server 解释
- 16memory leak 修复说明
- 17ChatGPT Learn:Local environments
- 18原帖
- 19原帖
- 20原帖
- 21原帖
- 22原帖
- 23原帖
- 24原帖
- 25官方转推
- 26官方原帖
- 27官方转推
- 28OpenAI YouTube 视频
Related content
- Sign in to comment.
