OpenAI:GPT-5.6 Sol 成本降 20%、ARC-AGI-3 得分升至 38.3%,研究者计划扩至 10 万人

OpenAI:GPT-5.6 Sol 成本降 20%、ARC-AGI-3 得分升至 38.3%,研究者计划扩至 10 万人

OpenAI 同日公布 GPT-5.6 Sol 的生产效率、ARC-AGI-3 评测设置和学术研究者免费访问计划;本期区分已确认的产品信号与尚未出现的价格、采用率和收入证据。

7 月 30 日凌晨,@OpenAI 连发三类消息:先给学术研究者提供免费前沿模型,再公布 GPT-5.6 Sol 的生产成本和生成效率改进,最后解释为什么两个 API 设置能让 ARC-AGI-3 得分从 13.3% 升到 38.3%。1 2 3
三条线索合在一起,指向同一个产品方向:OpenAI 正在同时压低运行成本、修正长任务的使用方式,并把高能力模型送进科研工作流。它们都没有给出价格、收入或实际采用率数据,因此还不能直接推导股价影响。
北京时间官方动作现在能确认的信号还缺什么
7 月 30 日 01:19学术研究者计划首批 1 万名,计划到 2027 年扩至 10 万名,免费使用前沿模型。2实际使用量、转化率和精确配额
7 月 30 日 05:21GPT-5.6 Sol 生产优化OpenAI 称端到端服务成本下降 20%,token 生成效率提升 15% 以上。1统计窗口、流量覆盖和 API 价格是否变化
7 月 30 日 07:57ARC-AGI-3 评测复盘保留 reasoning、启用 context compaction 后,公开集得分约提升 3 倍,输出 token 少 6 倍。3第三方复现,以及不同 harness 下的可比性

先看成本:这不是降价公告,而是运营账本的改善

OpenAI 把 GPT-5.6 Sol 部署后的优化写成了两个数字:端到端 serving cost 下降 20%,token-generation efficiency 提升 15% 以上。前者来自生产 GPU kernel 等优化,后者主要与 speculative decoding 有关。4
这里的关键词是 serving cost,不是 API 售价。官方文章谈到负载均衡、前向计算、KV cache、批处理、分片和配置调优如何叠加,以便在硬件不变时服务更多 token;但没有披露完整的统计窗口、流量覆盖、成本计算公式,也没有宣布 API 价格调整。4
对商业化来说,这更像供给侧信号:如果需求继续快于算力供给,单位推理成本下降可以给容量、毛利或产品额度留下空间。但「成本下降」不会自动变成「客户获得降价」;下一步要看价格、限额或可用性是否真的变化。
Loading content card…

再看评测:模型分数取决于它被怎样运行

ARC-AGI-3 测试的是模型能否在没有说明的陌生二维游戏中探索并推断规则。OpenAI 称,在公开 harness 下,GPT-5.6 Sol 得分为 13.3%;启用 retained reasoningcontext compaction 后,得分升至 38.3%,同时输出 token 减少 6 倍。5
这组数字最有价值的部分,不是「三倍」本身,而是它把评测争议具体化了。原始 harness 会在每次行动后丢弃 private reasoning,并随着上下文变长滚动截断早期动作;OpenAI 改用 Responses API,保留 reasoning,并用 compaction 管理上下文。5
所以,这不是一场简单的模型升级公告。它说明长任务 agent 的成绩,既取决于模型,也取决于 API、提示、上下文管理和评测 harness。OpenAI 建议 API 开发者使用 Responses API、保留 reasoning、启用 compaction;对外部评测者而言,更重要的动作是把这些设置写清楚,否则不同模型的分数可能连运行条件都没有对齐。6
商业信号也在这里:OpenAI 正在把「如何正确运行模型」变成产品能力的一部分。它有利于长任务和 coding agent 的真实表现,但目前仍是公司自己的测试结果,不能直接当作独立基准排名或普遍生产率结论。
Loading content card…

学术研究者计划:免费访问是分发策略,不是采用率证明

OpenAI 宣布向科学家、数学家和工程师免费提供前沿模型访问,首批从 1 万名研究者开始,并计划在 2027 年扩展到 10 万名。项目面向符合条件的学术机构,官方页面列出的工作范围包括文献综述、假设测试、代码、数据分析和基金申请等。7
参与者可使用 ChatGPT、ChatGPT Work 和 Codex,包括 GPT-5.6 系列;每个工作区提供企业级隐私与安全保护,研究者数据默认不用于训练,且每位参与者最多可邀请 4 名同机构协作者。官方同时提供培训、实操支持和研究者交流机会。7
这项计划的商业含义很清楚,但证据边界也很清楚。OpenAI 先用免费访问降低高价值专业用户的试用门槛,再把模型、Codex 和研究协作放进同一工作区;这可能帮助它积累科研工作流和反馈,但官方没有公布每位研究者的精确额度、完整机构名单、申请通过率、实际活跃人数或后续付费行为。它是分发实验,不是用户增长数据。
Loading content card…

今天该盯什么

  • 成本线:20% 的 serving cost 改善是否带来 API 价格、额度或容量变化。
  • 评测线:第三方是否能在公开记录的 harness 和 API 设置下复现 13.3% 到 38.3% 的变化。
  • 科研线:1 万名首批研究者的实际使用、机构覆盖和续用情况何时披露。
今天的三条推文更像一张运营地图:OpenAI 在优化每一次推理的成本,补齐长任务的运行条件,再用科研计划扩大高端用户入口。地图不等于财务结果;在价格、客户数和收入数据出现前,市场判断仍应停留在产品节奏和供给效率层面。

Related content

  • Sign in to comment.
More from this channel