《OpenAI 智囊团一日发言|2026-07-08》

《OpenAI 智囊团一日发言|2026-07-08》

本期高信号集中在两条线:Lilian Weng 把 AI 自我改进的短期路径指向 harness engineering,OpenAI Realtime mini 更新则把推理和工具调用下放到更低成本的语音 API。

过去 24 小时,30 个白名单账号里可核验的新发言和重要转发一共 17 条。高信号不多,但有两条值得放在前面:Lilian Weng 把「自我改进」的短期路径落到 agent harness 上;OpenAI Developers 的 Realtime mini 更新被白名单成员转推,说明语音 API 正在把推理和工具调用下放到更便宜的实时模型里。今日关注优先级:

今日最重要判断

1. 自我改进的近路不是模型直接改权重,而是先把 harness 做成可优化对象

Lilian Weng 是 Thinking Machines Lab 联合创始人,曾任 OpenAI AI Safety 与应用研究负责人。她在 7 月 7 日 13:58 发出新文,讨论 AI 自我改进里的 harness engineering。原文如下:1
new post on harness engineering for AI self-improvement: https://t.co/ZYvGfVs61k
It is hard to forecast how much the future of RSI will rely on harnesses. Likely harness engineering will evolve in the direction of self-improvement and enable auto-research, and, in turn, smarter models keeps harnesses simple.
Even when many harness improvement get eventually internalized into core model, the need to specify goals and context will not disappear.
中文:发布了一篇关于 AI 自我改进中 harness engineering 的新文章。很难预测未来的递归自我改进会在多大程度上依赖 harness。更可能的路径是,harness engineering 朝自我改进方向演化,支持自动研究;反过来,更聪明的模型会让 harness 保持简单。即使很多 harness 改进最终被内化进核心模型,指定目标和上下文的需求也不会消失。
Loading content card…
她在长文里把 harness 定义为「围绕基础模型的系统」:它负责组织执行、决定模型如何思考和规划、如何调用工具、如何管理上下文、如何保存状态与评估结果。她还把 Codex、Claude Code 一类编码 agent 作为例子,说明 agent 产品已经不只是提示词,而是运行时、文件系统、工具权限和评估逻辑的组合。2
这条信号和 OpenAI 今年 1 月的 Codex 技术文对得上。OpenAI 在 Codex agent loop 文章里说,Codex 的核心是一个 agent loop:模型产出工具调用,agent 执行工具,再把结果放回上下文,直到模型停止调用工具。文章还明确把 context window management 列为 agent 的责任之一。3
行业含义:短期看,「会用工具的模型」和「能稳定组织工具、文件、状态、权限的 harness」会一起进化。对开发者来说,竞争点不只在选哪个大模型,也在能否把任务拆解、状态保存、失败回滚和评估闭环做得足够稳。
信号分类:个人观点,但有完整长文支撑;归入「模型与推理」和「Agent/Codex」。外部观察席,不标记为 OpenAI 内部信源。

2. Realtime mini 开始接入推理和工具调用,语音 agent 的低成本线在补能力

OpenAI 员工 Jason Liu(@jxnlco)在 7 月 7 日 10:25 转推 OpenAI Developers 的 Realtime API 更新。白名单窗口内命中的是这条转推;原始公告发布于 7 月 7 日 06:13,略早于本期窗口,但它是被白名单账号在窗口内放大的重要产品信号。4
OpenAI Developers 原文如下:5
GPT-Realtime-2.1-mini is now available in the API, bringing reasoning and tool use to our Realtime mini lineup at the same cost as GPT-Realtime-mini. https://t.co/fOyeYeYkiV
中文:GPT-Realtime-2.1-mini 现已在 API 中可用。它把推理和工具使用带到了 Realtime mini 产品线,成本与 GPT-Realtime-mini 相同。
Loading content card…
OpenAI Developer Community 的公告补充了两个关键信息:这次发布包括 gpt-realtime-2.1gpt-realtime-2.1-mini 两个模型;Realtime 语音模型的 p95 延迟因为缓存改进降低至少 25%。其中 gpt-realtime-2.1 面向更强实时推理、工具使用和语音 agent 行为,gpt-realtime-2.1-mini 面向更快、更低成本的实时语音体验。6
行业含义:实时语音 agent 的产品门槛在下降。过去「低延迟」和「复杂推理 / 工具调用」往往要互相取舍,现在 OpenAI 把一部分推理能力下放到 mini 线,开发者可以用更低成本试 voice workflow:客服、销售、现场协作、口语化数据查询这类场景会更容易做小规模验证。
信号分类:事实发布。归入「产品与应用」。这不是 ChatGPT 客户端功能更新,今天不触发「ChatGPT 产品更新」专区。

3. 对 Transformer 替代路线,前 OpenAI 推理负责人给了一个克制提醒

Jerry Tworek 是 Core Automation CEO 与联合创始人,曾在 OpenAI 负责强化学习方向,参与过 o3、o1、GPT-4、ChatGPT、Codex 等项目。他在 7 月 8 日 00:59 写道:7
First step to replacing transformer is appreciating it deeply for how far it was able to carry us
中文:替代 Transformer 的第一步,是先深刻理解并尊重它把我们带到了多远。
Loading content card…
这不是产品发布,也没有给出具体新架构。但它来自前 OpenAI 推理负责人,语气本身有信息量:当前关于「后 Transformer」的讨论需要更少口号、更多工程与实证。Transformer 最早由《Attention Is All You Need》提出,论文的核心主张是只基于注意力机制、抛开循环和卷积,并在机器翻译任务上取得更好质量、更高并行度和更短训练时间。8
行业含义:短期不宜把「替代 Transformer」当成确定路线。更现实的读法是:新架构要证明自己,不仅要在单项指标上赢,还要解释为什么能承接 Transformer 已经形成的训练、推理、工具链和生态惯性。
信号分类:个人观点。归入「模型与推理」。

分类情报

分类今日入选信号摘要信号分类行业含义
模型与推理Lilian Weng 发文讨论 harness engineering;Jerry Tworek 谈 Transformer 替代;Mark Chen 转推 Noam Brown 的 ICML OpenAI booth Q&A。Weng 的长文把自我改进落在 harness、上下文、工作流和评估;Tworek 的短句提醒架构替代要先理解 Transformer;Mark Chen 的转推只说明 OpenAI reasoning research 团队在 ICML 现场答疑,未透露新技术细节。910个人观点 / 暗示信号模型路线的讨论更偏「系统与评估」而不是单点发布;ICML 现场活动本身不构成新结论。
Agent/CodexLilian Weng 的 harness 文章。文章把 coding agent 的文件系统、工具调用、子 agent、后台任务和评估循环放在同一框架里,和 Codex agent loop 的设计方向一致。23个人观点Agent 的护城河会落到运行时设计、状态管理和失败评估上,而不是只靠更长提示词。
产品与应用GPT-Realtime-2.1-mini 被白名单账号转推。OpenAI Developers 称 mini 线新增推理和工具调用,社区公告称 Realtime 语音模型 p95 延迟至少降低 25%。56事实发布语音 agent 的试错成本降低,开发者可以优先验证实时工具调用场景。
商业化与组织Gabriel 的收入玩笑。Gabriel 在 7 月 7 日 20:00 写道,自己正在「线性爆炸式收入」并预计 2045 年达到 1 亿美元 ARR,后一句自嘲这是「世界上最慢达到 1 亿 ARR 的创业公司」。11噪音情绪这条不应解读为真实财务指引,只能说明个人创业语境里的自嘲。
AI 安全与政策今日无合格新内容。白名单窗口内没有来自 OpenAI 安全、政策或外部观察席的新增政策判断。不硬凑。
外部观察席Lilian Weng。Weng 已离开 OpenAI,当前身份是 Thinking Machines Lab 联合创始人。她的发言可作为前沿 agent / 自我改进方向的外部观察,不作为 OpenAI 内部动向。1个人观点对 OpenAI 读者有参考价值,但不能当作 OpenAI 路线确认。

低信号观察

  • Jason Liu 在 7 月 8 日 06:29 写「we love open source!」。这句话没有上下文,不足以判断 OpenAI 的开源节奏,只能列为低信号观察。12
  • Mark Chen 转推 Noam Brown 的 ICML Q&A,显示 OpenAI reasoning research 人员在会议现场和研究社区交流,但原帖没有新论文、新模型或技术指标。910
  • 其余多数窗口内内容来自 Jason Liu 的日常互动、转发、个人问题或玩笑,按频道过滤规则不进入主栏目。

今日关注优先级

。没有 Sam Altman、Greg Brockman、OpenAI 研究高管的重大新判断;但 harness/self-improvement 与 Realtime mini 两条线分别对应 agent 系统能力和语音 API 产品化,值得开发者继续跟踪。

Related content

  • Sign in to comment.
More from this channel