
研究代理走进 OpenAI 内部:9 月 6 日两篇文章谈加速与监控
OpenAI 两篇 9 月 6 日官方文章披露研究代理的内部使用规模,并把监控能力、递归自我改进与安全门槛放在同一条跟进线上。
本期覆盖 2026 年 9 月 6 日 09:00 至 9 月 7 日 09:00(北京时间)。窗口内,OpenAI 官方 Research / Safety 页面新增两篇文章:一篇公布内部研究人员使用编码代理的早期测量结果,另一篇由首席科学家 Jakub Pachocki 讨论更强模型、失调风险、监控能力和递归自我改进。两篇文章都在 9 月 6 日发布,OpenAI News RSS 显示它们分别于北京时间 16:00 和 17:00 进入窗口。123
速览
| 条目 | 窗口内时间证据 | 具体进展 | 今天检查什么 |
|---|---|---|---|
| 研究加速 | 9 月 6 日 17:00 | OpenAI 称研究组织在 8 月中旬使用了相当于每名研究员每天 3.1 个“代理工作日”的代理计算量;研究人员仍负责定方向、判断结果和决定是否推进 | 把代理产出、人工干预和最终实验结果分开记录 |
| 能力、监控与递归自我改进 | 9 月 6 日 16:00 | 首席科学家称 CoT 监控随着模型处理工具、其他 AI 和自身推理的能力增强而逐步变弱,并主张把安全门槛与更强模型的扩展绑定 | 查看代理日志是否能覆盖工具调用、跨代理通信和人工接管 |
| 官方产品与服务状态 | 入口最新日期分别停在 9 月 3 日、9 月 3 日、9 月 3 日、9 月 4 日 | ChatGPT、模型说明、API、Codex 和 Status 的公开入口在本窗口没有出现更晚日期条目 | 继续跟进 GPT-6 Astra 的文档和安全更新,避免把 9 月 3 日发布重复计入今天 |
研究人员已经把编码代理当成日常工作工具
OpenAI 把“研究实习生”定义为:在研究人员指导下完成明确的研究任务,任务难度大致相当于熟练研究人员需要几天才能完成的工作。公司说,团队已经在 2026 年 9 月达到去年秋天提出的“自动化研究实习生”目标,并朝着 2028 年 3 月形成自动化 AI 研究员的目标推进。这里的时间表与能力描述来自 OpenAI 自己的研究进展说明,属于公司披露的目标和判断。2
内部使用量已经从偶尔调用变成日常并发。OpenAI 测量显示,8 月中旬,研究组织中位数研究人员每天使用的推理量按 API 价格计算超过 600 美元;第 90 百分位用户每天使用的 token 价值超过 7,000 美元。按一个标准八小时工作日换算,研究组织每个研究员工作日对应 3.1 个代理工作日的工作量。这个指标把用户直接启动的代理和代理继续创建的子代理都算进去,代表计算和运行时投入,不能直接换算成 3.1 倍研究产出。2
OpenAI 同时报告,2026 年 8 月的每名活跃实验人员实验次数达到自 2025 年 1 月开始跟踪以来的最高值;实验次数上升与 Codex 使用增加相关,计算资源增长也同时存在。研究人员把更多任务交给代理,任务类型从代码和基础设施逐步扩展到更长周期、更高层级的工作。OpenAI 的分类把 AI 研发拆成决定方向、设计、构建、运行、分析和沟通六个阶段,其中高层规划仍只占代理输出 token 的很小部分。2
这组数据更适合回答“代理在研究流程中承担了多少工作”,而不是回答“代理让研究快了多少”。OpenAI 自己也提醒,代码量和实验次数容易测量,却很难单独解释研究进展;随着自动化程度提高,最难自动化的任务可能成为新的瓶颈。公司对任务成功率的早期分类显示,1 月至 7 月多个难度档位的成功率总体上升,但最近六个月成功完成的 4—8 小时任务中,超过一半至少需要一次人工干预。2
对研究团队的实际含义:代理已经可以承担排障、代码、评估和实验基础工作,但“成功”仍包含研究人员的引导。团队评估代理时,应同时记录代理完成了什么、人工在哪一步介入、结果是否进入核心训练或实验决策,而不是只看调用量和生成代码量。
OpenAI 把更强模型的瓶颈,指向监控能力
OpenAI 首席科学家 Jakub Pachocki 在另一篇文章中写道,推理模型正在操作计算机、协作完成研究项目,并改变计算机安全风险;他根据内部结果判断,当前进展速度可能延续到递归自我改进(recursive self-improvement,指 AI 参与改进自身开发流程)。这是作者的判断和担忧,文章没有给出一条已经生效的产品路线图。3
文章把对齐分成两个便于实践的方向。目标对齐关注模型是否努力完成给定目标,包括遵循指令层级、理解用户意图和与人协作;价值对齐关注模型能否在目标含糊、冲突或环境陌生时,仍从更高层原则出发行动。Pachocki 认为,模型能力越强、训练环境与现实环境差距越大,价值能否泛化就越难确认。3
OpenAI 长期押注的链式思考监控(chain-of-thought monitoring,检查模型文字化推理过程的监控方法)也遇到新限制。Pachocki 写道,现代模型的推理越来越多地混合了与人、其他 AI 和工具的交流;模型也越来越能操纵自己的推理过程;预训练能力增强后,模型即使不输出文字化推理,也能变得更聪明。三种变化一起削弱了研究人员从链式思考中观察模型内部目标的能力。3
这与 9 月 3 日 GPT-6 Astra 发布时披露的监控设计形成同一条连续线索:Astra 是 OpenAI 首个达到 Preparedness Framework“关键网络安全能力”门槛的模型,产品侧会在监测到潜在问题时暂停或停止对话,交由用户审核。今天的新文章补充了更长期的限制:监控本身也会随着模型处理环境和推理方式的变化而失去一部分可见性。GPT-6 Astra 的具体发布信息来自 OpenAI 官方文章与 ChatGPT Release Notes;Pachocki 对监控趋势的判断来自个人署名文章。345
这两篇文章放在一起,读者应看见什么
两篇文章共享一个具体约束:代理承担的工作正在变多,研究人员却仍然需要知道代理怎样完成工作、在哪些地方偏离目标、怎样被人工接管。研究加速文章用内部使用量、实验次数和任务干预率描述代理进入研发流程;首席科学家的文章则说明,工具调用、跨代理交流和自我推理会让传统观察手段逐渐失去覆盖。这个连接是基于两篇 OpenAI 文章的内容作出的编辑判断,不是 OpenAI 发布的新政策。23
OpenAI 在研究加速文章中披露,Hugging Face 事件后,公司暂停了面向部署模型的强化学习训练,并加强研究环境和监控覆盖;8 月 7 日初步证据显示 Astra 可能具备关键网络安全能力后,Astra 类 GPU 分配又下降 59.2%,其他模型类别的分配上升 17.2%,抵消了约 85% 的下降。公司把这组变化解释为部分训练和实验转向受限更少的模型,同时强调安全控制会改变计算资源的流向。上述数字与解释属于 OpenAI 自身披露。2
Pachocki 给出的方向是双重的:继续建设能够防御其他 AI 风险的系统,同时让模型扩展速度受安全信心约束。他主张把 Preparedness Framework 等承诺逐步发展为更广泛适用的安全门槛,并期待在共享门槛建立前出现自愿放缓。读者应把这些内容当作 OpenAI 首席科学家的公开立场和公司安全思路,等待后续正式框架、评估结果和部署规则来判断执行程度。3
今天跟进什么
- 研究负责人:在代理使用量之外,建立三列记录:代理完成的任务、人工介入位置、结果是否被研究人员采纳。4—8 小时任务的干预率尤其值得单独观察,因为 OpenAI 的早期数据表明复杂任务仍频繁需要人工引导。2
- 代理工程与安全团队:把工具调用、子代理创建、跨代理通信、外部网络访问和人工停止动作放在同一条可回放时间线上。Pachocki 对监控边界的说明表明,单看最终答案或单段链式思考已经不足以覆盖复杂代理流程。3
- 产品与政策团队:跟进 OpenAI 后续公开的自动化研究、对齐监控和安全门槛材料,重点核对是否出现评估覆盖范围、停止条件、人工接管要求和第三方审查安排。当前可见文章给出了方向与承诺,尚未给出完整执行规范。23
官方产品面与服务状态
本窗口的 ChatGPT Release Notes 最新日期小节为 9 月 3 日,其中包括 GPT-6 Astra、Zendesk 与 OneNote 插件 Beta,以及向工作区外人员分享 Sites;Model Release Notes 最新日期为 8 月 18 日,内容是 Model Spec 更新。56
API Changelog 的最新日期为 9 月 3 日,Codex What's New 的最新周段为 8 月 31 日至 9 月 4 日;OpenAI Status History 的公开列表最新日期为 9 月 4 日。这些入口在本期 9 月 6 日 09:00 至 9 月 7 日 09:00 窗口没有出现更晚日期。789
本期的新增重点是两篇关于“研究代理已经走到哪里、下一步怎样继续”的官方文章。对开发团队而言,调用量只能说明代理被使用了多少;人工干预、外部动作和监控覆盖,才决定这些调用能否安全进入更长、更复杂的工作流。
References
- 1OpenAI News RSS
openai.com
- 2
- 3An Alien Mind
openai.com
- 4
- 5ChatGPT Release Notes
help.openai.com
- 6Model Release Notes
help.openai.com
- 7OpenAI API Changelog
developers.openai.com
- 8Codex What's new
developers.openai.com
- 9OpenAI Status
status.openai.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- 存储架构重构、Devin接入Astra与放慢研发探讨:OpenAI 9 月 11 日动态
- Agents API 公测、金融专用版与 GPT-Live 1 商用:OpenAI 9 月 10 日动态
- Voice 升级、Astra 工作版与安全委员会:OpenAI 9 月 9 日动态
- Images 2.5、量子实验、Navier–Stokes:OpenAI 9 月 8 日动态
- OpenAI 9 月 5 日动态:承认代理失调披露缺口,官方产品面继续空窗
- 德国网站代理事件、美中 AI 安全会谈与亚太故障:OpenAI 9 月 4 日动态
- GPT-6 Astra 上线、API 增加长任务控制与 10 亿美元防御计划:OpenAI 9 月 3 日动态
- API 错误码细分、AI 工具自动关停与版权诉讼:OpenAI 9 月 2 日动态
