9月7日 X AI 日报:研究 Agent 进入多日任务,监督与验证成为新指标

9月7日 X AI 日报:研究 Agent 进入多日任务,监督与验证成为新指标

本期追踪 OpenAI 研究 Agent 的多日任务数据、对齐与监测观点,以及两篇把代码 Agent 质量拆成可测指标的研究。

覆盖窗口:2026 年 9 月 6 日 10:00 至 2026 年 9 月 7 日 10:00(北京时间)
过去 24 小时,X 上最值得跟进的信号集中在研究流程和编码协作:OpenAI 公布了内部 Agent 使用数据,首席科学家 Jakub Pachocki 公开讨论扩展速度与安全门槛,研究者则继续把“模型能不能完成”推进到“改了多少代码、多久需要人工接管”。

先看重点

  • OpenAI 称已达到“自动化研究实习生”目标。 这套系统能在人工指挥下完成定义清楚的研究任务,包括熟练研究员需要几天才能完成的工作;OpenAI 研究部门在 8 月中旬每个人类工作日对应约 3.1 个 Agent 工作日。这个数字统计的是运行时长,不等于产出效率。1
  • 任务时间越长,人工接管越重要。 Rohan Paul 转述的 OpenAI 数据显示,任务从 15 分钟以内延长到 64—128 小时后,无需人工介入的成功率从 86% 降至约 16%。这组数字适合用来设计评测问题,暂时不宜当作通用 Agent 基准。2
  • OpenAI 首席科学家呼吁把扩展速度绑定到共同安全门槛。 Jakub Pachocki 在个人文章中写到,当前没有实验室已经把对齐与监测做到足以长期维持最高速度扩展的程度,并希望在共同安全门槛建立前出现更多自愿放缓。34
  • 两篇研究把代码 Agent 的评价拉回可测指标。 CROCODIL 关注跨模型协作时的无谓改动;Almost Free State Prediction Separation 关注训练阶段的额外预测计算。两条信号都给出了实验条件和数字,适合工程团队做复现实验。5678

OpenAI:研究 Agent 已进入多日任务,但仍由人来定方向

OpenAI 在北京时间 9 月 6 日 23:08 发布 Research acceleration: The view inside OpenAI。OpenAI 称,公司已经达到去年秋天设定的目标:让一个自动化研究实习生在人工指导下完成定义清楚的研究任务,包括熟练研究员需要几天完成的任务。OpenAI 同时表示,公司正在朝着 2028 年 3 月实现自动化 AI 研究员的目标推进。1
OpenAI 给出的内部快照显示,截至 8 月中旬,研究部门每个人类 8 小时工作日大约运行 3.1 个 Agent 工作日。研究人员每天使用编码 Agent,很多工作以并行会话进行;OpenAI 还称,研究部门中位数研究员每天用于推理的费用已经超过 600 美元,按 API 价格计算,第 90 百分位用户每天使用的 token 费用超过 7000 美元。这些是 OpenAI 的内部统计,费用按 API 价格折算,不能直接等同于个人或企业实际账单。1
OpenAI 也承认,研究 Agent 仍然需要大量人工引导。官方页面写道,在过去 6 个月里,超过一半的 4—8 小时任务在成功完成的过程中至少经历过一次人工介入。Rohan Paul 转述的另一组时间跨度数据则显示:少于 15 分钟的任务,无需人工介入的成功率约为 86%;在 64—128 小时的最长任务区间,这一比例约为 16%。两组数据的统计口径不同,后者来自 X 转述,读者不应把它们拼成一条统一曲线。12
这组材料对产品评估的提醒很直接:任务总时长、人工介入次数、每次介入消耗的时间,以及失败发生在哪一步,都应该单独记录。单看最终答案,读者看不出系统是连续完成了任务,还是在关键节点等待了人。

安全观点:Jakub Pachocki 把“继续扩展”与共同门槛放到同一张表上

OpenAI 首席科学家 Jakub Pachocki 在北京时间 9 月 7 日 00:02 发布个人文章 An Alien Mind。他写道,自己担心未来几年机器智能持续快速上升带来的后果;目前没有实验室已经把对齐和监测做到足以长期维持最高速度扩展的程度。他希望自愿放缓成为常态,直到行业建立共同安全门槛,并认为各国政府需要把未来 AI 开发的国际协调放在更重要的位置。34
这是一位公司首席科学家的个人判断,文章本身没有构成新的产品发布或监管决定。它把一个产品团队需要继续追问的问题摆到了台面上:安全门槛由谁设定,评测覆盖训练、部署还是只覆盖上线前检查,以及出现异常时谁有权暂停运行。

研究信号:代码 Agent 的质量需要同时看改动规模和测试结果

Rohan Paul 在北京时间 9 月 7 日 05:12 转述论文 CROCODIL: Cross-Model Code Editing with LLMs。论文由 Linghan Zhong 等人撰写,研究发现,语言模型修改其他模型生成的代码时,往往会产生更多、而且经常是多余的改动。论文提出的 CROCODIL 使用两类训练信号:相似度奖励惩罚过大的修改,执行奖励则检查构建和测试是否成功。56
Rohan Paul 的帖子称,在测试的跨模型实现中,CROCODIL 大致把编辑距离减半,同时提高了构建通过率和全量测试通过率。现有论文摘要说明了方法和研究问题,但没有支持完整软件仓库、长期维护或线上事故方面的结论。工程团队可以把“最终测试是否通过”和“为完成任务改了多少无关代码”分开记录,再观察模型更换后返工量是否变化。56
同一账号在北京时间 9 月 7 日 04:30 转述一篇被他称作 Free Pause Tokens 的论文;论文在 arXiv 上的标题是 Almost Free State Prediction Separation。论文提出给“预测下一个 token”的计算增加一个额外暂停步骤,同时把这部分计算放在并行预测流中,因此不增加序列中的 token 数。论文摘要称,这种方法在推理时不增加上下文长度和 KV cache,训练阶段的额外计算最低可降至普通预训练流程的 1.14 倍78
帖子还称,在训练进行到 42.5% 后启用这项机制,可以保留完整质量增益的大约 94%,训练墙钟时间约为普通模型的 1.33 倍。这条研究信号的实用价值在训练调度:额外计算未必需要从第一步持续到最后一步。复现时仍要保留模型规模、训练数据、硬件、批次和“质量增益”的具体定义;X 帖子没有提供完整实验表格。7

工程实践:Boris Cherny 建议先给 Agent 难任务,再用工具验证

Claude Code 负责人 Boris Cherny 的一段访谈在北京时间 9 月 7 日 03:08 被 Rohan Paul 转发。Cherny 说,使用模型没有一个适用于所有人的“奇招”;更实际的办法是给模型一个足够难的任务,给它提供验证工具,观察它在哪一步出错,再用更好的提示、技能或 MCP 连接补上缺失的上下文。9
这条内容属于访谈转述,不能当作 Anthropic 的产品公告。它和 CROCODIL 的研究信号指向同一个工程动作:团队要记录过程中的验证结果,而不是只看最后一段代码。对实际使用者来说,下一步是为每类任务准备可重复的构建、测试、数据核对或人工审批点。

本期判断

本期几条动态的共同点,是 Agent 的价值开始由“最后交付了什么”扩展到“运行了多久、改动了多少、何时需要人接管”。OpenAI 的内部数据给出任务时长、并行运行和人工介入的观察角度;CROCODIL 给出跨模型代码修改的量化方向;Almost Free State Prediction Separation 把额外计算放进训练过程的后段;Pachocki 的文章则提醒,能力扩展速度必须和监测能力一起讨论。
读者今天评估一个新 Agent 时,可以先记录三组数据:任务时长与人工介入改动规模与验证结果异常出现后的暂停权限。这些字段比“支持多少模型”更接近系统能否进入真实工作流。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel