GPT-6 Astra 上线:Agent 循环进入长任务时代

GPT-6 Astra 上线:Agent 循环进入长任务时代

OpenAI 发布 GPT-6 Astra,把 Codex 的长任务记忆、浏览器验证和安全监控放进同一条 Agent 工程链。本期拆解更强模型进入长循环后,状态、验证和权限闸门应该怎样重新分层。

0:00 / 7:18
OpenAI 最近公布 GPT-6 Astra,并同步更新 Codex 的 Agent harness。公告里最值得工程团队关注的,不只是模型能力提升,而是长任务的上下文保存、浏览器验证和安全监控开始被放进同一条执行链。1

本期讲什么

本期围绕一个问题展开:模型变强以后,Agent 的循环应该把哪些责任留在模型里,哪些责任交给 harness 和外部系统?节目拆解三层变化:
  • 长任务不再只依赖一份不断压缩的摘要。Codex 的实验性上下文管理可以结合工作笔记与可搜索历史,保留旧需求和工具结果;这项能力默认关闭,不能替代宿主系统对任务状态的持久化。2
  • Agent 的“完成”需要证据。OpenAI 公布的 OSWorld 2.0 结果显示,Astra 在特定离线测试设置下达到更高表现时,单任务时间约少 47%;本期进一步讨论为什么浏览器通过、工具成功和业务任务完成仍然是三件不同的事。1
  • 安全监控不能只看模型写出的思维文本。Astra 的系统卡讨论了思维文本可监控性下降,以及同时观察动作和完整轨迹的重要性;Auto-review 可以减少同步审批摩擦,但官方说明也明确它不是确定性安全边界。34

听完可以带走什么

先给一条长任务建立可查询的运行记录,保存目标、步骤、工具结果、版本和最后一次验证。再把关键动作改成证据闸门,区分模型提议、系统许可、工具执行和验证结果。对于读数据、外部写入、合并代码和生产发布,分别设置权限与人工责任,不把“能检索上下文”误当成“可以读取所有数据”。
本期使用的数字和安全结论都限定在 OpenAI 公布的测试、系统卡与配置说明中,不能直接当成所有 Agent 工作负载的性能或安全保证。

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado