OpenAI 披露“防御工厂”实操数据,RLHF 奠基人入局基金会董事会

OpenAI 披露“防御工厂”实操数据,RLHF 奠基人入局基金会董事会

OpenAI 公布 250 人安全冲刺淬炼的“防御工厂”智能体闭环架构,RLHF 奠基人 Paul Christiano 重返基金会董事会强化独立安全监督。

9 月 10 日,@OpenAI 发布两项关于安全防线与顶层治理的官方动作:官方公布了代号为“防御工厂”(Defense Factory)的智能体自动化闭环架构,并披露其在内部动员 250 多人进行全系统安全冲刺的实战数据;同日,强化学习人类反馈(RLHF)奠基人、前 OpenAI 对齐团队负责人 Paul Christiano 宣布重返 OpenAI 基金会董事会及其安全与安保委员会。这两起事件分别在自动化工程与顶层治理层面树立防御信誉,但企业全面落地同类架构的计算成本,以及新董事对营利性主体日常商业决策的实质制衡效力,仍需后续公开表现检验。
本期窗口为北京时间 2026 年 9 月 9 日 21:00 至 9 月 10 日 21:00。窗口内确认了两条 @OpenAI 原创发布与官方引用;互动数据为 9 月 10 日 21:05 左右的接口快照。
北京时间动作核心信息互动快照
9 月 10 日 01:39:20@OpenAI 原创宣布董事会新任命对齐研究中心创始人、前 OpenAI 对齐团队主管 Paul Christiano 加入 OpenAI 基金会董事会与安全委员会,并出任营利主体无投票权观察员。1270,092 次浏览;1,879 个赞;133 次转发;36 次引用;171 条回复。1
9 月 10 日 04:37:58@OpenAI 原创发布防御工厂白皮书动员 250 多人对数百套系统展开安全排查,发布以 AI 智能体为核心的防御工厂架构与实操手册。2432,588 次浏览;3,176 个赞;239 次转发;77 次引用;231 条回复。2
Loading content card…

“防御工厂”的实战数据与网安工具商业化

OpenAI 在白皮书中给出了设立防御工厂的紧迫背景:开源权重模型的大范围扩散,让外部攻击者拥有了调用长流程智能体自主发动复杂攻击的能力。传统的被动式规则扫描与纯人工响应,在机器速度的漏洞挖掘面前逐渐落入下风。为了赶在攻击者之前封堵敞口,防守方需要充分利用两项不对称优势:能够直接审查内部代码的白盒权限,以及调用最新前沿模型打出的时间差。3
在此背景下,OpenAI 发起了一场全员级别的安全冲刺。核心产品与平台负责人 Thibault Sottiaux 将其定性为全公司优先推进的紧急响应事项。安全、应用与研究三大部门协同合作,调动了 250 多名员工,覆盖了 100 多个业务服务领域,对底层数百套系统进行了地毯式攻防演练。3
演练催生出的“防御工厂”,是由 AI 智能体支撑的闭环工作流:
  • 资产清点(Inventory):智能体整合云上记录、部署配置与代码归属,输出结构化资产清单,为后续排查确定边界。
  • 漏洞发现(Discovery):结合资产清单、源码与威胁模型,探索潜在攻击路径,汇集外部漏洞报告形成候选漏洞池。
  • 动态验证(Dynamic Validation):在隔离且即用即弃的环境中复现可疑漏洞。排查规定必须获取运行时证据,代码静态分析不计入确认产出。实测使整体误报率降至 0.81%,在候选漏洞中运行时复现了 19.5% 的真实威胁,并识别出 37% 的重复漏洞。
  • 权属分配(Ownership Assignment):利用定制技能将验证漏洞直接指派给对应的系统负责人,任务分配准确率达到 90.6%;团队在首日即闭环了 53 个紧急或高危问题。
  • 验证修复(Verified Remediation):补丁生成环节实现 100% 基于 Codex 自动化编写,并在独立沙箱中由智能体重新运行测试;上线后的修复回滚率仅为 0.53%3
在整套流水线中,通用模型(Astra、Sol、Terra、Luna)与安全专有模型(Daybreak Blue、Daybreak Red)共同提供推理底座,系统生成的 SECURITY.md 充当跨轮次的共享记忆,避免智能体重复检索已确认的信息。3
这份工程复盘构成了 OpenAI 向企业推销网安服务的产品样板。OpenAI 同步推出了行动指南简报,引导企业申请接入 Daybreak 专有网络安全模型,并推广集成在 ChatGPT Learn 里的 Codex Security 插件。OpenAI 试图通过自研实测数据证明,采购其前沿大模型不仅能提升日常办公效率,更能转化为能够替企业省下大量安全外包成本的自主防御体系。3

对齐奠基人入局:基金会董事会的治理制衡

与工程落地并行推进的是治理架构层面的重要调整。9 月 10 日凌晨,OpenAI 宣布任命 Paul Christiano 为 OpenAI 基金会董事会成员。Paul 将与安全委员会主席 Zico Kolter 共同在基金会董事会下属的安全与安保委员会(Safety and Security Committee, SSC)任职。4
Paul 在人工智能学术界拥有深厚资历。作为 Alignment Research Center(ARC)的创办人,他在 2017 年至 2021 年期间曾主管 OpenAI 的对齐研究,主导了强化学习人类反馈(RLHF)的开创性工作。此后,他出任美国商务部国家标准与技术研究院(NIST)旗下人工智能标准与创新中心(CAISI,前身为美国 AI 安全研究所)的高级技术顾问,长期参与前沿模型国家安全风险的独立评估。4
根据公布的职责分工,SSC 负责监督包括营利性子公司 OpenAI Group PBC 在内的所有安全与安保实践。Paul 同时担任 OpenAI Group PBC 董事会的无投票权观察员。官方在公告中指出,这项任命呼应了 2025 年 10 月资本重组后确立的治理框架,履行了针对加利福尼亚州总检察长与特拉华州总检察长审查时做出的治理承诺。4
官方公告明确列出了一项关键的利益冲突回避条款:在担任高级技术顾问期间,Paul 将回避处理所有与 OpenAI 相关的事务,同时回避所有涉及 OpenAI 模型的评估工作。在营利性主体快速推进 GPT-6 Astra 等高能力模型商业化的当下,引入一位长年对前沿模型灾难性风险持审慎态度的专家,有助于平复监管机构与公众对于技术狂飙的担忧。不过,其在营利主体董事会中仅持有无投票权的观察员席位,未来能否对商业发布决策产生实质性约束,仍有待具体治理事件检验。4

接下来核验什么

  1. 企业落地防御工厂的环境与算力门槛。 0.81% 误报率与 100% 自动补丁严重依赖即时弹出的随用随弃沙箱环境。一般企业能否搭建配套的隔离容器网络,以及持续运行智能体集群带来的 API 账单规模,是该架构能否规模化普及的前提。3
  2. Daybreak 模型的申请通过率与审核标准。 OpenAI 借防御工厂力推 Daybreak 受信访问计划。官方后续面向普通企业、安全厂商与学术机构的审核准入机制及分发价格,决定了这项网安业务的商业变现空间。3
  3. 安全与安保委员会的独立监督实效。 面对未来可能触及高风险阈值的新一代模型,拥有监管与科研背景的 Paul Christiano 能否在模型安全卡签发、漏洞披露与紧急叫停流程中发挥有效制衡,将直接影响外界对 OpenAI 非营利监管承诺的信任度。4

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel