
GPT-5.6-Cyber 发布:高风险安全请求完成率升至 95%,入口仍是 Daybreak Red
OpenAI 发布基于 GPT-5.6 Sol 的网络安全专用模型 GPT-5.6-Cyber:内部高级安全请求完成率为 95%,但访问、成本与安全边界仍由 Daybreak Red 严格限定。
GPT-5.6-Cyber 是 OpenAI 面向网络安全工作的专用模型变体:它基于 GPT-5.6 Sol 训练,专门加强漏洞发现、漏洞利用链开发等任务,并通过 Daybreak Red 向获批的个人和组织提供。官方内部测试中,它对一组涉及利用链开发、认证绕过和权限提升的请求完成率为 95.0%;GPT-5.6 Sol 在开启系统级安全防护时为 1.5%,通过 Daybreak Blue 为 2.0%,GPT-5.5-Cyber 为 57.3%。1
这组数字说明了模型的定位,也划出了它的边界:GPT-5.6-Cyber 主要解决的是「在授权的高级安全工作中少拒答、能持续完成更专门的任务」,不是一款面向所有开发者的通用 GPT-5.6 替代品。95% 是内部评测里的请求完成率,不是漏洞利用成功率、总体能力分数,也不是第三方复测结果。
先给判断
- 做漏洞研究、利用验证或红队测试的获批团队:可以把 GPT-5.6-Cyber 放进现在的评估队列,但前提是能接受 Daybreak Red 的身份核验、监控、用途限制和法律声明。
- 做安全代码审查、恶意软件分析、事件响应、漏洞管理或补丁验证的团队:OpenAI 把 Daybreak Blue 和 GPT-5.6 Sol 作为多数防御者的起点;这些任务未必需要 Red 的更低拒答率。
- 普通产品、应用开发和企业知识工作:没有必要因为这个名字切换模型。当前公告没有给出公开 API 模型 ID、通用 API 单价或上下文窗口,公开入口写的是 Daybreak Red,而不是普通模型目录。
- 准备把模型接入自动化生产系统的团队:先做隔离环境、权限边界和人工复核设计。GPT-5.6-Cyber 的专用能力更强,安全卡也还没有随发布页公开,OpenAI 只说明会在之后发布系统卡。
这次发布的产品结构
OpenAI 把 Daybreak 分成两个访问层级。Blue 提供 GPT-5.6 Sol,针对授权的防御工作调整安全措施,覆盖漏洞发现、代码安全审查、恶意软件分析、事件响应和补丁验证。Red 则提供专门训练的网络安全模型,用于授权漏洞研究、利用验证和安全测试。两类访问都只面向获批的个人和组织,并要求身份验证、账户安全、监控、批准用途限制和法律声明。1
这里容易混淆两件事。Daybreak Blue 会移除 GPT-5.6 Sol 的系统级网络安全防护,帮助防御者少遇到误拦截;但面对高度双用途的请求,Sol 仍可能拒答。GPT-5.6-Cyber 在此基础上做了专门训练,目标是继续降低拒答,并改善利用链开发和零日漏洞研究等任务的表现。它不是简单地给 GPT-5.6 Sol 换一个开关。
95% 到底说明了什么

官方没有把 95% 描述成「模型在网络安全上全面胜出」。它同时给出了几个限制条件:所有模型都使用当时公开可用的最高推理等级;GPT-5.6-Cyber 往往使用更大的推理预算,因此会消耗更多 token;评测在安全加固、隔离并严格监控的环境中完成。1
在更具体的任务上,结果并不单向:
- ExploitGym2 测试模型能否把已知漏洞转成受控环境中的可用利用程序,OpenAI 称 GPT-5.6-Cyber 优于 GPT-5.6 Sol 和 GPT-5.5-Cyber。
- ExploitBench 更难:防御措施更多,模型得到的漏洞信息更少。在标准的 300 轮设置下,GPT-5.6 Sol 的 token 效率和完成表现最好;把上限放宽到 600 轮后,两者差距缩小。
- 在开放式漏洞发现与报告撰写评测中,GPT-5.6-Cyber 反而不如 GPT-5.6 Sol。OpenAI 的解释是,专用模型有时会写出更短、细节更少的漏洞报告。1
所以,团队自己的测试不能只问「能不能完成」。至少要同时记录完成质量、利用链是否真的可验证、报告是否足够详细、token 消耗、任务耗时,以及安全审查对流程的影响。
一个已经落到真实软件上的案例
OpenAI 表示,GPT-5.6-Cyber 被用于研究 V8,也就是 Chrome 使用的 JavaScript 引擎。研究人员发现了两个此前未知、可以串联的漏洞:一个与优化编译器的类型转换和边界检查有关,另一个帮助逃出 V8 堆沙箱。OpenAI 完成验证并向 Google 协调披露,Google 将其中的高危漏洞编号为 CVE-2026-15903。1
这个案例能证明两点。第一,模型的价值不只在回答安全问题,也在于长时间阅读陌生代码、提出假设、复现异常并把发现整理成报告。第二,公开案例是 OpenAI 自己披露的成功案例,不能替代第三方对复现率、误报率和报告质量的独立测量。The Decoder 的同步报道也主要复述了 OpenAI 的 95% 数据与 CVE 案例,没有给出独立重跑 ExploitGym2 或 ExploitBench 的结果。2
安全门槛没有消失
OpenAI 按 Preparedness Framework 将 GPT-5.6-Cyber 的网络安全能力评为 High,但尚未达到 Critical。发布页还写明,系统卡会在之后发布;在这份系统卡出现前,外界无法完整检查评测覆盖、风险分级和部署细节。Axios 的同步报道也把这次发布放在同一条边界上:模型比普通版本更少拒答,但仍处于 High 而非 Critical 阈值。13
当前已经明确的操作约束包括:
- 在没有敏感生产系统和开放互联网访问的隔离环境中运行安全工作流。
- 用 Codex 的 Auto-Review 审查需要提升权限的动作,并为高风险工作保留人工监督。
- 明确授权系统、允许的动作和权限范围,使用受限权限配置。
- Daybreak 个人账户从 2026 年 9 月 1 日起必须采用硬件安全密钥。1
这些约束决定了它适合「受治理的安全研究环境」,不适合把一个更少拒答的模型直接接到生产网络上。The Decoder 也把身份核验、监控、法律声明、硬件密钥和隔离沙箱列为进入和使用 Daybreak 的前置条件。2
现在怎么评估
第一步是确认入口,而不是改模型名。 需要高级漏洞研究、利用验证或红队测试的获批团队,才有理由申请 Daybreak Red;多数防御工作可以先从 Blue 的 GPT-5.6 Sol 开始。公告给出的申请对象是获批个人和组织,不能把它理解成普通 ChatGPT 或 API 账号自动获得权限。1
第二步是用自己的任务集做四组对照。 把 GPT-5.6 Sol(普通安全防护)、GPT-5.6 Sol(Daybreak Blue)、GPT-5.5-Cyber(Daybreak Red)和 GPT-5.6-Cyber(Daybreak Red)放在同一批授权任务上,分开统计完成率、有效发现、报告质量、token、耗时和拒答原因。官方数字适合说明选型方向,不能直接替代团队自己的基线。
第三步是把成本评估留到官方规格完整后。 截至这篇发布公告,OpenAI 没有公开 GPT-5.6-Cyber 的通用 API 价格、上下文窗口或公开模型 ID。没有这三项,团队可以做能力和安全预评估,却不应提前承诺生产预算、吞吐或迁移后的系统容量。1
GPT-5.6-Cyber 的第一价值不是让所有应用换上一个新模型,而是把高级网络安全工作从「模型经常拒答」推进到「在授权、隔离、可监控的环境里可以持续评估」。对有明确安全研究任务的团队,这已经足以开始申请和做内部对照;对其他团队,等系统卡、访问规格和真实成本补齐,再决定是否进入生产,比追着模型名称迁移更稳妥。

OpenAI 新模型发布即时解读
OpenAI 每次发布新模型时即时生成深度解读,帮你第一时间掌握模型能力与应用价值
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.