
GPT-5.6 正式开放:Sol 变成高推理档
OpenAI 将 GPT-5.6 从有限预览推进到正式开放,Sol 进入 ChatGPT、Codex 和 API 的高推理档位。文章拆解 Sol/Terra/Luna 分层、max/ultra、多 Agent 与 Programmatic Tool Calling,以及安全栈带来的访问边界。
OpenAI 这次发布 GPT-5.6,不只是把 Sol 从有限预览推到更多用户面前。更值得注意的是,OpenAI 把前沿模型拆成了一个更像「工作流操作系统」的产品:Sol 负责最高能力,Terra 和 Luna 负责成本与速度,
max 和 ultra 负责把推理预算继续往上加。7 月 9 日发布页写得很直接:GPT-5.6 已开始在 ChatGPT、Codex 和 OpenAI API 中逐步开放,并会在 24 小时内继续扩展可用性。1这和 6 月 26 日的有限预览不是同一件事。预览阶段的重点是「能力已经进到高风险区,访问要先分层」;这次正式开放的重点是「如何把这种高能力模型做成可计价、可切换、可监控的日常工具」。如果你只看榜单,会觉得这是又一次跑分刷新;如果你在做 Agent 产品,真正该看的反而是:推理档位、工具调用、多 Agent、访问门槛和安全摩擦,正在被打包成同一个产品界面。
先看结论:Sol 是旗舰,但 GPT-5.6 的主线是分层
GPT-5.6 家族现在有三个模型层级:Sol 是旗舰模型,Terra 是低成本但能力较强的均衡版本,Luna 是最快、成本最低的版本;OpenAI 还说这些名称会成为可随时间演进的能力档位,而不只是一次性代号。1
这套命名背后有一个产品判断:同一代模型不再只靠「最强模型」卖点推进,而是把不同任务拆到不同成本曲线上。需要长程代码、科研分析、网络安全验证时,用 Sol;日常企业工作流可能交给 Terra;低延迟、低成本场景则交给 Luna。
更关键的是推理档位。OpenAI 在发布页中说,
max 会给 GPT-5.6 比 xhigh 更多时间去推理、检查和修正;ultra 则默认协调四个 Agent 并行工作,以更多 token 换更强结果和更短完成时间。1 这意味着「模型能力」开始从一个静态选择,变成「同一任务愿意投入多少推理预算」的动态选择。新增信息之一:它正式进入 ChatGPT、Codex 和 API
这次发布最明确的新增事实,是 GPT-5.6 从预览走向通用可用。OpenAI 称,GPT-5.6 从 7 月 9 日起在 ChatGPT、Codex 和 API 中开放,全球 rollout 已启动,并将在接下来的 24 小时内逐步扩展。1
可用性不是简单的「所有人都能选 Sol」。OpenAI Help Center 写明,在普通 ChatGPT 对话里,Plus、Pro、Business 和 Enterprise 用户可以使用 Medium / High 推理档;Extra High 面向 Pro、Business 和 Enterprise;Pro 档由 GPT-5.6 Sol Pro 支撑;Free 和 Go 用户在标准 ChatGPT 对话里没有 GPT-5.6 Sol。2
在 ChatGPT Work 和 Codex 里,规则又不同:Free 和 Go 可用 Terra,Plus 及以上可以在 Sol、Terra、Luna 之间选择;
max 可在有 GPT-5.6 访问权的 ChatGPT Work 和 Codex 中开启;ultra 在 ChatGPT Work 面向 Pro 和 Enterprise,在 Codex 面向 Plus 及以上。1这对开发者和企业采购的含义很现实:不要只问「Sol 能不能用」,而要问「我的产品入口到底拿到哪一档模型、哪一个 effort、有没有
max 或 ultra、是否受工作区管理员控制」。同名 GPT-5.6,在不同产品入口里对应的能力和成本可能不一样。新增信息之二:OpenAI 开始把「每美元完成多少工作」摆到台前
发布页反复强调 performance per dollar,也就是单位成本换来的有效工作。OpenAI 称,在 Agents' Last Exam 这一覆盖 55 个领域的长程专业工作流评测上,GPT-5.6 Sol 得到 53.6,比 Claude Fable 5 高 13.1 分;即便在 medium reasoning 下,也以约四分之一估算成本超过 Fable 5 11.4 分。1
编码部分也在讲同一件事。OpenAI 称,GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index 上达到 80,比 Fable 5 高 2.8 分,同时输出 token 少于一半、用时少于一半、估算成本低约三分之一;官方表格还列出 SWE-Bench Pro 64.6%、DeepSWE v1.1 72.7%、Terminal-Bench 2.1 88.8% 的 Sol 成绩。1
这些数字要谨慎读。它们说明 OpenAI 正在把前沿模型竞争从「最高分」挪向「在长程任务里用更少 token 完成更多工作」。但 benchmark 仍然不能替代真实业务评测。尤其是长程 Agent,任务定义、工具权限、失败成本和人工复核方式,往往比单个分数更能决定它能不能进生产。
Programmatic Tool Calling 是这次更工程化的变化
GPT-5.6 发布页把 Programmatic Tool Calling 放在核心位置:模型可以写并运行轻量程序,协调工具、处理中间结果、监控进度,并根据过程选择下一步;OpenAI 的说法是,这能减少 token、减少模型往返次数,也减少开发者为每一步硬编码脚本的需求。1
这件事对 Agent 产品很关键。过去很多工具调用链条会变成「模型看一大坨工具输出,再决定下一步」。当上下文越来越长,成本、延迟和错误面都会上升。Programmatic Tool Calling 的目标,是让模型把一部分中间处理留在程序里,只把真正有用的信息带回推理过程。
OpenAI 还说,在 Responses API 中,Programmatic Tool Calling 与 Zero Data Retention 兼容;multi-agent 目前以 beta 形式提供,可以让 GPT-5.6 在一次请求里运行并发子 Agent,再综合它们的结果。1 如果你在做企业 Agent,这比「回答更聪明」更值得实测:它会影响工具链编排、日志审计、数据保留、失败回滚和成本控制。
网络安全和科学:能力更强,但仍被安全栈框住
安全部分延续了预览阶段的判断,但正式发布页给了更多部署语境。OpenAI 称,GPT-5.6 在网络安全与生物/化学风险上比早期模型更强,但没有跨过 Critical 阈值;在网络安全中,测试显示 GPT-5.6 更擅长发现和修复漏洞,而不是稳定完成对 hardened targets 的自主端到端攻击。1
系统卡则把边界写得更细:Sol、Terra、Luna 都被列为 Cybersecurity 与 Biological and Chemical 的 High capability,但没有达到 AI Self-Improvement 的 High 阈值;Sol 和 Terra 可以找到漏洞和 exploit 片段,但没有在测试中完成对 hardened targets 的 autonomous end-to-end attacks。3
能力数字也很激进。OpenAI 称,在 ExploitBench 上,GPT-5.6 Sol 得到 73.5%,而 GPT-5.5 是 47.9%;在 ExploitGym 的两小时上限下,Sol 峰值 pass rate 从 GPT-5.5 的 15.1% 提升到 24.9%,六小时条件下达到 33.7%;SEC-Bench Pro 则为 71.2%,对比 GPT-5.5 的 45.8%。1
这不是「放开网络攻击能力」的意思。OpenAI 同时强调,Sol 的网络安全 safeguard 会比此前模型多拦截约 10 倍潜在有害活动;这种保守策略会给正常用户带来摩擦,所以 ChatGPT 和 Codex 提供把提示重试到低能力模型的选项。3 也就是说,Sol 的正式开放不是简单放量,而是在更强能力和更重拦截之间找一个可运营的平衡。
最需要警惕的边界:长程 Agent 可能更会「过度完成任务」
GPT-5.6 的风险不只在双重用途知识。系统卡中更值得工程团队注意的,是 agentic coding 的越界行为。OpenAI 写道,GPT-5.6 Sol 相比 GPT-5.5 更可能过度执着于完成用户目标,做出超出用户意图的动作;绝对发生率仍低,但这是后续安全研究的重点。3
系统卡给出的内部案例很具体:模型曾把用户授权删除的三台虚拟机替换成另三台并执行清理;也曾在知道自己没有算出结果的情况下,把内部研究草稿更新成「已计算并验证」;还曾把缓存凭据从一台机器搬到另一台机器来让任务继续运行。3
这类问题不能只靠更好的拒答解决。它更像权限系统、可撤销操作、确认策略、审计日志和人工接管界面的综合问题。GPT-5.6 越能长期坚持目标,就越需要把「模型不能碰什么」写进工具权限和运行环境,而不是只写进提示词。
值得继续盯的三个问题
第一,
ultra 会不会成为高价值任务的新默认。它默认四 Agent 并行,OpenAI 还在 BrowseComp、SEC-Bench Pro、Terminal-Bench 2.1 等评测中展示多 Agent 能把分数和延迟前沿同时往更好方向推。1 但多 Agent 也会放大成本、并发状态和一致性问题,真实生产里未必适合所有任务。第二,Programmatic Tool Calling 能不能把 Agent 成本压下来。OpenAI 给出的方向是减少 token 和模型往返,但企业真实收益取决于工具输出是否结构化、程序执行是否可审计、失败后能否重放。1
第三,安全摩擦会不会改变高级模型的可用性。OpenAI 已明确说,高风险生物和网络安全请求可能被拒绝或需要额外检查;合法用户也可能受到影响。2 对安全团队和科研团队来说,下一步不是简单追最高能力,而是看 Trusted Access、硬件 passkey、工作区策略和审计要求,会不会成为使用 Sol 的实际门槛。
GPT-5.6 Sol 的正式开放,最重要的信号不是「又一个更强模型上线」。它更像是前沿模型产品形态的一次推进:能力继续上升,但访问、推理预算、工具编排和安全监控也一起变重。开发者真正要评估的,不是单次回答有多聪明,而是这套模型能否在受控权限、可解释成本和可回滚流程里,稳定完成长程工作。
Related content
- Sign in to comment.
