OpenAI GPT-5.6 发布:Sol/Terra/Luna 三档模型,押注长程 Agent

OpenAI GPT-5.6 发布:Sol/Terra/Luna 三档模型,押注长程 Agent

OpenAI 发布 GPT-5.6 家族,包含 Sol、Terra、Luna 三档模型。本文快速梳理官方披露的 benchmark、价格、可用范围、工具调用能力与未披露参数规模这一关键信息。

OpenAI 把 GPT‑5.6 从预览推到正式可用,主线不再只是「更聪明」。这次发布的重点是把旗舰、均衡、低成本三档放进同一个家族,并把工具调用、多智能体和长程任务做成默认卖点。1

先看结论

这是一条面向开发者和企业工作流的发布。GPT‑5.6 不是单个模型,而是 Sol、Terra、Luna 三档:Sol 是旗舰,Terra 主打日常任务的性价比,Luna 是最低成本档。OpenAI 没有披露参数规模,公开信息主要落在价格、评测、工具调用和可用范围上。1
如果你只关心是否值得试,优先看两点:第一,Sol 在长程代理、编码、浏览、网络安全和科研评测上给出了一批新分数;第二,OpenAI 把 Programmatic Tool Calling 和 multi-agent beta 放进 API 叙事里,明显在争夺「能自己把复杂任务跑完」的开发者场景。1

关键参数与发布信息

维度信息
发布时间OpenAI 在 2026 年 7 月 9 日发布 GPT‑5.6,并称其从有限预览进入 general availability。1
模型家族GPT‑5.6 包含 Sol、Terra、Luna 三档,分别对应旗舰、均衡和低成本模型。1
参数规模官方发布没有披露参数量;可确认的信息是三档能力层级和按 token 计费。1
可用范围GPT‑5.6 从发布日起在 ChatGPT、Codex 和 OpenAI API 中逐步开放,OpenAI 称全球 rollout 将在 24 小时内推进。1
API 价格Sol 为每 100 万 token 5 美元输入、30 美元输出;Terra 为 2.50 美元输入、15 美元输出;Luna 为 1 美元输入、6 美元输出。1

Benchmark:OpenAI 选择强调哪几类能力

OpenAI 把 GPT‑5.6 的评测重点放在长程代理、编码、知识工作、网络安全和科学任务上,而不是单纯给一个通用榜单分数。
  • 长程代理任务:在 Agents’ Last Exam 上,OpenAI 称 GPT‑5.6 Sol 达到 53.6,领先 Claude Fable 5 adaptive reasoning 13.1 分;即使在 medium reasoning 下,也领先 11.4 分,并且估算成本约为后者四分之一。1
  • 编码代理:在 Artificial Analysis Coding Agent Index 上,OpenAI 称 GPT‑5.6 Sol max reasoning 得分 80,比 Claude Fable 5 高 2.8 分,同时输出 token 少于一半、耗时少于一半、成本约低三分之一。1
  • 浏览与电脑使用:GPT‑5.6 Sol 在 BrowseComp 上为 92.2%,在 OSWorld 2.0 上为 62.6%;OpenAI 称其在 OSWorld 上超过 Opus 4.8,同时输出 token 少 85%。1
  • 网络安全:OpenAI 称 GPT‑5.6 在 ExploitBench 上为 73.5%,高于 GPT‑5.5 的 47.9%;在 SEC-Bench Pro 上为 71.2%,高于 GPT‑5.5 的 45.8%。1
这些分数的共同指向很清楚:GPT‑5.6 要证明自己在「把工具、浏览器、终端、代码库和长上下文串起来」这类任务上更稳。对普通聊天用户来说,差异未必每天可见;对用模型跑 agent、代码审查、资料检索和企业文档工作的团队,OpenAI 正在把单位成本和完成率放到同一张账上。

能力亮点:这次最值得盯的三个变化

1. Programmatic Tool Calling

OpenAI 称 GPT‑5.6 能写并运行轻量程序来协调工具、处理中间结果、监控进度,再决定下一步动作。开发者不必把每个工具返回结果都完整塞回模型,模型可以先过滤大批中间数据,只保留和任务相关的信息。1
这对 agent 成本很关键。很多自动化任务贵,不是因为最后答案长,而是因为中间工具调用和日志太多。GPT‑5.6 试图把这部分消耗压下去。

2. max 与 ultra 两档高强度推理

max 给 GPT‑5.6 更多时间做推理、检查和修订;ultra 默认协调 4 个 agent 并行工作,用更高 token 消耗换取复杂任务上的结果和速度。OpenAI 还提到,开发者可在 Responses API 中用 multi-agent beta 构建类似体验。1
这不是给所有问题都加大算力,而是把「普通任务省钱」和「难题上堆并行」拆成两个明确开关。

3. 更强的设计、文档和表格工作

OpenAI 称 GPT‑5.6 在前端、演示文稿、文档和电子表格上有明显提升,尤其能根据参考模板推断版式、字体、间距、颜色和重复内容规则。1
这部分看似偏办公,其实和代码 agent 是同一条线:模型不只生成文本,还要检查结果是否能直接交付。

安全与限制

OpenAI 表示,GPT‑5.6 在生物和网络安全能力上强于早期模型,但未跨过其安全框架中的 Critical 阈值;网络安全方面,OpenAI 判断它更擅长发现和修复漏洞,而不是可靠地自主攻击加固目标。1
同时,GPT‑5.6 Sol 的网络安全防护会比旧模型更严格。OpenAI 称其 cyber safeguards 拦截的潜在有害活动约为上一代相关模型的 10 倍,并通过 Trusted Access 给已验证用户开放更精细的防御类能力。1

读者该怎么跟进

如果你是开发者,先试 Terra 和 Luna 的单位成本,再把 Sol 留给长程 coding agent、资料检索、复杂工作流和安全分析。若你正在做企业自动化,重点测试 Programmatic Tool Calling 能否减少中间 token 和工具往返。1
如果你只想判断行业信号,这次发布的关键词是:三档模型、按任务调 effort、程序化工具调用、多 agent、每美元完成更多工作。参数规模没有公开,单看「大不大」已经不够;更该看它在你的真实工作流里能不能少跑几步、少花几次钱。

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel