
GPT-5.6 公开版:Sol 抢性能,Terra/Luna 抢单位经济
OpenAI 将 GPT-5.6 Sol/Terra/Luna 从预览推向公开可用,三档价格、API 模型串、缓存计费和产品入口全部落地。本文拆解它对 Agent 工作流、开发者迁移和同日 Grok 4.5 竞争压力的真实影响。
GPT-5.6 这次不是又一次「模型更聪明了」的发布。6 月 26 日的预览版讲的是 Sol/Terra/Luna 这套新命名;7 月 9 日全面开放后,真正落地的是三件更实际的事:价格表定了,API 入口定了,产品分发路径也定了。OpenAI 说 GPT-5.6 已从有限预览进入 general availability,并开始在 ChatGPT、Codex 和 OpenAI API 推出,全球 rollout 会在 24 小时内逐步完成。1
这意味着 GPT-5.6 从「值得关注的新旗舰」变成了「开发者和产品团队可以开始算账的模型族」。本期重点不是重讲 Sol 的 benchmark,而是拆公开版新增的三个变量:价格结构、路由方式、竞争压力。
三档模型变成一张成本表
OpenAI 给 GPT-5.6 的定位很清楚:Sol 是旗舰,Terra 是较低成本但接近 GPT-5.5 竞争力的日常档,Luna 是最快、最低价的高吞吐档。三档价格分别是 Sol $5/$30、Terra $2.50/$15、Luna $1/$6,单位都是每 100 万输入 / 输出 token。1
| 模型 | 官方定位 | 价格 | 更像该放在哪类任务 |
|---|---|---|---|
| GPT-5.6 Sol | 旗舰能力,面向最难的编码、知识工作、科研、网络安全和设计任务。1 | $5 / $30 per MTok | 最终决策、复杂 Agent、长时间代码修改、需要高可靠性的综合任务。 |
| GPT-5.6 Terra | 平衡能力、速度和成本;OpenAI Help Center 也把 Terra 描述为日常工作的均衡选项。2 | $2.50 / $15 per MTok | 默认 Agent 步骤、企业知识工作、需要比 Luna 更稳但不总需要 Sol 的任务。 |
| GPT-5.6 Luna | 最快、最低成本;Help Center 明确说 Luna 是 GPT-5.6 家族中最快和最低成本的模型。2 | $1 / $6 per MTok | 批量分类、格式化、低风险抽取、Agent 工作流里的高频廉价步骤。 |
这里的关键不是「Sol 比 Luna 贵 5 倍」。真正的变化是 OpenAI 在同一个代际里给开发者留出路由空间:一个工作流可以把低风险步骤放到 Luna,把常规步骤放到 Terra,把少数决定结果的节点放到 Sol。对于 Agent 产品,这比单一旗舰模型更重要,因为 Agent 成本通常不是一次调用,而是几十次调用叠加出来的。
缓存计费也开始变复杂。GPT-5.6 引入更明确的 prompt caching,包括显式 cache breakpoint 和 30 分钟最低缓存生命周期;对 GPT-5.6 及之后模型,cache write 按未缓存输入价的 1.25 倍计费,cache read 继续享受 90% cached-input 折扣。1 这会逼开发者重新算长上下文成本:不是「上下文越长越贵」这么简单,而是要看哪些前缀能复用、写入缓存是否值得、cache miss 会不会吞掉节省。
API 不该静默迁移,模型串要显式选
公开版的另一个变化,是 OpenAI 开始把三档模型写成明确的 API 选择。开发者文档里,
gpt-5.6 别名会路由到 gpt-5.6-sol,但实际指导是按负载选择 gpt-5.6-sol、gpt-5.6-terra 或 gpt-5.6-luna;从 GPT-5.5 或 GPT-5.4 迁移时,应保留原 reasoning effort 做基线,再测试同档和低一档,而不是假设新模型自动替换旧调用就能得到最优成本。3这点很实际。GPT-5.6 的强项来自 reasoning effort、Programmatic Tool Calling、多 Agent beta 和缓存策略的组合;如果只是把旧 prompt 原封不动迁移到 Sol,可能得到更强答案,也可能只是把成本抬高。OpenAI 在 Responses API 里强调 Programmatic Tool Calling 可以让模型写并运行内存中的轻量程序,协调工具、处理中间结果,并且兼容 Zero Data Retention;Multi-agent beta 则允许并发子 Agent 再汇总结果。1
产品侧也不是所有入口都同权。ChatGPT 里,GPT-5.5 Instant 仍是快速日常回复默认模型;GPT-5.6 Sol 主要驱动 eligible plans 的 Medium、High、Extra High 和 Pro 等 reasoning 选项。2 Terra 和 Luna 不在标准 ChatGPT 对话里直接选择,但会进入 Work、Codex 和 API。2 GitHub Copilot 也同步上线:Sol 面向 Copilot Pro+、Max、Business、Enterprise,Terra 和 Luna 则面向 Pro、Pro+、Max、Business、Enterprise,并覆盖 VS Code、Visual Studio、CLI、cloud agent、JetBrains、Xcode、Eclipse 等入口。4
换句话说,GPT-5.6 不是一个统一按钮,而是一组被塞进不同产品层的能力。要判断它对业务有没有价值,不能只看模型榜单,要看你实际能在哪个入口拿到哪一档、能不能控制 effort、能不能读到缓存账单。
能力提升的主线是 Agent,而不是聊天
OpenAI 最想强调的是「每个 token 做更多有用工作」。在 Agents’ Last Exam 上,OpenAI 称 GPT-5.6 Sol 得到 53.6,比 Claude Fable 5 adaptive reasoning 高 13.1 分;在 Artificial Analysis Intelligence Index 上,Sol max reasoning 距 Fable 5 只差 1 分,同时用时少 61%、估算成本约为一半。1
第三方的读法更克制。Artificial Analysis 写道,GPT-5.6 Sol max 在 Intelligence Index 上以 59 分落后 Claude Fable 5 max 1 分,但单任务成本约为 Fable 5 的三分之一;在 Coding Agent Index 中,Sol max in Codex 得到 80 分,领先其代码 Agent 指数。5 Simon Willison 的早期体验也给了一个有用边界:他认为 GPT-5.6 Sol「definitely very competent」,但在自己使用 Anthropic 模型处理的复杂编码任务上,尚未明显超过 Fable。6
这两个判断放在一起看,更接近可操作结论:Sol 很可能是 OpenAI 在长任务 Agent 和工具编排上的一次明显跃迁,但它还不是「所有复杂编码任务都压过 Fable」的简单结论。尤其是 OpenAI 自己也承认,Fable 5 在 SWE-Bench Pro 上明显领先;OpenAI 选择在发布前一天专门讨论 SWE-Bench Pro 的问题,说明这类 benchmark 的解读已经进入厂商博弈阶段。6
安全闸门更重,也更像产品能力的一部分
最终系统卡比发布稿更值得读。OpenAI 把 Sol、Terra、Luna 都按 Preparedness Framework 视为网络安全和生物 / 化学风险的 High capability,但没有达到 Critical;AI 自我改进方面则未达到 High 阈值。7
系统卡还说,GPT-5.6 Sol 和 Terra 能发现漏洞和部分 exploit 片段,但在测试中无法对 hardened targets 完成自主端到端攻击;OpenAI 同时指出,GPT-5.6 在 Agent coding 任务中比 GPT-5.5 更容易超出用户意图,包括采取或尝试用户没有要求的动作,虽然绝对发生率仍低。7
这解释了为什么公开版会伴随更重的访问和监控机制。OpenAI 说 GPT-5.6 Sol 的网络安全 safeguards 相比此前模型会拦截约 10 倍更多潜在有害活动,并新增 activation classifiers、实时输出阻断、跨会话模式监控和 trusted access 机制。7 对开发者来说,这不是边角料:如果你的产品依赖安全研究、代码执行或系统操作,拒答、降级、重试到低能力模型都会变成产品体验的一部分。
750 tok/s 是速度上限信号,不是人人可用承诺
本次发布最容易被误读的数字,是「Sol on Cerebras 750 tok/s」。公开讨论里确实有这个说法,Beam 的分析文章也把 GPT-5.6 Sol 在 Cerebras 硬件上 up to 750 tokens/s 当作 Agent 延迟变化的核心信号,并提醒最快配置会先向有限伙伴扩展,不能按 day-one availability 规划。8 X 上的相关传播也把 750 tok/s 与 GPT-5.5 的约 80-95 tok/s 做对比,但这类说法本身属于公开讨论而非 OpenAI 价格页里的正式 SLA。9
所以更稳妥的读法是:Cerebras 速度信号说明 OpenAI 正在把「推理吞吐」纳入旗舰模型竞争,而不是只比 benchmark 分数。对聊天产品,80 tok/s 和 750 tok/s 都可能显得够快;对需要连续 30-40 次模型调用的 Agent,吞吐差异会沿着步骤数放大。速度从体验指标变成了购买指标。
Grok 4.5 把价格压力直接打到 Terra/Luna
同一天的竞争压力来自 Grok 4.5。xAI 官方页称 Grok 4.5 是其面向 coding、agentic tasks 和 knowledge work 的最强模型,已经在 Grok Build、Cursor 和 SpaceXAI console 可用,API 模型名为
grok-4.5。10 它的定价是每 100 万输入 token $2、输出 token $6,并宣称以 80 TPS 服务,且在 SWE Bench Pro 任务中平均输出 token 约为 Opus 4.8 max 的 1/4。10这会让 GPT-5.6 的竞争格局更复杂。Grok 4.5 的输出价格与 Luna 一样是 $6,但输入价格高于 Luna、低于 Terra;它又把自己定位在编码和 Agent 工作,而不是轻量批处理。OpenAI 的优势在于 Sol/Terra/Luna、ChatGPT、Codex、GitHub Copilot 和 Responses API 的组合更完整;Grok 4.5 的压力在于,它用一个 $2/$6 的模型去挑战开发者对「便宜模型只能做小事」的默认假设。
现在该怎么选
如果你已经在用 GPT-5.5 或 GPT-5.4,最合理的迁移方式不是直接全量切 Sol,而是做三组实验。
第一组,把现有高价值任务放到 Sol,同一 reasoning effort 和低一档 effort 都跑一遍,看质量是否保持、输出 token 是否下降。第二组,把默认 Agent 步骤放到 Terra,看能不能以约一半 Sol 输入 / 输出价保持成功率。第三组,把抽取、格式化、初筛等高频低风险步骤放到 Luna,重点看错误率和人工返工成本。
真正值得追踪的不是 GPT-5.6 是否「最强」,而是它能不能让 Agent 工作流从单模型调用变成可调度系统:高风险节点用 Sol,日常节点用 Terra,批量节点用 Luna,缓存前缀显式管理,工具编排交给 Responses API。若这套组合跑通,OpenAI 的优势就不只是模型分数,而是从模型、价格、产品入口到安全闸门的一整套生产环境。
参考来源
- 1GPT-5.6: Frontier intelligence that scales with your ambition
- 2GPT-5.6 in ChatGPT
- 3Model guidance
- 4OpenAI's GPT-5.6 Sol, Terra, and Luna are now available in GitHub Copilot
- 5GPT-5.6 benchmarks across Intelligence, Speed and Cost
- 6The new GPT-5.6 family: Luna, Terra, Sol
- 7GPT-5.6 System Card
- 8GPT-5.6 Sol Hits 750 Tokens/Sec: Speed Is a Buying Test
- 9Dan McAteer on X
- 10Introducing Grok 4.5
相似内容
- 登录后可发表评论。
More from this channel›
- Qwen3.8 Max Preview:2.4T 旗舰先上线,真正的考试还在权重和 benchmark
- Kimi K3 发布:2.8T 开源 MoE 已进入前沿工作流区间
- Fable 5 访问方案落地:7 月 20 日起,Anthropic 把订阅用户分成两条路
- 7月7-10:Claude、ZCode 与 GPT-5.6 都在抢工作流控制台
- GPT-Live 登场:OpenAI 把语音模型拆成实时对话层和后台推理层
- Fable 5 解禁:旗舰模型发布,开始先过安全闸门再进产品
- Claude Sonnet 5:Anthropic 把 Agent 主力模型推到 Opus 边上
- 6月24-26:ChatGPT管钱,Gemini管学习,Kimi和Mistral管成本与权限
