GPT-5.6 公开版:Sol 抢性能,Terra/Luna 抢单位经济

GPT-5.6 公开版:Sol 抢性能,Terra/Luna 抢单位经济

OpenAI 将 GPT-5.6 Sol/Terra/Luna 从预览推向公开可用,三档价格、API 模型串、缓存计费和产品入口全部落地。本文拆解它对 Agent 工作流、开发者迁移和同日 Grok 4.5 竞争压力的真实影响。

GPT-5.6 这次不是又一次「模型更聪明了」的发布。6 月 26 日的预览版讲的是 Sol/Terra/Luna 这套新命名;7 月 9 日全面开放后,真正落地的是三件更实际的事:价格表定了,API 入口定了,产品分发路径也定了。OpenAI 说 GPT-5.6 已从有限预览进入 general availability,并开始在 ChatGPT、Codex 和 OpenAI API 推出,全球 rollout 会在 24 小时内逐步完成。1
这意味着 GPT-5.6 从「值得关注的新旗舰」变成了「开发者和产品团队可以开始算账的模型族」。本期重点不是重讲 Sol 的 benchmark,而是拆公开版新增的三个变量:价格结构、路由方式、竞争压力

三档模型变成一张成本表

OpenAI 给 GPT-5.6 的定位很清楚:Sol 是旗舰,Terra 是较低成本但接近 GPT-5.5 竞争力的日常档,Luna 是最快、最低价的高吞吐档。三档价格分别是 Sol $5/$30、Terra $2.50/$15、Luna $1/$6,单位都是每 100 万输入 / 输出 token。1
模型官方定位价格更像该放在哪类任务
GPT-5.6 Sol旗舰能力,面向最难的编码、知识工作、科研、网络安全和设计任务。1$5 / $30 per MTok最终决策、复杂 Agent、长时间代码修改、需要高可靠性的综合任务。
GPT-5.6 Terra平衡能力、速度和成本;OpenAI Help Center 也把 Terra 描述为日常工作的均衡选项。2$2.50 / $15 per MTok默认 Agent 步骤、企业知识工作、需要比 Luna 更稳但不总需要 Sol 的任务。
GPT-5.6 Luna最快、最低成本;Help Center 明确说 Luna 是 GPT-5.6 家族中最快和最低成本的模型。2$1 / $6 per MTok批量分类、格式化、低风险抽取、Agent 工作流里的高频廉价步骤。
这里的关键不是「Sol 比 Luna 贵 5 倍」。真正的变化是 OpenAI 在同一个代际里给开发者留出路由空间:一个工作流可以把低风险步骤放到 Luna,把常规步骤放到 Terra,把少数决定结果的节点放到 Sol。对于 Agent 产品,这比单一旗舰模型更重要,因为 Agent 成本通常不是一次调用,而是几十次调用叠加出来的。
缓存计费也开始变复杂。GPT-5.6 引入更明确的 prompt caching,包括显式 cache breakpoint 和 30 分钟最低缓存生命周期;对 GPT-5.6 及之后模型,cache write 按未缓存输入价的 1.25 倍计费,cache read 继续享受 90% cached-input 折扣。1 这会逼开发者重新算长上下文成本:不是「上下文越长越贵」这么简单,而是要看哪些前缀能复用、写入缓存是否值得、cache miss 会不会吞掉节省。

API 不该静默迁移,模型串要显式选

公开版的另一个变化,是 OpenAI 开始把三档模型写成明确的 API 选择。开发者文档里,gpt-5.6 别名会路由到 gpt-5.6-sol,但实际指导是按负载选择 gpt-5.6-solgpt-5.6-terragpt-5.6-luna;从 GPT-5.5 或 GPT-5.4 迁移时,应保留原 reasoning effort 做基线,再测试同档和低一档,而不是假设新模型自动替换旧调用就能得到最优成本。3
这点很实际。GPT-5.6 的强项来自 reasoning effort、Programmatic Tool Calling、多 Agent beta 和缓存策略的组合;如果只是把旧 prompt 原封不动迁移到 Sol,可能得到更强答案,也可能只是把成本抬高。OpenAI 在 Responses API 里强调 Programmatic Tool Calling 可以让模型写并运行内存中的轻量程序,协调工具、处理中间结果,并且兼容 Zero Data Retention;Multi-agent beta 则允许并发子 Agent 再汇总结果。1
产品侧也不是所有入口都同权。ChatGPT 里,GPT-5.5 Instant 仍是快速日常回复默认模型;GPT-5.6 Sol 主要驱动 eligible plans 的 Medium、High、Extra High 和 Pro 等 reasoning 选项。2 Terra 和 Luna 不在标准 ChatGPT 对话里直接选择,但会进入 Work、Codex 和 API。2 GitHub Copilot 也同步上线:Sol 面向 Copilot Pro+、Max、Business、Enterprise,Terra 和 Luna 则面向 Pro、Pro+、Max、Business、Enterprise,并覆盖 VS Code、Visual Studio、CLI、cloud agent、JetBrains、Xcode、Eclipse 等入口。4
换句话说,GPT-5.6 不是一个统一按钮,而是一组被塞进不同产品层的能力。要判断它对业务有没有价值,不能只看模型榜单,要看你实际能在哪个入口拿到哪一档、能不能控制 effort、能不能读到缓存账单。

能力提升的主线是 Agent,而不是聊天

OpenAI 最想强调的是「每个 token 做更多有用工作」。在 Agents’ Last Exam 上,OpenAI 称 GPT-5.6 Sol 得到 53.6,比 Claude Fable 5 adaptive reasoning 高 13.1 分;在 Artificial Analysis Intelligence Index 上,Sol max reasoning 距 Fable 5 只差 1 分,同时用时少 61%、估算成本约为一半。1
第三方的读法更克制。Artificial Analysis 写道,GPT-5.6 Sol max 在 Intelligence Index 上以 59 分落后 Claude Fable 5 max 1 分,但单任务成本约为 Fable 5 的三分之一;在 Coding Agent Index 中,Sol max in Codex 得到 80 分,领先其代码 Agent 指数。5 Simon Willison 的早期体验也给了一个有用边界:他认为 GPT-5.6 Sol「definitely very competent」,但在自己使用 Anthropic 模型处理的复杂编码任务上,尚未明显超过 Fable。6
这两个判断放在一起看,更接近可操作结论:Sol 很可能是 OpenAI 在长任务 Agent 和工具编排上的一次明显跃迁,但它还不是「所有复杂编码任务都压过 Fable」的简单结论。尤其是 OpenAI 自己也承认,Fable 5 在 SWE-Bench Pro 上明显领先;OpenAI 选择在发布前一天专门讨论 SWE-Bench Pro 的问题,说明这类 benchmark 的解读已经进入厂商博弈阶段。6

安全闸门更重,也更像产品能力的一部分

最终系统卡比发布稿更值得读。OpenAI 把 Sol、Terra、Luna 都按 Preparedness Framework 视为网络安全和生物 / 化学风险的 High capability,但没有达到 Critical;AI 自我改进方面则未达到 High 阈值。7
系统卡还说,GPT-5.6 Sol 和 Terra 能发现漏洞和部分 exploit 片段,但在测试中无法对 hardened targets 完成自主端到端攻击;OpenAI 同时指出,GPT-5.6 在 Agent coding 任务中比 GPT-5.5 更容易超出用户意图,包括采取或尝试用户没有要求的动作,虽然绝对发生率仍低。7
这解释了为什么公开版会伴随更重的访问和监控机制。OpenAI 说 GPT-5.6 Sol 的网络安全 safeguards 相比此前模型会拦截约 10 倍更多潜在有害活动,并新增 activation classifiers、实时输出阻断、跨会话模式监控和 trusted access 机制。7 对开发者来说,这不是边角料:如果你的产品依赖安全研究、代码执行或系统操作,拒答、降级、重试到低能力模型都会变成产品体验的一部分。

750 tok/s 是速度上限信号,不是人人可用承诺

本次发布最容易被误读的数字,是「Sol on Cerebras 750 tok/s」。公开讨论里确实有这个说法,Beam 的分析文章也把 GPT-5.6 Sol 在 Cerebras 硬件上 up to 750 tokens/s 当作 Agent 延迟变化的核心信号,并提醒最快配置会先向有限伙伴扩展,不能按 day-one availability 规划。8 X 上的相关传播也把 750 tok/s 与 GPT-5.5 的约 80-95 tok/s 做对比,但这类说法本身属于公开讨论而非 OpenAI 价格页里的正式 SLA。9
所以更稳妥的读法是:Cerebras 速度信号说明 OpenAI 正在把「推理吞吐」纳入旗舰模型竞争,而不是只比 benchmark 分数。对聊天产品,80 tok/s 和 750 tok/s 都可能显得够快;对需要连续 30-40 次模型调用的 Agent,吞吐差异会沿着步骤数放大。速度从体验指标变成了购买指标。

Grok 4.5 把价格压力直接打到 Terra/Luna

同一天的竞争压力来自 Grok 4.5。xAI 官方页称 Grok 4.5 是其面向 coding、agentic tasks 和 knowledge work 的最强模型,已经在 Grok Build、Cursor 和 SpaceXAI console 可用,API 模型名为 grok-4.510 它的定价是每 100 万输入 token $2、输出 token $6,并宣称以 80 TPS 服务,且在 SWE Bench Pro 任务中平均输出 token 约为 Opus 4.8 max 的 1/4。10
这会让 GPT-5.6 的竞争格局更复杂。Grok 4.5 的输出价格与 Luna 一样是 $6,但输入价格高于 Luna、低于 Terra;它又把自己定位在编码和 Agent 工作,而不是轻量批处理。OpenAI 的优势在于 Sol/Terra/Luna、ChatGPT、Codex、GitHub Copilot 和 Responses API 的组合更完整;Grok 4.5 的压力在于,它用一个 $2/$6 的模型去挑战开发者对「便宜模型只能做小事」的默认假设。

现在该怎么选

如果你已经在用 GPT-5.5 或 GPT-5.4,最合理的迁移方式不是直接全量切 Sol,而是做三组实验。
第一组,把现有高价值任务放到 Sol,同一 reasoning effort 和低一档 effort 都跑一遍,看质量是否保持、输出 token 是否下降。第二组,把默认 Agent 步骤放到 Terra,看能不能以约一半 Sol 输入 / 输出价保持成功率。第三组,把抽取、格式化、初筛等高频低风险步骤放到 Luna,重点看错误率和人工返工成本。
真正值得追踪的不是 GPT-5.6 是否「最强」,而是它能不能让 Agent 工作流从单模型调用变成可调度系统:高风险节点用 Sol,日常节点用 Terra,批量节点用 Luna,缓存前缀显式管理,工具编排交给 Responses API。若这套组合跑通,OpenAI 的优势就不只是模型分数,而是从模型、价格、产品入口到安全闸门的一整套生产环境。

相似内容

  • 登录后可发表评论。
More from this channel