
GPT-5.6 Sol/Terra/Luna 公开发布:从等邀请变成该评估了
OpenAI 确认 GPT-5.6 Sol、Terra、Luna 进入公开发布阶段。本期聚焦从受限预览到公开访问后的新增事实、价格结构、安全边界和开发者迁移评估顺序。
GPT-5.6 Sol、Terra、Luna 这次不是「又发了一遍」。6 月 26 日的版本是受限预览,OpenAI 明确说只给一小组可信伙伴和组织使用;7 月 8 日,OpenAI 官方账号改口径:GPT-5.6 Sol 会和 Terra、Luna 一起在周四公开发布,并且已开始全球扩大预览访问。1 Sam Altman 随后也发帖说「GPT-5.6 sol launches thursday! happy building」。2
这就是本轮值得单独成篇的新增事实:GPT-5.6 从「少数组织试用」进入「公开发布」阶段。对于开发者和产品团队,判断点也随之变化。上一阶段的问题是「能不能拿到」;现在的问题是「该不该把它放进评估队列,放在哪个业务里,成本和安全审核怎么预期」。
先给判断:Sol 不是默认替换 GPT-5.5 的答案
GPT-5.6 家族分成三档:Sol 是旗舰模型,Terra 是更均衡的低成本选项,Luna 是速度和成本优先的版本。OpenAI 在 6 月预览公告中说,Terra 的性能可与 GPT-5.5 竞争,同时价格便宜 2 倍;Luna 则是这个家族里成本最低的版本。3
所以别把 GPT-5.6 理解成一个单点升级。它更像 OpenAI 把主线模型拆成了稳定的三层选型:要最强能力用 Sol,要日常高性价比用 Terra,要低价高吞吐用 Luna。这个命名系统可能会长期存在,OpenAI 自己也说,数字代表模型代际,Sol、Terra、Luna 代表可按各自节奏演进的能力层级。3
和 6 月预览相比,新增信息是什么
这次新增的不是 benchmark,而是访问状态。
| 维度 | 6 月 26 日受限预览 | 7 月 8 日公开发布口径 |
|---|---|---|
| 发布状态 | OpenAI 称 GPT-5.6 Sol、Terra、Luna 先给少数可信伙伴和组织预览。3 | OpenAI 官方 X 称三款模型将在周四公开发布,并正在全球扩大预览访问。1 |
| 可用产品 | 预览期通过 API 和 Codex 面向被批准的组织,不包含 ChatGPT。4 | CNBC 报道称 OpenAI 将公开发布 GPT-5.6 Sol、Terra、Luna;OpenAI 同时推出 GPT-Live 语音模型。5 |
| 政府限制 | OpenAI 称其按美国政府要求先从小范围可信伙伴开始。3 | Reuters 称 GPT-5.6 将在政府要求导致的延迟后公开发布,Axios 报道美国政府已批准广泛发布。6 |
| 用户动作 | 大多数团队只能读文档、等邀请。 | 可以把 GPT-5.6 纳入迁移评估,但仍要等官方产品页和 API 文档同步到具体账号。 |
这里有一个小心点:截至本轮抓取,OpenAI Help Center 的 GPT-5.6 页面仍保留「未宣布 GA 日期」的预览期表述。4 因此,公开发布事实可以由 OpenAI 官方 X、Sam Altman 和媒体报道确认;具体到你的 API 组织、Codex 工作区或 ChatGPT 账号是否已经可选,还要看后台放量和文档更新。
能力变化:Sol 强在长任务、代码、生物和安全
OpenAI 对 GPT-5.6 Sol 的定位很高:它称 Sol 是「our strongest model yet」,并把能力重点放在 coding、biology 和 cybersecurity。3
具体看,GPT-5.6 引入了
max reasoning effort,让 Sol 有更多时间深度推理;还引入 ultra mode,通过 subagents 加速复杂工作。3 这两个词听起来很产品化,但含义很实际:OpenAI 正把「更长思考」和「多代理协同」做成模型层选项,而不是只留给外部框架自己拼。官方还声称,Sol 在 Terminal-Bench 2.1 上达到新的 state of the art;在 GeneBench v1 上比 GPT-5.5 更强且用更少 token;在 ExploitBench 上用约三分之一输出 token 就能与 Mythos Preview 竞争。3 这些 benchmark 仍是 OpenAI 的发布口径,不能当作第三方复测结果。但它们说明了 OpenAI 想把 Sol 推向哪类任务:长程编码、科学分析和高风险安全工作。
价格:Terra 可能比 Sol 更先进入生产
GPT-5.6 的公开价格按每 100 万 token 计费:Sol 输入 5 美元、输出 30 美元;Terra 输入 2.5 美元、输出 15 美元;Luna 输入 1 美元、输出 6 美元。OpenAI Help Center 和 6 月公告给出的价格一致。4
它还引入更可预测的 prompt caching,包括显式 cache breakpoints 和 30 分钟最低缓存生命周期。GPT-5.6 及之后模型中,cache writes 按未缓存输入价格的 1.25 倍计费,cache reads 仍享受 90% 的缓存输入折扣。4
这会改变不少团队的选型顺序。Sol 适合放进高价值、低频、复杂任务里评估,比如大型代码迁移、安全审计辅助、科研数据分析和高难度代理任务。Terra 更可能先进入日常生产:如果它确实能接近 GPT-5.5,同时便宜一半,产品团队会优先把它拿来跑现有 GPT-5.5 工作流的 A/B 测试。Luna 则适合批量、低延迟、可容忍能力折损的场景。
安全限制:公开发布不等于无限制使用
GPT-5.6 的安全卡把 Sol、Terra、Luna 都按 OpenAI Preparedness Framework 视为 Cybersecurity 和 Biological and Chemical risk 的 High capability,但未达到 AI Self-Improvement 的 High 阈值。7 这解释了为什么这次发布会和政府流程绑得这么紧。
OpenAI 还说,Sol 和 Terra 能发现漏洞和 exploit pieces,但在测试中不能对 hardened targets 完成自主端到端攻击。系统卡也提到,部署模拟发现 GPT-5.6 比 GPT-5.5 更容易在 agentic coding 任务中超出用户意图,虽然绝对发生率仍然较低。7
这不是一句合规套话。它会影响实际使用:生物和网络安全相关请求可能触发实时检查、暂停生成或拦截。Help Center 也明确说,GPT-5.6 使用分层安全措施,一些请求可能被阻止,或因为额外检查而变慢,特别是在生物和网络安全这类双用途领域。4
迁移建议:先评估 Terra,再把 Sol 放进高价值任务
如果你现在用 GPT-5.5 跑日常知识工作、客服辅助、文档分析或轻量代码任务,第一步不一定是上 Sol,而是拿 Terra 做对照。核心指标很简单:质量是否接近或超过现有模型,输出 token 是否下降,缓存命中后总成本是否可控,安全检查是否影响正常业务。
如果你做的是代码代理、安全分析、科研工作流或长任务自动化,Sol 值得进评估队列。测试时不要只看一次性回答,要看它在 30 分钟到数小时任务中的稳定性:会不会跑偏,会不会误调用工具,会不会因为安全检查卡住合法任务。
如果你的产品对成本和响应速度更敏感,Luna 才是要看的对象。它未必是最聪明的,但如果能覆盖分类、抽取、改写、低风险客服和批量处理,单位经济性会更好。
后续观察
接下来要盯三件事。第一,OpenAI 的产品文档和模型列表什么时候同步 GA 后的实际访问范围。第二,第三方能否复现 Sol 在代码、生物和安全 benchmark 上的优势。第三,安全检查在真实企业工作流里是合理拦截,还是让合法任务频繁卡顿。
GPT-5.6 GA 的意义不在于所有人都该立刻换模型,而是 OpenAI 的下一代主线模型终于从政策闸门后走到开发者面前。现在可以开始评估,但别跳过成本、权限和安全边界这三道关。
Related content
- Sign in to comment.
