OpenAI把GPT-5.6 API价格打到每百万 token 0.2美元:便宜的到底是模型,还是整条推理链?

OpenAI把GPT-5.6 API价格打到每百万 token 0.2美元:便宜的到底是模型,还是整条推理链?

OpenAI 同时下调 GPT-5.6 Luna、Terra 的 API 价格并为 Sol 增加 Fast mode,真正的变化在于模型、推理服务和 agent 编排开始共同承担降本。

先看结论

OpenAI 在 7 月 30 日把 GPT-5.6 的 API 价格、处理速度和模型分层一起调整:Luna 的输入 / 输出价格降到每百万 token 0.20 / 1.20 美元,Terra 为 2 / 12 美元;Sol 价格不变,但新增 Fast mode,最高可用两倍价格换取约 2.5 倍速度。12
这不是一次简单的「模型降价」。OpenAI 把成本下降归因于三层改动:模型少走重复步骤,推理服务更有效地利用 GPU,agent harness 减少上下文膨胀和重复工具调用。对开发团队来说,变化最大的地方是:以前必须用强模型才能勉强承受的高频任务,现在可以尝试交给便宜模型;但最终账单仍取决于上下文长度、缓存命中率、工具调用次数和任务失败后的重试。

价格到底变了什么

先把价格口径摆在一起。下表均为 API 标准处理、短上下文的每百万 token 价格;长上下文采用单独计价,不能直接拿短上下文单价乘总 token 数。2
模型 / 模式短上下文输入短上下文输出长上下文输入 / 输出适合的成本位置
GPT-5.6 Luna$0.20$1.20$0.40 / $1.80高频、可拆解、允许较低单步智能的工作 2
GPT-5.6 Terra$2.00$12.00$4.00 / $18.00日常工作,需要更稳定质量的任务 2
GPT-5.6 Sol$5.00$30.00$10.00 / $45.00复杂推理;Fast mode 可用更高价格换速度 12
OpenAI 在公告中称,Luna 的价格降低 80%,Terra 降低 20%;Sol 的价格保持不变。Fast mode 不是更聪明的模型,而是给 GPT-5.6 Sol 提供更快的处理通道:速度最高约为 Standard 的 2.5 倍,价格为两倍,原来的 Priority 请求会自动转到 Fast mode。1
这里有两个不能混用的比较基准。OpenAI 的工程说明称,Terra 在其智能评测上达到与 GPT-5.5 相当的表现、价格约为一半;同一篇说明又把 Luna 描述为 Sol 成本的 20%。这些是不同模型、不同基准下的横向比较,不等于「所有 GPT-5.6 模型都比上一代便宜同样比例」。3

降本来自哪三层

OpenAI 技术团队没有把降价只归给模型参数或训练方法,而是把它拆成一条完整的服务链。官方架构图把 agent harness、API orchestration 和 model inference 放在同一条路径上:前者管理上下文和工具,第二层负责请求编排,第三层负责 GPU 推理。3
第一层是模型本身。 OpenAI 称 GPT-5.6 被训练成用更少 token 完成更多工作。这个说法真正对应的工程指标,不是单次回答看起来多聪明,而是完成同一任务需要多少输出、多少轮推理和多少次工具调用。若模型少绕一圈,输入输出费用和等待时间会同时下降;但这仍需要按自己的任务评测,不能由模型名称直接推出。
第二层是推理服务。 OpenAI 工程说明披露,GPT-5.6 Sol 曾用于分析生产流量、优化路由和重写 GPU kernel;相关 kernel 工作让其披露的端到端 serving cost 降低 20%,对 speculative decoding 的实验让 token 生成效率提高超过 15%。这是 OpenAI 内部系统的工程结果,不是 API 用户都能获得的固定折扣。3
第三层是 agent harness。 多步骤 agent 的费用经常不是一次模型调用,而是「模型请求 → 工具执行 → 返回结果 → 再请求」循环。OpenAI 说,Codex 和 ChatGPT Work 的编排层通过延迟发现工具、限制工具输出、保持可复用的 prompt 前缀,减少上下文重复处理;官方文档还写明,工具输出默认限制为 10,000 token,除非模型要求更高上限。3
这三层叠加,才解释了为什么一次降价会同时牵动模型选择、缓存策略和 agent 架构。只换模型而保留冗长上下文、无上限工具输出和低缓存命中率,实际节省可能远小于价格表上的比例。

哪些工作流会先受益

最先受益的不是所有 AI 应用,而是那些能把任务拆成清晰步骤、能接受局部失败并且调用量足够大的流程:
  1. 批量分类和抽取。 例如把客服记录、合同字段或内部文档做初筛。只要质量标准可以用一组固定样本验证,Luna 的低输出价格会直接降低高频调用的门槛。
  2. 代码 agent 的常规环节。 复杂任务可以让 Sol 负责拆解和处理异常,再把格式明确的实现、测试和结果检查交给 Luna。OpenAI 自己也把「强模型定计划、便宜模型执行」作为示例工作流,但这是产品方给出的用法建议,不是普遍效果保证。1
  3. 对延迟敏感的关键步骤。 如果用户等待时间比 token 价格更重要,Fast mode 才有意义。它适合支付确认、交互式代码补全或需要快速返回的环节;如果任务可以排队,单纯为速度支付两倍价格未必划算。
相反,长文档、长上下文和高工具调用密度的任务要谨慎。Luna 和 Terra 的长上下文输入输出价格都高于短上下文,且 agent 每增加一轮工具调用,就可能重复支付上下文、工具结果和输出 token。API 价格页还提示,支持数据驻留的区域处理端点对 2026 年 3 月 5 日及之后发布且支持该能力的模型加收 10%;合规、网络和存储要求也可能改变总成本。2

降价不等于总成本下降

要判断 GPT-5.6 是否真的改变了部署经济学,至少要把四个数字放进同一张账:
  • 每次任务的 token 量:输入和输出必须分开记录,长上下文不能按短上下文价格估算。
  • 缓存命中率:重复的系统提示、工具定义和历史上下文是否能命中缓存,决定输入 token 会不会每次都按全价处理。
  • 任务成功率与重试次数:便宜模型如果让失败率上升,额外调用会吃掉名义上的单价优势。
  • 等待时间的价值:Fast mode 的两倍价格只有在更快响应能减少流失、提高吞吐或缩短人工等待时才有经济意义。
OpenAI 公布了内部成本下降和客户案例,但没有在这次公告中给出跨行业、统一口径的生产成功率、平均任务 token、GPU 利用率或用户总拥有成本数据。Notion、Ramp、Blitzy、Cognition 和 Dust 的引述可以作为早期部署信号,不能当作独立验证的行业平均值。1

对行业的三个观察

第一,模型价格竞争开始从「每百万 token 多少钱」转向「完成一个可验收任务要花多少钱」。当模型能够少输出、少调用工具、更多复用缓存时,单价只是结果的一部分。模型供应商会越来越多地把推理服务和 agent 编排效率包装进产品竞争里。
第二,模型分层会让应用架构更像一条生产线。最复杂的环节使用 Sol,常规环节使用 Luna,中间状态用 Terra,速度最敏感的步骤再叠加 Fast mode。这样的组合能压低平均成本,但前提是团队已经能判断每一步的质量阈值,并为失败和人工接管留出路径。
第三,降价会扩大试错范围,却不会替企业完成评测。低价让更多任务值得尝试,真正决定是否上线的仍是错误成本、数据边界、工具权限和可观测性。上一轮 agent 平台竞争已经说明,能调用工具不等于能承担业务;这次 GPT-5.6 的价格变化,则把同一个问题推进到了单位任务成本。

接下来观察什么

判断这次更新能否变成行业级拐点,可以看四个可验证信号:
  1. OpenAI 是否披露更多跨客户、统一任务口径的成本与质量数据,而不只是内部 benchmark 和客户引述。
  2. Luna、Terra 的低价是否带来真实的 API 调用结构变化,例如批量分类、代码执行和后台 agent 的调用量明显上升。
  3. 其他模型供应商是否跟随下调中端模型价格,或改用缓存、批处理和按任务计费来争夺相同工作流。
  4. 开发团队在真实部署中能否把失败率、重试、缓存和人工接管纳入每次任务的成本,而不是只比较输入输出单价。
这次更新最值得看的不是「80%」这个醒目的折扣,而是 OpenAI 把模型、推理系统和 agent 编排放进了同一张成本表。对于高频、可拆解的任务,低价模型可能第一次具备大规模试错的条件;对于复杂业务,真正的答案仍要等自己的 token、失败率和延迟数据跑出来。
每周行业与大厂动态

每周行业与大厂动态

每周追踪中国互联网大厂、全球科技巨头、AI 行业与具身智能领域的关键动态,一站式把握行业脉搏。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.