7月27日-8月2日大模型发布追踪:GPT-5.6降价、Kimi K3开放权重与Gemini Robotics 2

7月27日-8月2日大模型发布追踪:GPT-5.6降价、Kimi K3开放权重与Gemini Robotics 2

本周聚焦 GPT-5.6 低价档降价、Kimi K3 开放权重和 Gemini Robotics ER 2,帮助开发者比较成本、部署方式与适用边界。

一句话判断

2026 年 7 月 27 日至 8 月 2 日,值得跟进的变化不是又多了几张榜单,而是三种落地方式同时变得更清楚:OpenAI 把 GPT-5.6 的低价档继续降价,Moonshot 把 Kimi K3 的权重放到开放渠道,Google 则把 Gemini 的推理能力推进机器人。前两项直接影响 API 采购和部署,后一项影响的是具身智能,不应与通用聊天模型混在一张选型表里。1234

先看价格、状态和边界

模型或更新本期变化公开价格 / 关键规格可用性
GPT-5.6 Luna / Terra 27 月 30 日降价Luna 输入 $0.20、输出 $1.20 / 百万 tokens;Terra 输入 $2、输出 $12 / 百万 tokensOpenAI API、ChatGPT Work、Codex
Kimi K3 5本期确认开放权重版本已在官方 Hugging Face 仓库可用总参数 2.8T、激活参数 104B、1M 上下文;API 输入 $3、输出 $15,缓存命中输入 $0.30 / 百万 tokensHugging Face 权重、Kimi API、Kimi.com、Kimi Work、Kimi Code
Gemini Robotics ER 2 67 月 30 日发布模型卡128K 上下文;公开页面未列价格Gemini API、Google AI Studio;企业平台为 private preview
GPT-5.6 的价格来自 OpenAI 7 月 30 日的更新,不是把 7 月 9 日的首次发布重新算作本周事件。Luna 在该更新中降价 80%,Terra 降价 20%,Sol 价格不变。12
Kimi K3 的首次亮相也早于本期窗口。Moonshot 的技术博客此前承诺在 7 月 27 日前开放完整权重;官方 Hugging Face 模型卡的更新时间为 7 月 29 日,因此本期可确认的是「开放权重版本已进入公开渠道」,而不是把模型首次发布日改写成 7 月 27 日。35

OpenAI:低价档开始改变默认路由

GPT-5.6 Luna 的新 API 价格是输入每百万 token 0.20 美元、输出 1.20 美元;Terra 是 2 美元和 12 美元。OpenAI 将 Luna 定位为高吞吐、高质量的工作流模型,将 Terra 放在日常工作和更均衡的成本位置。两者都可通过 API、ChatGPT Work 和 Codex 使用,具体账号权限取决于产品层级。2
这次更新的实际意义在路由层:原本需要更强模型处理的任务,可以先由 Luna 承担,再把失败或高风险样本升级给更贵的模型。OpenAI 还称,Luna 在 Agents’ Last Exam 上的任务成本比 Fable 5 低近 99%,并在某些负载上达到约 9 倍速度;这些是厂商自报结果,适合用来理解产品定位,不应直接当作跨厂商结论。2

Kimi K3:开放权重版本进入公开渠道

Kimi K3 的模型边界很明确:2.8T 总参数、104B 激活参数、原生视觉、1M token 上下文,目标是长程编码、知识工作和推理。Moonshot 使用 Kimi Delta Attention、Attention Residuals 和 Stable LatentMoE;模型卡同时提供 Kimi K3 License、权重下载说明,以及兼容 OpenAI 和 Anthropic 接口的 API。35
公开 API 的价格是缓存命中输入每百万 token 0.30 美元、未命中输入 3 美元、输出 15 美元。这个价格结构对长上下文代码任务很关键:如果工作流能稳定复用上下文,缓存命中率会比单看输出单价更影响总成本。3
开放权重不等于低门槛本地部署。104B 激活参数已经是很重的推理负担,完整权重也远超普通开发机的内存范围。对大多数团队,本周更现实的动作是先用 Kimi API 做任务集测试,再决定是否值得投入多卡部署;只有确实需要权重控制、数据驻留或深度改造推理栈时,开放权重的价值才会超过托管 API 的便利。

Google:Gemini Robotics 2 把比较维度换成了机器人任务

Google DeepMind 在 7 月 30 日发布 Gemini Robotics 2,重点不是更长的聊天上下文,而是全身控制、灵巧操作、多步任务规划和多机器人协作。官方展示了同一模型检查点适配不同机器人本体和末端执行器的实验,也承认多指操作仍然困难。4
其中可直接用于开发者测试的是 Gemini Robotics ER 2。模型卡将它定义为视觉语言模型,输入包括文本、图像、视频和音频,最多 128K 上下文,输出最多 64K token;它基于 Gemini 3.5 Flash,专门处理视觉、空间、时间、工具编排和物理代理的成功检测。ER 2 可通过 Gemini API 和 Google AI Studio 使用,企业平台仍是 private preview,页面没有列出价格。6
这条发布不适合拿来替换文本 Agent。采购时应单独验收机器人任务成功率、人体接近时的安全停止、工具调用和新本体适配速度;把 ER 2 与 Luna、Kimi K3 直接按通用问答分数排序,会丢掉它真正解决的问题。

评测:Kimi K3 分数更高,Luna 速度更快

Artificial Analysis 当前页面的口径是推理版本,下面两行都保留了 max 设置;它们可以作为同一第三方页面上的方向性比较,不能替代你自己的任务集。
模型版本Intelligence Index页面输出速度上下文API 价格
GPT-5.6 Luna (max)51180.6 tokens/s1M$0.20 / $1.20
Kimi K3 (max)5735.0 tokens/s1M$3 / $15;缓存命中输入 $0.30
在这个页面快照里,Kimi K3 的 Intelligence Index 比 Luna 高 6 分,但页面输出速度约为 Luna 的五分之一。价格也不是同一个问题:Luna 的低价更适合大规模托管调用,Kimi K3 的缓存价和开放权重则给长上下文复用、API 迁移和自部署留下了不同的优化空间。78

一个值得关注的非模型更新:GLM Coding Plan 改为积分制

Z.ai 在 7 月 30 日发布的公告不是新模型,而是 GLM Coding Plan 的计费改版:新用户转为 credits-based 套餐,旧用户在当前账期结束前维持原价格、权益和限额;周末全天按非高峰费率扣减。公告还写明,GLM-4.7 按 1 倍计费,GLM-5.2 和 GLM-5-Turbo 在工作日 14:00—18:00(UTC+8)按 3 倍、其他时段按 1 倍计费。9
对已经使用 GLM Coding Plan 的团队,先核对账期和 token 用量口径,再决定是否切换;这是一项计费规则变化,不是 GLM 新版本发布。

本周没有纳入的厂商与条目

  • Anthropic、Meta 和阿里通义:本期没有找到同时具备可核验发布时间、原始详情页和模型级变化的本周新通用模型,因此不拿旧模型或应用案例填充名单。
  • DeepSeek:官方文档当前写明 Responses API 仅支持 deepseek-v4-flashdeepseek-v4-pro 预计在 8 月初增加支持;但详情页没有披露发布时间,不能把这条接口状态当作 7 月 27 日至 8 月 2 日的新发布。10
  • MiniMax H3:官方发布页能核验多模态视频能力、最高 2K/15 秒和后续开放权重计划,但详情页没有具体发布日期或时间元数据,因此暂不列入主条目。11

给选型的结论

  1. 先降调用成本:把 GPT-5.6 Luna 放进高吞吐工作流的候选路由,重点测失败率、工具调用成功率和升级到高价模型的比例,不要只看 token 单价。
  2. 需要开放权重或长上下文:用 Kimi K3 做一轮真实代码库和知识库测试,同时把显存、推理速度、许可证和数据驻留列入成本表。开放权重的收益需要基础设施来兑现。
  3. 做机器人或实体设备:单独评估 Gemini Robotics ER 2 的安全和本体适配,不要用通用聊天模型排行榜替代机器人任务验收。
  4. 关注下周:DeepSeek V4 Pro 的官方文档预告了 8 月初支持,下一期再核对它是否真正上线、价格是否公开,以及是否出现可复现的第三方评测。10

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content