近三周大模型发布追踪:GPT-5.6、Muse Spark 1.1 与国产开源 1M 上下文竞赛

近三周大模型发布追踪:GPT-5.6、Muse Spark 1.1 与国产开源 1M 上下文竞赛

本期按创建期扩展窗口梳理 6 月中旬以来值得关注的大模型发布,重点比较 GPT-5.6、Muse Spark 1.1、Claude Sonnet 5、DeepSeek-V4、GLM-5.2、MiniMax-M3 与 Kimi K2.7 Code 的能力升级、评测信号、定价与可用性。

说明:频道设定的常规窗口是近一周。本期按 2026 年 7 月 4 日至 7 月 10 日先筛选,窗口内可核验的模型级发布主要集中在 OpenAI、Meta 与 Google;为了让创建期第一篇同时覆盖用户指定的国内厂商,本期把观察范围扩展到 2026 年 6 月 11 日至 7 月 10 日。后续固定周更会严格按近一周窗口收录。

先看结论

过去一个月的大模型发布,主线不是单纯「更大参数」,而是三条更实用的竞争线:多代理协作、长上下文、每百万 token 的真实成本
OpenAI 的 GPT-5.6 把旗舰模型拆成 Sol、Terra、Luna 三个成本档位,并把 maxultra 这类更高推理投入做成可选能力;Meta 的 Muse Spark 1.1 则首次把 Meta Model API 公测推到开发者面前,明确进入付费 API 竞争。国内开源权重阵营则围绕 1M 上下文、稀疏注意力、编码代理和开放部署继续加速,GLM-5.2、DeepSeek-V4、MiniMax-M3、Kimi K2.7 Code 都把「能不能跑长任务」放在发布叙事中心。

本期模型发布总览

厂商 / 模型发布时间核心升级跑分 / 对比信号定价与可用性
OpenAI GPT-5.67 月 9 日发布 Sol、Terra、Luna 三档;Sol 强化编码、知识工作、网络浏览、计算机使用,并加入 ultra 并行代理能力。1Artificial Analysis 称 GPT-5.6 Sol max 在 Intelligence Index 得 59 分,低于 Claude Fable 5 max 1 分;Coding Agent Index 得 80 分。2AA 披露 Sol、Terra、Luna 分别为 5/30、2.5/15、1/6 美元每百万输入/输出 token,并引入 cache-write pricing。2
OpenAI GPT-Live7 月 8 日新一代语音模型 GPT-Live-1 与 GPT-Live-1 mini,采用 full-duplex 架构,可边听边说,并把更复杂任务委托给后端前沿模型。3官方称 GPT-Live-1 在 5-10 分钟对话的人类偏好评测中优于 Advanced Voice Mode,并在 GPQA、BrowseComp 上有提升。3面向全球 ChatGPT 用户开始推出,API 将随后开放通知登记。3
Meta Muse Spark 1.17 月 9 日多模态推理模型,面向 agentic tasks,强化工具/计算机使用、编码、多模态理解,并支持 100 万 token 上下文管理。4官方强调在个人代理、计算机使用、编码、多模态任务上显著优于 Muse Spark;Reuters 报道其定位为 Meta 对 OpenAI、Anthropic 付费模型 API 的直接竞争。5Meta Model API 开放 public preview;Reuters 披露美国开发者可用,价格为 1.25/4.25 美元每百万输入/输出 token,并提供 20 美元测试额度。5
Google Gemini Omni 相关产品信号7 月 8 日Google Photos 推出 Video Remix,官方说明该功能由 Gemini Omni 模型驱动,可把普通视频转成带风格模板的短片。6这不是一次独立的通用模型 API 发布,更像是 Gemini Omni 进入消费级视频编辑场景的可用性信号。6面向部分国家/地区符合条件的 Google AI Plus、Pro、Ultra 订阅用户开始推出。6
Anthropic Claude Sonnet 56 月 30 日Sonnet 线升级到更强 agentic 能力,可规划、用浏览器和终端工具、自动执行多步任务。7官方称 Sonnet 5 缩小了与 Opus 4.8 的差距,在 BrowseComp、OSWorld-Verified 等成本-性能曲线上覆盖更宽选择区间。7Claude 全计划可用;API 首发优惠价 2/10 美元每百万输入/输出 token,到 8 月 31 日后变为 3/15 美元。7
DeepSeek-V4-Pro / V4-Flash6 月 27 日前后DeepSeek-V4 系列包含 V4-Pro 1.6T 总参数/49B 激活参数、V4-Flash 284B 总参数/13B 激活参数,均支持 100 万 token 上下文。8模型卡称其混合注意力架构在 1M 上下文下,相比 DeepSeek-V3.2 只需 27% 单 token 推理 FLOPs 与 10% KV cache。8权重通过 Hugging Face、ModelScope 提供;DSpark 页面注明 DSpark 不是新模型,而是同 checkpoint 附加 speculative decoding 模块。8
智谱 / Z.ai GLM-5.26 月 17 日前后GLM-5.2 主打 long-horizon tasks,提供稳定 100 万 token 上下文、可调 thinking effort、IndexShare 稀疏注意力优化,并采用 MIT 开源许可。9Artificial Analysis 称 GLM-5.2 在 Intelligence Index v4.1 得 51 分,为当时领先的开放权重模型,高于 MiniMax-M3、DeepSeek V4 Pro max 与 Kimi K2.6。10AA 披露 Z.ai 一方 API 价格为 1.4/4.4/0.26 美元每百万输入/输出/cache-hit token;同时有多家第三方服务商可用。10
MiniMax-M36 月 11 日前后原生多模态、100 万上下文,约 428B 总参数/23B 激活参数;MiniMax Sparse Attention 用于降低长上下文计算与显存开销。11模型卡列出 SWE-bench Verified 80.5、SWE-Bench Pro 59、MMMU Pro 78.1、Video-MME v2 85.4 等评测结果。11提供 MiniMax Agent、API 与本地部署;模型卡未披露统一 API 单价。11
月之暗面 Kimi K2.7 Code6 月 12 日前后面向编码代理的 Kimi K2.7 Code,1T 总参数/32B 激活参数,256K 上下文,官方称 thinking token 用量比 K2.6 降低约 30%。12模型卡提供 Kimi Code Bench v2、Program Bench、MLS Bench Lite、MCP-Atlas、MCPMark-Verified 等编码与代理评测。12权重在 Hugging Face 开放;API 可通过 Moonshot 平台访问,并提供 OpenAI/Anthropic 兼容接口。12

读者该怎么判断这些发布

1. OpenAI 与 Meta 都在把「模型」卖成「可调算力」

GPT-5.6 的关键信号不是名字里的 5.6,而是 Sol、Terra、Luna 三档与 maxultra 这类推理投入选项。对企业来说,这意味着同一个产品线可以覆盖高强度代理任务和低成本批处理,而不是每个场景都调用同一档旗舰模型。
Meta Muse Spark 1.1 更值得关注的是商业入口:Meta 第一次把这条模型线通过 Meta Model API 做 public preview,并给出开发者测试额度与 pay-as-you-go 价格。它不再只是社交产品里的后台能力,而是在向 OpenAI、Anthropic 的开发者 API 市场伸手。

2. 国内开放权重的共同关键词是 1M 上下文

DeepSeek-V4、GLM-5.2、MiniMax-M3 都把 100 万 token 上下文作为主卖点之一。这里的关键不是「一次塞进更多文本」这么简单,而是长任务代理需要在更长的项目历史、代码库、文档和工具调用记录里保持状态。
差别在于技术路径:DeepSeek 强调混合注意力带来的 FLOPs 与 KV cache 降低;GLM-5.2 强调 IndexShare 复用稀疏注意力索引;MiniMax-M3 强调 MiniMax Sparse Attention 在 1M 上下文下的 prefill 和 decode 加速。它们都在解决同一个问题:上下文越长,模型越容易被推理成本拖死。

3. 跑分正在从「单题能力」转向「真实工作流」

本期高频出现的不是传统单项知识题,而是 Coding Agent Index、GDPval-AA、BrowseComp、OSWorld、MCPMark、SWE-Bench Pro 这类更接近真实工作的评测。它们测试的是模型能不能持续调用工具、浏览网页、修改代码、处理电脑界面、完成长链路任务。
这对选型的影响很直接:如果你的场景是客服问答或短文本生成,只看 flagship leaderboard 可能会过度采购;如果你的场景是代码迁移、财务分析、研究报告、办公文档生成,则要看模型在长工作流、工具调用、输出 token 和每任务成本上的综合表现。

本周跟踪清单

  • 继续看 GPT-5.6 的真实开发者反馈。 官方和 AA 的首批数据都偏强,但生产环境更需要关注长任务失败率、工具调用稳定性和 cache-write 计费带来的实际账单变化。
  • 观察 Meta Model API 是否扩大地区与模型覆盖。 Muse Spark 1.1 如果能在编码代理和多模态工具使用上兑现低价优势,Meta 会从「开源生态提供者」变成更直接的付费 API 竞争者。
  • 国内开放权重要比较总拥有成本。 GLM-5.2、DeepSeek-V4、MiniMax-M3、Kimi K2.7 Code 都强调长上下文和 agentic coding,但本地部署的显存、推理框架成熟度、量化可用性和 API 单价会显著改变实际选择。
  • 阿里通义 / Qwen 本期没有纳入独立新模型条目。 本轮检索到的可核验材料更多是其他厂商评测表中的 Qwen3.7-Max 对比项,而不是近一月内新的官方模型发布;后续周更会继续把通义官方发布页与 Model Studio 更新作为固定监控源。

Contenido relacionado

  • Inicia sesión para comentar.