
8月3日-9日大模型发布追踪:Qwen3.8-Max、GPT-5.6 Sol 与 WeatherNext 2
本周聚焦 Qwen3.8-Max 的 API 与开放权重进度、GPT-5.6 Sol 的 ChatGPT 端更新,以及 WeatherNext 2 的气象模型开源,并把 DeepSeek V4-Flash 的价格与可用性作为边界跟进。
一句话判断
2026 年 8 月 3 日至 9 日,模型发布的主线分成三条:Qwen3.8-Max 把多模态长上下文与长程 Agent 任务推到 API 产品;OpenAI 重做 GPT-5.6 Sol 在 ChatGPT 里的使用方式,却明确不改 Work 和 Codex;Google 开源 WeatherNext 2,把模型能力用于气旋预测。前两者可以进入通用模型选型,WeatherNext 2 应按专业气象模型验收,不能混进通用问答排行榜。123
先看价格、状态和边界
| 模型或更新 | 本周发生了什么 | 能力与评测入口 | 价格 / 可用性 |
|---|---|---|---|
| Qwen3.8-Max | 8 月 3 日正式发布 | 2.4T 总参数、95B 激活参数;1M 上下文;原生文本、图像、视频输入 | 输入 $2、输出 $6、隐式缓存输入 $0.25 / 百万 tokens;QwenCloud API 已可用,开放权重只承诺下周发布 14 |
| GPT-5.6 Sol | 8 月 6 日更新 ChatGPT 体验 | Plus / Pro 获得更可靠的事实回答和思考强度滑杆;Work、Codex 使用的版本不变 | Artificial Analysis 模型页显示 API 价格为输入 $5、输出 $30 / 百万 tokens;本次公告不是 API 版本更新 25 |
| WeatherNext 2 | 8 月 6 日开源 WeatherNext 2 与 WeatherNext Cyclones | 气旋路径、强度和风场预测;平均多出一天预测提前量;可生成 1,000 个情景 | 代码和权重面向研究社区开放;不是通用聊天模型,没有可比的 API token 价格 3 |
| DeepSeek V4-Flash-0731 | 边界跟进,不计入本周新发布:模型页和 Reuters 均指向 7 月 31 日发布 | 1M 上下文;284B 总参数、13B 激活参数;文本输入输出;开放权重 | 输入 $0.14、输出 $0.28、缓存命中 $0.003 / 百万 tokens;Responses API 当前支持 V4-Flash,不支持 V4-Pro 678 |
Qwen3.8-Max:本周最明确的旗舰级发布
Qwen 官方在 8 月 3 日宣布 Qwen3.8-Max 正式发布,模型规模为 2.4 万亿参数,其中每次推理激活约 950 亿参数。官方把重点放在编码、专业工作、研究和长程任务,给出的产品形态是通过 QwenCloud 调用,而不是先把本地权重交给用户。1
QwenCloud 页面把输入模态列为文本、图像和视频,上下文上限为 1M,最大输出为 131K;标准输入价格是每百万 tokens 2 美元,输出 6 美元,隐式缓存命中输入 0.25 美元。模型支持函数调用、结构化输出、批处理、网页搜索和代码解释器,调用入口是兼容 OpenAI API 的 QwenCloud。4
这次发布最值得测试的不是参数规模,而是它是否能把长任务稳定做完。Qwen 官方展示了 10 天以上的自主编码运行、约 5 天的论文复现实验,以及多模态竞赛中的端到端工作流;这些数字来自 Qwen 自己的测试,不能当作跨厂商的第三方结论。官方还报告了 PaperBench 93.0、GPQA Diamond 92.6 和 OSWorld-Verified 86.1,但这些项目的测试设置、提示词和对比模型仍需单独核对。1
开放权重是另一个容易被提前写错的点。8 月 3 日的官方原文说,这是 Qwen Max 系列首次计划开放权重,并承诺「下周」发布;截至本期覆盖窗口 8 月 9 日,正文没有把权重写成已上线。因此,想研究本地部署的团队可以先记录硬件和许可证核验任务,不能把 QwenCloud API 的可用性当成已经能下载权重。1
GPT-5.6 Sol:变化发生在 ChatGPT,不在 API
OpenAI 8 月 6 日更新了 GPT-5.6 Sol 的 ChatGPT 版本。Plus 和 Pro 用户可以使用更新后的 Sol,并通过滑杆调节回答所花的思考量;OpenAI 说新版本更少出错、更少堆格式,也会根据问题难度调整答案细节。2
免费和 Go 用户的默认模型将切换为 GPT-5.6 Luna,OpenAI 计划在下一周再提供不限量文本聊天和 Think 按钮。公告同时写明,Work 和 Codex 使用的 GPT-5.6 Sol 版本不在这次更新里。对开发者来说,这是一项产品层可用性变化,不应写成 API 模型已经换代。2
OpenAI 在公告中给出一项内部评估:需要处理事实细节的金融、医疗和法律问题里,出现至少一个事实错误的回答,GPT-5.6 Luna 比 GPT-5.5 Instant 少约 62%,Sol 少约 68%。这是厂商内部结果,适合用来理解更新方向,不应直接和 Artificial Analysis 的综合指数放在同一列。2
如果你的流程依赖 ChatGPT 的研究、写作或复杂决策,应该测试更新后的回答是否更少跑题,以及思考强度滑杆对等待时间和事实准确率的影响。如果你的流程走 API、Work 或 Codex,8 月 6 日这条公告本身不足以证明需要改路由或改模型版本。2
WeatherNext 2:专业模型的开源方式变了
Google DeepMind 8 月 6 日宣布开源 WeatherNext 2 和 WeatherNext Cyclones 的代码与权重。官方称,模型在气旋路径、强度和风场预测上达到 state-of-the-art accuracy,平均能把预测提前量增加一天:现在的三天预测,接近此前模型两天预测的准确度。3
WeatherNext Cyclones 会对未来最多 15 天生成预测,并用 1,000 个成员构成概率情景;WeatherNext 2-mini 可以在单个 TPU 上运行,Google 还提供了公开 Colab notebook。它的输入、输出、延迟和部署方式服务于气象预测,不适合与 Qwen3.8-Max 或 GPT-5.6 Sol 按通用问答分数比较。3
对气象机构、灾害研究和能源预测团队,实际验收字段应是路径误差、强度误差、风场覆盖、极端情景召回和本地气象数据适配。Google 也提醒,正式天气预报和预警仍应参考当地气象机构;开源权重解决的是研究与二次开发门槛,不等于模型自动成为业务预警系统。3
评测:速度、价格和综合分数指向不同选择
Artificial Analysis 当前模型页的 Intelligence Index v4.1.1 汇总 9 个评测,包括 GDPval-AA、Terminal-Bench、SciCode、GPQA Diamond 和长上下文推理;下表保留了各页面的 reasoning 版本、输出速度和 API 价格。它适合做同一第三方口径下的方向性比较,不替代自己的任务集。569
| 模型页面版本 | Intelligence Index | 输出速度 | 上下文 | API 价格(输入 / 输出;缓存命中) |
|---|---|---|---|---|
| Qwen3.8 Max(reasoning) 9 | 58 | 84.0 tokens/s | 1M | $2 / $6;$0.25 / 百万 tokens |
| GPT-5.6 Sol(max) 5 | 61 | 69.2 tokens/s | 1M | $5 / $30;$0.50 / 百万 tokens |
| DeepSeek V4 Flash 0731(reasoning, max effort) 6 | 52 | 136.5 tokens/s | 1M | $0.14 / $0.28;$0.003 / 百万 tokens |
这张表不能读成一个总排名:GPT-5.6 Sol 的综合分数最高,但价格和速度都不占优;DeepSeek V4-Flash 的速度和价格最有吸引力,却是文本模型,且本身不在本周新发布窗口;Qwen3.8-Max 处在更高价格档,换来多模态输入和长程工作流。模型选择还要看输出长度、缓存命中、工具调用成功率和失败重试次数。569
边界条目:哪些变化没有算进本周新发布
DeepSeek V4-Flash-0731 的发布时间落在 7 月 31 日,所以本期只把它作为上一期追踪事项的状态核验,不把它改写成 8 月 3 日至 9 日的新发布。Reuters 报道它已正式发布,Artificial Analysis 模型页也把发布日期标为 7 月;DeepSeek 当前 Responses API 文档只列出
deepseek-v4-flash,并明确写着 deepseek-v4-pro 尚未支持。678Anthropic 8 月 7 日的官方更新是 Fable 5 的 biology safeguards,官方称相关 fallback 在测试中减少约 85%;这是安全护栏和可用性更新,不是新模型发布,所以没有放入主表。10
Meta、智谱 GLM、Kimi 和 MiniMax 本期没有列出新的模型级主条目:当前检索没有得到同时具备本周原始详情页、可核验时间和能力变化的合格证据。旧模型的产品功能、此前发布的 H3 或 Kimi K3,以及没有原始时间的传言,都不拿来填满本周名单。
给选型的行动结论
- 要测长上下文、多模态和长程 Agent:把 Qwen3.8-Max 放进真实代码库、文档库和工具调用任务,单独记录首 token 延迟、总输出 tokens、缓存命中率、失败重试和人工接管次数。它的 API 已可用,但开放权重仍应等官方后续状态确认。
- 要测低成本文本推理:DeepSeek V4-Flash 可以作为价格和吞吐基线,但要把它标为 7 月 31 日发布的跟进项,不能当成这周的新版本;同时确认文本输入边界、MIT 许可证和自部署显存成本。
- 使用 ChatGPT、Work 或 Codex 的团队:先区分产品线再做回归测试。GPT-5.6 Sol 的 8 月 6 日变化主要作用于 ChatGPT;不要因为 ChatGPT 的回答风格变化,就直接修改 API 或 Codex 的生产路由。
- 做气象、能源或灾害预测:单独评估 WeatherNext 2 的路径、强度和极端情景指标,不能用通用 LLM 的 Intelligence Index 代替业务验收。
- 下期继续核对两件事:Qwen3.8-Max 的开放权重是否真正进入公开下载渠道,以及 DeepSeek V4-Pro 是否获得官方 API 支持和可核验的模型版本信息。18
本期的可直接行动项是建立三套任务集:长程多模态、低价文本推理、专业气象预测;仍需验证的是模型在你的数据、工具链和失败成本下是否值得迁移。榜单只能缩短候选清单,不能替你完成最后的选型。
References
- 1
- 2
- 3
- 4Qwen3.8-Max - QwenCloud
qwencloud.com
- 5GPT-5.6 Sol (max) - Intelligence, Performance & Price Analysis
artificialanalysis.ai
- 6DeepSeek V4 Flash 0731 (max) - Intelligence, Performance & Price Analysis
artificialanalysis.ai
- 7
- 8Responses API
api-docs.deepseek.com
- 9Qwen3.8 Max - Intelligence, Performance & Price Analysis
artificialanalysis.ai
- 10Improving Fable 5 Safeguards \\ Anthropic
anthropic.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
