8月10日-16日大模型发布追踪:DeepSeek V4-Pro、Gemini 3.7 Flash 与 Muse Glimmer

8月10日-16日大模型发布追踪:DeepSeek V4-Pro、Gemini 3.7 Flash 与 Muse Glimmer

本期梳理 DeepSeek-V4-Pro、Gemini 3.7 Flash、Muse Glimmer、Qwen3.8-27B 与 OpenAI 两项更新,重点比较能力、评测、价格、部署方式和可用性边界。

一句话判断

8 月 10 日至 16 日,值得改变选型的信号集中在三件事:DeepSeek-V4-Pro 把旗舰模型从预览版推到 app、网页和 API,并用峰谷定价换取调度弹性;Gemini 3.7 Flash 把编码与 Agent 能力放进更低的价格档;Meta Muse Glimmer 和 Qwen3.8-27B 则把本地部署的门槛继续压向消费级硬件。OpenAI 同期有两条重要更新,但 GPT-5.6-Cyber 是受控的网络安全专用模型,Ultrafast 是 API 服务档位,都不应直接当作通用模型换代。123456

先看价格、状态和边界

条目本周确认的变化可用性 / 价格读者该先做什么
DeepSeek-V4-Pro8 月 13 日转为 GA,支持 reasoning effort;官方文档列出 lowhighmax 三档app、网页 Expert Mode 和 API 均可用;北京时间 8 月 17 日 0 时起,峰时输入(缓存未命中)$1.32、输出 $3.96 / 百万 tokens,非峰时分别为 $0.66、$1.98;缓存命中输入在峰时 / 非峰时分别为 $0.044 / $0.022把峰谷时段、长输出和缓存命中率一起放进成本测试 1
Gemini 3.7 Flash8 月 13 日发布;Google 称其在编码、知识工作和网页开发上超过 3.6 Flash,GDP.pdf 自报成绩为 34.0% 对 22.0%Gemini API 可用;2026 年底前介绍价为输入 $0.75、输出 $3.75 / 百万 tokens;上下文 1M测多步工具调用和失败重试,不要只测单轮问答 2
Muse Glimmer8 月 10 日开放权重,30B,Apache 2.0;目标是常驻本地 Agent、函数调用和本地编码Meta 称单张消费级 GPU 的 Mac 或 PC 可以运行;Artificial Analysis 当前页面列出 131k 上下文,托管价格并非 Meta 官方报价先测本地显存、量化后延迟和工具调用成功率 37
Qwen3.8-27BHugging Face 模型卡在本周更新并公开权重;27B,视觉编码器,Apache 2.0原生上下文 262,144 tokens,可用 RoPE scaling 扩到 1M;模型卡未给出托管 API 价格适合先做单卡或多卡本地验证;把官方卡上的 SWE-bench Pro 61.7 与自己的代码库测试分开 4
GPT-5.6-Cyber8 月 10 日发布网络安全专用版本;基于 GPT-5.6 Sol,重点减少高风险双用途网络安全任务的拒答只通过 Daybreak Red 向获批防御团队提供;OpenAI 内部 Advanced Cybersecurity Completion Rate 为 95.0%,GPT-5.6 Sol 为 1.5%有授权安全任务再申请和评估,不能把内部完成率当作通用榜单分数 5
GPT-5.6 Sol Ultrafast8 月 13 日预览新的 API 服务档位;不是新模型权重首批走 OpenAI API,由 Cerebras 提供推理;官方称最高约为 Standard 的 14 倍,最高 750 output tokens/s,价格和开放范围仍待扩大只有对交互延迟敏感的流程才值得单独测;先向 OpenAI 确认正式配额与计费 6
两项价格需要特别看清。DeepSeek 官方页面给的是 V4 全系列的新计费规则,峰时与非峰时相差一半;它在本周窗口内公布,但北京时区的生效点已经落到 8 月 17 日凌晨。Gemini 的 $0.75 / $3.75 是介绍价,官方写明 2027 年 1 月 1 日起恢复为 $1.50 / $7.50。12

DeepSeek-V4-Pro:从「能不能用」进入「什么时候用」

DeepSeek 这次的关键变化不是又一个预览编号,而是 V4-Pro 已经同时进入 app、网页 Expert Mode 和 API;模型名保持不变,调用方需要按 API 文档确认路由。官方还把 reasoning effort 分为 low、high、max:简单任务可以少花推理预算,日常 Agent 任务用 high,复杂任务再上 max。1
定价规则因此比一个静态的「每百万 tokens 多少钱」更重要。峰时缓存命中输入为 $0.044,缓存未命中输入为 $1.32,输出为 $3.96;非峰时对应 $0.022、$0.66、$1.98。北京时间 9:00—12:00 和 14:00—18:00 为峰时,其余时段为非峰时,非峰时价格折半,实际换算应以官方时段和调用端显示为准;稳定的批处理任务可以把非峰时作为成本基线,实时 Agent 则要按峰时预算。1
Artificial Analysis 的统一页面使用 V4 Pro 0813、Reasoning、Max Effort 版本,Intelligence Index 为 53,输出速度 80 tokens/s,上下文 1M;它列出的峰时 API 价为输入 $1.32、输出 $3.96。这个页面能帮助比较同一套测试口径,不能替代对缓存、峰谷调度和自有任务失败率的测量。8

Gemini 3.7 Flash:低价档开始承担更长的工作流

Google 把 3.7 Flash 定位成编码和 Agent 的 workhorse,而不是单纯追求更短响应的轻量模型。官方给出的 GDP.pdf 结果从 3.6 Flash 的 22.0% 提到 34.0%,并称模型更能处理工程中的路障、澄清意图、规划多步工具调用。这个成绩是 Google 自报评测,适合说明升级方向,不能直接和 Artificial Analysis 的综合指数拼成一个排名。2
它的商业化信号更直接:Gemini API 现在可以用 1M 上下文,介绍价为输入 $0.75、输出 $3.75 / 百万 tokens,且只承诺到 2026 年底。Artificial Analysis 的 Gemini 3.7 Flash (high) 页面也记录了 1M 上下文、56 分 Intelligence Index,以及同样的 $0.75 / $3.75;页面没有给出可用的输出速度值。29
对开发者来说,值得测的是「长上下文 + 工具调用 + 重试」的总成本。把一份真实代码库或合同集放进去,记录首 token 延迟、完整任务耗时、工具调用成功率、重复调用次数和最终人工修改量;单轮 GDP.pdf 分数无法回答这些问题。

本地开放权重:两个尺寸,两个落点

Meta 的 Muse Glimmer 更像本地 Agent 的成品化尝试。Meta 在 8 月 10 日开放 30B 权重,采用 Apache 2.0,目标场景包括常驻 Agent、函数调用、本地编码和 LLM-as-a-judge;官方称它可在一台消费级 GPU 的 Mac 或 PC 上运行。llama.cpp、MLX 和 ExecuTorch 的优化集成则写成「接下来几天」陆续到位,不能把计划中的集成写成当天全部可用。3
Qwen3.8-27B 的模型卡给出了更明确的本地规格:27B 参数、视觉编码器、原生 262,144 tokens 上下文,并建议在超过原生上限的长任务中使用 RoPE scaling;卡片还提供了 Transformers、vLLM、SGLang 和 Docker Model Runner 的启动路径。模型卡中的基准包括 Terminal Bench 2.1 73.0、SWE-bench Pro 61.7、DeepSWE 1.1 42.2,但这些是 Qwen 的模型卡结果,测试 harness、采样参数和题目集要先看清,再决定是否与别家分数并列。4
两个模型的选择条件不同。Muse Glimmer 先回答「一张消费级 GPU 能否让 Agent 常驻并及时响应」;Qwen3.8-27B 先回答「27B 模型在本地代码和多模态任务上是否足够」,然后再看显存与并发。Artificial Analysis 对 Muse Glimmer (high) 的统一页面给出 35 分、106 tokens/s、131k 上下文和 $0.32 / $1.35 的托管价格;这些数字来自第三方托管入口,不是 Meta 的官方自部署报价。7

OpenAI:能力变化和产品变化要分开

GPT-5.6-Cyber 是本周最容易被标题夸大的条目。OpenAI 给出的 Advanced Cybersecurity Completion Rate 是内部评测,衡量模型在漏洞利用链、身份认证绕过和权限提升等高风险请求上的响应完成率。GPT-5.6-Cyber 为 95.0%,GPT-5.6 Sol 为 1.5%,Daybreak Blue 下的 Sol 为 2.0%;这说明专门训练减少了拒答,但也说明它被放在受控的 Daybreak Red 访问层,不能拿 95.0% 当通用能力分数。5
Ultrafast 则改变的是推理速度。OpenAI 称 GPT-5.6 Sol 在首批 API 服务中最高达到 750 output tokens/s、约为 Standard 的 14 倍,当前仍是预览和逐步扩大访问的服务档位。它可能改变实时客服、事件响应和语音交互的体验,但在价格、配额和长输出稳定性确认前,不宜把它写成「Sol 变便宜了」或「新模型发布」。6

第三方横向比较:先保留版本,再看数字

Artificial Analysis 的 Intelligence Index v4.1.1 包含 9 项评测,下面保留页面可见的 reasoning / effort 设置;Qwen 行按页面默认版本记录。分数、速度和价格不是同一个目标函数,表格也不构成总排名。Qwen 行是上周已经发布的 Qwen3.8 2.4T A95B,用来做家族级别的 API 参照,不代表本周新公开的 27B 权重。7891011
Artificial Analysis 页面版本reasoning / effortIntelligence Index输出速度上下文页面列出的 API 输入 / 输出价
GPT-5.6 SolReasoning / max6171 tokens/s1M$5 / $30
Qwen3.8 2.4T A95B页面默认版本5847 tokens/s984k$2 / $6
Gemini 3.7 FlashReasoning / high56页面未给出可用值1M$0.75 / $3.75
DeepSeek V4 Pro 0813Reasoning / max effort5380 tokens/s1M$1.32 / $3.96
Muse GlimmerReasoning / high35106 tokens/s131k$0.32 / $1.35
这组数字支持三个较窄的判断。GPT-5.6 Sol 与 Qwen3.8 Max 的综合分数高,但 API 价格和推理速度都不占优;Gemini 3.7 Flash 的分数低于两者,却把 1M 上下文和较低介绍价组合在一起;DeepSeek V4-Pro 的分数略低于 Gemini,速度更高,但峰时价格高于 Gemini。Muse Glimmer 的优势在开放权重和本地部署,不能只看第三方托管价格来判断它是否适合本地团队。7891011

本期未纳入与下周要核对的事项

本期检索没有把 Anthropic、智谱 GLM、月之暗面 Kimi 和 MiniMax 写成模型级主条目:在当前时间窗内,没有拿到同时满足「原始详情页可读、发布时间可核验、能力或可用性变化可说明」的完整证据链。GLM-5.3 的官方页面本次只返回页面壳,搜索摘要里的发布日期和跑分不足以支撑正文;Kimi 与 MiniMax 也没有找到能在本周时间窗内完成核验的合格模型发布。旧模型的产品功能和没有原始时间的传言不用于填表。
下周值得继续追三件事:DeepSeek-V4-Pro 的峰谷计费在真实账单中的呈现,Qwen3.8-27B 的量化版本与长上下文实际速度,以及 Muse Glimmer 在 llama.cpp、MLX、ExecuTorch 上的官方集成状态。若团队要马上开始选型,先建立三套任务集:代码库 Agent、长文档多模态和本地常驻工具调用;把每个模型的总成本、延迟、重试、人工接管和部署占用写进同一张表。
本期可以直接行动的是:DeepSeek 测峰谷调度,Gemini 测 1M 上下文 Agent,Muse Glimmer 与 Qwen3.8-27B 测本地部署,GPT-5.6-Cyber 只在授权安全场景评估。Artificial Analysis 的分数适合缩短候选清单,最终是否迁移仍要由自己的任务集和账单决定。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel