7月20-26日大模型发布追踪:Gemini 3.6 Flash、Claude Opus 5 与 Qwen3.7 Flash

7月20-26日大模型发布追踪:Gemini 3.6 Flash、Claude Opus 5 与 Qwen3.7 Flash

本周三家厂商把竞争推向生产效率:Google压低 Flash 成本,Anthropic把 Opus 5 下放到每百万 token 5/25 美元,阿里云则同时更新多模态 Agent 与图像版面模型。

一句话判断

2026 年 7 月 20 日至 26 日,模型发布的重点从「谁的参数更大」转向「谁能以更低成本稳定完成真实工作」。Google 同时推出 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和受限开放的 Gemini 3.5 Flash Cyber;Anthropic 发布 Claude Opus 5,把接近更高阶模型的能力放进更低价位;阿里云上线 Qwen3.7-Flash,并开放 Qwen-Image-3.0-Pro 邀测。1 2 3

先看价格和状态

模型发布日官方定位公开价格当前状态
Gemini 3.6 Flash7 月 21 日面向大规模 Agent 的高效主力模型输入 $1.50 / 100 万 token;输出 $7.50 / 100 万 tokenGemini API、Google AI Studio 等可用
Gemini 3.5 Flash-Lite7 月 21 日低延迟、高吞吐、低成本任务输入 $0.30 / 100 万 token;输出 $2.50 / 100 万 tokenGemini API、Google AI Studio 等可用
Gemini 3.5 Flash Cyber7 月 21 日网络安全漏洞发现与修复未披露仅政府和可信合作伙伴限量试点
Claude Opus 57 月 24 日更主动的通用推理与软件工程模型输入 $5 / 100 万 token;输出 $25 / 100 万 tokenClaude API、Claude 平台和 Claude Code 可用
Qwen3.7-Flash7 月 25 日多模态理解与 Agent 执行北京地域输入 0.2 元 / 100 万 token;输出 0.8 元 / 100 万 token阿里云百炼北京、新加坡等地域可用
Qwen-Image-3.0-Pro7 月 21 日复杂版面与高保真文字渲染北京、新加坡限时免费阿里云百炼邀测;两地模型 ID 均可见
Google 的价格来自 Gemini API 标准付费档,Qwen 的价格与地域状态来自阿里云百炼当前页面;批量、Flex、Fast mode 等特殊计费模式没有混入表格。4 5 6

三个可比信号

Artificial Analysis 当前页面给出的三款推理模型指标如下。它们不是同一套 API 配置下的官方排名:Gemini 页面显示的是 reasoning version,Claude 页面显示的是 Adaptive Reasoning、Max Effort,因此更适合看大致的价格和速度区间,不适合直接宣布谁「全面第一」。
模型Intelligence Index页面速度上下文窗口
Gemini 3.6 Flash50239.6 output tokens/s1M tokens
Gemini 3.5 Flash-Lite36417.3 output tokens/s1M tokens
Claude Opus 56152.8 output tokens/s1M tokens
这三行很直观:Flash-Lite 把吞吐和价格放在第一位,3.6 Flash 试图在速度、能力和成本之间找平衡,Opus 5 则用更高单价换取更高的推理分数。Qwen3.7-Flash 和 Qwen-Image-3.0-Pro 在本轮取得的公开材料里没有同口径的 Artificial Analysis 数值,不能填进这张表假装可比。7 8 9
Gemini 3.6 Flash 是本周最完整的一次产品化更新。Google 称,它在编码、知识工作和多模态表现上超过 3.5 Flash,并在 Artificial Analysis Index 中减少 17% 的输出 token,在 DeepSWE 中最高减少 65%。官方给出的任务结果包括 DeepSWE 49% 对 37%、MLE Bench 63.9% 对 49.7%、OSWorld-Verified 83.0% 对 78.4%。这些数字是 Google 自己选择的评测口径,不能替代独立复测,但它们说明更新方向很明确:少走几步推理、少调用几次工具,再完成同一项工作。1
Flash-Lite 的任务边界更窄,也更实用。Google 把它定位为 3.5 系列中最快、最适合高吞吐执行的模型,重点场景是 Agent 搜索、文档处理和简单数据处理,标准 API 输入价格是 3.6 Flash 的五分之一,输出价格约为三分之一。TechCrunch 的独立报道也把这次发布概括为「更便宜、更快的模型」,同时指出 Google 仍未发布传闻中的 Gemini 3.5 Pro。10
3.5 Flash Cyber 不适合拿来做普通 API 选型。它基于 3.5 Flash 做网络安全漏洞发现与修复,只通过 CodeMender 面向政府和可信合作伙伴限量试点,当前没有公开价格。1

Anthropic:Opus 5 把前沿能力打到 $5 / $25

Claude Opus 5 于 7 月 24 日上线。Anthropic 称它在编码、知识工作、问题解决、科学研究和视觉输出上都有提升,在 Frontier-Bench 和 GDPval-AA 等评测中达到新的 SOTA;官方还称,它接近更高阶的 Fable 5,但输入和输出价格分别为每百万 token 5 美元和 25 美元,和 Opus 4.8 相同。2
Reuters 的报道补足了一个更适合采购判断的差异:Opus 5 更适合日常办公和计算机编程,Anthropic 把它描述为比 5 月的 Opus 4.8 更高效;如果任务需要连续数天的高度自主执行,Fable 5 仍是更高阶选项。换句话说,Opus 5 的发布重点不是把最高能力再往上推,而是把更强的能力放到日常调用能够承受的价格里。11

阿里:一个 Flash,一个图像模型

Qwen3.7-Flash 是本周国内条目里最值得开发者直接试用的更新。阿里云百炼页面写明,qwen3.7-flashqwen3.7-flash-2026-07-15 在 7 月 25 日上线,重点加强多模态理解、真实世界感知、空间智能,以及 Search Agent、CI Agent 和多模态 Coding。北京地域的公开价格是输入 0.2 元、输出 0.8 元每百万 token;新加坡和美国弗吉尼亚的价格略高。3 5
这个价格使 Qwen3.7-Flash 进入了「先接进工作流再观察效果」的区间。它的官方页面强调的是 Agent 执行稳定性和多模态场景,不是单项榜单冲刺;对需要中文、多模态输入、搜索和代码协作的团队,实际任务成功率比一张孤立跑分表更值得先测。
Qwen-Image-3.0-Pro 则是另一条路线。Qwen 官方发布页称,它支持最高 4.5K token 输入、10 像素小字渲染和 12 种语言,可生成报纸、分镜、试卷、网页和复杂信息图。阿里云百炼将其标为邀测上线,模型选择页显示北京和新加坡可用,当前价格页显示输出限时免费。它不是文本 Agent 的替代品,而是把「版面里有没有真正可读的字」这件事往前推进了一步。12 3 5

怎么选

  • 高吞吐、低延迟的分类、翻译、文档和简单 Agent 任务:先看 Gemini 3.5 Flash-Lite。它的标准输入价是每百万 token 0.30 美元,Artificial Analysis 页面速度为 417.3 output tokens/s,适合把调用量做大。
  • 需要多模态、工具调用和更复杂的 Agent 流程:Gemini 3.6 Flash 和 Qwen3.7-Flash 都值得做小规模 A/B 测试。前者公开了更完整的英文评测与 1M 上下文,后者在中文、多模态和阿里云工作流里更顺手,适合按中国地域价格单独核算。
  • 编码、知识工作和更高强度推理:Claude Opus 5 的价格高于 Flash 系列,但 Intelligence Index、通用能力和 API 可用性更适合高价值任务。先把它放在难题路由上,比全量替换便宜模型更合理。
  • 复杂海报、试卷、菜单、信息图和 UI 版面:Qwen-Image-3.0-Pro 应按图像生成模型单独评估,重点看小字准确率、布局保持和真实细节,不要拿文本模型的榜单分数替代视觉验收。

本周未纳入

OpenAI 的 GPT-5.6 Sol 官方页面日期为 2026 年 6 月 26 日,不在本期 7 月 20 日至 26 日的窗口内;Meta 本周可核验的官方材料是 SAM 3 / DINOv3 在科研项目中的应用报道,不是新的通用语言模型。DeepSeek、智谱、月之暗面和 MiniMax 在本窗口内没有拿到可直接核验的模型级官方发布详情,因此没有用旧闻或传闻补齐名单。13 14

Related content

  • Sign in to comment.
More from this channel