
Gemini 3.6 Flash、3.5 Flash-Lite 与 Flash Cyber:Google 把模型选型拆成三种工作负载
Google DeepMind 把 3.6 Flash、3.5 Flash-Lite 与 Flash Cyber 分别推向主力推理、低价高吞吐和漏洞研究,公开 benchmark、价格与访问边界并不属于同一条性能曲线。
先给判断:三款模型不是同一条性能曲线
Google DeepMind 在 2026 年 7 月 21 日同一篇官方博客中公布了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。它们对应的不是「同一个模型逐档降价」,而是三种工作负载:3.6 Flash 面向需要较强编码、知识工作和多模态能力的主力任务;3.5 Flash-Lite 面向低延迟和高吞吐;Flash Cyber 则把模型能力收窄到漏洞发现与修复,并通过 CodeMender 限定给政府和可信合作伙伴试用。1
因此,发布页最值得读的部分不是「谁的分数最高」,而是 Google 如何把能力、token 消耗、调用价格和安全边界放进同一个选型框架。3.6 Flash 的卖点是单位 agentic task 做得更多、用得更少;Lite 的卖点是把大量简单或可拆分任务的边际成本压下来;Cyber 的公开信息则还不足以支持普通开发者直接接入。
3.6 Flash:官方强调的是单位任务效率
3.6 Flash 被定位为 workhorse model。官方相对 3.5 Flash 给出的结果如下:
| 评测 | 3.6 Flash | 3.5 Flash | 官方对照 |
|---|---|---|---|
| DeepSWE | 49% | 37% | 代码任务成功率更高 1 |
| MLE Bench | 63.9% | 49.7% | 机器学习工程任务更高 1 |
| OSWorld-Verified | 83.0% | 78.4% | 计算机操作任务更高 1 |
| GDPval-AA v2 | 1421 | 1349 | 工作任务评分更高 1 |
效率数字是另一条线。Artificial Analysis Index 中,3.6 Flash 相比 3.5 Flash 的输出 token 使用量减少 17%;在 DeepSWE 上,官方观察到最高 65% 的输出 token 减少。原文还把这种减少归因于更少的 reasoning steps 和 tool calls。这里的判断对象是完成一次任务的工作量,不是把 17% 当成所有提示都能获得的固定节省。1
这使 3.6 Flash 的工程价值取决于任务是否真的需要多步推理和工具调用。若工作流本来只有一次短文本分类,token 效率的收益可能不如单价变化明显;若任务包含代码执行、浏览或多轮工具协作,减少中间步骤才可能转化为延迟和成本收益。
3.5 Flash-Lite:低价不等于只能做简单任务
Flash-Lite 的官方定位是低延迟、高吞吐,Artificial Analysis 给出的输出速度是 350 tokens/s。它相对 3.1 Flash-Lite 的 Terminal-Bench 2.1、GDM-MRCR v2 和 GDPval-AA v2 结果分别是 54% 对 31%、72.2 对 60.1、1140 对 642;在另一组对照中,它在 SWE-Bench Pro 上以 54.2% 对 49.6% 高于 3 Flash,在 OSWorld-Verified 上以 74.0% 对 65.1% 高于 3 Flash。不同数字对应不同基线,不能合并成「Lite 全面超过 3.6 Flash」的结论。1
模型还提供不同 thinking levels。minimal 或 low thinking 适合把延迟和价格压到最低;更高 thinking levels 则用于多步 subagent 工作负载。最新模型文档列出的模型 ID 是
gemini-3.5-flash-lite,上下文窗口为 1M token,最大输出为 64k token,并支持包括 Computer Use 在内的内置工具。2这类配置更像路由策略,而不是一个静态「强模型 / 弱模型」标签:高吞吐抽取、文档处理和可拆分的子任务可以先走 Lite,只有需要更深推理或更高成功率的环节再升级到 3.6 Flash。
价格表把差异变成了工程约束
Google AI for Developers 的 API 定价页列出的 Standard 价格如下,单位均为每百万 token;输出价格包含 thinking tokens。Batch 和 Flex 价格更低,但适合的服务等级与调用方式不同,不能直接拿来替代在线 Standard 预算。3
| 模型 | Standard 输入 | Standard 输出 | Batch / Flex 输入 | Batch / Flex 输出 |
|---|---|---|---|---|
gemini-3.6-flash | $1.50 | $7.50 | $0.75 | $3.75 3 |
gemini-3.5-flash-lite | $0.30 | $2.50 | $0.15 | $1.25 3 |
两款通用模型的 1M 上下文、64k 最大输出、thinking 和 Computer Use 支持,使它们可以共用一部分 agent 基础设施;真正的差别在于每次任务应该承担多少推理预算,以及高吞吐是否比单次成功率更重要。2
Flash Cyber:产品边界比价格更重要
Flash Cyber 建立在 3.5 Flash 之上,并针对发现、验证和修补漏洞做了微调。官方只说它会在 CodeMender 中由多个 agents 协作生成一份 combined report,在 CyberGym 上达到与更大模型有竞争力的表现;可用性仍是政府和可信合作伙伴的 limited-access pilot。官方 API 定价页公开列出了 3.6 Flash 和 3.5 Flash-Lite,却没有给 Flash Cyber 单独的公开 token 价格。1 3
这意味着 Cyber 目前不能按「更便宜的通用 Flash」来采购。它的价值要结合受控评测、代码安全流程和双重用途风险一起判断;独立的 Cyber 深度评测页还给出了更细的调用条件和漏洞数字,不能用主发布页的一句 benchmark 概括替代。
Gemini 4 只到预训练阶段
博客最后透露,Gemini 4 已经开始「迄今最雄心勃勃的预训练运行」,但没有给出发布日期、架构或评测数字。它可以被理解为研发状态信号,不能写成近期上线时间表。1
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
