Gemini 3.6 Flash、3.5 Flash-Lite 与 Flash Cyber:Google 把模型选型拆成三种工作负载

Gemini 3.6 Flash、3.5 Flash-Lite 与 Flash Cyber:Google 把模型选型拆成三种工作负载

Google DeepMind 把 3.6 Flash、3.5 Flash-Lite 与 Flash Cyber 分别推向主力推理、低价高吞吐和漏洞研究,公开 benchmark、价格与访问边界并不属于同一条性能曲线。

先给判断:三款模型不是同一条性能曲线

Google DeepMind 在 2026 年 7 月 21 日同一篇官方博客中公布了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。它们对应的不是「同一个模型逐档降价」,而是三种工作负载:3.6 Flash 面向需要较强编码、知识工作和多模态能力的主力任务;3.5 Flash-Lite 面向低延迟和高吞吐;Flash Cyber 则把模型能力收窄到漏洞发现与修复,并通过 CodeMender 限定给政府和可信合作伙伴试用。1
因此,发布页最值得读的部分不是「谁的分数最高」,而是 Google 如何把能力、token 消耗、调用价格和安全边界放进同一个选型框架。3.6 Flash 的卖点是单位 agentic task 做得更多、用得更少;Lite 的卖点是把大量简单或可拆分任务的边际成本压下来;Cyber 的公开信息则还不足以支持普通开发者直接接入。

3.6 Flash:官方强调的是单位任务效率

3.6 Flash 被定位为 workhorse model。官方相对 3.5 Flash 给出的结果如下:
评测3.6 Flash3.5 Flash官方对照
DeepSWE49%37%代码任务成功率更高 1
MLE Bench63.9%49.7%机器学习工程任务更高 1
OSWorld-Verified83.0%78.4%计算机操作任务更高 1
GDPval-AA v214211349工作任务评分更高 1
效率数字是另一条线。Artificial Analysis Index 中,3.6 Flash 相比 3.5 Flash 的输出 token 使用量减少 17%;在 DeepSWE 上,官方观察到最高 65% 的输出 token 减少。原文还把这种减少归因于更少的 reasoning steps 和 tool calls。这里的判断对象是完成一次任务的工作量,不是把 17% 当成所有提示都能获得的固定节省。1
这使 3.6 Flash 的工程价值取决于任务是否真的需要多步推理和工具调用。若工作流本来只有一次短文本分类,token 效率的收益可能不如单价变化明显;若任务包含代码执行、浏览或多轮工具协作,减少中间步骤才可能转化为延迟和成本收益。

3.5 Flash-Lite:低价不等于只能做简单任务

Flash-Lite 的官方定位是低延迟、高吞吐,Artificial Analysis 给出的输出速度是 350 tokens/s。它相对 3.1 Flash-Lite 的 Terminal-Bench 2.1、GDM-MRCR v2 和 GDPval-AA v2 结果分别是 54% 对 31%、72.2 对 60.1、1140 对 642;在另一组对照中,它在 SWE-Bench Pro 上以 54.2% 对 49.6% 高于 3 Flash,在 OSWorld-Verified 上以 74.0% 对 65.1% 高于 3 Flash。不同数字对应不同基线,不能合并成「Lite 全面超过 3.6 Flash」的结论。1
模型还提供不同 thinking levels。minimal 或 low thinking 适合把延迟和价格压到最低;更高 thinking levels 则用于多步 subagent 工作负载。最新模型文档列出的模型 ID 是 gemini-3.5-flash-lite,上下文窗口为 1M token,最大输出为 64k token,并支持包括 Computer Use 在内的内置工具。2
这类配置更像路由策略,而不是一个静态「强模型 / 弱模型」标签:高吞吐抽取、文档处理和可拆分的子任务可以先走 Lite,只有需要更深推理或更高成功率的环节再升级到 3.6 Flash。

价格表把差异变成了工程约束

Google AI for Developers 的 API 定价页列出的 Standard 价格如下,单位均为每百万 token;输出价格包含 thinking tokens。Batch 和 Flex 价格更低,但适合的服务等级与调用方式不同,不能直接拿来替代在线 Standard 预算。3
模型Standard 输入Standard 输出Batch / Flex 输入Batch / Flex 输出
gemini-3.6-flash$1.50$7.50$0.75$3.75 3
gemini-3.5-flash-lite$0.30$2.50$0.15$1.25 3
两款通用模型的 1M 上下文、64k 最大输出、thinking 和 Computer Use 支持,使它们可以共用一部分 agent 基础设施;真正的差别在于每次任务应该承担多少推理预算,以及高吞吐是否比单次成功率更重要。2

Flash Cyber:产品边界比价格更重要

Flash Cyber 建立在 3.5 Flash 之上,并针对发现、验证和修补漏洞做了微调。官方只说它会在 CodeMender 中由多个 agents 协作生成一份 combined report,在 CyberGym 上达到与更大模型有竞争力的表现;可用性仍是政府和可信合作伙伴的 limited-access pilot。官方 API 定价页公开列出了 3.6 Flash 和 3.5 Flash-Lite,却没有给 Flash Cyber 单独的公开 token 价格。1 3
这意味着 Cyber 目前不能按「更便宜的通用 Flash」来采购。它的价值要结合受控评测、代码安全流程和双重用途风险一起判断;独立的 Cyber 深度评测页还给出了更细的调用条件和漏洞数字,不能用主发布页的一句 benchmark 概括替代。

Gemini 4 只到预训练阶段

博客最后透露,Gemini 4 已经开始「迄今最雄心勃勃的预训练运行」,但没有给出发布日期、架构或评测数字。它可以被理解为研发状态信号,不能写成近期上线时间表。1
对准备接入的团队,当前更可靠的判断路径是:高复杂度、多工具协作先评估 3.6 Flash;海量抽取、搜索子任务和低延迟响应先测 Flash-Lite;涉及漏洞研究则等待受邀访问与安全评测条件,而不是把三款模型放进同一张排行榜。两款通用模型的模型卡也都标注为 2026 年 7 月 21 日的官方 PDF,可作为评测口径和限制的后续入口。4 5

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel