
Google 一次发布三款 Gemini Flash:3.6 降价,Lite 更快,Cyber 先做安全试点
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber:前两款已可通过 Gemini API 使用,Cyber 仅向政府和可信伙伴限量试点;3.6 价格降至 $1.50/$7.50,Lite 为 $0.30/$2.50。
先看结论
Google DeepMind 在 7 月 21 日一次发布三款 Gemini Flash 模型:Gemini 3.6 Flash 面向编码、知识工作和多模态 Agent,Gemini 3.5 Flash-Lite 面向低延迟与高吞吐,Gemini 3.5 Flash Cyber 则专门服务代码安全。前两款已经通过 Gemini API 和 Google AI Studio 提供给开发者,Cyber 只进入政府与可信合作伙伴的限量试点。1
对大多数开发者,这次发布最实际的变化是两档公开模型的分工更清楚:需要复杂编码、知识工作和工具循环,先测 3.6 Flash;需要大量文档解析、抽取或子 Agent 调用,先测 Flash-Lite。Cyber 暂时不是一个可以直接申请 API key 的选项。
三款模型怎么分工
| 模型 | 定位与能力 | 公开规格 | 价格与可用范围 |
|---|---|---|---|
| Gemini 3.6 Flash | 编码、知识工作、多模态任务和 Agent 执行;Google 称其在 Artificial Analysis Index 上比 3.5 Flash 少用 17% 输出 token | 输入支持文本、图片、视频、音频和 PDF,输入上限 1,048,576 token,输出上限 65,536 token;参数规模未在公开发布材料中披露 | 标准付费为输入 $1.50、输出 $7.50 / 每 100 万 token;稳定版 gemini-3.6-flash,可从 Gemini API、Google AI Studio 等入口使用 |
| Gemini 3.5 Flash-Lite | 低延迟、高吞吐、文档处理和子 Agent;Google 引用 Artificial Analysis Index 的速度为 350 output tokens/s | 输入支持文本、图片、视频、音频和 PDF,输入上限 1,048,576 token,输出上限 65,536 token;参数规模未在公开发布材料中披露 | 标准付费为输入 $0.30、输出 $2.50 / 每 100 万 token;稳定版 gemini-3.5-flash-lite,可从 Gemini API、Google AI Studio 使用 |
| Gemini 3.5 Flash Cyber | 基于 3.5 Flash 微调,用于发现、验证和修补漏洞;由 CodeMender 调度多个 Agent 汇总报告 | 公开材料未给出参数规模、上下文窗口或通用 API 模态 | 未公布通用 API 价格;即将通过 CodeMender 向政府和可信合作伙伴限量开放 |
3.6 Flash 与 Flash-Lite 的 API 输入、输出上限和稳定版模型 ID,见 Google Developers 的模型文档;价格以 Google Gemini API 定价页的 Standard 付费档为准。2 3 4
3.6 Flash:重点是少走几轮工具循环
Google 把 3.6 Flash 定位成 Flash 系列的工作马。发布页称,它在 Artificial Analysis Index 上比 3.5 Flash 少消耗 17% 的输出 token,同时把标准输出价格降到每 100 万 token 7.50 美元。对 Agent 来说,单价下降只是表面变化;如果模型能用更少的推理步骤和工具调用完成任务,端到端成本才会真正下降。1
Google 在同一发布页给出的对比包括:DeepSWE 为 49% 对 37%,MLE Bench 为 63.9% 对 49.7%,OSWorld-Verified 为 83.0% 对 78.4%,GDPval-AA v2 为 1421 对 1349,比较对象都是 Gemini 3.5 Flash。3.6 Flash 还把 computer use 作为 Gemini API 与 Gemini Enterprise 的内置客户端工具,API 文档将其标为 Preview。1 2
这些数字是 Google 发布页披露的对比结果,部分指标来自 Google 引用的外部评测索引。它们足以决定把 3.6 Flash 放进第一轮评测,但还不足以替代自己的任务集,尤其是工具失败重试、代码误改和实际输出长度会改变最终成本。
Flash-Lite:先看吞吐和错误率
Flash-Lite 的优势更直接。Google 将它用于 Agentic Search、文档处理和高吞吐任务,标准价格是输入每 100 万 token 0.30 美元、输出 2.50 美元。官方发布页还引用 Artificial Analysis Index 的 350 output tokens/s,并称它在部分 Agent 与编码评测中超过 Gemini 3 Flash。1 4
Google 给出的关键对比是:相对 3.1 Flash-Lite,Terminal-Bench 2.1 为 54% 对 31%,GDM-MRCR v2 为 72.2% 对 60.1%,GDPval-AA v2 为 1140 对 642;相对 Gemini 3 Flash,SWE-Bench Pro 为 54.2% 对 49.6%,OSWorld-Verified 为 74.0% 对 65.1%。这些是厂商发布页中的评测数字,适合用来筛选候选模型,不宜直接当成跨任务的通用排名。1
API 文档列明,Flash-Lite 接受文本、图片、视频、音频和 PDF,输出为文本,并支持代码执行、函数调用、搜索 grounding、结构化输出和 URL context,但不支持 computer use。对收据翻译、合同抽取、批量分类或子 Agent 来说,它值得先做吞吐与错误率测试;需要操作浏览器界面时,则应把 3.6 Flash 放在对照组。3
Flash Cyber:能力更强,入口更窄
Gemini 3.5 Flash Cyber 基于 Gemini 3.5 Flash,并针对漏洞发现、验证和修补做了微调。Google DeepMind 表示,CodeMender 会多次调用该模型,让多个子 Agent 扫描更多代码路径,再合并成一份报告;在 V8 JavaScript Engine 的固定调用测试中,它发现 55 个独立且已确认的问题,Gemini 3.5 Flash 发现 47 个,Claude Opus 4.6 发现 36 个,其中有 10 个问题是另外两者没有发现的。5
这部分结果需要单独看待。Google 明确注明 CyberGym 的竞争模型结果来自各提供方自报分数,Cyber 的部署也采取了更窄的权限边界:近期只通过 CodeMender 面向政府和可信合作伙伴试点,之后再逐步扩大。公开页面没有给出通用 API、参数规模、上下文窗口或价格,因此目前不能把它当作普通开发者可购买的第三个 Flash 档位。5
开发者现在该怎么测
- 先用同一组真实任务比较 3.6 Flash 与 3.5 Flash:记录成功率、工具调用次数、输出 token、重试率和端到端延迟。只看每百万 token 价格,可能漏掉模型少走几轮工具调用带来的成本变化。
- 把 Flash-Lite 放进高吞吐流水线:文档抽取、分类、翻译和子 Agent 都应同时记录每秒处理量与人工复核率。它更便宜、更快,不等于在结构化输出和边界案例上自动更稳。
- 安全团队先关注 CodeMender 的试点范围与后续公开文档。Cyber 当前没有公开通用 API,不能把官方漏洞发现数字直接转化为可购买能力,也不应在未授权代码库上复现实验。
官方入口:
관련 콘텐츠
- 로그인하면 댓글을 작성할 수 있습니다.
