Gemini 3.6 Flash 发布:更少 token,三款新模型重分 Agent 预算

Gemini 3.6 Flash 发布:更少 token,三款新模型重分 Agent 预算

Google 同日推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,本文拆解三款模型的能力、价格、API 迁移和安全部署边界,并对照 GPT-5.6 Luna、Grok 4.5 与 Claude Sonnet 5。

先看结论

Google 这次不是只把一个 Flash 模型换了版本号,而是把「Agent 的单位成本」拆成了三种产品方案:Gemini 3.6 Flash 负责复杂编码、知识工作和多模态任务;Gemini 3.5 Flash-Lite 负责高吞吐、低延迟的抽取与子 Agent;Gemini 3.5 Flash Cyber 则把安全漏洞发现和修复交给专用模型与 CodeMender 的多次调用。三者都在 2026 年 7 月 21 日发布,前两款已在 Gemini API 和相关产品中正式可用,Cyber 仍是面向政府与可信伙伴的限量试点。1 2
如果只看主要基准测试成绩,3.6 Flash 还没有全面超过 GPT-5.6 Luna、Grok 4.5 或 Claude Sonnet 5。它的发布价值在于,把相近甚至更高的任务分数与更少的输出 token、较低的输出价格和原生 Computer Use 绑在了一起。对于真正运行 Agent 的团队,这比「聊天回答更聪明」更接近成本表和故障日志。

三款模型,三个工作位置

模型当前定位关键规格与价格现在能不能直接用
Gemini 3.6 Flash复杂 Agent、编码、知识工作、多模态1M 上下文、64K 输出;$1.50/百万输入 token,$7.50/百万输出 token;默认 thinking 为 medium可以,Gemini API、AI Studio、Gemini Enterprise、Gemini App 等
Gemini 3.5 Flash-Lite高吞吐抽取、分类、翻译和轻量子 Agent1M 上下文、64K 输出;$0.30/百万输入 token,$2.50/百万输出 token;默认 thinking 为 minimal;Artificial Analysis 测得 350 output tokens/s可以,Gemini API、AI Studio、Gemini Enterprise 等
Gemini 3.5 Flash Cyber漏洞发现、验证和修复建在 3.5 Flash 上,针对网络安全任务微调;价格未公开尚未面向普通 API 用户开放,先通过 CodeMender 小范围试点
这个分工很清楚:3.6 Flash 是主 Agent,Flash-Lite 是规模化的工作单元,Cyber 是受访问控制的垂直工具。把三者都当成可互换的「新 Gemini」会误判部署条件。规格与价格来自 Google 的开发者文档和模型卡;Cyber 的访问边界来自 DeepMind 的发布说明。2 3 4

3.6 Flash:减少 token,也减少执行回路

3.6 Flash 基于 3.5 Flash,核心升级不是单一能力项,而是完成同一多步骤任务时减少输出 token、推理步骤和工具调用。Google 引用 Artificial Analysis Index 称,3.6 Flash 的输出 token 用量比 3.5 Flash 少 17%;官方 API 文档还明确写到,它更常先运行诊断脚本再修改代码,能减少不必要的文件改动和执行循环,但简单前端任务可能因此多出探索步骤。1 2
模型卡给出的对比数据说明了这个方向。3.6 Flash 在 DeepSWE v1.1 上为 49%,3.5 Flash 为 37%;MLE-Bench 为 63.9% 对 49.7%;OSWorld-Verified 为 83.0% 对 78.4%;GDPval-AA v2 的 Elo 为 1421 对 1349。它并非每项都赢,SWE-Bench Pro 也只是 58.7% 对 55.1%,但「少写一点、少调用几次、少陷入循环」和这些分数放在一起,才构成了实际的 Agent 升级。3
Google 同一张模型卡还列出了几个外部竞品的结果。由于不同模型的厂商、harness、推理设置和工具条件未必完全一致,下面只能当作官方披露口径的横向参考,不能当成统一实验室的绝对排名。3
模型SWE-Bench ProDeepSWE v1.1OSWorld-VerifiedGDPval-AA v2输出价 / 百万 token
Gemini 3.6 Flash58.7%49%83.0%1421$7.50
GPT-5.6 Luna62.7%67%72.6%1584$6.00
Grok 4.564.7%54%未列出1535$6.00
Claude Sonnet 563.2%54%81.2%1607$15.00,临时折扣 $10.00
从结果看,3.6 Flash 的优势集中在 Computer Use 和长上下文,而软件工程长任务仍落后于表中最强项。它更像一个适合做总控和多模态观察的中档模型,不是所有编码任务都应该无条件迁移的旗舰替代品。

真正会影响迁移的,是 API 变化

3.6 Flash 和 Flash-Lite 的 API 迁移要求比一次改 model ID 更具体。Google 将 temperaturetop_ptop_k 标为弃用参数;未来模型会因继续传入它们返回错误。预填充 model turn 也不再支持,旧请求如果以非空的 model turn 结尾,会收到 HTTP 400。使用旧版 Gemini 请求格式的团队,需要把原先依赖预填充来控制开头或 JSON 输出的逻辑改成 system instruction 或 structured outputs。2
这类改动的信号很明确:Google 正在把模型行为控制从采样旋钮移到 system instruction、thinking level 和结构化输出。3.6 Flash 默认 medium,可配置为 mediumhigh;Flash-Lite 默认 minimal,高吞吐抽取可以保持 minimal,带工具调用的子 Agent 则应测试 medium 或 high。迁移前应在代码库里全量搜索采样参数、prefilled turn、旧的 thinking_budget 和候选数设置,而不是只替换模型字符串。

Flash-Lite:便宜的不只是 token

Flash-Lite 的账面价格是输入 $0.30、输出 $2.50 / 百万 token,输出速度按 Artificial Analysis 的测量为 350 tokens/s。模型卡显示,它相对 3.1 Flash-Lite 在 Terminal-Bench 2.1 上从 31.0% 升到 54.0%,GDPval-AA v2 从 642 提到 1140,OSWorld-Verified 从 54.3% 提到 74.0%。它也不是低价版万能模型:在 SWE-Bench Pro 上为 54.2%,略低于模型卡列出的 GPT-5.4 mini 的 54.4%,GDPval 为 1140 对 1171。1 5
这决定了它更适合做大量、短链路、可重试的任务:文档分段、分类、翻译、结构化 JSON、搜索结果初筛,以及由 3.6 Flash 发起的子任务。若把它用于自主编码或长流程办公,thinking level、工具调用重试和提前终止都要单独测,不能因为单价低就默认总成本低。

Cyber:专用模型的价值在调用次数

Gemini 3.5 Flash Cyber 建在 3.5 Flash 上,并针对漏洞发现、验证和补丁生成微调。CodeMender 不把它当成一次性问答模型,而是最多调用五次,让多个子 Agent 扫描更多代码路径,最后合并成一份报告。Google 在 CyberGym 上称其相较更大的安全模型有竞争力,同时也明确说明竞品结果来自提供方自报。4
这个设计比「安全模型更强」更值得关注。漏洞搜索的瓶颈往往是路径覆盖和重复验证,轻量模型足够便宜,才能把同一份代码拆成更多次探索。Google 还称,在 V8 JavaScript Engine 的固定调用次数测试里,Cyber 找到 55 个独特且确认的问题,3.5 Flash 找到 47 个,Claude Opus 4.6 找到 36 个;这些数字来自 Google 的评估,不能直接外推到所有仓库。4
风险边界也没有被藏起来:Flash Cyber 近期只会通过 CodeMender 面向政府和可信伙伴试点,Google 计划逐步扩大;普通客户可以在 Gemini Enterprise Agent Platform 使用 CodeMender 的基础能力,但不等于拿到了 Cyber 模型本身。安全团队要关注的不是模型是否能生成 exploit,而是扫描权限、补丁审批、结果留痕和人工复核是否被强制保留。

Gemini 4 已开始预训练,但还不是产品消息

Google 在发布三款模型的同时说,Gemini 4 已经启动「最雄心勃勃的一次预训练」,但没有公布发布时间、规格、能力或访问方式。这个信息可以作为路线信号,不能写成 Gemini 4 即将上线。当前能直接影响开发者的,仍然是 3.6 Flash 和 Flash-Lite 已进入 GA,以及 API 迁移规则已经落地。1 2

判断:这次升级卖的是任务预算

对开发者,3.6 Flash 的第一价值是降低复杂 Agent 的执行预算,同时把 Computer Use 和 1M 上下文放到可生产使用的模型里;迁移成本则来自 API 参数和对话格式变化。对产品团队,Flash-Lite 让高吞吐任务有了更便宜的默认层,但必须用端到端成功率、重试次数和延迟验证真实成本。对安全团队,Flash Cyber 的贡献是把更多代码路径纳入扫描,而不是开放一个可以随意调用的漏洞模型。
因此,适合立刻做的不是把所有流量切到 3.6 Flash,而是分三组建立基线:用固定任务集比较 3.5 Flash 与 3.6 Flash 的完成率、工具调用数和输出 token;用 Flash-Lite 测抽取、分类和子 Agent 的单位成功成本;等待 Cyber 扩大试点后,再在隔离代码库中评估漏洞召回、补丁正确率和审批链。Gemini 4 先留在观察列表里,直到 Google 给出模型卡、预览入口或可复核的技术材料。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel