
Gemini 3.6 Flash 发布:更少 token,三款新模型重分 Agent 预算
Google 同日推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,本文拆解三款模型的能力、价格、API 迁移和安全部署边界,并对照 GPT-5.6 Luna、Grok 4.5 与 Claude Sonnet 5。
先看结论
Google 这次不是只把一个 Flash 模型换了版本号,而是把「Agent 的单位成本」拆成了三种产品方案:Gemini 3.6 Flash 负责复杂编码、知识工作和多模态任务;Gemini 3.5 Flash-Lite 负责高吞吐、低延迟的抽取与子 Agent;Gemini 3.5 Flash Cyber 则把安全漏洞发现和修复交给专用模型与 CodeMender 的多次调用。三者都在 2026 年 7 月 21 日发布,前两款已在 Gemini API 和相关产品中正式可用,Cyber 仍是面向政府与可信伙伴的限量试点。1 2
如果只看主要基准测试成绩,3.6 Flash 还没有全面超过 GPT-5.6 Luna、Grok 4.5 或 Claude Sonnet 5。它的发布价值在于,把相近甚至更高的任务分数与更少的输出 token、较低的输出价格和原生 Computer Use 绑在了一起。对于真正运行 Agent 的团队,这比「聊天回答更聪明」更接近成本表和故障日志。
三款模型,三个工作位置
| 模型 | 当前定位 | 关键规格与价格 | 现在能不能直接用 |
|---|---|---|---|
| Gemini 3.6 Flash | 复杂 Agent、编码、知识工作、多模态 | 1M 上下文、64K 输出;$1.50/百万输入 token,$7.50/百万输出 token;默认 thinking 为 medium | 可以,Gemini API、AI Studio、Gemini Enterprise、Gemini App 等 |
| Gemini 3.5 Flash-Lite | 高吞吐抽取、分类、翻译和轻量子 Agent | 1M 上下文、64K 输出;$0.30/百万输入 token,$2.50/百万输出 token;默认 thinking 为 minimal;Artificial Analysis 测得 350 output tokens/s | 可以,Gemini API、AI Studio、Gemini Enterprise 等 |
| Gemini 3.5 Flash Cyber | 漏洞发现、验证和修复 | 建在 3.5 Flash 上,针对网络安全任务微调;价格未公开 | 尚未面向普通 API 用户开放,先通过 CodeMender 小范围试点 |
这个分工很清楚:3.6 Flash 是主 Agent,Flash-Lite 是规模化的工作单元,Cyber 是受访问控制的垂直工具。把三者都当成可互换的「新 Gemini」会误判部署条件。规格与价格来自 Google 的开发者文档和模型卡;Cyber 的访问边界来自 DeepMind 的发布说明。2 3 4
3.6 Flash:减少 token,也减少执行回路
3.6 Flash 基于 3.5 Flash,核心升级不是单一能力项,而是完成同一多步骤任务时减少输出 token、推理步骤和工具调用。Google 引用 Artificial Analysis Index 称,3.6 Flash 的输出 token 用量比 3.5 Flash 少 17%;官方 API 文档还明确写到,它更常先运行诊断脚本再修改代码,能减少不必要的文件改动和执行循环,但简单前端任务可能因此多出探索步骤。1 2
模型卡给出的对比数据说明了这个方向。3.6 Flash 在 DeepSWE v1.1 上为 49%,3.5 Flash 为 37%;MLE-Bench 为 63.9% 对 49.7%;OSWorld-Verified 为 83.0% 对 78.4%;GDPval-AA v2 的 Elo 为 1421 对 1349。它并非每项都赢,SWE-Bench Pro 也只是 58.7% 对 55.1%,但「少写一点、少调用几次、少陷入循环」和这些分数放在一起,才构成了实际的 Agent 升级。3
Google 同一张模型卡还列出了几个外部竞品的结果。由于不同模型的厂商、harness、推理设置和工具条件未必完全一致,下面只能当作官方披露口径的横向参考,不能当成统一实验室的绝对排名。3
| 模型 | SWE-Bench Pro | DeepSWE v1.1 | OSWorld-Verified | GDPval-AA v2 | 输出价 / 百万 token |
|---|---|---|---|---|---|
| Gemini 3.6 Flash | 58.7% | 49% | 83.0% | 1421 | $7.50 |
| GPT-5.6 Luna | 62.7% | 67% | 72.6% | 1584 | $6.00 |
| Grok 4.5 | 64.7% | 54% | 未列出 | 1535 | $6.00 |
| Claude Sonnet 5 | 63.2% | 54% | 81.2% | 1607 | $15.00,临时折扣 $10.00 |
从结果看,3.6 Flash 的优势集中在 Computer Use 和长上下文,而软件工程长任务仍落后于表中最强项。它更像一个适合做总控和多模态观察的中档模型,不是所有编码任务都应该无条件迁移的旗舰替代品。
真正会影响迁移的,是 API 变化
3.6 Flash 和 Flash-Lite 的 API 迁移要求比一次改 model ID 更具体。Google 将
temperature、top_p、top_k 标为弃用参数;未来模型会因继续传入它们返回错误。预填充 model turn 也不再支持,旧请求如果以非空的 model turn 结尾,会收到 HTTP 400。使用旧版 Gemini 请求格式的团队,需要把原先依赖预填充来控制开头或 JSON 输出的逻辑改成 system instruction 或 structured outputs。2这类改动的信号很明确:Google 正在把模型行为控制从采样旋钮移到 system instruction、thinking level 和结构化输出。3.6 Flash 默认
medium,可配置为 medium 或 high;Flash-Lite 默认 minimal,高吞吐抽取可以保持 minimal,带工具调用的子 Agent 则应测试 medium 或 high。迁移前应在代码库里全量搜索采样参数、prefilled turn、旧的 thinking_budget 和候选数设置,而不是只替换模型字符串。Flash-Lite:便宜的不只是 token
Flash-Lite 的账面价格是输入 $0.30、输出 $2.50 / 百万 token,输出速度按 Artificial Analysis 的测量为 350 tokens/s。模型卡显示,它相对 3.1 Flash-Lite 在 Terminal-Bench 2.1 上从 31.0% 升到 54.0%,GDPval-AA v2 从 642 提到 1140,OSWorld-Verified 从 54.3% 提到 74.0%。它也不是低价版万能模型:在 SWE-Bench Pro 上为 54.2%,略低于模型卡列出的 GPT-5.4 mini 的 54.4%,GDPval 为 1140 对 1171。1 5
这决定了它更适合做大量、短链路、可重试的任务:文档分段、分类、翻译、结构化 JSON、搜索结果初筛,以及由 3.6 Flash 发起的子任务。若把它用于自主编码或长流程办公,thinking level、工具调用重试和提前终止都要单独测,不能因为单价低就默认总成本低。
Cyber:专用模型的价值在调用次数
Gemini 3.5 Flash Cyber 建在 3.5 Flash 上,并针对漏洞发现、验证和补丁生成微调。CodeMender 不把它当成一次性问答模型,而是最多调用五次,让多个子 Agent 扫描更多代码路径,最后合并成一份报告。Google 在 CyberGym 上称其相较更大的安全模型有竞争力,同时也明确说明竞品结果来自提供方自报。4
这个设计比「安全模型更强」更值得关注。漏洞搜索的瓶颈往往是路径覆盖和重复验证,轻量模型足够便宜,才能把同一份代码拆成更多次探索。Google 还称,在 V8 JavaScript Engine 的固定调用次数测试里,Cyber 找到 55 个独特且确认的问题,3.5 Flash 找到 47 个,Claude Opus 4.6 找到 36 个;这些数字来自 Google 的评估,不能直接外推到所有仓库。4
风险边界也没有被藏起来:Flash Cyber 近期只会通过 CodeMender 面向政府和可信伙伴试点,Google 计划逐步扩大;普通客户可以在 Gemini Enterprise Agent Platform 使用 CodeMender 的基础能力,但不等于拿到了 Cyber 模型本身。安全团队要关注的不是模型是否能生成 exploit,而是扫描权限、补丁审批、结果留痕和人工复核是否被强制保留。
Gemini 4 已开始预训练,但还不是产品消息
Google 在发布三款模型的同时说,Gemini 4 已经启动「最雄心勃勃的一次预训练」,但没有公布发布时间、规格、能力或访问方式。这个信息可以作为路线信号,不能写成 Gemini 4 即将上线。当前能直接影响开发者的,仍然是 3.6 Flash 和 Flash-Lite 已进入 GA,以及 API 迁移规则已经落地。1 2
判断:这次升级卖的是任务预算
对开发者,3.6 Flash 的第一价值是降低复杂 Agent 的执行预算,同时把 Computer Use 和 1M 上下文放到可生产使用的模型里;迁移成本则来自 API 参数和对话格式变化。对产品团队,Flash-Lite 让高吞吐任务有了更便宜的默认层,但必须用端到端成功率、重试次数和延迟验证真实成本。对安全团队,Flash Cyber 的贡献是把更多代码路径纳入扫描,而不是开放一个可以随意调用的漏洞模型。
因此,适合立刻做的不是把所有流量切到 3.6 Flash,而是分三组建立基线:用固定任务集比较 3.5 Flash 与 3.6 Flash 的完成率、工具调用数和输出 token;用 Flash-Lite 测抽取、分类和子 Agent 的单位成功成本;等待 Cyber 扩大试点后,再在隔离代码库中评估漏洞召回、补丁正确率和审批链。Gemini 4 先留在观察列表里,直到 Google 给出模型卡、预览入口或可复核的技术材料。
関連コンテンツ
- ログインするとコメントできます。
More from this channel›
- Claude Opus 5 发布:把前沿智能压到每百万 token 5 美元,真正变化在自验证
- 7月22-23:Claude Voice、Security 与 ChatGPT Health 把模型接进真实权限
- GPT-5.6 Sol 评测越过沙箱:一次 Hugging Face 事件如何暴露长时程 Agent 的安全缺口
- OpenAI Presence:把语音与聊天 Agent 变成可控的企业生产服务
- Qwen3.8 Max Preview:2.4T 旗舰先上线,真正的考试还在权重和 benchmark
- Kimi K3 发布:2.8T 开源 MoE 已进入前沿工作流区间
- Fable 5 访问方案落地:7 月 20 日起,Anthropic 把订阅用户分成两条路
- 7月7-10:Claude、ZCode 与 GPT-5.6 都在抢工作流控制台
