
Gemini 3.7 Flash 发布:1M 上下文、$0.75/$3.75,编码与 Agent 评测明显提升
Google 发布 Gemini 3.7 Flash,主打编码与多步 Agent 工作流;官方数据显示它在多项编码、网页开发和企业自动化评测上领先 3.6 Flash,API 价格在 2026 年底前为每百万 tokens $0.75/$3.75。
先看结论
如果你正在做编码 Agent、网页生成,或把模型接进多步工具链,Gemini 3.7 Flash 值得先做一轮 A/B 测试。Google 官方给出的对照结果显示,它相较 Gemini 3.6 Flash 在生产代码、长程软件工程、网页开发、企业自动化和复杂文档理解等任务上都有提升;API 价格在 2026 年 12 月 31 日前为每百万 tokens 输入 $0.75、输出 $3.75。1
但这仍是一款以 API 和产品入口为主的新模型。官方没有披露参数规模,也没有开放权重;公开 benchmark 主要是 Google 在发布页和模型卡中整理的结果,适合决定「先测什么」,不能替代你自己的任务集评测。
关键资料一览
| 项目 | Gemini 3.7 Flash |
|---|---|
| 发布时间 | 2026 年 8 月 13 日。1 |
| 模型定位 | Gemini 3 家族的下一代 Flash 模型,主打编码、Agent 和复杂知识工作;支持可调节的 thinking 配置。2 |
| 参数规模 | 官方未披露;模型卡只说明它基于 Gemini 3.6 Flash。2 |
| 输入与输出 | 支持文本、图片、音频和视频输入;上下文窗口最高 1M tokens,输出最高 64K tokens。2 |
| API 价格 | 2026 年底前:输入 $0.75 / 1M tokens,输出 $3.75 / 1M tokens;2027 年 1 月 1 日起为 $1.50 / $7.50。1 |
| 可用入口 | Google AI Studio、Gemini API、Android Studio、Google Antigravity;企业入口包括 Gemini Enterprise Agent Platform 和 Gemini Enterprise;Spark 面向 Google AI Pro / Ultra 订阅者,在支持地区提供。1 |
提升集中在哪些任务
Google 发布页把 3.7 Flash 定义为「编码和 Agent 的 workhorse 模型」。从官方对照数字看,提升最集中在需要连续执行、反复调用工具或处理复杂输入的任务:
- FrontierCode 1.1 Main:43.6% 对 34.4%。 这是生产代码质量评测,3.7 Flash 的首轮代码准确率更高。1
- DeepSWE v1.1:65.3% 对 48.6%。 模型卡表格把它列为长程软件工程结果;发布页正文把 Gemini 3.6 Flash 的基线写为 49.0%,两页对 3.7 Flash 的 65.3% 一致,基线存在 0.4 个百分点差异。12
- WebDev Arena:Elo 1588 对 1538。 这对应网页布局、功能完整度和参考设计遵循能力。1
- AutomationBench:30.4% 对 17.0%;GDP.pdf:34.0% 对 22.0%。 前者面向企业工作流自动化,后者考察复杂 PDF 文档理解。2

这些结果支持一个较窄的判断:3.7 Flash 更适合拿来测试「模型能否把一串动作做完」,而不只是比较单轮问答的答案质量。模型卡也列出边界:它能完成单个编码任务,但还不能在没有人工干预的情况下,把多个任务稳定串成端到端研究流程。2
价格低,比较单位仍应是一次任务
2026 年底前的 API 价格是输入 $0.75、输出 $3.75 / 1M tokens。官方说明,2027 年 1 月 1 日起恢复为 $1.50、$7.50;如果项目生命周期跨年,预算需要按两个阶段分别估算。1
这组价格很适合做高频 Agent 的候选,但不能只拿单价判断是否更省。更有用的指标是:一次任务用了多少输入和输出 tokens、调用了几轮工具、返工了几次,以及人工修复花了多少时间。3.7 Flash 如果能减少重试和人工接管,单次任务成本可能低于只看 token 单价的估算;这部分需要用你自己的日志验证。
现在可以怎样试
- 先选一组真实任务做对照。 用同一批代码修复、网页生成、长文档处理和工具调用任务,与 Gemini 3.6 Flash 保持相同提示词、工具权限和超时设置。
- 把「完成」定义清楚。 除了最终答案,还要记录测试是否通过、工具调用是否走偏、重试次数、输出 tokens、延迟和人工修改量。
- 把上线入口与部署方式分开判断。 官方列出的入口集中在 Gemini API、AI Studio、Android Studio、Antigravity 和企业产品;参数规模与权重没有公开,因此当前更像 API / 产品选型,而不是本地部署选项。12
- 把安全测试放进首轮评估。 Google 表示 3.7 Flash 更新了针对 CBRN 和网络攻击滥用的安全措施;模型卡仍提醒存在幻觉、偶发变慢或超时,知识截止时间为 2026 年 3 月,部分领域可能只覆盖到 2025 年 1 月。高权限 Agent 应先在受限环境中试跑。12
如果你的任务价值主要来自多步执行、代码质量和长上下文处理,3.7 Flash 的官方数据已经足以支持一次针对性评测;如果你需要本地权重、明确的参数规模或完全独立的 benchmark 复核,当前发布信息还不够。
References
- 1Google DeepMind 官方发布页
blog.google
- 2Gemini 3.7 Flash 模型卡
deepmind.google

大模型发布追踪
追踪各大厂商最新大模型发布,第一时间推送核心信息
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
More from this channel›
- DeepSeek-V4-Flash-Vision-Exp 发布:官方称多模态 Agent 接近 Opus-4.8,API 已上线
- GLM-5.3 API 正式上线:与 GLM-5.2 同价,接入前先改推理参数
- Qwen3.8-27B 开放权重上架:27B 原生视觉、Apache-2.0、262K 上下文
- GLM-5.3 发布:基于 743B 基座训练,编码与网络安全能力跃升
- DeepSeek 峰谷定价落地:8 月 17 日起高峰价最高涨至现行 4.5 倍
- DeepSeek-V4-Pro-0813 落地:1M 上下文,API 价格 3/0.025/6 元,参数与 benchmark 未披露
- Grok 4.6 发布:长程 Agent 进入 API,$2/$6 起,参数未披露
- Qwen3.8-Max 开放权重上架:2.4T/95B,先分清本地模型与 QwenCloud