Gemini 3.7 Flash 发布:1M 上下文、$0.75/$3.75,编码与 Agent 评测明显提升

Gemini 3.7 Flash 发布:1M 上下文、$0.75/$3.75,编码与 Agent 评测明显提升

Google 发布 Gemini 3.7 Flash,主打编码与多步 Agent 工作流;官方数据显示它在多项编码、网页开发和企业自动化评测上领先 3.6 Flash,API 价格在 2026 年底前为每百万 tokens $0.75/$3.75。

先看结论

如果你正在做编码 Agent、网页生成,或把模型接进多步工具链,Gemini 3.7 Flash 值得先做一轮 A/B 测试。Google 官方给出的对照结果显示,它相较 Gemini 3.6 Flash 在生产代码、长程软件工程、网页开发、企业自动化和复杂文档理解等任务上都有提升;API 价格在 2026 年 12 月 31 日前为每百万 tokens 输入 $0.75、输出 $3.751
但这仍是一款以 API 和产品入口为主的新模型。官方没有披露参数规模,也没有开放权重;公开 benchmark 主要是 Google 在发布页和模型卡中整理的结果,适合决定「先测什么」,不能替代你自己的任务集评测。

关键资料一览

项目Gemini 3.7 Flash
发布时间2026 年 8 月 13 日。1
模型定位Gemini 3 家族的下一代 Flash 模型,主打编码、Agent 和复杂知识工作;支持可调节的 thinking 配置。2
参数规模官方未披露;模型卡只说明它基于 Gemini 3.6 Flash。2
输入与输出支持文本、图片、音频和视频输入;上下文窗口最高 1M tokens,输出最高 64K tokens。2
API 价格2026 年底前:输入 $0.75 / 1M tokens,输出 $3.75 / 1M tokens;2027 年 1 月 1 日起为 $1.50 / $7.50。1
可用入口Google AI Studio、Gemini API、Android Studio、Google Antigravity;企业入口包括 Gemini Enterprise Agent Platform 和 Gemini Enterprise;Spark 面向 Google AI Pro / Ultra 订阅者,在支持地区提供。1

提升集中在哪些任务

Google 发布页把 3.7 Flash 定义为「编码和 Agent 的 workhorse 模型」。从官方对照数字看,提升最集中在需要连续执行、反复调用工具或处理复杂输入的任务:
  • FrontierCode 1.1 Main:43.6% 对 34.4%。 这是生产代码质量评测,3.7 Flash 的首轮代码准确率更高。1
  • DeepSWE v1.1:65.3% 对 48.6%。 模型卡表格把它列为长程软件工程结果;发布页正文把 Gemini 3.6 Flash 的基线写为 49.0%,两页对 3.7 Flash 的 65.3% 一致,基线存在 0.4 个百分点差异。12
  • WebDev Arena:Elo 1588 对 1538。 这对应网页布局、功能完整度和参考设计遵循能力。1
  • AutomationBench:30.4% 对 17.0%;GDP.pdf:34.0% 对 22.0%。 前者面向企业工作流自动化,后者考察复杂 PDF 文档理解。2
Gemini 3.7 Flash 与其他模型的官方 benchmark 对照表
Google DeepMind 模型卡截至 2026 年 8 月列出的官方对照;表中的粗体表示该行的最高成绩,数字属于发布方披露口径,不是本频道的独立复测。2
这些结果支持一个较窄的判断:3.7 Flash 更适合拿来测试「模型能否把一串动作做完」,而不只是比较单轮问答的答案质量。模型卡也列出边界:它能完成单个编码任务,但还不能在没有人工干预的情况下,把多个任务稳定串成端到端研究流程。2

价格低,比较单位仍应是一次任务

2026 年底前的 API 价格是输入 $0.75、输出 $3.75 / 1M tokens。官方说明,2027 年 1 月 1 日起恢复为 $1.50、$7.50;如果项目生命周期跨年,预算需要按两个阶段分别估算。1
这组价格很适合做高频 Agent 的候选,但不能只拿单价判断是否更省。更有用的指标是:一次任务用了多少输入和输出 tokens、调用了几轮工具、返工了几次,以及人工修复花了多少时间。3.7 Flash 如果能减少重试和人工接管,单次任务成本可能低于只看 token 单价的估算;这部分需要用你自己的日志验证。

现在可以怎样试

  1. 先选一组真实任务做对照。 用同一批代码修复、网页生成、长文档处理和工具调用任务,与 Gemini 3.6 Flash 保持相同提示词、工具权限和超时设置。
  2. 把「完成」定义清楚。 除了最终答案,还要记录测试是否通过、工具调用是否走偏、重试次数、输出 tokens、延迟和人工修改量。
  3. 把上线入口与部署方式分开判断。 官方列出的入口集中在 Gemini API、AI Studio、Android Studio、Antigravity 和企业产品;参数规模与权重没有公开,因此当前更像 API / 产品选型,而不是本地部署选项。12
  4. 把安全测试放进首轮评估。 Google 表示 3.7 Flash 更新了针对 CBRN 和网络攻击滥用的安全措施;模型卡仍提醒存在幻觉、偶发变慢或超时,知识截止时间为 2026 年 3 月,部分领域可能只覆盖到 2025 年 1 月。高权限 Agent 应先在受限环境中试跑。12
如果你的任务价值主要来自多步执行、代码质量和长上下文处理,3.7 Flash 的官方数据已经足以支持一次针对性评测;如果你需要本地权重、明确的参数规模或完全独立的 benchmark 复核,当前发布信息还不够。

References

  1. 1
  2. 2
大模型发布追踪

大模型发布追踪

追踪各大厂商最新大模型发布,第一时间推送核心信息

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel