Gemini 3.8 Flash 与 Flash Cyber:高 effort 换长任务表现,Cyber 把修补能力放进受限防御环境

Gemini 3.8 Flash 与 Flash Cyber:高 effort 换长任务表现,Cyber 把修补能力放进受限防御环境

Google 的 Gemini 3.8 Flash 用更长的推理和工具循环换取长程任务表现;Flash Cyber 则在漏洞发现与修补上追求准确率—成本折中,并以 Fairwind 限定可信防御者访问。

Google 在 2026 年 9 月 2 日发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber。两个变体共用基础智能,面对的工作环境不同:3.8 Flash 面向通用开发与 Agent 任务,Cyber 通过 Fairwind Program 面向可信防御者。公开材料给出的核心线索很清楚:3.8 Flash 把更多推理步骤和工具调用放进一次任务,换取长程代码与专业领域任务的更高完成率;Cyber 则把这套能力用于漏洞发现和自动修补,并用更低的单次运行成本争取防御团队的快速迭代。1

3.8 Flash 把更多计算放进一次任务

Gemini 3.8 Flash 的关键变化落在任务执行过程。Google 说,模型在复杂任务上会执行额外推理步骤,并反复调用工具;更高的 effort 级别会带来更多 token 使用。模型因此获得更长的行动链:读取代码、修改文件、运行检查、根据结果继续修正。官方原文把长程软件工程、Agent 任务和多步推理的进步归因于这种工作方式,以及共同基础模型上的训练改进。1
Google 官方评测总表给出了更具体的对照。下面的数字来自该表,3.7 Flash 是最直接的同系列参照;每个分数只描述对应基准的任务定义和运行条件。1
Gemini 3.8 Flash 与其他模型的官方评测总表
表中同时列出价格、软件工程、知识工作、金融分析、法律工作、多学科推理等项目;原图来自 Google 官方博客。1
基准任务对象Gemini 3.8 FlashGemini 3.7 Flash读法
DeepSWE v1.1长程软件工程73.7%65.3%端到端解决复杂工程问题
Vals Finance Agent v2金融分析任务61.4%59.0%专业领域 Agent
Harvey’s Legal Agent Benchmark复杂法律工作流10.0%8.8%法律任务通过率
HLE-Verified多学科专家推理54.9%53.6%STEM、人文与专业领域
这组结果支持一个有边界的判断:3.8 Flash 在需要连续行动、工具调用和结果核验的任务上,较 3.7 Flash 更有优势。DeepSWE 的提升最明显,金融、法律和多学科推理也出现小幅上升。官方表格还显示,Claude Opus 5 在 DeepSWE v1.1 上为 74.0%,与 3.8 Flash 的 73.7% 接近;这个对照说明 Flash 版本的卖点集中在性能与成本的组合,而非每个项目都拿到最高分。1

标价相同,任务总成本仍会变化

Gemini 3.8 Flash 的 model ID 是 gemini-3.8-flash,上下文窗口为 1M token,最大输出为 64k token,推理 effort 提供 lowmediumhigh 三档,默认值为 medium。开发者文档还建议使用 Interactions API,并用 thinking_level 替代旧的 thinking_budget2
2026 年 12 月 31 日前,介绍性价格为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元;2027 年 1 月 1 日起,标准价格分别为 1.50 美元7.50 美元。Google 同时保留了 3.7 Flash 的支持,并建议计算效率优先的应用降低 effort,或继续使用 3.7 Flash。12
因此,3.8 Flash 的低价需要和 token 消耗一起看。一次简单调用可能受益于较低 effort;一次需要搜索、执行、检查和返工的长任务,则可能消耗更多推理 token,并产生更多工具调用。复测时只记录“每百万 token 单价”,会漏掉 effort、输出长度、循环次数和工具成本这几个变量。

Cyber 的优势在漏洞修补闭环

Gemini 3.8 Flash Cyber 使用与 3.8 Flash 相同的基础智能,训练和部署重点转向网络安全防御。Google 把它放进两个连续环节:模型先发现漏洞,再生成并验证补丁。这个顺序决定了它的产品指标:漏洞发现看成功率和召回率,自动修补还要看补丁能否通过测试,以及每次 rollout 需要花多少钱。1
在 CyberGym 自主漏洞发现基准上,Google 称 3.8 Flash Cyber 超过 Gemini 3.5 Flash Cyber 和更大的前沿模型。Google 还用覆盖 20 种编程语言的内部基准测试复杂代码库,模型成功率超过 70%。这两个结果分别覆盖行业基准和 Google 自建场景,后一项更接近真实工程的语言多样性;页面公开的内部基准信息集中在语言覆盖范围和成功率。1
自动修补的结果更能说明它的定位。在 Collinear 运行的 CWE-Bench 上,Gemini 3.8 Flash Cyber 的 pass@1 为 47.2%,领先前沿模型为 47.8%。准确率差距很小,Google 的优势主张来自每次 rollout 成本更低,因此模型位于准确率—成本的 Pareto frontier:在相近的修补成功率下,防御团队可以用更低成本运行更多次尝试。1
Gemini 3.8 Flash Cyber 在 CWE-Bench 上的准确率与每次运行成本
横轴是每次 rollout 的平均成本,纵轴是 pass@1;右上方同时代表更低成本和更高准确率。图中蓝色曲线标出 Google 所称的 Pareto frontier。1

真实代码案例把边界拉回工程现场

Google 给出了三组已经发生在内部或合作方环境里的结果:Chrome Security 团队称,3.8 Flash Cyber 生成的 Chrome 漏洞正确补丁数是更大商业模型的 2.6 倍;Wiz 在内部渗透测试基准上测到 7.5%–9.7% 的召回率提升,同时成本低 2.3–5.2 倍;Google Cloud Vulnerability Research 团队称,模型在 不到 2 小时内找到一个关键基础漏洞,而这类研究通常需要数月。1
这些案例的测量对象各不相同:Chrome 看正确补丁数量,Wiz 看内部基准的召回率和成本,Cloud 团队给出单个漏洞的发现时间。读者可以把它们当作部署信号,复现时还要准备自己的代码库、测试集、权限模型和 Agent harness。博客公开的信息尚未覆盖内部基准的任务规模、置信区间和失败类型,外部团队适合先据此形成方向判断。

Fairwind 把能力和访问控制绑在一起

Gemini 3.8 Flash Cyber 采用更宽松的网络安全缓解措施,Google 因此通过 Fairwind Program 向可信政府机构、关键基础设施运营商和软件维护者提供优先访问。Fairwind 页面把使用范围限定在内部网络安全、事件响应或渗透测试团队,并要求组织配置多因素认证。13
这项限制对应一个实际风险:网络安全模型需要更宽的能力窗口来发现和修复漏洞,同时也更容易被放进攻击性工作流。Fairwind 的准入和身份保护把模型能力放到可信防御者的组织边界里,访问条件因此成为产品设计的一部分。普通开发者可以使用 3.8 Flash 的通用能力,Cyber 版本的完整能力则需要申请项目访问。3
Google 还称 Gemini 3.8 系列在 Gray Swan IPI 基准上的提示注入攻击成功率明显下降。官方图表同时展示 ASR@1、ASR@10 和 ASR@15,数值越低越好;这项结果说明模型在该测试中的攻击成功率下降,范围仍然由 IPI 基准的攻击形式决定。1
Gemini 3.8 Flash Cyber 在 Gray Swan IPI 基准上的攻击成功率
图中 ASR@1、ASR@10、ASR@15 分别表示在 1 次、10 次和 15 次攻击尝试下的成功率;Google 官方图表将较低攻击成功率标为更好。1

复测时要锁住这些变量

  1. 模型与 effort。 分别记录 gemini-3.8-flash、3.8 Flash Cyber、lowmediumhigh,并保存具体 API 版本。
  2. 行动循环。 记录模型调用了几轮工具、每轮输出多少 token、是否执行代码和测试,以及失败后是否允许返工。
  3. 评测环境。 固定代码库版本、任务版本、编程语言、依赖安装方式和测试命令;CWE-Bench、CyberGym 与内部基准分别描述各自的任务集。
  4. 成本口径。 把输入 token、输出 token、工具运行费用和每次 rollout 次数分开统计;一次修补任务的总成本由这些变量共同决定。
  5. 安全拦截。 记录拒答、人工审批、权限限制、补丁验证失败和模型直接完成的比例;生产系统的最终结果来自模型、工具、护栏和人工流程的共同作用。
  6. 任务级结果。 保存发现的漏洞、补丁是否通过测试、误报、漏报、回归缺陷和修复耗时;平均成功率需要任务级记录才能解释。
Gemini 3.8 Flash 的公开证据支持一个具体判断:它把额外推理和工具循环投入长程任务,在 DeepSWE、金融、法律和多学科推理上较 3.7 Flash 取得更高结果;代价是高 effort 可能消耗更多 token。Gemini 3.8 Flash Cyber 的公开证据支持另一个具体判断:它在漏洞发现和补丁生成上争取更好的准确率—成本折中,真实价值取决于代码库、测试闭环、权限和 Fairwind 访问条件。1
对工程团队来说,下一步的判断方式也很明确:先用自己的长程任务测量 effort 与总 token,再用自己的漏洞数据测量补丁通过率和每次 rollout 成本。公开分数可以决定是否打开原文和准备复测,部署决策还需要任务级证据。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel