2026 年 9 月 2 日,Google 同时发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber。普通版被定位为软件工程、Agent 任务和专业领域多步推理的通用工作模型;开发者文档显示,
gemini-3.8-flash 已在 Gemini API 中正式可用,支持 1M 上下文、64K 输出,以及 low / medium / high 三档 thinking level。Cyber 版专注漏洞发现与自动修复,通过 Fairwind Program 向受信防御方开放。12这次发布真正值得产品团队判断的问题是:模型可以连续规划、调用工具、检查结果并修改代码以后,企业还要把什么锁在模型外面?我的判断是,安全边界正在从“给 Agent 配什么权限”推进到“让每一条长程行动链都经过验证、全程可观察、随时可停止、出现问题可回滚”。这句话是基于发布材料形成的产品解读。
长程能力把风险单位改成了行动链
Google 对 3.8 Flash 的解释很具体:复杂任务会执行更多推理步骤,迭代调用工具,并在途中检查结果。开发者文档也把 thinking level 做成可调参数,高 effort 会换来更多推理工作,同时消耗更多 token。12
当模型只返回一段答案时,产品主要审查答案内容。当模型进入代码库后,模型可能读取文件、运行测试、根据结果重试,再写入补丁。每一次工具调用都会增加任务状态,每一次重试都会增加新的路径,每一次写入都会留下副作用。于是,权限范围仍然重要,工具入口、运行环境、写入闸门、审计记录和停止条件也必须同时进入产品设计。
这也是“长程 Agent 上线”的关键变化:企业要审查的对象从一条调用扩大为一条可重放的行动链。产品需要知道 Agent 看到了什么、调用了什么、改动了什么、哪一次检查放行了下一步,以及谁能在中途停止任务。
Fairwind 先收紧模型入口
Fairwind 的规则把“谁能使用”拆成了组织、身份、岗位和用途四道门。参与组织需要接受背景核查,并使用用户级身份、抗钓鱼多因素认证和适用的访问控制;组织只能把 Gemini 3.8 Flash Cyber 交给内部网络安全、事件响应或渗透测试团队,还要追踪员工的访问与使用。授权威胁模拟、逆向工程,以及面向防御或学术研究的恶意软件分析属于允许的双用途任务。Fairwind 同时禁止共享、转售和再分发模型访问。3
这套安排说明 Google 正在把能力强弱和交付范围绑定:普通 Flash 面向更广的开发者与企业工作流,Cyber 版因为网络安全缓解措施更宽松,只交给需要完整防御能力的受信方。Google 的 Frontier Safety Framework 也把前沿能力的滥用缓解作为模型部署的一部分。14
Fairwind 解决的是模型访问控制。客户仍然要管理模型进入哪些代码库、可以调用哪些工具、能够使用哪些凭证、可以写入哪些分支,以及生产环境是否允许执行。模型拿到合规身份,客户的运行时才刚刚开始承担责任。
基准分数说明能力,距离上线许可还有多远
Google Fairwind 页面披露,Gemini 3.8 Flash Cyber 在 CyberGym 上的 Pass@1 为 86.2%;同一页面把对照模型写作 Fable 5,成绩为 47.8%。这组数字属于 Google 发布材料中的评测口径。CyberGym 官网说明,榜单结果由各团队自行提交,Agent 运行具有随机性。CyberGym 的主要 Level 1 任务从漏洞描述和包含目标漏洞的代码库出发,要求 Agent 生成可复现漏洞的 PoC;开放式漏洞发现属于单独的研究轨道。356
修复侧的数字更能说明上线距离。Fairwind 页面披露,CWE-Bench 上 Gemini 3.8 Flash Cyber 的 Pass@1 为 47.2%,Fable 5 为 47.8%。Pass@1 表示一次尝试通过率,工程团队还需要观察失败类型、回归测试、程序等价性和人工审核结果。Google 的 CodeMender 流程会先生成代码 diff 或 PR,再用模型判断程序等价性,最后等待开发者批准后入库。37
因此,榜单适合回答“模型在某种评测口径下能做到什么”,上线流程需要回答“模型在我的代码、我的凭证和我的故障预算里能被允许做到什么”。前一个问题属于能力测量,后一个问题属于运行时治理。
产品应该怎样把能力变成受控闭环
- 从只读扫描开始。 Agent 先读取限定代码库,输出漏洞线索、证据和修复建议。只读令牌把模型的发现能力与写入副作用分开,团队可以先评估误报、漏报和任务成本。
- 把验证放进隔离沙盒。 需要复现漏洞或运行测试时,Agent 只能进入客户管理的沙盒。沙盒要限制网络、文件系统、凭证和执行时间,并保留完整运行记录。
- 让小范围修复经过人审。 Agent 只能提交小块 diff 或 PR,自动检查要覆盖构建、测试和程序行为等价性;开发者审阅改动后,系统才允许进入金丝雀环境。
- 最后才扩大到受限令牌和自动回滚。 产品可以按仓库、分支、工具、时间和预算收紧令牌范围,同时记录每次调用与写入。自动回滚和人工停止开关需要在扩大权限前完成验证。
这四步把 Fairwind 的“谁能碰模型”与客户自己的“模型能碰什么”接在一条回路上。长程 Agent 的上线单位,最终应当是一条可验证、可停止、可重建的行动链。
来源与口径
本文使用的性能数字均按 Google 发布材料标注,并把这些数字保留在官方评测口径内;基准通过率也保留为能力信号。关于 Cyber 版的地区可用性、独立模型卡和具体获准组织名单,公开页面目前只给出有限信息;本文聚焦已核验的发布范围与产品机制。
References
- 1
- 2What's new in Gemini 3.8 Flash
ai.google.dev
- 3Fairwind Program
deepmind.google
- 4Strengthening our Frontier Safety Framework
deepmind.google
- 5CyberGym
cybergym.io
- 6
- 7CodeMender: AI Agent for Code Security
cloud.google.com


Comments