模型会看哪里、Agent 如何协作、企业谁能看见:本周三条运行时更新

模型会看哪里、Agent 如何协作、企业谁能看见:本周三条运行时更新

从 Google 的主动视频取证、Antigravity 的多 Agent 协作到 Anthropic 的客户侧安全架构,拆清 Agent 运行时如何决定观察、协作与控制边界。

2026 年 8 月 27 日至 9 月 1 日,三条更新把 Agent 的“运行时”往前推了一步:模型开始主动决定该看什么,Harness 开始按任务组织一支会互相质疑的 Agent 团队,企业安全开始把监控数据和复核权放回客户自己的云环境。它们分别落在理解地图的 ②模型层、③Harness/运行时、⑥权限与安全、⑧产品形态与落地

1. Google agentic video understanding:模型开始主动决定看哪一段

(对应地图 ②模型层、③Harness/运行时
发生了什么: Google DeepMind 在 2026 年 9 月 1 日为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 发布 agentic video understanding。开发者把处理模式设为 agentic 后,模型可以在视频帧、音频和转写文本之间动态选择,搜索和重新扫描需要的时间片段。Google 公布的基准结果是:token 消耗最多下降 88%,分析成本最多下降 66%,准确率最高提升 7%。这项能力当日通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 提供。1
机制是什么: 传统视频分析先按固定帧率把整段视频送进模型,模型再从统一输入里找答案。Google 的新方案把“取哪一段、用多快的帧率、看画面还是听音频或读转写”变成 Agent loop 里的决策;模型通过内部工具加载相关片段,命中疑点后可以提高采样密度再看一遍。模型因此负责判断信息价值,运行时负责按需取数,token 预算也从“覆盖整段视频”转向“覆盖问题相关片段”。Google 的开发者文档把这种模式作为 API 参数 processing: "agentic" 暴露出来。2
面试可说句: > Google 这次把视频理解从固定采样改成了模型驱动的取证循环:模型先决定看哪里,再用工具补看关键片段;所以评估一个视频 Agent 时,我会把命中率、重采样行为和每个任务的 token 成本放在同一张表里,而不是只看最终摘要写得像不像。

2. Antigravity Teamwork:多 Agent 的价值在于会反驳的运行时

(对应地图 ③Harness/运行时、⑧产品形态与落地
发生了什么: Google Antigravity 在 2026 年 8 月 27 日发布 Teamwork 更新。Teamwork 是一个多 Agent 编排框架:Agent 可以在数小时或数天内提出候选、互相批评、修正并合并结果。框架会根据任务自动选择一种 pattern,并在运行中动态决定需要多少 Agent、运行多少轮。Google 披露的案例包括:用 Gemini 3.7 Flash 和 Teamwork 在 TCSBench 上取得 71%,构建能启动 xv6 的周期精确 RISC-V CPU 模拟器,和让 ParlayHash 初始插入吞吐提升 2 倍、内存占用减少 25%3
机制是什么: Teamwork 把“协作方式”从写死的流程代码里抽出来,变成描述 Agent 角色、推进条件和验收标准的 pattern。以 Long Proof 为例,多个候选策略并行生成,每个候选都配一个专门寻找漏洞的 falsifier;综合树把候选和反驳合并,失败路线保留在共享知识目录里,后续轮次继续利用。Agent 数量和轮数随任务变化,意味着 Harness 承担的核心工作不是简单并发,而是管理候选、反驳、依赖、状态和验收之间的关系。3
面试可说句: > Antigravity Teamwork 给我的启发是,多 Agent 产品的核心指标不是“同时开了多少个 Agent”,而是运行时能否让候选生成、反驳、综合和验收形成闭环;如果一个 pattern 没有独立的质疑角色和可检查的终态,增加并发只会更快地放大早期错误。

3. Anthropic Enterprise Frontier Safeguards:把监控和数据控制权交给客户

(对应地图 ⑥权限、安全与熔断
发生了什么: Anthropic 在 2026 年 9 月 1 日宣布 Enterprise Frontier Safeguards(EFS)。这套方案把零数据保留(ZDR)与前沿模型滥用检测结合起来:活动数据可以存放在客户自己的云账号、客户自己的加密密钥和访问策略下;自动监控在跨会话、跨账号的滚动窗口里寻找严重滥用信号,告警直接发给客户团队,Anthropic 不需要安排人工复核。EFS 将分阶段推送,目标是在 2026 年秋季晚些时候广泛提供,并支持 Claude Code、Claude Enterprise、Claude Platform 以及多家云平台。4
机制是什么: 前沿 Agent 的安全监控需要把多个会话和账号串起来看,零数据保留又要求服务商无法长期持有企业活动数据。EFS 的解法不是让客户在隐私和检测之间二选一,而是把活动数据、密钥、访问策略和审计日志放进客户控制的云环境,Anthropic 的自动系统执行模式检测,再把信号交给客户自己的安全团队判断。这个架构把“谁能看日志”“哪些数据进入监控窗口”“谁可以确认告警”拆成了不同的权限面,也把模型供应商和企业安全团队的责任边界写进部署形态。4
面试可说句: > EFS 说明企业 Agent 的安全设计不能只写“供应商负责监控”:跨会话检测需要数据留存,监管又要求客户掌握数据、密钥和人工复核权,所以我会把存储位置、加密密钥、告警接收方和人工查看权限分别列成上线验收项。

本期填入地图的三块

更新地图模块运行时新增动作面试抓手
Google agentic video understanding②、③动态选片、跨帧率重采样、在画面/音频/转写之间取证准确率与 token 成本一起评估
Antigravity Teamwork③、⑧按任务选择 pattern,动态调整 Agent 数量和轮次,保留反驳与失败状态并发数量不等于协作质量
Anthropic EFS跨会话监控、客户侧存储、客户侧人工复核把数据、密钥、告警和复核权限拆开验收
本期跨期口令可以再具体一层:目标写清 → 模型决定看哪里 → Harness 组织反驳 → 数据留在该留的环境 → 权限默认最小 → 随时能停。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel