
模型路由、物理设备、双盲评测:Agent 正在补哪三层基础设施
用 Snowflake 动态模型路由、Anthropic Model Hardware Standard 和 Google DeepMind 双盲评测,拆清 Agent 在模型层、环境与状态、评测与指标上的三处新变化。
面试官问「Agent 下一步要补什么」时,三条近期更新给出了三个很具体的答案:模型要按任务步骤分配,环境要能描述并控制真实设备,评测要让双方都无法提前看到对方的秘密。覆盖窗口为 2026 年 8 月 18 日至 9 月 1 日,三条分别落在理解地图的 ②模型层、⑤环境与状态、⑦评测与指标。
1. Snowflake 动态模型路由:每一步都要算一次“够用的模型”
(对应地图 ②模型层)
发生了什么
Snowflake 在 8 月 18 日发布的文章介绍了 Cortex AI Gateway 的动态模型路由。系统会在 Agent 执行的每一步,选择“有把握完成任务的最便宜模型”;低复杂度、重复性工作交给更高效的模型,需要更深推理的工作再交给前沿模型。Snowflake 同时强调,路由只使用管理员批准的模型,遵守数据驻留设置,并记录每次路由决定。1
Snowflake 给出的内部测试包括两组结果:在 dbt 数据流水线任务中,动态路由的 token 效率最高达到只用前沿模型方案的 3 倍;在编码任务中,工程团队保持相同的 pull request 吞吐量,同时少用约 25% 的 token。文章注明,这些结果来自 Snowflake 内部测试,方法和条件需要另行索取,实际结果会随任务和配置变化。1
机制是什么
Agent 的模型选择单位从“一次会话”变成了“一次执行步骤”。同一项任务可能先做摘要,再调用工具处理数据,最后处理风险判断;每一步需要的推理能力、延迟和成本都不同。路由器因此要读取当前请求、上下文和执行策略,再在候选模型中选择满足质量门槛的那一个。
这套机制把模型层和运行治理接在了一起。只有管理员批准的模型能进入候选池,数据驻留限制决定请求能去哪,路由日志则让团队知道每一步由谁处理。模型路由由此拥有三个可验收字段:质量是否过线、单位结果成本是多少、选择是否符合组织规则。Snowflake 的内部数字可以说明潜在收益,不能单独替代面向真实业务的质量评测。
面试可说句
Snowflake 的动态路由让我把“模型层”理解成按 Agent 执行步骤做预算:先用便宜模型处理可预测环节,遇到复杂度或质量风险再升级,同时把批准模型、数据驻留和路由日志放进同一个控制面。面试一个企业 Agent 产品时,我会要求团队同时报每步的质量、token 成本和路由理由,而不是只报一个平均准确率。
2. Anthropic Model Hardware Standard:Agent 的环境开始包含设备知识
(对应地图 ⑤环境与状态)
发生了什么
Anthropic 在 8 月 27 日开放了 Model Hardware Standard(MHS)研究预览,首批参与者是科研实验室和先进制造商。MHS 为硬件提供标准化驱动,把不同设备翻译成 Agent 可以理解的
read 与 write 原语,也让设备以统一格式被发现。一个设备的驱动还可以用自然语言标签写入重量、可测量项目、可调参数和安全上限,再自动生成设备参考文件。2MHS 让 Agent 通过 MCP、命令行和代码文件控制设备,并协调显微镜、液体处理器、机械臂、摄像头等仪器。Anthropic 记录的早期项目包括:卡内基梅隆大学把分布在三台电脑上的四类设备用于连续稀释实验,速度约提升到原来的 3 倍;QuEra 的量子计算设备用 Agent 控制激光系统,激光锁定可在无人干预下以 99.3% 的成功率恢复。研究预览仍要求专家监督,当前设备需要具备可编程接口。2
机制是什么
Agent 的环境不再只是一个能读写文件的沙箱。真实设备有物理属性、操作范围、速度、相互碰撞的风险和会随时间变化的状态。MHS 把这些信息写进驱动和参考文件,让 Agent 在规划动作时能看到“这个设备是什么、能做什么、哪些值不能越过”。
MHS 还把探索性推理和确定性执行分开。Anthropic 观察到,Claude 可以先调整激光、通过摄像头观察结果,再反复修正;当 Agent 找到稳定步骤后,它会把经验写成代码文件,让设备连续执行一整段动作。这样,Agent 的在线推理负责探索和异常判断,代码与设备负责重复执行,长任务也更容易留下可恢复的状态。
面试可说句
MHS 说明环境设计要把设备的能力、物理限制和实时反馈一起交给 Agent。做机器人或实验室 Agent 时,我会把验收拆成三层:设备能否被标准方式发现,驱动是否带着安全边界,Agent 找到稳定流程后能否把它固化成可审计、可重复执行的代码;只接一个 API 还不能算完成环境建设。
3. Google DeepMind 双盲评测:评测环境也要防止“提前看题”
(对应地图 ⑦评测与指标)
发生了什么
Google DeepMind 在 8 月 27 日公布一项双盲 AI 评测试点,与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用 Gemini Flash Lite 模型接受机密基准测试。试点使用 Google Cloud Confidential Space:外部评测方看不到 Gemini 的模型权重,Google 也看不到评测方的测试提示。3
Google DeepMind 解决的是 benchmark contamination,也就是模型或模型提供方提前接触测试题后,分数被抬高的问题。过去的高风险外部评测通常要在两种风险之间选择:评测方交出题目,模型方可能提前看到;模型方交出权重,模型知识产权又会暴露。双盲试点用加密隔离把两边的数据和权重分别封在自己的边界内。3
机制是什么
评测的可信度不仅由题目和评分规则决定,还由 Agent 运行评测时能看到什么决定。若模型方可以读取题目,或者评测方可以读取权重,双方都拥有改变评测结果的机会。Confidential Space 把模型、题目和执行过程放进可加密验证的计算环境,再让双方只拿到约定的评测结果。
这使评测从“发布一个分数”变成了一套可审计的测量协议:谁提供测试集,谁提供模型,谁能看到中间数据,谁负责验证环境,都需要写清楚。对于网络安全、政府采购等高风险 Agent,分数的可重复性和数据主权会直接影响外部机构是否愿意采用结果。双盲试点首先修复的是测量条件,尚未等同于证明某个模型在所有 Agent 任务上更强。
面试可说句
Google DeepMind 的双盲评测提醒我,Agent 指标要先问“测试时谁能看到什么”。如果模型、题目和运行环境没有隔离,分数很可能混入数据污染和信息泄漏;我会把机密测试集、加密运行环境、第三方验证和结果审计一起列为高风险 Agent 的评测基础设施,而不是上线后再补一张排行榜。
本期填入地图的三块
| 更新 | 地图模块 | 新增的工程判断 | 面试抓手 |
|---|---|---|---|
| Snowflake 动态模型路由 | ②模型层 | 按执行步骤在质量、成本、延迟与治理之间选模型 | 质量门槛 + 路由理由 + 单位结果成本 |
| Anthropic MHS | ⑤环境与状态 | 把设备能力、物理边界和可恢复流程写进 Agent 环境 | 发现设备 + 约束动作 + 固化稳定流程 |
| Google DeepMind 双盲评测 | ⑦评测与指标 | 先保护测试条件,再解释模型分数 | 机密题目 + 加密隔离 + 第三方审计 |
跨期口令仍然可以压缩成一句话:目标写清 → 工具接对 → 环境真隔离 → 权限默认最小 → 随时能停。 本期补上的三个细节是:模型路由要按步骤算账,真实环境要携带设备知识,评测环境要让分数具备可相信的出处。
References
- 1
- 2Previewing the Model Hardware Standard
anthropic.com
- 3Piloting the world's first double-blind AI evaluations
deepmind.google
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
