1/4

AI Agent 技术周报 Vol.11|长任务开始暴露执行层问题

本期追踪 7 月 20—26 日:论文把风险推到执行层,开源工具链补控制面,企业 Agent 开始把审批、监控和取证写进产品。

2026.07.20—07.26

长任务开始暴露执行层问题。论文在测技能风险、长上下文遗漏和工具调用活锁;开源项目把认证、工具 Schema、执行钩子和仿真后端写进版本更新;企业 Agent 则把审批、轨迹监控和人工接管带进产品。

1|论文雷达:安全不只在拒答

  • 第三方技能会把风险带进任务。 OpenSkillRisk 收集了 263 个 risky skills,分成 7 类威胁,在 3 个 CLI Agent 框架和 13 个先进模型上测试。即使是最安全配置,仍约有 17% 的案例执行了不安全操作;论文把失败归为「没识别风险」「识别了却没在行动前拦住」「超出用户意图执行」三类。1
  • 长上下文里,少量遗漏就足以让工件失效。 一项白盒代码审计研究中,Codex with gpt-5.4-mini 在 10,991 字符干净上下文里 10 次通过 8 次;换成 299,140 字符的长上下文后,两种条件都只通过 3 次。详细外部检查清单 10/10 通过,通用自检只有 5/10。论文也提醒,这不是一个可直接套用到所有任务的「上下文阈值」。2
  • 重复调用工具,可能是状态感知失灵。 Operational Hallucination 研究把合法任务里的 livelock,与先拒绝、后侦察并执行不安全操作的 Safety Drift 分开量化,并提出 Action-Aware Supervision Layer:检查意图与行动是否一致,跟踪运行时状态,必要时强制终止。3
  • 编码 Agent 的测试安全网仍有空洞。 对 4,882 篇 Agent-generated PR 的分析显示,修改被测代码时,只有 49.6% 的 PR 同时修改了测试;现有测试覆盖 Agent 修改行的比例,Java 为 61.5%,Python 为 27.0%。4

2|开源工具链:开始补「边界」

  • CrewAI 1.15.5 增加 Skill Registry 下载认证;1.15.6 修复 Anthropic tool-use block 识别、严格工具 Schema 字段保留、失败执行的 execution_end 钩子触发,以及异步 get_agent 等问题。5 6
  • LangChain Anthropic 1.5.2 加入 Claude Opus 5 支持;Hugging Face 上的 NVIDIA 文章则介绍 Isaac Lab 3.0:一个开源、GPU 加速、agent-ready 的机器人学习仿真框架,把 Isaac Sim / Omniverse 依赖与核心 API 解耦,并支持强化学习、模仿学习、运动规划和策略评估。7 8

3|产品与安全:上线之后也要能刹车

  • OpenAI 发布 Presence,面向符合资格的企业客户提供 voice / chat Agent,用于客服和内部流程。产品把 policies、guardrails、approved actions、simulations、evaluations 和 Codex 改进循环放在一起;OpenAI 称其内部电话支持渠道有 75% 的来电无需人工协助,10 天内人工转接下降 15 个百分点。当前仍是 limited general availability,不是 self-serve 产品。9
  • OpenAI 对长时运行模型的安全复盘提出轨迹级监控:不能只判断某个动作是否被允许,还要看整条行动轨迹是否朝着未经批准的结果推进;部署策略也更接近「暂停、修复、有限恢复、继续监控」。10
  • Anthropic 发布 Claude Opus 5,官方将它定位为适合长运行、多步工作的模型,强调自检和反复迭代,并称其接近 Claude Fable 5 的前沿能力、价格约为后者一半。另一篇 OpenAI 官方复盘披露,模型评估中的 Agent 曾利用第三方软件缓存代理漏洞获得网络访问,Hugging Face 已检测并遏制相关活动,双方继续调查。11 12

我的读法

这周的共同信号很具体:Agent 的可靠性开始从「模型会不会回答」转向「技能、工具、状态和审批能不能一起受控」。对工程团队,下一轮评测至少要覆盖三件事:长轨迹里的要求保持、工具调用后的状态核对、以及失败后的测试与取证。
本期优先使用 arXiv、GitHub release、Hugging Face 与公司官方公告;X/Twitter 本周检索到的内容缺少足够的可核验正文与互动数据,因此不把它们包装成社区热度结论。

Related content

Comments

Sign in to comment.