1/4

AI Agent 技术周报 Vol.10|从会聊天到能值班

本期聚焦 2026.07.13–07.19:前瞻记忆、工具侧经验、AG-UI 工作流、自动化红队与社区讨论,一起补齐 Agent 的持续执行和安全边界。

过去一周,Agent 的短板被拆得更细:它要记住将来要做的事,工具也要积累跨任务经验,界面协议、安全机制和社区讨论则开始跟着执行链一起补齐。

01 记忆不只要存,还要按时做

PM-Bench 把「记住」拆成了一个更接近真实工作的任务:在持续处理其它事情时,判断某个延迟任务是否已经到期。论文用 7 天模拟周测试 8 种 Agent 配置,最佳 GPT-5.4 Agent 只有 65.1% F1。阅读 PM-Bench · Benchmark 代码
MemCon 处理的是另一半:记忆什么时候取、取多少、何时重查、合并或忘掉。它用一个在线学习的轻量控制器决定这些操作,不增加额外 LLM 调用;论文在 6 个 benchmark、3 个 Agent 框架和 3 个模型骨干上报告了最高 15.2 个百分点的任务成功率提升,同时减少 5%–20% token 消耗。阅读 MemCon · 代码

02 Agent 工作流接上两层基建

ToolAtlas 把经验的归属从 Agent 移到了工具提供方:服务端维护工具能力、失败边界和跨工具组合的记忆图,再让不同 Agent 复用。论文在覆盖 8 个 MCP 服务的两个 benchmark 上测试,报告最高 21.61% 的 pass@1 相对提升,而且不需要每个 Agent 重新训练或在任务时重新探索。阅读 ToolAtlas · 代码
AG-UI 则处理另一端:它用开放、轻量的事件协议,把 Agent 后端、实时用户上下文和前端应用接起来。GitHub 的 2026 年 7 月 15 日最新 release 列出 .NET 包 AGUI.Abstractions、AGUI.Formatting、AGUI.Protobuf、AGUI.Client 和 AGUI.Server,版本均为 0.0.4。查看 AG-UI Release

03 Agent 上线前,先过两道闸

OpenAI 的 Workspace Agents 帮助页当前列出一套可共享、可定时、可 API 触发的工作流:Agent 可以接入 ChatGPT、Slack、应用、自定义 MCP、skills 和 files。页面还写明了角色权限、写操作审批和 Connector Action Constraints;其中 API 触发会排队并返回 202 Accepted,当前不返回 run ID 或 Agent 响应。查看 Workspace Agents
安全侧,OpenAI 在 7 月 15 日公布 GPT-Red,一个通过自博弈训练的内部自动红队模型。它在复现的间接提示注入场景中,攻击成功率为 84%,人类红队员为 13%;OpenAI 还称,经过 GPT-Red 生成的攻击训练后,GPT-5.6 在最难的直接提示注入 benchmark 上失败次数降至此前最佳生产模型的六分之一。阅读 GPT-Red

社区雷达

X 上 7 月 19 日一条 Agentic coding 讨论获得 18,053 次浏览、520 个赞、77 条回复和 26 次转发。发帖者说自己写代码时不用 MCP、subagents、coordinators、memory systems、loops 或 graphs,批评社区过度追逐工具配置,观点落点是先计划、写代码、交付结果。这是一条高互动观点,不是 benchmark 或产品评测。查看原帖
Hugging Face 在 7 月 15 日发布 Inkling 介绍:Thinking Machines 的开放模型支持图像、文本和音频输入,页面称它具备 agentic capabilities,并支持 1M context;博客还给出了用 Pi coding agent、llama.cpp 和 MCP 做实验的路径。阅读 Inkling 介绍 · 模型页
这期的共同信号很具体:Agent 需要记住未来任务,也需要知道何时少取一点上下文;工具经验要能跨 Agent 复用,执行入口要有权限和红队测试,社区还会追问这些复杂配置到底有没有带来更好的产出。PM-Bench、MemCon 和 ToolAtlas 都是论文中的受控实验,GPT-Red 目前仍是 OpenAI 内部模型,数字应按各自的测试设定来读。

関連コンテンツ

コメント

ログインするとコメントできます。