arXiv AI 前沿日报|8 月 4 日:工具规格、模型趋同与机器人闭环

本期回看 7 月 31 日首次提交的三篇论文:工具规格如何影响 Agent 安全、模型评委为何趋同,以及闭源机器人如何用部署反馈闭环微调。

本期说明

8 月 4 日早间没有可核验的当天新 v1 首次提交。本期按频道时间口径回看 72 小时,三篇论文均首次提交于北京时间 7 月 31 日;Reddit 没有取得对应的可核验原帖,因此不填 Reddit 数字。123

01|工具规格,会让 Agent 失去拒绝能力吗?

Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents(arXiv:2607.29254)把问题定位到工具规格的表示方式:schema 化工具描述会削弱模型内部的拒绝信号。SafeKeep 的做法是把安全判断与工具执行拆开:判断阶段读取扁平文本,真正执行时仍保留原 schema;方案不需要微调,也不需要访问内部激活。4
在 AgentHarm 与 InjecAgent 上,4 个 LLM 的有害请求平均拒绝率从 23.8% 提到 70.6%,观测级提示注入的平均攻击成功率从 25.6% 降到 2.5%。论文比较的既有防护包括 SafeJudge、SafePrompt、SafeHarbor。组件分解还显示,工具规格造成的平均 AUROC 下降为 0.136;换成扁平文本后,三个开源模型的 AUROC 回升到 0.885、0.845、0.898。1
边界也很明确:论文只覆盖 2 个基准和 4 个 LLM,白盒机制分析只在 3 个开源模型上完成;它是推理期防护,不是训练方法。4
作者与机构:Minghui Pan(Beijing University of Posts and Telecommunications);Jiayuxuan Yang(Beihang University);Yuanyuan Yuan、Yu Jiang、Zhenpeng Chen(Tsinghua University)。论文列出 Zhenpeng Chen 为通讯作者。4
社区信号偏弱:X 上 @shivam2003_dev 的具体解读帖页面显示 4 views、1 like、1 reply;Hacker News 对应条目显示 2 points、0 comments。两种平台口径不相加。56
Loading content card…

02|模型评委为什么会彼此趋同?

Language Models Agree With Each Other, Not With Readers(arXiv:2607.29274)没有另造一套人类评测,而是使用 Glasp 平台读者自发产生的 2,523 组标注:120 篇网页、78 个域名,每篇文档最多 60 名读者。论文把等长句集的重叠减去深度—长度带重采样后的期望重叠,作为一致性指标。7
在 18 个模型臂、11 家厂商、3 个国家和 3 代模型中,153 个模型对的一致性中位数为 +0.093,读者基准为 +0.040,前者约高 2.3 倍。99 个模型对完全高于人类区间,28 个低于。控制实验中,提示改写仍保留 91% 的效应;经典抽取式提取的 10 对中位一致性为 −0.002;分析完成后新发布的 4 个模型无一超过人类区间。7
限制不是小字注释:模型被给了任务,读者没有。研究者改成预测读者标注的目标后,只保留 39% 的自一致性,因此「指令存在」与模型能力退化还不能完全拆开。7
作者与机构:Kazuki Nakayashiki、Keisuke Watanabe,均来自 Glasp Inc.。7
社区信号同样偏弱:第一作者 @kazuki_sf_ 的 X 原帖页面显示 28 views、2 likes;Hacker News 对应条目显示 3 points、0 comments。89
Loading content card…

03|闭源机器人能不能靠部署反馈变专门?

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning(arXiv:2607.29172)针对只能调用托管 SFT API 的闭源权重模型:真实 rollout 先由奖励模型打分,再转成 API 可接受的监督数据,经过 SFT 后用优势 token 引导下一轮推理。整个过程不需要权重、梯度、似然或损失。10
在 Gemini Robotics On-Device(GROD)的 Box Packing、Cup Insertion、Bimanual Plate Handover 三项任务上,每任务每轮收集 100 次 rollout,跑两轮闭环。密集优势条件变体的成功率分别从 93% 提到 100%70% 提到 98%53% 提到 96%;直接 SFT 对比段另报告 Gemini 在 Bimanual 上 84% 对 π0.5 的 46%,Cup Insertion 上 88% 对 46%。10
这两组 Cup Insertion 数字不能直接合并:正文对比段与 Figure 5 使用的设定没有统一,图卡保留了两组口径。论文的可见限制是每轮都依赖真实机器人 rollout,成本高且有安全风险;目前只评估了一个开源权重模型。310
作者与机构:Yuxin Chen、Hari Srikanth、Nathan Jew、Menglin Wu、Pengcheng Wang、Masayoshi Tomizuka(University of California, Berkeley);Junli Ren、Peng Xu、Ran 「Thomas」 Tian(Google DeepMind);Jinyu Xie(NVIDIA Research)。arXiv 摘要同时写「8 other authors」但列出 10 名作者,本文按作者列表照录。10
社区信号为弱信号:X 上 @fly51fly 的真人帖子页面显示 205 views、1 like;没有找到对应的 Hacker News 或 Reddit 原帖。11
Loading content card…
这三篇论文的共同点不是一个新模型,而是把问题推进到部署现场:工具 schema 如何改变安全行为,模型评委如何形成趋同,以及闭源机器人如何用真实反馈迭代。社区互动量都不高,读者应把它当作筛选信号,而不是论文质量的替代指标。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments

Sign in to comment.