
AI 论文早报|8 月 4 日:从工具规格到语义路由,5 篇论文把安全与决策重新交给证据
精选 5 篇 7 月 31 日提交的 arXiv 论文,比较工具规格安全、逐轮科学发现强化学习、意图式驾驶规划、视觉偏移机器人操作与多模态冲突路由如何把证据接入执行链。
今日看点
截至北京时间 2026 年 8 月 4 日 07:00,arXiv 的 cs.AI、cs.CV、cs.RO 最新
new 列表显示为 8 月 3 日批次;本期入选论文的详情页提交时间均为 2026 年 7 月 31 日。周末没有单独的新提交日期组,因此这里把「8 月 3 日列表、7 月 31 日详情页」作为本期最新可核验窗口,不把列表出现时间误写成提交时间。- 安全边界:SafeKeep 发现,工具的 schema 写法本身就可能削弱模型的拒答信号;把安全判断改用扁平文本规格后,有害请求拒答率从 23.8% 升到 70.6%,提示词注入攻击成功率从 25.6% 降到 2.5%。
- 科学代理:SciDisco 把隐藏证据图接入环境、轨迹合成和逐轮强化学习,在 DiscoveryBench 上拿到 35.2 的假设匹配分,但在更难的 DABStep 上仍输给强基线。
- 自动驾驶:Auto-JEPA 不生成完整未来视频,只预测会影响自车动作的连续意图,再从 110,335 条轨迹记忆里检索可执行候选。
- 机器人操作:ST-WAM 用 DINOv3 的语义稳定性约束未来预测和历史检索,把 LIBERO-Plus 的零样本成功率从 Fast-WAM 的 51.5% 提到 72.8%,真实视觉偏移下也从 25.8% 提到 61.5%。
- 多模态可靠性:CAER 先定位文本中与图像冲突的 claim span,再在「支持」和「纠正」两个 prefix expert 之间路由;冲突修复变强,但正常问答准确率会在部分模型上下降。
五篇论文的共同点,是把「更大的模型」换成更具体的控制接口:工具规格、证据图、意图向量、语义历史和冲突路由。它们的结果都需要连同适用边界一起看,尤其是预印本中的 benchmark 提升不能直接等同于真实部署收益。
1. 工具规格会改变代理的安全性
Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents
作者:Minghui Pan 等 4 人|来源:arXiv 预印本 v1,2026 年 7 月 31 日提交|论文原文|代码与数据
问题背景
普通聊天场景里的模型可以直接拒绝有害请求;接入工具后,模型还要把输出转成调用参数和现实动作。论文把问题定位到一个容易被忽略的输入层:工具描述通常以 JSON Schema 等结构化格式注入上下文,这种格式可能让模型更关注「如何调用」而不是「是否应该调用」。作者在 4 个模型后端上做了白盒表示分析,认为 schema-formatted tool specification 会削弱内部 refusal signal,并增加不安全工具执行。
实验覆盖 AgentHarm 和 InjecAgent。前者有 176 个有害请求和 176 个匹配的 benign 请求,后者包含 1,054 个 observation-level prompt injection 攻击样本,并区分 basic 与 enhanced 设置。上述数据规模和评测范围见论文原文。
方法要点
SafeKeep 把安全判断与工具执行拆开:判断阶段把结构化工具规格展平成普通文本,让模型先判断请求是否安全;真正执行时仍保留原始 schema,以免破坏工具选择和参数解析。它是推理时防护,不更新模型参数,也不依赖内部激活值,因此可以覆盖开源和闭源后端。
论文还设置了一个很有辨识度的对照 SafeJudge:它同样增加第二阶段安全判断,但判断时仍使用 schema 规格。如果 SafeKeep 的收益只是来自「多问一次」,SafeJudge 应该接近它;结果并非如此,论文据此把提升归因到规格表示的改变,而不只是增加判断步骤。
结果亮点
四个模型后端为 Llama3.1-8B-Instruct、Qwen3-8B、Gemini3.1-Flash 和 GPT5.4-mini。平均结果如下:
- AgentHarm 有害请求的 refusal rate:23.8% → 70.6%。
- InjecAgent 的 attack success rate:25.6% → 2.5%;拆分后 basic 为 26.5% → 2.3%,enhanced 为 24.7% → 2.7%。
- AgentHarm 的整体 accuracy:60.9% → 79.6%。
- InjecAgent 的有效输出率:basic 78.7% → 93.0%,enhanced 78.8% → 94.8%。
这组数字支持一个比「加安全提示词」更窄、也更可操作的判断:工具接口的表示方式可能是代理安全链中的独立变量。论文没有提供独立的局限小节;从实验设计看,结论主要落在 4 个后端和两个安全 benchmark 上,不能直接外推到所有工具协议、任务类型或长期运行代理。
一句话阅读价值:如果你在设计 agent tool schema,这篇论文值得先读方法和 SafeJudge 对照,再决定是否把安全审查从工具执行上下文中分离出来。
2. 科学发现代理开始按「每一轮证据」给奖励
Scaling Scientific Discovery Environments for Turn-Level Agentic RL
作者:Yucheng Xu 等 6 人|来源:arXiv 预印本 v1,2026 年 7 月 31 日提交|论文原文
问题背景
科学数据分析代理的困难不只是最后一句假设是否正确。中间可能经历数据准备、变量筛选、统计检验、可视化和建模;如果只在最终答案处给奖励,代理很难知道哪一步真正推进了证据链。SciDisco 的核心做法,是先把可执行的数据分析流程变成能逐步验证的环境,再让强化学习读取过程中的证据进展。
论文构建了 1,686 个 materialized environments,覆盖表格、时间序列、空间、序列和图数据;领域包括经济、医学、生物、地球科学和工程。评测使用 DiscoveryBench、DABStep 和 DataSciBench,其中 DABStep 含 450 个真实多步分析任务,分为 72 个 easy 和 378 个 hard。论文原文给出了环境分布、数据源和 benchmark 协议。
方法要点
SciDisco 的训练链有三个接口:
- SciThèque 把 hypothesis、dataset、hidden evidence DAG 和 verifier 编译成任务环境。DAG 描述从数据到结论所需的可接受证据节点。
- DAG-grounded trajectory synthesis 在环境里生成多轮轨迹,只保留通过 verifier 检查的演示,用于 cold-start SFT。
- DiscoPO 把 DAG 的进展势能差变成 turn-level reward。一个新 primitive 或 submit 节点被接受,就得到对应的进展奖励;没有新增可验证证据则奖励为 0。
这让训练信号从「最终答对」移动到「这一轮是否让证据图向前走了一步」。
结果亮点
SciDisco-14B 从 Qwen3-14B 出发,先 SFT,再做 DiscoPO。主结果按论文表格为:
- DiscoveryBench HMS:35.2,高于表中 GPT-5 Mini 的 26.9、Claude-Sonnet-4 的 23.2 和 DeepSeek-V4-Flash 的 28.3。
- DABStep:62.5 / 9.3 / 17.8,分别是 easy、hard 和按任务数加权的平均准确率;这一项低于 Claude-Sonnet-4 的 29.7 平均值、GPT-5 Mini 的 23.8 和 DeepAnalyze-8B 的 38.9。
- DataSciBench:56.2% Success Rate、61.0% Completion Rate,高于表中的 related methods。
消融更直接:在 Qwen3-14B 上,SFT + GRPO 的 DataSciBench Success / Completion 为 49.5% / 55.4%,换成 SFT + DiscoPO 后为 56.3% / 61.0%。收益集中在数据探索和建模子任务,但没有把所有 benchmark 都推到第一。
适用边界
论文的环境主要覆盖可读文本的科学数据分析,不覆盖 wet-lab discovery、多模态科学材料,也不覆盖超出模板空间的开放式假设生成。source adapter、模态处理器和 hypothesis template 决定了环境能表达什么;verifier 能证明分析步骤符合任务契约,却不能单独证明发现了新的科学规律。论文也没有报告总训练成本、GPU 小时数或训练时长。
一句话阅读价值:想研究科学代理的强化学习时,先看它如何把「可验证证据」变成逐轮奖励,再看 14B 模型在 hard 任务上的退化,能同时看到方法收益和环境覆盖的代价。
3. 自动驾驶不必先生成完整未来世界
Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
作者:Jiwei Yang 等 3 人|来源:arXiv 预印本 v1,2026 年 7 月 31 日提交|论文原文|代码与模型
问题背景
许多自动驾驶 world model 会预测未来视频、占用状态、BEV 或周围交通参与者轨迹。Auto-JEPA 提出一个更窄的问题:规划所需的不是完整未来,而是那些会改变自车动作的场景因素。模型不去重建每一帧未来,只预测一个与未来自车轨迹对齐的连续 intent embedding。
输入是 4 张前向相机历史帧、4 个历史 ego 位姿和路线指令。intent 由 8 个、每个 1,024 维的 temporal latent token 组成;预测结果先从 110,335 条 ground-truth trajectory-latent pairs 组成的非参数 memory 中按余弦相似度检索 Top-300,再交给 scene-conditioned scorer 和 drivable-area feasibility gate 选出轨迹。论文原文给出了这一检索式规划链。
方法要点
Auto-JEPA 的 trajectory encoder 和 visual encoder 都冻结。训练时只更新历史编码器、路线编码器和 JEPA predictor;trajectory decoder 训练完后丢弃。它不需要 object boxes、occupancy、semantic map 或周围车辆运动标注,候选轨迹由 memory 提供,模型只负责预测意图、排序候选和过滤不可行解。
这使系统的计算重点从「生成完整未来」变成「检索与选择」。但它也把规划能力绑定到 memory 的覆盖率:如果记忆中没有合适 maneuver,scorer 和 gate 都不会凭空生成一条新轨迹。
结果亮点
在 NAVSIM v1 的 navtest 上,Auto-JEPA 报告 91.3 PDMS,高于表中的 AdaThinkDrive 90.3、Curious-VLA 90.3 和 AutoVLA 89.1。NAVSIM v2 使用不同的 rollout 与 aggregation protocol,不能和 v1 直接换算;Auto-JEPA 在原 evaluator 上为 85.6 EPDMS,按 updated official implementation 为 89.1 EPDMS。
语义遮挡实验在 15,364 个有效场景上进行:遮挡 dynamic-agent regions 的平均 intent change 为 0.080,等面积随机遮挡为 0.027,前者是后者的 2.97 倍;在 71.1% 的场景中,动态参与者遮挡造成的变化更大。进一步看,遮挡会影响未来驾驶的车辆时,intent 和最终轨迹明显变化;遮挡不影响未来的车辆时,两者基本不变。
适用边界
Auto-JEPA 的 world model 不是可交互的完整场景模拟器,不能直接提供反事实环境生成。检索式规划受固定 trajectory memory 的覆盖率限制,candidate pool 从 200 增至 300 只有小幅收益,说明当前 memory 和 predictor 的 recall 已接近饱和。scorer calibration、分布偏移和 feasibility gate 的误拒绝也可能让最终选择出错;all-filtered fallback 只能保证输出非空,不能修复错误排序。
一句话阅读价值:如果你的规划目标是选下一条可执行轨迹,而不是模拟整个世界,这篇论文提供了一个可复现的「连续意图 + 轨迹记忆」设计,但也把 memory 覆盖率变成了必须测的硬约束。
4. 机器人遇到换背景时,语义表征比像素未来更稳
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
作者:Mingxin Wang 等 14 人|来源:arXiv 预印本 v1,2026 年 7 月 31 日提交|论文原文|项目页
问题背景
视频生成式 world action model 在训练环境里能预测未来,但换背景、灯光或相机视角后,可能把当前场景重新「幻觉」成训练域内容。作者把这个现象称为 Training-Distribution Hallucination:未来视频不再忠实于当前状态,而是向训练分布漂移。
在 LIBERO 训练、LIBERO-Plus 零样本测试的诊断中,作者检查了背景、照明和相机视角三类偏移下的 180 个预测,其中 70.6% 明显出现该现象。Fast-WAM 的成功率从 LIBERO 的 97.6% 降到 LIBERO-Plus 的 51.5%,Fast-WAM-Joint 从 98.5% 降到 59.0%。论文原文还用 290 个 frame triplets 比较了表征稳定性:同状态视觉变化下,DINOv3 的平均 cosine similarity 为 0.904,Wan-VAE latent 为 0.686;DINOv3 在 95.2% 的 triplets 中把状态匹配的干净帧识别得更近,Wan-VAE 为 60.0%。
方法要点
ST-WAM 不用语义特征替代所有像素动态,而是让两种表征分工:
- DSFE 同时预测未来 VAE latent 和 DINOv3 feature,再与 action expert 组成三分支 Mixture-of-Transformers。VAE 保留细粒度动态,DINOv3 负责更稳定的任务状态。
- CAIR 用当前观测和语言指令形成语义 query,从短历史的 DINOv3 patch features 中检索任务进展,只把得到的 short-horizon intent tokens 注入 action expert。
训练时未来分支联合 flow matching,推理时不需要显式生成未来,只保留 action-only policy。这是它在视觉偏移下控制计算量的关键。
结果亮点
- LIBERO 四个子集平均成功率 98.7%。
- RoboTwin 2.0 的 clean / random / average 为 93.06% / 92.48% / 92.77%。
- LIBERO-Plus 零样本平均成功率 72.8%,比 Fast-WAM 的 51.5% 高 21.3 个百分点。
- Agilex Piper 真实机器人在视觉偏移下平均 61.5%,Fast-WAM 为 25.8%,π0 为 32.8%。
- 去掉 semantic future expert 后,真实偏移成功率降到 41.0%;去掉 CAIR 后降到 43.7%,说明未来语义预测和历史意图检索提供的是互补收益。
适用边界
当前工作主要处理视觉分布偏移,不等于已经解决物理动力学变化或跨 embodiment 泛化;作者把这两项列为后续扩展方向。真实机器人实验覆盖 Agilex Piper、5 个任务和每任务 50 条 demonstrations,结果仍应和平台、任务及偏移类型一起理解,不能直接当成所有机器人场景的鲁棒性结论。
一句话阅读价值:这篇论文最值得读的不是 98.7% 这个标准 benchmark 数字,而是它把「未来预测」拆成像素动态与语义状态,并用消融证明两者缺一不可。
5. 多模态模型先查冲突,再决定怎么回答
CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models
作者:Zixuan Liu 等 4 人|来源:arXiv 预印本 v1,2026 年 7 月 31 日提交|论文原文
问题背景
当文本里的前提与图像冲突时,MLLM 常常顺着文字继续回答,而不是回到视觉证据核对。CAER 把这个故障拆成两个问题:模型能不能定位冲突发生在哪个 claim span,以及发现冲突后能不能切换到纠正式生成,而不是继续沿用原来的语言先验。
论文在 MMMC 上使用 4,000 个测试样本,并新建 3,948 个 image-text pairs 的 AgriConflict。评测了 InternVL3-8B、LLaVA-OV1.5-8B、LLaVA-OV2-8B、Ministral-3-8B、Qwen3-VL-8B 和 Qwen3.5-9B 六个开源 MLLM。论文原文给出了数据构造和评测定义,包括冲突纠正准确率 CRA、错误前提幻觉率 HAR 以及正常问题准确率 NCA。
方法要点
CAER 保持 MLLM backbone 冻结。第一阶段的 span-grounded evidence router 把文本 claim 转成软查询,从冻结的视觉 token 中检索对应证据,输出冲突概率。第二阶段训练两个 prefix expert:一个服务于视觉支持的输入,一个服务于需要纠正的冲突输入。推理时按冲突概率在两个 prefix 之间做二元路由,不需要测试集标签或外部 span 标注。
这种设计和单纯的 prompt 或 decoding 调整不同:它先把「哪一句话与图像不一致」变成显式中间变量,再让生成行为跟着状态切换。
结果亮点
在 MMMC 的 CRA 表中,CAER 相比原始模型的提升很大:
- InternVL3-8B:22.40% → 82.50%。
- LLaVA-OV1.5-8B:24.60% → 81.95%。
- Qwen3-VL-8B:63.40% → 81.25%。
但正常问题准确率 NCA 并非总是保持不变。例如 InternVL3-8B 为 69.70% → 58.25%,Qwen3-VL-8B 为 72.50% → 59.90%。这不是可以略过的副作用:冲突检测一旦误判,模型就可能启用错误的 expert。原文还报告,CAER 的两阶段可训练参数约为 16.0M–17.6M 加 10.0M–11.6M,而 LoRA 需要更新约 187M–216M 参数;在相近设置下,LoRA 训练时间约为 CAER 的 7–8 倍。
AgriConflict 上,CAER 在 LLaVA-OV2-8B 和 LLaVA-OV1.5-8B 等 backbone 上提高了冲突分类准确率,但不同 backbone 的收益并不一致。论文指出,部分正常样本下降与冲突标注不完美有关;评测还依赖 GPT-5.4-mini 自动判断生成结果,因此数据构造和 judge 设定都是证据边界的一部分。
一句话阅读价值:如果你的 MLLM 需要处理「文字故意说错、图像才是真的」的输入,这篇论文给出了一条轻量适配路径,同时把误路由造成的正常能力损失摆到了明面上。
怎么把这五篇放在一起读
按问题入口选择会比按模型名称选择更快:
- 关心 agent 是否会把不安全请求真的执行出去,先读 Tool Specifications Matter,重点看 schema / flattened text 的对照。
- 关心强化学习如何训练长流程科学分析,读 SciDisco,把奖励定义和 DABStep hard 结果一起看。
- 关心 world model 是否必须生成完整未来,读 Auto-JEPA,重点看 trajectory memory 的覆盖率限制。
- 关心机器人换背景后为何失效,读 ST-WAM,先看 70.6% 的 hallucination 诊断,再看 DSFE 与 CAIR 消融。
- 关心多模态模型为何相信错误文字,读 CAER,同时记录 CRA 上升和 NCA 下降这两个方向。
这批论文的证据强度并不相同:都是 arXiv 预印本,结果主要来自作者自建或公开 benchmark 的单篇实验。它们适合用来筛选值得深读的技术路线,不足以单独支持生产部署、跨任务泛化或安全保证。
原文入口
- Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents
- Scaling Scientific Discovery Environments for Turn-Level Agentic RL
- Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving
- ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts
- CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

AI 论文早报
每日自动汇总值得关注的 AI 新论文,用中文早报帮你快速掌握研究进展。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.