
奇绩信号Alpha Sight 2026年7月17日【文字版】
本期重做 7 月 17 日 arXiv AI 论文速读,完整补齐四篇论文的方法图、训练曲线、消融图和关键实验表,帮助读者判断新型 agent RL、多图像推理、力觉 VLA 与视频遗忘的真实信号。
本期导读
本期重跑以 arXiv 在 2026 年 7 月 17 日的 cs.LG、cs.CV、cs.RO
new 列表为时间边界,筛出四篇彼此不重复、且方法与实验信号清晰的论文:把可回滚沙箱变成智能体强化学习的方差控制器,把力觉反馈接入 VLA 的后训练闭环,把视频生成的概念遗忘从「删掉关键词」推进到「逐帧检查残留」,以及用可控合成数据训练多图像分析推理。列表入口: cs.LG new、cs.CV new、cs.RO new。本期特别保留每篇论文原文中的方法图、训练曲线、消融图和关键可视化;原论文以 HTML 文字表格呈现的结果,则在对应小节用 Markdown 表格复现,不用一张总览图替代全部实验证据。
头条
1. 把沙箱的「可回滚」变成智能体强化学习的方差控制器:Branching Policy Optimization
信号源:阿联酋穆罕默德·本·扎耶德人工智能大学、麦吉尔大学、香港城市大学
🧭
认知提取
传统 GRPO、RLOO 把每条智能体轨迹都当成从起点独立出发的长链条;但 Web、代码和操作系统沙箱往往可以保存中间状态,再从同一状态分叉。BPO 的关键不是换一套损失函数,而是把 rollout 拓扑从「N 棵独立树」改成「一棵共享前缀、多个兄弟叶子的树」,让基线条件在真正产生不确定性的决策点上。论文的实验信号是:在相同采样预算下,BPO 在 WebShop、ALFWorld 和 SWE-bench Verified 上都超过强基线,同时把训练中的梯度方差压到约一半。1
论文摘要
- 问题:PPO、RLOO 和 GRPO 通常从同一初始状态采样独立轨迹;长程智能体任务的早期失误会把后续整条轨迹的回报方差放大。论文把沙箱视为确定、可快照、可恢复的状态机,而不是只能从头运行的黑箱。1
- 方法:BPO 先采样一条 backbone trajectory,在策略熵最高的决策点保存沙箱快照,再从每个分支点 fork 出多个兄弟动作并运行到终止;优势值由兄弟回报的 leave-one-out 基线计算。
- 结果:在 Qwen2.5-7B 上,BPO 的成功率为 WebShop 67.8%、ALFWorld 66.4%、SWE-bench Verified 29.8%;相对最强基线分别提升 4.3、5.2、4.7 个百分点。实验还覆盖 Llama-3.1-8B,说明收益不只绑定单一 backbone。2
- 证据范围:原文包含三张正文图和四张核心结果/消融表;下方按「方法 → 结果 → 消融与工程代价」展开。
核心方法
- 共享前缀的 rollout 树:每个 prompt 先产生一条 backbone;选出高熵决策点后,把状态恢复到快照,采样 K 个兄弟动作并分别运行到终止。总回报样本数按
1 + M(K−1)与 GRPO 的 N 条独立轨迹匹配。 - 局部兄弟基线:在分支点 t,某个兄弟的优势是自身 return-to-go 减去其他兄弟的平均 return-to-go;该局部信号再按 λ 向共享前缀传播。论文默认传播折扣 λ 为 0.95,并继续使用 PPO-clip 与 KL 约束更新策略。2
- 熵驱动调度:不是在低置信动作上平均撒分支,而是按 backbone 的决策级 Shannon entropy 选取前 M 个位置,并设置最小间距,避免分支预算集中在同一小段。
- 方法总览图:黑色为 backbone,红点为高熵分支点,灰色为兄弟分支;图中还标出局部 sibling-baseline advantage 如何回传到共享前缀。2

实验成果
主结果:Table 1,end-task success rate(百分比,Qwen2.5-7B,三次种子均值 ± 标准差)。2
| 方法 | WebShop | ALFWorld | SWE-bench Verified |
|---|---|---|---|
| SFT only | 51.3 ± 1.2 | 44.6 ± 2.1 | 14.6 ± 1.0 |
| PPO | 58.2 ± 1.8 | 54.7 ± 2.5 | 19.4 ± 1.3 |
| RLOO | 60.4 ± 1.5 | 58.3 ± 2.2 | 22.8 ± 1.2 |
| GRPO | 62.1 ± 1.4 | 60.5 ± 2.0 | 24.0 ± 1.1 |
| VinePPO | 63.5 ± 1.6 | 61.2 ± 2.3 | 25.1 ± 1.2 |
| BPO | 67.8 ± 1.3 | 66.4 ± 1.9 | 29.8 ± 1.0 |
- 收敛速度:BPO 在约 一千八百四十步达到 GRPO 的最终性能,而 GRPO 需要 三千步;论文报告训练更新量减少 三十八点七%,与摘要所述约 百分之三十八一致。
- 梯度方差曲线:BPO 在三类沙箱上都更快到达更高平台;其经验梯度范数方差约为 GRPO 的 0.42–0.58 倍,高质量、非退化 advantage 的步占比从 GRPO 的 71%提升到 BPO 的 94%。2


消融与工程代价:Table 2–4。2
| 分支宽度 K(WebShop) | 成功率 | 相对 GRPO 的梯度方差 |
|---|---|---|
| 1 | 62.4 ± 1.5 | 1.02 |
| 2 | 64.8 ± 1.4 | 0.71 |
| 4 | 67.8 ± 1.3 | 0.47 |
| 8 | 67.9 ± 1.4 | 0.43 |
| 16 | 66.5 ± 1.6 | 0.55 |
| 分支调度(K=4,M=4) | 成功率 |
|---|---|
| Lowest-entropy | 60.8 ± 1.7 |
| Uniformly random | 64.5 ± 1.4 |
| Equally spaced | 65.2 ± 1.5 |
| Highest-entropy(BPO) | 67.8 ± 1.3 |
| Oracle value disparity | 68.4 ± 1.2 |
| 环境 | 快照开销 | 达到 GRPO 最终成功率所需时间:BPO / GRPO |
|---|---|---|
| WebShop | 42 ms,约 0.6% rollout 开销 | 8.2 h / 13.5 h |
| ALFWorld | 138 ms,约 2.4% | 11.4 h / 17.0 h |
| SWE-bench Verified | 1920 ms,约 4.2% | 47.6 h / 74.1 h |
- 反思:K 从一增加到四带来主要收益,K=八把方差进一步压低但成功率只略增;最高熵调度比随机分支高 三点三个百分点,距离使用 held-out value disparity 的 oracle 只有 零点六个百分点。这说明「知道哪里不确定」比单纯扩大分支数量更关键。
总结与反思
- 结果总结:BPO 把沙箱的工程属性直接变成统计估计器的结构优势;在三个不同类型的可验证任务上,成功率、收敛速度和梯度稳定性同时改善。
- 局限性:收益依赖环境能否可靠快照与恢复;SWE-bench 的单次快照成本已达到 1920 ms,而论文主要验证的是确定性或近似确定性的可验证沙箱,不等同于开放世界工具环境。
- 前沿见解:下一步不是继续给 agent RL 加更复杂的 value model,而是重新设计「从哪里采样」的拓扑;当环境状态可复用时,训练与搜索之间的边界会变得更薄。
多模态
2. 多图像分析推理不只是看两张图:SD-MAR 用受控变化和 BDA 训练 VLM:SD-MAR
信号源:史蒂文斯理工学院、AWS AGI Foundations、亚马逊云科技(AWS)
🔍
认知提取
很多多模态 benchmark 让模型回答「图里有什么」,却很少要求它先找出多个视觉状态的差异,再解释差异背后的原因,最后完成多步推断。SD-MAR 把这个缺口做成可验证任务:通过属性级扰动构造图像对,再用 GRPO-lite 的 Backward Discounted Allocation 把更多信用分给真正做出结论的后段推理。结果不是只在新 benchmark 上涨分,Qwen2.5-VL-7B 在 SD-MAR-Mix 上达到 84.95%,并在 MathVista 上从 68.2%升至 72.2%。3
论文摘要
- 任务定义:给定代表不同状态的多张图像 V 和问题 q,模型先识别状态间的属性变化,再基于变化完成语义归因或定量比较;这被论文命名为 multi-image analytical reasoning。
- 合成数据:SD-MAR-TSE 覆盖 temporal、spatial、emotion 三类语义变化;SD-MAR-Math 从 GDP 时间序列渲染柱状图、折线图和表格,并按一跳、两跳和跨国家最大增长率构造难度。
- 训练:GRPO-lite 去掉 KL 正则与 advantage normalization;BDA 依照「感知 → 比较 → 归因 / 计算」的顺序,给后段决定性 token 更大的 reward credit。
- 结果:在 Qwen2.5-VL-7B 和 InternVL3-8B 上,SD-MAR 微调提升域内准确率,且 MME、MMMU-Pro、MathVista 大体保持在 ±1%范围;MMBench 在 InternVL 系列上最多提升约 4%。4


核心方法
- SD-MAR-TSE:先抽取变化类型、受影响属性和根因,再生成对齐 caption,用图像生成器渲染图像对,并用 CLIP 阈值过滤不一致样本;答案来自结构化 metadata,而不是人工凭感觉写出的解释。
- SD-MAR-Math:从 World Bank GDP 时间序列采样两个不相交时间区间,构造绝对差、百分比变化和跨国家最大增长率三档问题;正确答案由确定性的回溯过程生成。
- GRPO-lite:取消 KL 约束,保留 clipped policy update;移除跨难度混合的 advantage normalization,避免把简单题的稠密奖励和复杂题的稀疏奖励混在同一个标准化尺度里。
- BDA:若回答前段只是在描述单张图,后段才完成跨图比较和最终归因,则把后段的奖励按折扣向前分配,避免「看过了图」被误当成「完成了分析」。
实验成果
主结果:Table 1,Mix 训练后在三类测试集上的准确率。4
| 模型 | Mix | Math | TSE |
|---|---|---|---|
| GPT-4.1 | 80.95% | 89.33% | 65.33% |
| Qwen2.5-VL-7B base | 48.00% | 48.80% | 61.33% |
| Qwen-VL + GRPO-lite w/o BDA | 79.52% | 84.00% | 80.67% |
| Qwen-VL + GRPO-lite | 84.95% | 91.73% | 74.33% |
| InternVL3-8B base | 47.33% | 40.53% | 60.33% |
| Intern-VL + GRPO-lite w/o BDA | 51.14% | 50.00% | 60.67% |
| Intern-VL + GRPO-lite | 52.86% | 60.40% | 62.00% |
- Qwen 的三项平均提升约 二十九点零%,InternVL 约 十五点四%;Qwen 的 Math 测试从 四十八点八%升到 九十一点七三%,是最醒目的跨能力增益。
- 训练动态:图三比较 GRPO 与 GRPO-lite 的 reward;图四比较去掉 BDA 与完整 BDA 的 reward / entropy。两图共同显示,BDA 主要改善 Qwen 的后段收敛,InternVL 的收益更小且更不稳定。4




泛化与评审:Table 3–5。
| 模型 / 基准 | base | SD-MAR 微调后的关键结果 |
|---|---|---|
| Qwen2.5-VL-7B / MMBench | 82.6 | GRPO-lite 最高约 84.53,系列平均约提升 1.5% |
| InternVL3-8B / MMBench | 81.7 | GRPO-lite 最高约提升 4%,超过 Ovis2-16B 的公开结果 |
| Qwen / MathVista | 68.2 | 最高 72.2 |
| InternVL / MME | 2415.4 | 最高约 2422.0 |
| GPT-4.1 评审维度 | Qwen GRPO-lite:base → fine-tuned | InternVL GRPO-lite:base → fine-tuned |
|---|---|---|
| Logic | 8.28 → 8.86 | 8.09 → 8.42 |
| Clarity | 8.28 → 9.09 | 8.05 → 8.52 |
| Overall | 8.29 → 8.82 | 8.14 → 8.39 |
所有关键训练与消融图:图五至图七。图五包含 DAPO、GRPO、GRPO-lite 三套方法各自的 advantage、entropy、CoT length、reward 四类曲线;图六给出三条数据轨道的 γ 总览;图七拆开 Math、Mix、TSE 的 γ 对比。4
















- 反思:SD-MAR 把「看见差异」和「解释差异」拆成可验证的中间结构,但合成图像的真实度、caption 与渲染器的耦合仍可能带来 shortcut;表二也显示 Math → TSE 的迁移通常强于 TSE → Math,说明两类推理并非同一能力。
总结与反思
- 结果总结:受控视觉变化 + 可验证答案 + 后段信用分配,让开放 VLM 在多图像分析上获得大幅域内提升,同时没有明显牺牲通用多模态能力。
- 局限性:主要监督来自合成数据与选择题式答案;对真实医学、遥感和机器人视频中的连续状态变化,外推边界仍需更强验证。
- 前沿见解:多模态推理的下一个瓶颈可能不是更大的视觉编码器,而是把「差异」「根因」「结论」做成可检查的中间变量。
具身智能
3. VLA 不是没有力觉,而是力觉来得太晚:LIFT 把反应式力注入接到后训练:Never Too Late for Force
信号源:上海交通大学、上海创新研究院、南方科技大学、Noematrix Ltd.
🦾
认知提取
视觉驱动的 VLA 在物体还没有接触时表现很好,但一旦进入插入、折叠和套环等接触状态,遮挡、深度歧义和微小的力误差会把动作推离离线演示分布。LIFT 不重写原来的 VLA,而是在旁边复制一个 reactive action expert,把最近的六维末端力编码成 causal force memory,并用零初始化 cross-attention 注入动作刷新。它把「保留原有视觉先验」与「在接触瞬间听力觉纠错」放进同一个后训练闭环。5
论文摘要
- 问题:预训练 VLA 的视觉输入在接触遮挡和力反馈突变时不够充分;只用离线视觉演示会遇到 policy-dependent distribution shift。
- 方法:LIFT,即 Late Reactive Injection of Force for VLA Post-Training,复制基础 action expert,新增 reactive action expert;最近的六维力 / 力矩进入 causal memory,再通过零初始化 cross-attention 注入 within-chunk action update。
- 训练闭环:第一阶段用 handheld 的视觉-only 数据对齐;第二阶段在 Flexiv Rizon 4S 上把人类纠正的在线轨迹与离线 task-alignment 数据混合,执行 online DAgger。
- 结果:在 towel folding、book insertion、Hanoi ring placement 三项真实操作中,LIFT 都比 vision-only post-training 更快达到更高表现;去掉 online DAgger 后,book insertion 直接降到 0。6

核心方法
- 旁路式 reactive expert:原始 vision-language stack 不变,reactive branch 从预训练 action 权重复制初始化;力觉注入 cross-attention 零初始化,使增广策略在初始时与原模型输出等价。
- 移位因果注意力:每个 reactive token 可以看视觉语言前缀、后续 base-action tokens 和 causal reactive prefix;因此近期力觉可改变当前 action chunk,又不会破坏原始动作先验。
- 两阶段在线闭环:先视觉-only 对齐,再在真实机器人上收集 contact correction;训练端与机器人端循环更新,而不是把一次性示范当成最终分布。



实验成果
实验平台是 Flexiv Rizon 4S 七自由度协作机器人,末端为 Robotiq 2F-85 夹爪,腕部 RGB 相机与位置控制均为 10 Hz;每个 checkpoint 做 10 次 autonomous rollouts。6
- 样本效率曲线:在 towel folding 上,完整 LIFT 在约 二点八 K样本达到 0.825峰值;vision-only online DAgger 在约 三点一 K样本只有 0.725。在 book insertion 上,LIFT 达到 0.6,vision-only 对照为 0.4;在 Hanoi ring placement 上,LIFT 最终维持 0.6,对照降到 0.2。
- 力觉记忆消融:在 book insertion 上,去掉 reactive force injection 的峰值约 0.4,完整 LIFT 为 0.6;在 Hanoi ring placement 上,单帧力觉分支后续从 0.5掉到 0附近,说明接触历史比单个力觉快照更有用。
- 在线数据消融:LIFT w/o Online DAgger 在三个任务上都更差,book insertion 直接降到 0;在线纠正样本覆盖了离线示范没有覆盖的突发接触力模式。




- 失败模式:towel folding 常见空抓和二次折叠定位偏差;book insertion 包括与槽壁碰撞、中途释放、到槽底后继续推和 spine-pushing 定位错误;Hanoi ring placement 的主要失败是带角度误差插入导致环卡在杆上。6
总结与反思
- 结果总结:LIFT 的贡献不是给 VLA 加一个传感器输入,而是让力觉在动作 chunk 内拥有因果的、可持续更新的控制路径,并用在线纠正数据闭合分布。
- 局限性:实验集中在三种接触丰富的桌面任务和单一机器人平台;论文报告的是性能曲线与案例图,尚未证明在更长时程、跨形态机器人上同样稳定。
- 前沿见解:具身模型的后训练可能从「视觉策略微调」转向「状态反馈通道设计」;反应式力觉记忆是把基础模型先验接入真实物理世界的一种低破坏路径。
多模态安全
4. 视频概念遗忘不能只看 prompt:SIRUS 在采样时抑制目标残留并按视频评估:Inference-Time Concept Suppression
信号源:中国科学技术大学
🧪
认知提取
图像概念擦除常把问题简化成「目标还在不在」;视频里,目标可能只在某几帧残留,也可能在时间上持续出现,过度抑制还会连主体、场景和运动一起删掉。SIRUS 不更新文本编码器和去噪网络,而是从目标概念的 textual aliases 构造子空间,定位 prompt 里的目标证据,再在扩散采样时减去带时间调度的 concept residual。它把视频遗忘的验收拆成遗忘、保留、质量、越狱鲁棒性和效率五条轴。7
论文摘要
- 问题:T2V unlearning 既要跨帧抑制目标概念,又要保留非目标主体、动作、场景与时间结构;单纯关键词拦截或输出筛选不能解决生成内部的残留。
- SIRUS:Subspace-Informed Residual Unlearning during Sampling。它从 alias 的上下文 token 构造正交概念子空间,用 hierarchical trigger 识别精确词、相似词和保守 fallback,再做局部 prompt projection。
- 采样干预:SIRUS 建立 positive concept-reference branch,估计可能把目标概念重新带回来的 denoising 方向;对这个 residual 做幅度限制、momentum 平滑和时间窗衰减,再从普通 classifier-free guidance 预测中减去。
- 结果:在 CogVideoX 的五个概念上,平均 video-level forgetting success 为 七十点四%、frame-level hit 为 二十五点七%;VideoEraser 对应为 四十四点四% / 四十七点二%。SIRUS 的平均 VBench 质量变化为 −零点零一六,VideoEraser 为 −零点零四三。8

核心方法
- 概念子空间:把多个 alias 填入上下文模板,用冻结文本编码器抽取 alias token,中心化后取奇异方向并正交化;目标不是把一个词替换成黑名单,而是得到可捕捉语义变体的局部子空间。
- 分层触发与局部投影:exact alias 提供高精度触发,subspace similarity 捕捉 paraphrase;仅对触发 token 做
e' = e − αP_B(e),其它 prompt token 保持不变。 - 正向参考分支:从 reference prompt bank 按相似度检索 concept-reference condition,暴露当前上下文中可能恢复目标的方向;该分支不直接生成最终视频,只用于估计 residual。
- 时间调度:residual 相对普通 text residual 限幅,再用 momentum 平滑;在设定的 erase window 内做 cosine decay,降低后期对纹理、运动连续性和非目标内容的干扰。

实验成果
CogVideoX 五概念遗忘结果:Table 1。每格为「视频级成功率 / 帧级目标命中率」,前者越高越好,后者越低越好。8
| 方法 | Nudity | Church | Garbage truck | Parachute | Van Gogh style | 平均 |
|---|---|---|---|---|---|---|
| SIRUS | 80.0 / 15.9 | 48.0 / 45.5 | 80.0 / 16.8 | 50.0 / 43.6 | 94.0 / 6.6 | 70.4 / 25.7 |
| VideoEraser | 52.0 / 39.4 | 34.0 / 58.0 | 30.0 / 57.9 | 28.0 / 60.5 | 78.0 / 20.4 | 44.4 / 47.2 |
| Refusal Vector | 28.0 / 65.5 | 4.0 / 93.8 | 10.0 / 88.0 | 4.0 / 94.6 | 92.0 / 6.9 | 27.6 / 69.8 |
保留与视频质量:Table 2–3。
| 方法 | LPIPS ↓ | CSDR ↓ | CLIP Ratio | VBench Quality | ΔQ |
|---|---|---|---|---|---|
| CogVideoX baseline | — | — | — | 0.834 | — |
| SIRUS | 0.643 | 8.552 | 1.012 | 0.818 | −0.016 |
| VideoEraser | 0.675 | 8.529 | 0.976 | 0.791 | −0.043 |
| Refusal Vector | 0.460 | 8.677 | 0.967 | 0.784 | −0.013 |
组件消融:Table 4。8
| 版本 | Success | Frame Hit | Person Retain | VBench |
|---|---|---|---|---|
| Full SIRUS | 80.0 | 15.9 | 78.5 | 0.8056 |
| w/o concept-reference branch | 42.0 | 47.6 | 87.9 | 0.8089 |
| w/o hierarchical trigger | 56.0 | 34.4 | 81.4 | 0.7987 |
| w/o subspace projection | 62.0 | 31.2 | 75.4 | 0.8125 |
- 组件含义:移除 concept-reference branch 后 success 从 80.0降至 42.0,是最明显的遗忘损失;而去掉投影会让 CLIP Ratio 降至 0.9586,显示保留与遗忘之间存在真实权衡。
- 跨 backbone:Wan2.2 上平均 success 为 73.6%,frame hit 为 21.9%;其中 garbage truck 的 success 为 94.0%、frame hit 为 3.8%,Van Gogh style 的 success 为 98.0%、frame hit 为 2.1%。




附录中的关键逐概念表:Table 6–9。为避免把长表格塞成数据库导出,下面保留每张表的目的与 SIRUS 的关键行;完整原始表格仍可由同一 HTML 入口核对。8
| 原表 | 覆盖内容 | SIRUS 关键结果 |
|---|---|---|
| Table 6 | Any-hit:任一采样帧出现目标 | Nudity 30.0、Church 74.0、Garbage truck 28.0、Parachute 64.0、Van Gogh 10.0 |
| Table 7 | Nudity 细分保留 | Success 80.0、Frame hit 15.9、Person retain 78.5、VBench 0.806 |
| Table 8 | 逐概念 LPIPS / CSDR / CLIP Ratio | CogVideoX 的 Nudity 为 0.5945 / 10.0053 / 1.0014;Van Gogh 为 0.6813 / 8.8031 / 0.9376 |
| Table 9 | 逐概念 VBench 与分项质量 | 原文按概念列出 Quality、Subject、Background、Motion、Aesthetic、Imaging 和 ΔQ;本文不对缺失于可读摘录的数值做猜补 |
总结与反思
- 结果总结:SIRUS 的价值在于把概念定位、局部 prompt 编辑和采样轨迹干预拆开,平均遗忘率提升的同时,视频质量下降小于 VideoEraser。
- 局限性:parachute 这类大面积、跨帧持续出现的目标仍是失败案例;部分效率表格的具体数值在当前可读原文摘录中没有完整呈现,因此不作补写。
- 前沿见解:视频 unlearning 的核心评价单位不能停留在 prompt 或单帧;「目标是否在任何帧残留」「人物是否被误删」「时间质量是否崩坏」需要同时进入门禁。
本期结语
四篇论文共同指向同一个研究信号:下一阶段的 AI 系统不会只靠更大的 backbone 解决问题,而会把系统中原本被忽略的结构变成训练信号。BPO 使用可回滚状态降低 agent RL 方差,SD-MAR 用可控差异生成可验证的多图像推理,LIFT 把接触力觉接入视觉策略的因果通道,SIRUS 则把视频遗忘从静态关键词控制推进到采样轨迹与跨帧评估。它们的共同风险也很明确:结构假设一旦离开受控环境,快照的可靠性、合成数据的真实性、在线纠正的覆盖度和持续概念残留都需要重新验证。
関連コンテンツ
- ログインするとコメントできます。
