本周 3 篇机器人 arXiv:触觉 WAM、自监督 VLA、真实 RL 数据扩增

本周 3 篇机器人 arXiv:触觉 WAM、自监督 VLA、真实 RL 数据扩增

本期精读 VT-WAM、TAP、WorldSample 三篇 2026 年 7 月 2 日提交的机器人 arXiv 新稿,聚焦接触触觉建模、任务无关 VLA 预训练,以及用世界模型降低真实机器人 RL 交互成本。

本周三篇都在回答同一个问题:机器人策略到底该从哪里获得「物理感」。VT-WAM 把触觉形变做成动作生成的一部分;TAP 认为 VLA 先要从无语言交互中学会怎么动;WorldSample 则把真实 rollout 和世界模型合成数据接成闭环,用来降低真实机器人 RL 的交互成本。
我会把它们放在一起读,因为这三篇的共同点不是「又一个更大的模型」,而是把过去常被当作辅助材料的信号重新放到训练主路径里。

本期速览

论文解决的问题最关键证据主要限制
VT-WAM接触丰富任务里,视觉看不到滑移、压力和局部形变,直接把触觉当输入又容易被视觉信号压过去。论文提出 Visual-Tactile World Action Model,把未来视觉预测、触觉形变预测和动作预测放进统一 flow matching 框架。1在 6 个真实接触任务上,VT-WAM 平均成功率 71.67%,高于 Fast-WAM 的 45.00% 和 OmniVTLA 的 35.83%。1作者明确说本工作聚焦 individual-task specialization,多任务训练和 scaling law 还没有探索。1
TAPVLA 训练把「怎么动」和「按语言做什么」绑在一起,导致必须依赖昂贵的语言标注专家示范。TAP 先用任务无关交互做 inverse dynamics 预训练,再用少量专家数据做语言对齐。2在 SIMPLER 上,TAP-20k 的 Avg-All 为 33.32%,高于从头训练 BC 的 23.15%;真实 WidowX 实验中,TAP 用 30 小时自主探索和每任务 200 条专家轨迹,在视角扰动下仍保留 15%-25% 成功率,而 NORA 和从头训练基线为 0%。2失败分析里,作者把约 75% 失败归为语义和推理失败,说明底层物理先验改善了动作,但单一反应式 VLA 的指令保持和目标选择仍是瓶颈。2
WorldSample真实机器人 RL 每次物理 rollout 代价高,而且只覆盖一条实际发生的动作-结果路径。WorldSample 用真实 rollout 锚定世界模型,生成反事实轨迹,再用 Policy-Paced Learning 控制合成数据进入训练的时机和比例。3在 5 类真实操作任务上,WorldSample 平均成功率 82%,高于 HIL-SERL 的 56%;平均训练步数从 56K 降到 23K,训练时间从 83 分钟降到 64 分钟。3作者在局限中写明,当前框架主要处理单任务、相对固定场景分布;实例、任务、场景级泛化仍待解决。3

1. VT-WAM:把触觉形变纳入动作生成

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation 由中国科学院自动化所、国科大、TARS Robotics、新加坡国立大学和复旦大学团队完成,arXiv 分类为 cs.RO,提交时间是 2026 年 7 月 2 日。1
这篇论文抓住了接触丰富 manipulation 的一个硬问题:擦拭、剥皮、插接这类任务不只看全局画面,还要依赖局部压力、滑移、摩擦和形变;这些信息在腕部相机里要么弱,要么被遮挡,要么只在短暂接触阶段出现。1 过去一些 visual-tactile policy 已经把触觉观测喂给策略,但论文认为问题在于,模型没有显式学习「触觉形变随动作怎么演化」。1
方法上,VT-WAM 做了两件事。第一,它把 wrist camera 的未来视觉、触觉形变和动作 chunk 放进同一个 flow matching 目标里,让动作预测和触觉动态预测共用训练过程。第二,它用 Asymmetric MoT Attention 让 action token 只看第一帧视觉锚点和完整触觉序列,避免推理时还要生成未来视觉;同时用 AVTAG 在接触阶段鼓励 action query 更多依赖触觉证据。1
实验设置比较实在:xArm7 机械臂、Robotiq 2F-85 夹爪、腕部相机和两枚 Xense 触觉传感器;每个任务 100 条专家轨迹,6 个任务分为表面交互和约束插入两类,每个方法每个任务做 20 次独立试验。1 表面交互包括擦白板、擦花瓶、剥黄瓜;约束插入包括插插头、刷卡、插管。1
结果最有说服力的是表面交互:VT-WAM 达到 81.67% 成功率,Fast-WAM 是 56.67%,OmniVTLA 是 33.33%。1 在约束插入任务上,VT-WAM 也有 61.67%,高于 OmniVTLA 的 38.33% 和 Fast-WAM 的 33.33%。1 这说明提升不只是来自「多了一个传感器」,而是来自把触觉时序当作动作生成的条件。
消融也支持这个判断。Fast-WAM 在擦花瓶和插管上分别是 55% 和 25%;加上对完整触觉序列的非对称注意力后,两个任务升到 70% 和 50%;再加 AVTAG 后,擦花瓶升到 85%,插管升到 55%。1 如果只给 action query 第一帧触觉,擦花瓶和插管只有 40% 和 30%,这对「触觉动态」这个核心论点是比较直接的反证。1
局限也清楚:这不是一个已经证明可扩到多任务、多物体、多场景的大一统模型。作者把当前工作定位在精确触觉建模的 individual-task specialization,并把多任务训练和 scaling law 留作后续方向。1 如果你关心触觉 VLA 或接触反馈控制,这篇比单纯看主结果更值得读它的注意力设计和消融表。

2. TAP:先学「怎么动」,再学「按语言做什么」

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs 来自复旦大学和上海创智学院,arXiv 分类为 cs.RO,提交时间同样是 2026 年 7 月 2 日。2
这篇的假设很直接:VLA 数据贵,不只是因为机器人数据少,还因为现有训练把 observation、language instruction、action 三元组绑死了。作者把学习拆成两步:物理能力,也就是 how to move;语义对齐,也就是 what to do。只有后者必须要语言标注。2
TAP 的第一阶段用任务无关数据做 inverse dynamics:给模型两个观测帧,让它预测从前一帧到后一帧需要什么动作。论文使用两类便宜数据:已有数据集中原本会被丢弃的无关任务轨迹,以及机器人自主 random play 产生的无语言交互。2 第二阶段再用少量有语言标注的专家示范做行为克隆,把物理先验对齐到具体指令。2
论文的模拟实验在 SIMPLER WidowX 环境做了 4 个任务,并把成功拆成 Partial 和 Entire 两层:Partial 更像抓取等低层物理能力,Entire 才是完整任务完成。TAP-20k 的 Avg-All 是 33.32%,Standard BC 是 23.15%;Avg-Partial 是 45.82%,接近 Octo 的 42.30%,低于 π0 的 53.10%。2 这个结果的含义是:TAP 没有解决所有语义执行问题,但确实把底层抓取和接触能力往上抬了一截。
真实机器人实验更能看出它的边界。作者在 WidowX 250s 上做「把胡萝卜放到盘子上」和「把南瓜向左推」两个任务,每任务只给 200 条专家示范,Stage 1 用 30 小时自主 random play。2 在标准设置下,NORA 仍然强于 TAP;例如胡萝卜任务 NORA 为 65%,TAP 为 40%,推南瓜任务 NORA 为 85%,TAP 为 75%。2 但一旦加视觉干扰、背景纹理变化和视角变化,TAP 的韧性更好:视角变化下,TAP 在两个任务上保留 15% 和 25%,NORA 与从头训练基线都是 0%。2
这篇的局限不是作者藏起来的,而是写在错误分析里。真实 WidowX 失败中,约 25% 是执行和动力学失败,例如末端执行器滑脱、预抓取毫米级偏差、单视角造成深度歧义;约 75% 是语义和推理失败,例如在干扰物中抓错目标,或长时序任务中冻结、循环。2 所以 TAP 更像是给 VLA 补一层便宜的物理底座,而不是直接替代高质量任务数据或规划模块。

3. WorldSample:真实 rollout 牵住世界模型,合成数据再反哺 RL

WorldSample: Closed-loop Real-robot RL with World Modelling 来自南洋理工大学 PINE Lab、清华大学、中央南方大学和北京邮电大学等机构,arXiv 分类为 cs.RO,提交时间是 2026 年 7 月 2 日。3
它要解决的是另一个老问题:真实机器人 RL 可以突破 imitation learning 的示范覆盖限制,但物理交互太贵。一次真实 rollout 只给一条发生过的动作-结果路径,还可能带来硬件磨损、人工 reset 和安全成本。3
WorldSample 的做法不是让世界模型完全替代真实环境,而是让真实 rollout 和合成轨迹形成闭环。真实 rollout 一方面进入 policy learning,另一方面用来 post-train action-conditioned world model;世界模型再围绕真实动作序列做局部反事实扰动,生成合成 transitions;Policy-Paced Learning 决定哪些合成样本进入训练、什么时候进入训练。3 这里的重点是「围绕真实轨迹局部扩展」,而不是从任意动作先验里乱梦一堆视频。
真实实验使用 Galaxea A1X 机械臂、二值夹爪、侧视和腕部两台 RealSense D435i 相机,任务覆盖 Pushing、Insertion、Sorting、Pick & Place、Assemble 五类。所有方法用同一平台、观察设置、动作空间、奖励定义和干预协议,并用每任务 20 条人类示范初始化。3
主表里,WorldSample 平均成功率 82%,HIL-SERL 是 56%,VLAW 是 64%,WMPO 是 69%。3 与 HIL-SERL 相比,WorldSample 平均训练步数从 56K 降到 23K,训练时间从 83 分钟降到 64 分钟;插入和分类任务上分别达到 95% 成功率。3
世界模型质量也有单独评估。只用预训练模型时,PSNR 为 8.50、SSIM 为 0.334、LPIPS 为 0.743;加入 online rollout adaptation 后,rollout-only 模型达到 28.43 PSNR、0.906 SSIM 和 0.034 LPIPS;dual-view 版本达到 29.89 PSNR 和 0.925 SSIM。3 这说明它的生成质量不是凭通用视频先验硬撑,而是确实依赖在线机器人数据把世界模型拉回当前任务分布。
Policy-Paced Learning 的消融也值得看。插入任务上,完整 WorldSample 是 95% 成功率、10K 步、30 分钟;去掉 uncertainty-guided scheduling 后只有 61%;去掉 Q-aware selection 后是 76%;完全不用 PPL 虽能到 86%,但需要 32K 步和 69 分钟。3 这给出的结论很清楚:合成数据有用,但不能一股脑喂给 critic,否则容易把世界模型的幻觉变成价值估计偏差。
局限同样具体。作者写明,WorldSample 当前聚焦单任务和相对固定的场景分布;要扩到实例级、任务级或场景级泛化,还需要后续工作。3 这对想把它直接接到开放家庭机器人环境的人是个提醒:目前的证据更支持「在一个给定任务分布内降低真实 RL 成本」,还不能证明它能泛化到开放世界。

三篇放在一起看:本周的信号

第一,机器人学习正在把「数据来源」拆得更细。TAP 说语言标注不是学运动能力的必要条件,WorldSample 说真实 rollout 不只能当一条经验,还能锚定世界模型生成更多近邻经验;VT-WAM 说触觉不是附加输入,而是要进入动作生成的动态建模。123
第二,三篇都没有绕开真实机器人实验。VT-WAM 的核心结果来自 6 个真实接触任务,TAP 做了 WidowX 真实扰动评测,WorldSample 的主表来自 Galaxea A1X 在线 RL。123 这让它们比纯仿真或纯 benchmark 论文更适合作为本周精读对象。
第三,证据边界也都清楚。VT-WAM 还没有多任务规模化,TAP 的语义推理失败占主要比例,WorldSample 还在单任务和相对固定场景分布内。123 如果你只想找「马上能部署的通用机器人方案」,这三篇都还不够;如果你在找下一步提高物理交互能力的训练路径,它们给了三个可复现实验方向。

建议怎么读原文

如果只读一篇,优先读 VT-WAM。它的假设、模型结构、表格和消融链条最集中,适合快速判断触觉动态建模是否值得跟进。
如果你做 VLA 数据或自监督预训练,TAP 更有参考价值。尤其是它把 Partial / Entire 成功率拆开之后,能看出 physical grounding 和 semantic execution 的分工。
如果你关心真实机器人 RL 的交互成本,WorldSample 值得细读。它的重点不在「世界模型能不能生成漂亮视频」,而在怎样控制合成数据进入 actor-critic 训练,避免把生成误差放大成价值估计错误。
具身智能与机器人 arXiv 论文精读

具身智能与机器人 arXiv 论文精读

每周一 8:00 更新:从具身智能与机器人方向筛选 3 篇值得关注的 arXiv 论文,用中文基于论文原文讲清问题、创新、对比优势和局限。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.