
从数据、记忆到触觉:本周 3 篇机器人 arXiv 精读
本期精读 ABC、ReGen、VibeAct 三篇机器人 arXiv 新稿,分别聚焦开放行为克隆栈、连续模仿学习的生成回放,以及基于振动触觉的灵巧手反应控制。
本期怎么选
本期继续只看论文原文:从 arXiv 标注为 2026 年 6 月 25 日提交、且主题落在 cs.RO / 机器人学习附近的新稿里,挑出 3 篇放在同一张图上看:一篇补齐行为克隆的数据与训练栈,一篇处理机器人策略连续学习中的遗忘,一篇把振动触觉接到灵巧手反应式控制里。上一期已经讲过的 E-TTS、LA4VLA、SSI-Policy 不再重复。
如果只用一句话概括:这 3 篇都不只是「再堆一个大模型」。ABC 试图把机器人行为克隆的公共基础设施做厚;ReGen 追问策略学新任务时旧技能怎么留住;VibeAct 则把视觉看不见的接触和滑移变成策略能用的反馈。
| 论文 | 机构线索 | 本期关注点 | 先看哪类读者 |
|---|---|---|---|
| Scalable Behavior Cloning with Open Data, Training, and Evaluation | UC Berkeley、MIT、Amazon FAR、XDOF、Carnegie Mellon University 等 | 开源机器人操作行为克隆栈 ABC,以及 ABC-130K 数据集 | 做机器人数据、BC/VLA 训练和真实评测的人 |
| World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays | University of North Carolina at Charlotte | 用 World Action Model 生成旧任务伪回放,缓解连续模仿学习遗忘 | 关心机器人基础模型持续适应的人 |
| VibeAct: Vibration to Actions for Contact-Rich Reactive Robot Dexterity | Carnegie Mellon University、Bosch Center for Artificial Intelligence | 用压电麦克风估计接触/滑移,再接入仿真训练的灵巧手策略 | 做触觉、灵巧操作、sim-to-real 的人 |
1. ABC:把行为克隆从「各家私有栈」往公共基建推
论文:Scalable Behavior Cloning with Open Data, Training, and Evaluation。作者包括 Arthur Allshire、Himanshu Gaurav Singh、Ritvik Singh、Adam Rashid 等,论文首页列出的机构包括 UC Berkeley、MIT、Amazon FAR、XDOF 和 Carnegie Mellon University。1
这篇论文解决的不是一个窄算法问题,而是机器人操作里一个更底层的矛盾:行为克隆看起来简单,但要在真实机器人上比较模型、数据、训练 recipe,往往被数据规模、硬件设置、训练基础设施和评测成本卡住。作者提出 ABC,一个完全开源的 manipulation behavior cloning stack;核心资产是 ABC-130K,arXiv 摘要称其包含约 3,500 小时遥操作数据、超过 130K episodes、覆盖 195 个任务。2
方法上的重点有三层。第一层是数据:ABC-130K 不只是放出少量演示,而是把任务多样性和 episode 数量做成主要卖点。第二层是可复现栈:论文同时开源硬件设置、训练基础设施和仿真流水线。第三层是评测前置:作者还释放 400 小时 sim-teleop 数据,并给出 co-training recipe,使仿真评测和真实世界评测具备相关性,从而在昂贵的真实机器人评测之前,用仿真代理来消融模型设计和训练决策。2
它的对比价值在于「把比较条件摆出来」。论文摘要明确说,作者比较了 Diffusion Transformer(DiT)和 Vision-Language-Action(VLA)模型中的常见架构选择,并把结论落到真实世界评测上;最终策略能完成 box folding、从钱包中取出信用卡等灵巧任务。2 这对读者的意义是:如果你正在判断一个机器人 BC / VLA 方案到底是模型强、数据强,还是评测设置有利,ABC 更像一套可复验的参照系,而不是单点 SOTA 声明。
需要留意的边界也很清楚。ABC 的贡献主要是开放数据、训练和评测栈;它并不等于证明某个策略架构在所有机器人任务上最优。co-training 提供的是「与真实世界评测相关」的仿真代理,价值在于降低消融成本,但最后的可信度仍要回到真实世界任务和硬件分布。2
读者判断:做机器人操作数据集、行为克隆训练、VLA/DiT 架构比较的人,应优先读这篇;只关心单个新算法 trick 的读者,可能会觉得它更像基础设施论文。
2. ReGen:让机器人策略「想象旧任务」,但不保存旧演示
论文:World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays。作者为 Manish Kumar Govind、Dominick Reilly、Smit Patel、Hieu Le、Srijan Das,论文首页机构为 University of North Carolina at Charlotte。3
这篇论文问的是连续模仿学习里的老问题:机器人策略按顺序学新任务时,旧任务会被遗忘;经验回放通常有效,但它要求保存旧任务的人类演示数据。作者的切入点是 World Action Models(WAMs):这类模型不只预测动作,也能生成未来视觉观测。ReGen 利用这个生成能力,在持续适应时递归查询 WAM,根据旧任务指令和当前任务观测,合成旧任务的 pseudo-replay trajectories。4
机制可以拆成两步:先让 WAM 以旧任务语言指令和初始视觉观测为条件,生成旧任务的伪演示轨迹;再把这些伪轨迹和新任务演示一起用于 fine-tuning。这样做的目标不是让模型「回忆」真实旧数据,而是在没有旧演示存储的前提下,给策略一个复习旧任务分布的训练信号。论文首页的介绍也把 ReGen 称为第一个把 WAM 本身作为原生生成式回放机制的持续学习框架。3
实验结果的关键数字是:在仿真和真实机器人操作设置中,相比 sequential fine-tuning,ReGen 将灾难性遗忘最多降低 50%,并接近 privileged experience replay 的表现;后者需要访问真实 replay 数据。4 这个结果的含义不是「生成回放已经替代真实回放」,而是说明 WAM 的生成接口可以承担一部分记忆功能,尤其适合旧数据不能保存、无法公开或存储成本过高的场景。
作者没有回避瓶颈。论文摘要和正文都指出,当前限制主要来自长时程视觉生成退化,以及生成动作和预测观测之间的不一致;正文进一步说,ReGen 相比 privileged ER 仍有性能差距,瓶颈在当前 WAM 的生成保真度。3 所以这篇最值得看的不是「50%」这个数字本身,而是它把机器人基础模型的持续学习问题,转化成了可诊断的生成质量问题。
读者判断:如果你关心机器人策略上线后的持续适应、旧任务合规存储、机器人 foundation model 的终身学习,这篇值得精读;如果你的系统可以长期保留完整旧演示,传统经验回放仍是必须比较的强基线。
3. VibeAct:把「听到的接触」变成灵巧手策略能用的观测
论文:VibeAct: Vibration to Actions for Contact-Rich Reactive Robot Dexterity。作者为 Yuemin Mao、Uksang Yoo、Jean Oh、Jonathan Francis、Jeffrey Ichnowski;论文首页机构为 Carnegie Mellon University 和 Bosch Center for Artificial Intelligence。5
VibeAct 的问题设定很具体:灵巧操作依赖接触和滑移事件,但这些事件速度快、位置局部,且经常被视觉遮挡。作者使用嵌入灵巧手指尖的压电麦克风采集 vibro-acoustic signals;这种信号带宽高、结构紧凑,但难点是原始振动声学波形很难被足够真实地仿真,因而不适合直接做端到端 sim-to-real 策略学习。6
它的核心设计是加一个物理中间表征,而不是让策略直接吃原始音频。真实世界中,机器人通过遥操作采集带振动声学信号的数据;然后在校准过的数字孪生中 replay 这些录音对应的轨迹和物体姿态,用仿真接触求解器自动标注每个手指的 contact 和 slip。接着,tactile estimator 学会从真实麦克风波形预测 contact / slip;控制策略则在仿真中使用同一套 contact / slip 表征训练。6
实验覆盖 5 个 contact-rich 任务,包括 regrasping、in-hand reorientation 和 insertion。论文摘要称,VibeAct 在仿真中持续优于 proprioception-and-point-cloud baseline;收益最大的是需要持续反应控制的任务,而 continuous slip-magnitude channel 是最有信息量的观测。论文正文还说明,策略在真实 dexterous hand-arm 平台上部署后,提高了 deployed tasks 的成功率。6
这篇的对比优势在于它没有试图「仿真原始触觉音频」。作者把难仿真的声学波形留给真实传感器和估计器,把可计算的 contact / slip 留给仿真策略训练;这个解耦让策略能使用快速触觉反馈,同时绕开原始音频模拟不准的问题。论文首页的引言也明确写到:estimator 解决 sensing problem,simulator 解决 control problem。5
边界同样来自这套解耦。VibeAct 的效果依赖压电麦克风嵌入、数字孪生校准、contact / slip 标签生成和每指估计器训练;如果换手、换材料、换安装方式,振动波形与接触事件之间的映射未必直接迁移。论文也提到,记录波形会受到 finger material、adhesive、mounting location、object texture、amplifier chain、background motor vibrations 等因素影响。5
读者判断:做灵巧手、触觉传感、接触丰富任务的人应优先读;如果你的操作任务主要靠低速视觉闭环,VibeAct 的价值可能更多体现在传感设计启发,而不是可以直接迁移的控制栈。
放在一起看:机器人学习的三个缺口
这 3 篇论文分别补三个缺口。
- 数据与评测缺口:ABC 说的是「没有公共数据、硬件、训练和评测栈,模型比较很难公平」。
- 记忆缺口:ReGen 说的是「机器人策略不能每学一个新任务就忘掉旧任务,而旧演示又不总能保存」。
- 传感闭环缺口:VibeAct 说的是「视觉看不到的接触和滑移,需要变成策略能稳定使用的反馈」。
因此,本期的共同线索不是某个统一架构,而是机器人学习从论文 demo 走向可复现系统时必须面对的三件事:数据栈要开放,持续学习要有记忆机制,控制闭环不能只依赖视觉。下周如果继续筛论文,我会优先关注那些不仅给出漂亮结果、也把数据、评测和部署边界讲清楚的工作。
References
- 1
- 2
- 3
- 4
- 5
- 6

具身智能与机器人 arXiv 论文精读
每周一 8:00 更新:从具身智能与机器人方向筛选 3 篇值得关注的 arXiv 论文,用中文基于论文原文讲清问题、创新、对比优势和局限。
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.