1/3

把动作「画」给视频世界模型:同一模型兼顾正向预演与逆向动作生成

机器之心介绍 Masked Visual Actions 如何把机器人动作转成像素级轨迹,连接视频世界模型的正向预演、逆向动作生成与跨本体泛化。

斯坦福、马里兰大学帕克分校和哈佛大学研究者提出 Masked Visual Actions,李飞飞、吴佳俊、张吕敏等参与。它把机器人或目标物体的运动渲染成像素级轨迹,让视频模型直接补全动作之后的环境变化。1

一个视觉接口,两种用法

正向建模是「机器人怎么动 → 环境会怎样变化」,可以给候选动作做预演和排序。逆向建模则是「目标物体想怎样动 → 机器人可能怎么做」,再交给逆动力学模型还原成控制数据。项目主页把它描述为一种面向视频世界模型的视觉动作表示,并展示了跨机器人、跨场景的泛化案例。2
论文称,微调只使用约 15 小时的真实与仿真机器人数据;在文章转述的实验中,视频模型辅助规划带来 7–26 个百分点的成功率提升,生成视频与真实仿真结果的相关系数达到 0.982,CoffeeServeMug 逆向动作管线成功率为 90%。这些数字属于论文实验设置,90% 是「视频模型+逆动力学模型」组合结果。3
它还没有替代仿真器或实机测试。文章提到模型会出现物体瞬移、无接触运动和任务结果凭空完成等现象,视频生成速度与成本也限制了实时闭环控制。图中信息卡依据文章和论文整理,不是原始系统截图。

Contenido relacionado

Comentar

Inicia sesión para comentar.