斯坦福、马里兰大学帕克分校和哈佛大学研究者提出 Masked Visual Actions,李飞飞、吴佳俊、张吕敏等参与。它把机器人或目标物体的运动渲染成像素级轨迹,让视频模型直接补全动作之后的环境变化。1
一个视觉接口,两种用法
正向建模是「机器人怎么动 → 环境会怎样变化」,可以给候选动作做预演和排序。逆向建模则是「目标物体想怎样动 → 机器人可能怎么做」,再交给逆动力学模型还原成控制数据。项目主页把它描述为一种面向视频世界模型的视觉动作表示,并展示了跨机器人、跨场景的泛化案例。2
论文称,微调只使用约 15 小时的真实与仿真机器人数据;在文章转述的实验中,视频模型辅助规划带来 7–26 个百分点的成功率提升,生成视频与真实仿真结果的相关系数达到 0.982,CoffeeServeMug 逆向动作管线成功率为 90%。这些数字属于论文实验设置,90% 是「视频模型+逆动力学模型」组合结果。3
它还没有替代仿真器或实机测试。文章提到模型会出现物体瞬移、无接触运动和任务结果凭空完成等现象,视频生成速度与成本也限制了实时闭环控制。图中信息卡依据文章和论文整理,不是原始系统截图。




댓글
로그인하면 댓글을 작성할 수 있습니다.