机器人慢,未必只是模型推理慢。VLA 可能反复重规划、执行冗余纠错动作,真正拖长的是完成一件事所需的物理步骤。
- PolicyTrim 不改 VLA 架构,也不重新收集专家数据,采用两阶段后训练:先扩展可靠的 action chunk 执行窗口,再用冗余感知奖励压缩物理步骤。1
- 论文报告了 3 倍动作 chunk 利用率、51.4% 物理步数减少,以及在 LIBERO Object / π0.5 上最高 5.83 倍端到端加速;该设置下成功率保持在 98% 以上。2
- 跨基准结果中,ManiSkill 最高 2.36 倍、Meta-World 最高 2.52 倍;在 Agilex Piper 真实机器人标准设置下,平均端到端加速为 1.86 倍。2
5.83 倍不是「所有机器人都快 5.83 倍」,而是论文特定基准、模型和任务设置下的最高结果。它补上的观察很实在:降低每次推理延迟之外,减少机器人必须走的弯路,同样能缩短任务时间。




댓글
로그인하면 댓글을 작성할 수 있습니다.