PolicyTrim:VLA 提速,不只优化单次推理

机器人慢,未必只是模型推理慢。VLA 可能反复重规划、执行冗余纠错动作,真正拖长的是完成一件事所需的物理步骤。
  • PolicyTrim 不改 VLA 架构,也不重新收集专家数据,采用两阶段后训练:先扩展可靠的 action chunk 执行窗口,再用冗余感知奖励压缩物理步骤。1
  • 论文报告了 3 倍动作 chunk 利用率、51.4% 物理步数减少,以及在 LIBERO Object / π0.5 上最高 5.83 倍端到端加速;该设置下成功率保持在 98% 以上。2
  • 跨基准结果中,ManiSkill 最高 2.36 倍、Meta-World 最高 2.52 倍;在 Agilex Piper 真实机器人标准设置下,平均端到端加速为 1.86 倍。2
5.83 倍不是「所有机器人都快 5.83 倍」,而是论文特定基准、模型和任务设置下的最高结果。它补上的观察很实在:降低每次推理延迟之外,减少机器人必须走的弯路,同样能缩短任务时间。

References

  1. 1
    新智元原文

    mp.weixin.qq.com

  2. 2

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments