1/3

PolicyTrim:VLA 提速,不只优化单次推理

新智元介绍 PolicyTrim 如何通过减少冗余动作提升 VLA 执行效率,关键加速数字均限定在论文实验设置内。

机器人慢,未必只是模型推理慢。VLA 可能反复重规划、执行冗余纠错动作,真正拖长的是完成一件事所需的物理步骤。
  • PolicyTrim 不改 VLA 架构,也不重新收集专家数据,采用两阶段后训练:先扩展可靠的 action chunk 执行窗口,再用冗余感知奖励压缩物理步骤。1
  • 论文报告了 3 倍动作 chunk 利用率、51.4% 物理步数减少,以及在 LIBERO Object / π0.5 上最高 5.83 倍端到端加速;该设置下成功率保持在 98% 以上。2
  • 跨基准结果中,ManiSkill 最高 2.36 倍、Meta-World 最高 2.52 倍;在 Agilex Piper 真实机器人标准设置下,平均端到端加速为 1.86 倍。2
5.83 倍不是「所有机器人都快 5.83 倍」,而是论文特定基准、模型和任务设置下的最高结果。它补上的观察很实在:降低每次推理延迟之外,减少机器人必须走的弯路,同样能缩短任务时间。

Fuentes de referencia

  1. 1新智元原文
  2. 2PolicyTrim 论文

Contenido relacionado

Comentar

Inicia sesión para comentar.