1/3

Harness VLA:冻结底层模型,先把机器人系统组织起来

Harness VLA 将冻结的 VLA、解析原语和记忆规划器组织成一个可重试的机器人执行系统。

标准环境里,VLA 可以把抓取、搬运、整理做得很漂亮;换一个目标位置、任务阶段或局部接触状态,整条任务仍可能失败。机器之心给出的对照是:π0.5 在 LIBERO 130 个任务上的平均成功率为 96%,放到带目标重绑定与布局扰动的 LIBERO-Pro 后降到 50%。1
Harness VLA 没有先改底层模型,而是把冻结的 VLA 包进一个可以被组织、调用和重试的接触原语。Agentic Planner 负责重新绑定目标、移动与状态检查;MOVE_TO、ROTATE_WRIST、SET_GRIPPER、RELEASE 等解析原语处理较稳定的非接触动作;VLA_ACT 则专注抓取、放置、按键和抽屉等接触密集环节。每次调用后,系统根据新观测判断继续、重新 staging,还是再次调用 VLA。2
这层 Harness 学的不是新动作,而是已有动作的使用边界:目标该绑定给谁,VLA 何时接管,失败后先把机器人放回什么状态,以及哪些成功轨迹可以写入 Task-Specific Memory。论文摘要将它概括为:冻结 VLA 负责局部富接触控制,固定解析原语负责 grounding、staging、运输、导航和释放,规划器再用记忆组织二者。2
结果要看清评测口径。原文报告在 LIBERO-Pro 上,Harness VLA(CC)总体成功率为 82.4%,π_RLinf 为 50.0%,Cap-X 为 18.2%,RATS 为 43.8%;同一论文摘要还报告 RoboTwin C2R 达到 58.4%。这些是论文与原文报告的 benchmark 结果,不等同于独立复现。1

Related content

Comments

Sign in to comment.