Xiaomi-Robotics-1:小米把 VLA 的扩展瓶颈押在数据规模上

Xiaomi-Robotics-1:小米把 VLA 的扩展瓶颈押在数据规模上

小米用 10 万小时 UMI 轨迹做预训练,再用约 1 万小时跨形态机器人数据对齐;论文显示数据规模收益能传到真实机器人,但榜单数字存在口径差异,RoboDojo 评测也不使用历史观测。

先给判断:小米把扩展问题拆成了两次对齐

小米 Robotics Team 的 Xiaomi-Robotics-1 把 VLA 的数据瓶颈拆成两段:先用超过 10 万小时的 UMI 真实操作轨迹学习通用动作生成,再用约 1 万小时的跨形态机器人数据,把这种能力接到具体机器人和人类常用的命令式指令上。论文的证据显示,预训练数据规模的收益确实能传到陌生环境中的真实机器人执行;但这是一套在特定数据、机器人和评测协议下成立的训练方案,还不能直接等同于已经验证的通用机器人 scaling law。1
它的价值不只在于榜单分数。更值得看的是,UMI 轨迹承担了「先学会动作如何改变场景」的角色,后训练再处理「这些动作由哪种机器人执行、用户会怎样下命令」的问题。这个分工让数据规模化和机器人适配不必在同一个数据集里一次完成。

100K 小时数据,先教模型理解状态变化

真实机器人遥操作数据有两个硬伤:采集慢,而且天然绑定具体硬件。Xiaomi-Robotics-1 预训练阶段改用 UMI 手持夹爪和第一视角相机采集真实操作轨迹,覆盖家庭、商业场所、工业现场、办公室和户外环境。小米项目页把这部分数据概括为 100K 小时、1.7K+ 场景、240 万个 episode 和 260+ 个任务。2
Xiaomi-Robotics-1 预训练数据概览,展示不同环境、轨迹规模和任务分布
小米 Robotics 官方项目页中的预训练数据概览,包含 100K 小时、1.7K+ 场景、240 万个 episode 和 260+ 个任务。2
关键处理在标注。论文没有要求人工逐段写命令,而是把轨迹切成固定长度片段,再用 Qwen3.5-27B 为每个片段描述夹爪和物体的场景状态变化。训练目标于是变成:给定当前观测和一段「物体从哪里变到哪里」的语言描述,生成能推动场景走向目标状态的动作。论文称,整套 10 万小时语料的自动标注大约用了两周。1
这一步解决的是标注成本,不是自动消除噪声。状态转移描述如果遗漏接触关系、遮挡或动作失败,模型会把错误的因果关系一起学进去。论文展示了自动标注管线和结果,但没有在正文中给出一套独立的标注准确率指标,因此读者不能只凭「10 万小时」判断有效数据量。

后训练做两次翻译:从 UMI 到机器人,从描述到命令

预训练得到的是跨环境的动作生成能力,输入语言偏向状态转移描述;真实部署需要的是「把鞋放进柜子」这样的命令,还要适配移动底盘、腰部和不同机械臂。后训练数据总量约 1 万小时,其中包括 7,200+ 小时的小米移动操作机器人与双臂机器人数据、1,000+ 小时带时间段和指令标注的 UMI 数据,以及 Bridge V2、RT-1、DROID 等开源机器人数据。1
论文把不同形态的手臂动作统一成相对于当前状态的末端执行器位姿变化,移动机器人则使用底盘速度和腰部位置变化;某种机器人没有的动作维度,在损失计算时被 mask 掉。这样做的作用很具体:同一种「向前移动」或「向后移动」的动作,在不同硬件上的表示尽量保持一致,同时允许各机器人保留自己的动作维度。
因此,后训练不是简单地把一个大数据集再训一遍。它承担了两个接口转换:把 UMI 夹爪动作对齐到真实机器人,把「场景状态变化」对齐到人类给机器人的命令。若没有这一步,10 万小时数据很难直接兑现为多种机器人都能执行的策略。

模型结构:VLM 负责看懂,DiT 负责生成动作块

Xiaomi-Robotics-1 使用 Mixture-of-Transformers 架构,把预训练 VLM 与 Diffusion Transformer 组合起来。论文的三个缩放版本是 2B、5B 和 10B。VLM 编码视觉观测和语言指令,同时用 Choice Policy 预测多个候选动作块;DiT 读取机器人本体状态,以及 VLM 对视觉和语言 token 形成的 KV cache,再通过 flow matching 生成最终动作块。推理时用 5 步 Euler 积分还原动作。1
这里有一个容易被忽略的设计:论文发现,如果 DiT 能直接关注 VLM 生成动作相关的 token,它可能走一条「复制候选动作」的捷径,而不是继续根据视觉和语言条件生成动作。因此,作者把这些 action-related token 排除在 DiT 的注意力范围外,只让 DiT 使用观测和指令表示。这让 Choice Policy 的辅助监督负责加速 VLM 变得可行动,DiT 仍需自己完成条件化动作生成。

缩放收益传到了真实机器人,但证据范围比标题窄

预训练数据缩放实验使用的是约 2 万小时 UMI 数据的 12.5%、25%、50% 和 100% 子集,模型规模实验则在同一份约 2 万小时数据上比较 2B、5B、10B。数据量增大时,验证集 action error 下降得更明显;论文还观察到,当前设置下数据规模带来的差距比模型规模带来的差距更突出,说明现阶段更像是数据覆盖先碰到瓶颈。1
Xiaomi-Robotics-1 预训练的数据缩放与模型缩放曲线,纵轴为验证集动作误差
预训练缩放曲线显示,数据量和模型规模增大时验证集动作误差都下降;左图的数据实验实际使用的是约 20K 小时语料的不同子集。2
这个趋势在后训练的真实机器人评估里也出现了。四个任务是鞋子收纳、包裹打包、桌面整理和沙发整理,训练阶段见过任务,但评估环境和物体实例没有见过,且没有按任务或环境再微调。没有动作预训练时,整体成功率为 26%;使用完整的 20K 小时预训练子集后升到 75%。在模型缩放实验中,2B、5B、10B 的整体成功率分别为 61%、75% 和 79%,鞋子收纳任务从 58% 升到 92%。1
在四个全新任务上,低数据设置只有 36 小时总数据,平均每个任务不到 10 小时。Xiaomi-Robotics-1 的平均成功率为 75%,π0.5 为 40%;论文还报告了装纸、洗衣机装载等任务上的差距。不过每个任务只评估 10 次,这组结果足以说明数据效率信号,离稳定的统计估计还有距离。1

两个榜单很强,指标口径也要一起看

论文在四个模拟 benchmark 上都报告了最高结果。下面只列出最能说明泛化边界的两项;RoboDojo 每个数字都按「score / success rate」表示,不能把前后两个数混成一个成功率。
BenchmarkXiaomi-Robotics-1论文表格中的前一名读法
RoboCasa365 Average57.4%46.6%(ABot-M0.6)50 个评测任务,含 Composite-Unseen 组合任务
RoboDojo Average20.07 / 13.93%13.07 / 8.80%(Hy-Embodied-0.5-VLA)五类能力维度的平均 score / success rate
RoboCasa365 的优势主要出现在最难的 Composite-Unseen 划分:Xiaomi-Robotics-1 为 32.1%,ABot-M0.6 为 7.9%。RoboDojo 的 Generalization、Precision、Long-Horizon 和 Open 四个维度排名第一,但 Memory 维度落后于显式建模记忆的 Hy-Embodied-0.5-VLA。论文特别说明,RoboDojo 评估没有使用历史观测,所以这部分结果不能用来证明长期记忆能力。1
RoboDojo 官方排行榜截图,显示 Xiaomi-Robotics-1 的平均分与成功率为 20.07 / 13.93%,前一名为 13.07 / 8.80%
RoboDojo 官方榜单截图中的 Average 列同时展示 score 和 success rate,Xiaomi-Robotics-1 排名第一。2
这里还存在一处需要记录的版本内不一致:论文摘要写 RoboCasa365 为 57.6%,而表 3 和小米项目页写 57.4%;摘要写 RoboDojo 的平均分为 20.07、此前最好为 13.07,却没有给出成功率,表 5 和项目页则给出 13.93% 对 8.80%。本文采用表格与官方榜单的完整 score / success rate 口径,读者复现时应以指标定义和代码为准,不要用摘要中的单个数字替代整张表。

最后的判断:它证明了训练管线可扩展,还没有证明机器人能力无边界

Xiaomi-Robotics-1 给出的最强证据,是一条从数据到执行的连续链路:UMI 轨迹扩大后,预训练动作误差下降;更强的预训练模型经过跨形态后训练,在陌生真实环境中成功率更高;同一基础策略在少量新任务数据上也更容易适配。对机器人基础模型来说,这比单纯展示一个更大的参数量更有说服力。
但三条边界不能省略。第一,缩放曲线的主体是约 20K 小时语料的子集,不能直接把结果外推成 100K 小时仍按同样比例增长。第二,自动语言标注是整条管线的关键,却没有配套的独立标注质量指标。第三,真实机器人和下游任务的实验规模仍有限,RoboDojo 还不使用历史观测,榜单高分不等于完成了长期闭环控制。
如果代码和模型检查点按论文所说开放,最值得复现的不是再次抄一遍榜单,而是核对三个变量:状态转移自动标注的噪声如何影响动作学习,跨形态后训练需要多少真实机器人数据,以及加入历史观测后 Memory 和 Long-Horizon 是否仍能保持当前差距。现阶段,这篇论文足以支持一个较窄但有用的结论:在小米公开的实验设置里,扩大且多样的动作数据,比单纯把 VLA 做大更先决定泛化上限。

原文与项目页

Contenido relacionado

  • Inicia sesión para comentar.
More from this channel