Xiaomi-Robotics-U0:小米把 38B 具身世界模型做成数据引擎

Xiaomi-Robotics-U0:小米把 38B 具身世界模型做成数据引擎

小米的 Xiaomi-Robotics-U0 把多视角场景生成、具身迁移和视频预测统一起来,重点价值在于用生成数据提升机器人对陌生背景与光照的鲁棒性,而不是直接替代闭环控制。

先给结论:它把世界模型做成了数据工厂

小米在 7 月 13 日提交的 Xiaomi-Robotics-U0,是一个 380 亿参数的多模态自回归模型。论文的重点不在于让一个模型直接输出机器人动作,而在于把通用图像 / 视频生成能力,继续训练成可以生成多视角机器人场景、迁移场景外观、预测操作视频的统一模型。1
这条路线解决的是具身智能里一个很实际的问题:真实机器人数据昂贵、重复,而且很难覆盖陌生的桌布、光照、物体摆放和交互状态。U0 试图先生成更多仍然符合机器人几何约束的视觉数据,再用这些数据训练下游策略。论文的真实机器人实验支持了「提升分布外视觉鲁棒性」这个判断,但还不能把它理解成一个已经能独立控制机器人的闭环世界模型。

U0 统一了哪些任务

U0 从 EMU3.5 初始化,底层是基于 Qwen3-32B 的解码器式 Transformer,使用 IBQ 图像 Tokenizer,把图像和文本放进同一个离散词表,用统一的下一 Token 预测目标训练。论文把训练样本分成单步和序列两类,任务边界如下。2
类型输入输出解决的问题
文生图 / Any-to-Image文本、参考图或多张参考图新图像保留通用生成和编辑能力
具身场景生成机器人形态、场景描述同一场景的多视角初始观测让多台相机看到同一个合理的 3D 场景
具身迁移多视角深度图、场景描述迁移后的多视角 RGB 图像换背景、光照或物体外观,同时保持几何和交互状态
具身视频生成初始观测、语言指令、动作引导后续多帧机器人视频预测任务推进和接触过程
序列训练又加入了带子任务和子目标的图文交错序列,以及 1、3、5 FPS 的操作视频。这样做的含义很清楚:低帧率样本帮助模型看较长的任务进展,高帧率样本补充抓取、放置和接触时的细节。项目页也把这条链路概括为「单步生成 + 序列生成」,而不是把场景图像和视频当成两个互不相干的模型。3
论文披露,单步数据有 950 万个样本、约 564 亿 Token,序列数据有 260 万个视频片段、约 496 亿 Token。数据来源混合了真实机器人、仿真、自动驾驶、第一视角视频、3D 重建和游戏环境;小米还用 Qwen3-VL-235B 做结构化标注,把场景拆成工作区、目标物体、无关前景物体、背景和光照五个可独立控制的维度。2

关键变化:从「生成一张图」到「改造一条轨迹」

具身迁移是 U0 最有价值的设计。输入不是一张普通照片,而是原始多视角观测提取出的深度图,再配合修改后的场景描述。模型需要生成新的多视角 RGB 观测,同时保住机器人姿态、相机几何和物体交互关系。
这和普通图像编辑的差别在于,目标不是让每一张图单独好看,而是让多台相机仍然在描述同一个场景。比如可以改变桌布、背景和灯光,却不能让同一个杯子在不同视角里换位置,也不能让机械臂的抓取状态前后矛盾。论文在 300 个迁移样本上测试,Easy 和 Hard 各 150 个。以分割 mIoU 为例,U0 在 Easy / Hard 上分别达到 0.7621 / 0.7436,GPT-Image-2 为 0.4105 / 0.4098;以深度 δ1 为例,U0 为 0.8017 / 0.7846,对照组为 0.5307 / 0.5340。2
小米项目页给出的人工两两比较也指向同一结论:具身场景生成在 Easy / Hard 上的胜率为 62.0% / 68.5%,具身迁移为 82.0% / 79.3%。这里的强项主要是跨视角一致性,论文并没有声称在所有指令跟随维度上都大幅领先。3

它怎样影响真实机器人

U0 的下游用法不是在机器人运行时插入一个视频预测模块,而是先把示范轨迹做风格迁移,再把原始数据和迁移数据混合起来训练 π0.5 策略。论文测试了 Store Earphones、Fold Towel 和 Pack Box 三个真实桌面操作任务,每个任务约采集 40 小时真实示范,再生成约 40 小时外观变化后的增广数据。评测条件包含训练分布内的普通场景,以及训练中没有出现过的桌布和光照变化。2
在分布内场景中,增广策略与原始策略大致相当,部分任务略低;在陌生背景和光照的 interference group 中,增广策略在三个任务上都更高。论文摘要进一步报告,困难真实操作任务上的 π0.5 分布外成功率从 36.9% 提高到 63.2%。这个结果说明 U0 的价值首先体现在「让策略少依赖训练时的视觉外观」,而不是替代策略本身完成动作规划。1

视频能力有亮点,但别把榜单当成闭环控制

在 WorldArena 上,U0 的 EWMScore 为 73.64,项目页列为 100 多个提交模型中的第一名。它的 Instruction Following 得分为 93.86,Interaction Quality 为 87.30,Motion Smoothness 为 95.51,Perspectivity 为 98.84。这个组合说明模型能把语言、初始观测和动作引导转成相对连贯的视觉后果,尤其擅长让视角和运动看起来稳定。3
但 WorldArena 衡量的是生成视频的视觉、运动、物理贴合度和可控性,不等于机器人已经根据真实传感器反馈完成了长期任务。论文的真实机器人实验也没有在执行时调用 U0,而是只把 U0 生成的数据用于策略后训练。更准确的说法是,U0 让「想象未来」成为训练数据的一部分,暂时还不是部署现场的实时决策器。

工程细节:FlashAR+ 解决了什么

380 亿参数的自回归图像模型如果按 Token 逐个解码,实际使用会很慢。U0 的 FlashAR+ 只在目标图像区域按反对角线并行生成,同一步的视觉 Token 不互相可见,避免并行时泄漏未来信息;参考图、文本和控制条件仍作为完整前缀保留。再接入 vLLM 的批处理和分页 KV Cache 后,论文在单张 H20、1024×1024 文生图设置下测得:标准自回归路径为 450.77 秒,FlashAR+ 为 16.56 秒,FlashAR+ 加 vLLM 为 5.44 秒。2
项目页把这一结果概括为最高约 82.9 倍的生成效率提升。这里的 82.9 倍来自特定硬件、分辨率和推理配置,不能直接当成所有分辨率、批大小或视频生成任务的通用速度。3

三个需要盯住的限制

第一,具身迁移依赖深度估计作为中间表示。深度估计本身的误差会传到生成结果,局部纹理和外观也会因此受限。论文下一步想直接从原始多视角观测做编辑,减少这一层中间处理。2
第二,场景生成和后续视频生成目前是分开的步骤。先生成一组初始观测,再从它滚出操作视频,长序列中就会累积前一步的错误。论文明确把联合生成场景与视频列为后续方向。
第三,当前上下文窗口是 32K,限制了长时段视频建模。它可以展示短时操作和一定程度的任务推进,但距离分钟级、可持续交互的具身世界模型仍有工程距离。2
因此,读者评价 Xiaomi-Robotics-U0 时,最合适的切入点不是「小米做了一个会控制机器人的 380 亿模型」,而是「小米把通用视觉生成、机器人几何和轨迹增广放进了一个可扩展的数据生产管线」。它已经在陌生视觉条件下给出真实策略收益,下一轮复现最值得检查的是:生成数据的数量和质量如何影响不同任务,增广后的动作标签是否始终可靠,以及更长视频 rollout 的误差会不会抵消数据规模带来的收益。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel