
探索RSI,生数新世界模型让机器人开始自我进化
生数科技最新发布具身世界模型 Motus2,将动作生成、结果预测与价值评估整合为闭环以探索递归自我改进(RSI),在 13 万小时人类第一视角数据与触觉加持下大幅提升高自由度灵巧操作表现。
转载说明:本文转载自微信公众号「量子位」官方报道(biz_id:MzIzNjc1NzUzMw),原文发表于 2026 年 9 月 12 日,作者署名“林方舟 发自 凹非寺 量子位 | 公众号 QbitAI”。原文链接:[量子位微信公众号原文](http://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw&mid=2247922322&idx=1&sn=205bab2dcbe1fe72bd7f8ef202a49ff0),量子位官网同题文章可参考量子位官方网站。
机器人学习拧灯泡,如果拧歪了,谁来告诉它问题出在哪,下次又该怎么改?
这正是机器人“自进化”让人期待的原因:人类难以替它示范所有现实状况。想要机器人越做越好,系统必须具备评估动作结果的能力,并从持续反馈中迭代策略。
生数科技最新发布了具身世界模型 Motus2。除了探索自进化,该模型同时整合了触觉、高自由度灵巧操作以及大规模人类第一视角(Ego)数据 1。
今年 2 月前代 Motus 发布时,世界动作模型概念尚处起步阶段,Motus 在 50 项通用任务评测中比 Pi-0.5 的绝对成功率高出 35% 以上。在前代基础上,Motus2 进一步扩展视觉、语言、动作与触觉等多模态输入,将三种核心能力统一在单个模型中:负责输出动作的行动能力、负责预测画面变化的预测能力,以及负责衡量任务效果的评估能力 1。

模型实现闭环自进化迭代
Motus2 相比上一代最核心的变化在于自进化。
主流机器人策略模型通常学习“在当前状态下下一步该做什么”。这种范式依赖输入与输出动作的统计关联,缺乏对因果关系的深层理解。一旦作业环境发生变动,既有策略容易失效。
Motus2 将三项功能整合到了同一个神经网络架构内:
- 行动:WAM(世界动作模型)生成具体的控制动作,回答“接下来做什么”;
- 预测:AC-WM(条件动作世界模型)预测动作执行后的物理画面,回答“做完会发生什么”;
- 评估:VM(价值模型)对预测出的结果画面进行打分,回答“这个结果是否达标”。

这三项能力在系统内建立了环环相扣的数据流:
生成动作 → 预测后果 → 评估结果 → 更新策略
模型自主预测并评估的结果直接作为策略改进的反馈信号,推动下一轮动作优化。这是 Motus2 团队对递归自我改进(Recursive Self-Improvement,RSI)的初步探索。这里的自进化特指利用模型自建的预测与价值反馈优化策略参数,属于特定任务范围内的闭环演进 1。
为了让单个模型同时掌握行动与预判,工程设计的核心在于避免模型在生成动作前预先看到执行后的视觉画面。如果时序上发生穿透,模型容易退化为借助未来画面倒推当前控制,在真实硬件部署时失去应变能力。
为此,Motus2 在中间训练阶段引入了 Action-first(动作优先)的信息流:先根据当前真实观测生成动作,再基于该动作推演未来的状态演变,最后对演变结果进行打分。
在明确了时序规范后,团队在推理与训练两个阶段分别引入了优化机制:

在推理阶段,Motus2 采用 Best-of-N 规划策略:模型先构思数个候选动作分支,在内部仿真对应的执行画面,再由价值模型进行横向打分,挑选分值最高的一组动作交付真机执行。执行完该动作片段后,机器人重新捕获现实观测,开启下一轮比选。Motus2 将这套推演机制直接内置于多模态大模型内部,无需外部单独运行轻量级物理仿真器。
在训练阶段,候选动作的评估分值转化为策略更新的梯度信号,高分方案获得正向加强,低分方案逐步被淘汰。团队将这一过程定义为基于模型的强化学习(MBRL)。该阶段专门优化动作生成参数,预测与评估模块参数保持冻结,确保基础仿真能力的稳定性 1。
这一机制重塑了具身训练中对失败轨迹的定义。以往采集数据偏好成功样本,失败操作常被作为脏数据丢弃。在 Motus2 的框架下,成功轨迹提供标准示范,而失败轨迹则成为训练预测模型识别不良后果、训练价值模型建立判别边界的实用样本。
在手机放置与多指操作两项真机实验中,基础策略的平均成功率为 65%;单独启用推理阶段规划后,成功率提升至 67.5%;单独启用基于模型的强化学习后,成功率达到 72.5%;两者协同运作时,综合成功率达到 75%,相比基线提升了 10 个百分点 1。
触觉与记忆补全物理环境感知
除了认知闭环,Motus2 在感知输入层补充了触觉与长期记忆两块关键能力。
在精密灵巧操作中,视觉传感器可以定位物体空间坐标与几何姿态,却很难捕捉接触界面的微观压力分布与滑动状态。以撕取厨房用纸为例,双手位置准确并不能确保纸张处于受控张力状态,抓持面若发生打滑,后续撕扯动作就会变形。
Motus2 增设了轻量级触觉专家模块。在执行短动作片段前,该模块快速读取高频触觉传感信号微调末端控制指令。在工程架构上,触觉专家复用了主干网络已计算出的中间特征表征,避免针对每帧触觉信号重复遍历沉重的视频骨干网络,有效兼顾了控制响应频率与计算消耗。在抽取纸杯与双手撕纸的真机任务中,加入触觉感知后,系统平均成功率从 60% 上升到 72.5%,净增 12.5 个百分点 1。
在记忆管理维度,针对“杯中藏方块后重新洗牌”等依赖历史线索的任务,单帧图像无法提供推断线索。Motus2 默认缓存完整的近期连续观测帧。对比实验表明,在寻找遮挡方块与依据历史提示操作按钮两项测试中,保留完整历史帧方案的平均成功率为 57.5%,显著高于对历史信息进行粗暴压缩的方案。对于依赖长时上下文的物理交互,历史观测构成了当前决策的基础信息,现阶段保留全量观测属于兼顾决策稳定性的务实方案。
13 万小时第一视角数据迁移至高自由度灵巧手
硬件平台上,Motus2 已适配单手 22 自由度的 Sharpa Wave 以及单手 20 自由度的 WUJI Hand 2,展示了包括拧动灯泡、单手翻书与精细多指捏取在内的复杂动作。
高自由度带来了更为宽广的操作空间,也让控制策略的学习难度成倍增长。为了解决高精度真实真机数据采集成本高昂的瓶颈,Motus2 确立了以人类第一视角(Ego)操作数据为主干的迁移路径 1:
- 单目视频预训练:借助海量人类单目第一视角视频,掌握物理世界的基础因果变化与通用物体交互规律;
- 双目视频与动作精调:引入双目立体视频与人类动作捕获数据,提取细粒度的手部关节坐标与操作时序;
- 机器人领域适配:融合真实机械臂末端轨迹与少量人机跨本体对齐数据,将通用手部先验映射至特定机械手的控制空间。
整套数据训练体系涵盖了约 13 万小时人类第一视角操作视频,辅以数百小时规模的真实机器人轨迹与跨本体对齐样本。

对比实验验证了这一分层数据管线的有效性:仅经过人类 Ego 视频预训练的基模型在五项真机测试中的平均成功率为 51%;经过机器人领域中间层适配后,平均成功率跃升至 84%,增幅达到 33 个百分点。人类数据承担了提供通用物理世界常识的任务,少量真机数据则聚焦于解决机械关节映射的工程适配。

在数据规模扩展性测试中,研发团队将双目第一视角数据量从 2000 小时递增至 20000 小时,模型在动作预测任务上的验证误差保持稳步下降态势,验证了通过扩充高质量人类 Ego 数据持续改善模型能力的有效性。
通用世界模型的五级演进路径
在技术架构之外,生数科技提出了通用世界模型的五级演进路线图:
- L1 生成世界:以视频生成为代表,实现高品质像素级场景渲染;
- L2 与世界交互:引入轻量交互机制,支持初步的虚拟环境反馈;
- L3 在世界中行动:深入理解环境物理法则,能够预测动作后果并输出物理机器人的控制指令;
- L4 自主世界智能体:具备自主决策、长程自主反馈与持续自我改进能力;
- L5 世界组织者:实现跨领域复杂环境的全面协同与自主组织。

依据这套演进标准,Motus2 已经具备了 L3 阶段的核心特征:准确理解现实观测、预判动作可能产生的物理结果,并直接驱动灵巧手完成真实作业。通过将价值评估与强化学习机制引入循环,模型开始触及 L4 阶段所要求的自适应优化与决策闭环。
从特定任务内的策略打磨迈向开放环境下的自主演进,具身智能领域仍面临着触觉跨机械本体泛化困难、超长程动作预测误差累积以及复杂现实环境探索安全性等多重挑战。Motus2 通过将未来预测与价值反馈深度融入多模态模型,为世界模型参与现实动作闭环迭代提供了一条清晰可行的探索路线。
项目主页与演示视频可访问 Motus2 官方项目页面,技术预印本详见 arXiv:2608.30237 论文页面。
References
- 1探索RSI,生数新世界模型让机器人开始自我进化
mp.weixin.qq.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
