机器之心介绍灵初智能与北大-灵初联合实验室开源的 EgoSteer:它把第一视角人类视频、动作生成、未来状态预测和人在闭环纠偏放进同一套双灵巧手系统。1
- 数据管线 EgoSmith 分四步:先过滤非操作片段,再做 4D 运动估计,生成从原子动作到分步动作的 5 级语言标注,最后清理 episode、chunk 和 frame 级异常。
- EgoSteer 由 Qwen3-VL 2B 视觉语言主干、约 3 亿参数的 DiT 动作专家和约 7000 万参数的世界模型专家组成。世界模型训练时预测下一帧 DINOv3 特征,推理时丢弃,不增加额外推理开销;双臂双手动作统一为 48 维。2
- Robot-Stack 把自主运行、遥操作和人在闭环纠偏接进同一控制环路,并用相对动作映射减少接管时的状态突变;文章报告接管成功率超过 85%。
- 训练数据横跨 12 个开源数据集,共 9.6K 小时、209 万个片段和 10.4 亿帧。论文报告的整体平均成功率为 75%,未见过语义的新任务为 62%;这些是论文实验口径,不是第三方复测。2
这套路线的重点不是把一个更大的模型塞进机器人,而是让数据、世界模型和接管机制共同服务于长程操作。更多方法图与代码入口见 EgoSteer 项目主页。




评论
登录后可发表评论。