具身智能离 GPT-1 时刻还差什么?沈宇军给出的答案,落在真实数据的规模化,而不是再堆一个漂亮 demo。这组图片沿着访谈推进:从为什么先做「大脑」,到预训练如何进入物理世界,再到数据、本体与机器人构型。
本期嘉宾是蚂蚁灵波首席科学家沈宇军。单集时长约 1 小时 53 分钟,shownotes 将对话分成五段:公司缘起、原生大脑、数据 scale up、大脑与本体、创业与老师汤晓鸥。1
先抓住一条主线
沈宇军的判断很克制:具身智能还没有到 GPT-1 时刻。眼下最大的瓶颈不是再堆一个漂亮 demo,而是找到可持续的真实数据 scale up 路径;只有具身数据与互联网数据逐渐接近相同量级,机器人基础模型才可能获得类似的训练拐点。这个判断来自本集 01:07:29 附近的讨论。
从数字世界到物理世界
数字模型可以回答「这是什么」,机器人还要继续回答「它在哪里」「我能不能到达」「接触之后会发生什么」。36 氪对蚂蚁灵波全栈 2.0 的报道,将这组差异概括为感知、预测、行动三道鸿沟,并记录了沈宇军关于物理世界原生设计的解释。2
所以,预训练的起点不是把一个已经在数字世界训练好的模型接上机器人。访谈中,数据准备先落到两个具体问题:给机器人下发什么任务,以及拿到数据之后怎样清理得更干净。模型要在物理约束里把感知、预测和行动连起来。
六个模型,六个问题
本期 shownotes 列出 Depth、Vision、VLA、Video、World 和 VA 2.0 六个模型。它们不是一张万能卡,而是一条全栈路线上的不同模块:空间深度、视觉理解、视觉-语言-动作、视频建模、实时交互世界模型,以及世界-动作模型。最后一个问题仍然是:这些能力怎样在真实机器人上稳定复用。
数据为什么难 scale up
互联网数据可以被复制、筛选和批量处理,真实传感器数据却要面对不同的本体、场景、任务和动作轨迹。第二代模型使用了约 6 万小时数据,但沈宇军仍把它放在「远远不够」的位置;相比第一代约 2 万小时,数量上升之外,数据管线也重新做了清洗。1 访谈提到,行业需要从百万小时级别的真实数据起步;真机遥操作与 UMI 等接口,可能改变数据采集的成本和复用方式,但路径还没有被证明。
这也是为什么「一次成功」不等于「能力泛化」。机器人必须在位置随机、环境变化和人的持续打断中行动,动作本身还会改变下一刻的输入。
大脑与本体
蚂蚁灵波选择先做通用大脑,是因为本体很难天然通用:如果场景选错,硬件设计会把模型上限一起锁住。但这不意味着本体不重要。访谈里给出的方向是,大脑与本体会交替上升;下一代模型也可能先遇到上一代传感器和硬件的代际错配。
最后一个问题
当主持人问到人形机器人时,答案并不绕向形态崇拜。对沈宇军来说,眼下更直接的任务仍是把机器人的智能补上。把这段回答放回整期访谈,才会发现它和前面的数据、预训练、本体讨论是一条线:先解决能否理解并行动,再讨论机器人长什么样。
引号内为沈宇军在本集访谈中的原话;其余文字是沿时间轴整理的概括。
完整节目可在小宇宙《张小珺 Jùn|商业访谈录》收听。




Comments
Sign in to comment.