机器人 GPT-1 还没到:沈宇军给 AI 创业者的四个判断Chapters1×0:08一、机器人 GPT-1 还没到1:38二、先把研究做成真实业务4:47三、为什么要做具身原生大脑11:32四、六万小时仍然不够14:38五、大脑和本体会交替上升16:05六、创业就是在路径不确定时下注0:0019:020:08主持人今天这期,我们从一场很容易被产品发布会带偏的访谈开始。蚂蚁灵波发布了第二代具身基础模型,模型覆盖视觉、深度、动作和世界建模等不同环节,数据也从上一代的约两万小时增加到约六万小时。可沈宇军给出的判断很克制:机器人还没有到 GPT-1 时刻,当前最大的卡点仍然是数据。0:33分析这句话的分量在于,它把问题从「模型有没有变大」挪到了「数据能不能规模化」。大语言模型的 GPT-1 时刻,背后有互联网文本这个已经准备好的数据世界。机器人面对的是真实物理环境,任务、构型、传感器和人的操作方式都不一样。数据不是下载下来就能用,甚至不是采得越多越好。0:56主持人所以我们今天先补一段灵波怎么走到这一步,再把这期一小时五十二分钟的访谈压成四个创业判断。第一,为什么要做具身原生的大脑。第二,六万小时为什么还远远不够。第三,大脑和本体为什么会交替上升。第四,资源有限、路径又不确定时,创业团队到底在赌什么。1:20分析先说明素材边界:这是一集基于原始公开音频完整 ASR 的二次精炼,不是嘉宾原声剪辑版。下面的数字、观点和语境都以这段完整音频为基础,官方 shownotes 用来校正章节和专有名词。1:38主持人先回到灵波怎么走到这一步。沈宇军之前在字节做业务,后来去了蚂蚁技术研究院。他说自己有过一段迷茫:一篇论文、引用量,究竟是不是研究价值的全部。这个问题到了机器人这里,会换一种问法:模型在实验室里领先,是否真的能在现实场景里把事情做成。2:00分析他从视觉转向机器人,原因也很直接。数字世界里,视觉技术有很多应用,但他感觉真正能大规模发挥价值的场景还不够多;物理世界则完全不同,机器人离开视觉几乎没法工作。二零二四年,他在蚂蚁研究院开始想做具身智能,正好赶上蚂蚁集团从数字世界的生活服务向物理世界延伸。2:24主持人二零二四年底,蚂蚁正式宣布成立蚂蚁灵波科技,沈宇军也从研究院来到这家公司。这个组织选择很重要:他们没有继续把具身智能当成研究院里的试验项目,而是把它当成真实业务来做。沈宇军说,研究员认为先进的技术,和行业需要的先进技术之间,可能一直有一段距离。2:47分析对 AI 创业者来说,这里有一个常被忽略的组织问题。研究机构擅长探索上限,产品公司擅长把确定的东西交付出去,灵波试图把两件事放在一起:一只手看智能的上限,另一只手抓真实落地。行业技术还没收敛时,纯研究可能脱离需求,纯业务又可能只是在一条已经确定的路上把桩打得更深。3:13主持人沈宇军还提到,刚开始做机器人时,他发现自己原来掌握的视觉和模型知识远远不够。模型怎么部署到机器人,通信怎么调,硬件和软件如何一起工作,都会冒出新的技术问题。这个阶段的价值,不是把研究团队包装成创业公司,而是承认交付本身就是研究的一部分。3:37分析这也是灵波后来坚持「两头抓」的原因。模型还在早期,不可能同时解决十个方向,所以要靠真实场景告诉团队下一步先做什么。哪里不行,就把这个失败带回模型迭代。对创业团队而言,场景不是上线之后才寻找的销售出口,它会直接决定训练数据、模型指标和组织优先级。4:00主持人再看二零二五年和二零二六年的技术选择。沈宇军说,二零二五年做了两个决定:一是从视频开始学,二是从传感器开始学空间智能。于是第一代开源模型里,有 Depth、视频动作模型、世界模型和 VLA。到了第二代,又把视觉、深度、动作、视频和世界建模等环节继续往前推。4:26分析可以把这组模型理解成一条链:先从传感器理解距离和空间,再把视频里的变化和动作对齐,接着让模型能预测环境怎么变化,最后把指令转成真实动作。它们不是六个互相独立的产品,而是在回答同一个问题:机器人怎样从「看见」走到「做好」。4:47主持人沈宇军说,灵波成立之初就决定先做机器人的大脑,不把完整本体作为主业。这个选择听起来像是在回避硬件,实际是在押注一个更长的产品关系:未来机器人可能有很多种形态,但不同本体都需要一个能感知、理解并执行任务的大脑。5:07分析这里有个很具体的前提。灵波想做的是跨本体、跨场景、跨任务的模型,但沈宇军同时承认,本体和场景又不能完全拆开。一个本体如果不追求通用,就必须先选准场景,按照场景去做强化和减配,否则拿一个各方面都很强的「六边形战士」去完成一个具体任务,成本会直接上去。5:31主持人这其实给 AI 创业者一个产品提醒:不要把「通用」当成一句愿景。你要先回答,通用性到底是跨什么。是跨设备,跨任务,还是跨客户流程。每增加一个维度,数据分布和验收方式都会变,模型也会面对新的失败模式。5:50分析灵波这次升级 Depth 模型时,讲了一个很适合产品团队理解的例子。数字世界里,模型知道玻璃门外面有一只猫,似乎就完成了识别;物理世界里,机器人还必须知道自己会先撞上玻璃,只有把门拉开,猫才会逐渐出现在可行动的位置上。能看到猫,是语义理解;知道玻璃挡在前面,是空间感知。6:15主持人所以他们没有继续把数字世界模型往机器人上加功能,而是重新做一套面向物理世界的预训练。Depth 的新路线从几何和边缘出发,先让模型理解点、线、面和距离,再把视觉感知接到空间感知。这不是换一个模型名字,而是重新定义模型要学什么。6:38分析对做 AI 产品的人来说,判断「原生」有没有意义,不能只听架构描述。你要看它是否改变了数据、评测和交付。灵波的答案是,原生大脑要被真实机器人拉回去检验,哪里做不好,哪里就反过来决定下一轮模型迭代,研究上限和落地反馈要同时存在。6:59主持人具身原生这个选择,并不是灵波一开始就完全想清楚了。沈宇军说,第一代模型发布之后,他们发现很多能力是强行在数字模型上改出来的,改得再花哨,问题还是会暴露。于是团队下了一个决定:必须具备从更底层训练机器人基础模型的能力。7:19分析这是一种很典型的技术路线转向。第一代不是失败,而是把不匹配暴露出来。数字世界模型擅长语义和画面质量,机器人需要的是距离、动作后果和实时反应。如果还把机器人的问题当成数字模型的下游任务,模型可能看起来更大,执行却没有跟着变好。7:41主持人沈宇军举了一个更底层的例子。数字世界的视频生成通常会先做视觉压缩,让大模型更容易处理;但如果这个压缩过程只负责把数据变小,不参与后面的语义和动作学习,它对机器人未必有帮助。灵波尝试让视觉编码同时感知语义和动作,让后面的生成和控制更容易对齐。8:04分析另一个差异是速度。文生视频可以等十秒、二十秒,机器人不能等。机器人执行时,历史只能流向未来,不能提前看到未来的结果,这要求模型做单向建模,也要求推理效率从架构层面就被考虑。对物理产品来说,画面不必漂亮到适合欣赏,但反应要足够快,结果要足够合理。8:28主持人这会改变产品评测。数字产品可能先看画质、完整度和用户主观满意度,机器人产品要先看延迟、成功率、被打断之后能不能恢复,以及它有没有在错误的位置做出一个不可逆的动作。把数字世界的指标原样搬过来,最后只会得到一套漂亮但没法交付的分数。8:51分析所以「原生」至少有三层含义。模型架构要针对物理世界,数据要覆盖真实的任务和身体条件,评测也要回到机器人能不能把活干好。只做到第一层,还不能证明路线成立;如果数据和交付完全没有变化,原生就只是一个新的宣传词。9:11主持人访谈里还谈到两条路线的差异。Generalist 更接受高效后训练,Physical Intelligence 更强调 zero shot,也就是机器人进入新场景后尽量直接完成任务。沈宇军的判断是,这两种能力最后都需要:进家庭之后,大部分日常工作要自己完成,剩下一小部分不会的,最好教一次就会。9:35分析这对创业者的启发是,zero shot 和后训练不是口号上的二选一。前者决定你的基础模型能不能跨场景,后者决定产品能不能在客户现场快速适应。你要先看自己的业务,用户愿不愿意教,教一次的成本是多少,教完之后的能力能不能留在模型里,而不是笼统地说自己追求泛化。9:57主持人沈宇军讲过一个很有意思的例子。机器人和人一起打球,这个任务同时考验反应速度、随机性处理和动作预判。模型做完预训练之后,为了执行这个任务,他们大约只采了二十条数据。这个数量听起来很小,但他的重点不是二十条数据可以解决所有任务,而是预训练先提供了一个足够好的基础,后训练只需要把一个具体能力推过门槛。10:24分析这也解释了为什么他后来提到,第一代很多任务的后训练数据大约要一百条,现在约二十条就可以。更重要的变化是,过去可能一个任务要单独训一个模型,现在可以把多个任务放进同一个模型里一起解决。这个结果说明,基础模型的价值不只是提高一个分数,而是降低每个新任务的边际适配成本。10:48主持人但这里不能被误读成「数据少了,数据就不重要」。二十条数据成立的前提,是前面的预训练、动作空间和模型能力已经打好了底。如果基础能力没建立起来,二十条示范可能什么也改变不了。后训练省下来的数据,往往是用更大规模的预训练和更好的数据设计换来的。11:10分析对于 AI 产品团队,评估一个模型供应商时,可以把问题问得更细:新客户接入需要多少示范,示范里哪些信息是通用能力,哪些信息只是场景特例,失败之后能不能把反馈沉淀为下一次部署能力。只有这样,数据才会从一次性交付变成产品的一部分。11:32主持人第二个判断是,六万小时听起来很大,但还没有形成真正的规模效应。沈宇军说,第一代大约用了两万小时数据,第二代做到约六万小时;但第一代数据重新清洗后,只剩下一万多小时。也就是说,数据管线变严格之后,表面上的数量增长并不等于有效数据同比增长。11:55分析第二代还把机器人构型从九种扩到了二十多种,加入了头、腰、底盘和腿脚等自由度。这个变化很关键,因为实验室里的双臂抓取,和真实场景里需要抬头、弯腰、移动底盘的任务不是一回事。模型覆盖的不是一个动作,而是一组身体条件、任务分布和空间关系。12:17主持人数据准备的第一个难点,是任务怎么下发。任务不能让数据百分之九十都只用到手臂,几乎不动头和腰,否则模型会把高频的身体部分学得很熟,对低频自由度却很迟钝。第二个难点,是拿到数据之后怎么清洗。跨本体意味着相机位置、关节连接和 configuration 都不同,不能把同一条清洗链路直接搬过去。12:43分析这对创业团队很实用。数据团队的核心能力不只是采购数据,而是能不能把任务分布设计出来,能不能把一条不顺滑的操作剔除或纠正,能不能知道哪些差异来自本体配置,哪些差异才是模型应该学的规律。一个看起来很大的数据集,如果分布偏了,训练出来的只是偏科模型。13:07主持人沈宇军还提到,灵波以真机和 Ego 数据为主,仿真数据更多用于评测。仿真能很快生成大量数据,但它容易出现任务同质化,柔性物体和复杂物理交互也还不够可靠。真机数据的采集渠道正在变多,成本也在下降,但真正决定上限的,仍是数据能不能被模型稳定使用。13:31分析这也解释了他为什么说机器人还没有 GPT-1。灵波这次有约六万小时数据,但和上一版相比,还没有形成数量级提升;机器人真机数据与互联网数据的量级,他判断大约相差两个数量级。模型架构已经可以做到具身原生,数据却还没有准备好进入 scale up。13:53主持人他的估计是,具身数据至少要接近互联网数据的量级,才可能迎来机器人 GPT-1 时刻,而且可能要从百万小时起步。这个时间和数量是受访者的判断,不是确定预测。对创业者更有用的,是把它理解成一个门槛问题:你的数据采集方式,能不能从项目制变成可复制的生产系统。14:18分析如果答案是否定的,继续堆模型参数意义有限。先把任务分布、采集 SOP、数据清洗和反馈闭环做出来,才有资格谈 scaling。灵波的下一步也被他概括得很直接:把数据做得更原生,让数据能够规模化,同时还要保持模型真正用得上。14:38主持人第三个判断,是不要把「只做大脑」误解成大脑可以永远脱离本体。沈宇军的判断是,目前大脑的开发落后于本体,行业今年的主要矛盾,是先让机器人把活干好。等智能层跑得更快,模型又会对本体提出新的要求,本体再按照模型更容易控制的方式重新设计。15:00分析这是一种交替上升。今天的硬件不一定能适应下一代模型,尤其是传感器。过去做传感器,可能先追求精度、频率这些传统指标;到了模型驱动的时代,真正重要的也许是响应够不够快,或者某种触觉信号是否更利于控制。指标要从模型需求出发重新排优先级。15:23主持人这对做软件产品的人也成立。产品和模型不是一方先做完,另一方再接入。模型能力、交互方式、设备约束和场景成本,会在真实使用里互相改写。今天最漂亮的 demo,可能会逼出明天完全不同的传感器和控制接口。15:42分析所以创业者现在不必急着回答「家庭机器人最后一定是人形、轮式还是足式」。沈宇军的说法是,当前核心问题不是构型,而是智能不够;智能不够的核心又是数据不够。只有等模型真的能把任务做好,团队才有条件通过落地和用户研究,反过来判断哪种本体值得量产。16:05主持人最后一个判断,来自沈宇军对第一次创业的总结。他说,创业一定是在资源有限、路径不确定的情况下下注。如果一条路已经被所有人证明成功,资源最多的大厂往往更容易赢。创业公司的机会,恰恰在于敢于选择一条还没有被证明、但自己认为值得走的路。16:28分析灵波押了几次注。一个是传感器,一个是具身原生,另一个是先做大脑而不是把本体全包下来。沈宇军没有把失败说成不可能,他直接承认,原生模型可能训一年、花很多资源,最后仍然不收敛;也可能只是进入得太早,或者资源不足。下注不是乐观,而是提前承认风险,再决定自己能承受哪一种失败。16:53主持人蚂蚁给灵波的组织方式,也和这个下注有关。沈宇军说,团队整体按创业公司的方式管理,业务相对独立,但共享集团的基础设施。集团会提出建议,双方经过几轮交流再达成一致。对一家深技术公司来说,这种安排解决的是两个问题:既要有长期研究的耐心,也要有真实产业场景和资源支持。17:19分析他的最好预期很具体,机器人进入家庭,而且跑的是灵波的模型;最坏预期也很具体,就是没做出来。至于机器人最终长什么样,他没有执念。把眼下最核心的问题先解决,等智能真的上来,再让产品、硬件和用户研究继续往前走。17:38主持人把这期访谈压成创业者的四个检查问题。第一,你说自己做的是原生模型,数据是否也有原生且可规模化的获取方式。第二,你的数据集覆盖了哪些任务、构型和自由度,还是只在一个漂亮 demo 上反复采样。第三,模型每一次迭代,是由真实落地里的失败驱动,还是只看离线分数。第四,当路径没有被证明时,你准备下注多少资源,什么结果出现时必须止损或换路。18:10分析沈宇军提到他的老师汤晓鸥,印象最深的是能从混乱里快速抓住主要矛盾。对这期访谈来说,主要矛盾并不在机器人到底长什么样,而在数据能不能规模化,模型能不能把活干好。对正在做 AI 产品的团队,先把这两个问题拿回去复盘,再谈更大的故事。18:32主持人以上就是本期精炼版。原集是《张小珺Jùn|商业访谈录》第 147 期,想听完整访谈,可以从正文里的来源入口回听。本期没有加入嘉宾原声剪辑,所有内容都来自完整公开音频的二次精炼。我们下期再见。