风浪越大鱼越贵:24 岁具身首席科学家的路线选择

风浪越大鱼越贵:24 岁具身首席科学家的路线选择

今年五月,王家伟博士毕业,二十四岁。他没有去那几家能给他最多算力的公司,而是进了一家做家用机器人的创业公司,做首席科学家。

0:00 / 20:04
一个二十四岁的博士毕业生,面前摆着两条路:一条是去能给他最多算力的公司,继续做已经收敛的大模型;另一条是去一个连评估标准都还没有共识的领域,自己做数据、自己做模型。他选了第二条。
欢迎收听《七档 AI 创业者精选播客缩短版》。
这期原节目是《十字路口》对王家伟的访谈。他是中科大少年班出身,中科大与微软亚洲研究院联合培养的博士,在 DeepSeek 的多模态组实习过,也待过字节 Seed 一个很早就做 Agent 的组,现在是一家家用机器人公司的首席科学家。访谈从他的成长经历开始,一路讲到具身基础模型、数据采集设备、Agentic OS,最后落在这一行现在最缺的东西上。
这一集不替听众判断具身这条赛道该不该进,而是把一位一线研究者的具体选择翻译成创业团队可以照着问的几个问题。

这一集带走什么

  • 一个还没有收敛的领域,才留给新人定义问题的空间。 他给的理由不是热情,而是位置:在大模型这样已经收敛的方向里,刚毕业的人很难自己定义一件事,更多是跟着大部队往前推;而具身没有共识,风险更高,可做的研究也更多。他说自己相信「风浪越大,鱼越贵」,并把最大的风险算成时间——方向踏错,几年之后才发现整条路都不对。1
  • 买不到的数据,就自己做,但真正的成本在后面。 他们开源了两千小时的 HiFi-UMI 数据集,内部已经到几万小时;因为供应商设备的精度和时间同步达不到要求,采集手套是自己做的,还改掉了基站定位、把相机时间戳对齐到微秒级。更值得注意的是后面的部分:采集之后的清洗和标注才是投入重心,现在他们已经用通用模型先顶上,再训自己的标注模型。1
  • 什么才算具身的智能,他给了三个可检验的能力。 适应能力(零样本或少量样本进入没见过的场景)、可操控性(语言之外,图像和视频也能指挥它)、上下文理解(从一秒内的因果,到任务内的记忆,再到跨任务的长期记忆)。关于外部最热的词,他区分得很清楚:他们看到的是 Scaling 的趋势,但不会说自己验证了 Scaling Law,因为后者需要说清多少数据配多大的模型、配多少算力。1
  • 上面那一层不是你的。 他认为通用大模型会承担越来越多的理解与规划,但机器人需要能在一秒内反应的动作能力,所以他判断「下面不可能把上面吃掉,上面确实有可能把动作模型吃掉」。对应到资源上,他们把有限的算力优先给了动作模型的预训练,上层大脑先用外部模型,把力气花在自己定义的具身能力上。1
  • 没有公认的尺子,就把自己的评估做扎实。 仿真榜靠纯后训练就能刷高分,真机榜又要交出模型,所以他们判断具身的评估只能自己认真做:从简单到困难铺开任务,覆盖场景泛化和物体泛化,少量样本的实验就写清楚用了多少数据。至于中立第三方,他说以前有人试过,最后不了了之,因为既当裁判又当运动员没人服;这件事的出口,最后还是要看产品和用户买不买账。1

研究摘要与素材边界

本期没有取得原节目的官方逐字稿。内容结构使用官方单集页的 shownotes 与章节时间线,事实底稿使用官方公开完整音频的全量转写。六段原声都从同一份公开原音频按原始时间码裁取,并进入本期同一份音频工程;原声窗口逐一复核过边界和内容,但自动转写仍可能有专有名词或断句误差。节目里提到的模型发布、数据集下载量、团队规模和外部工作,都按王家伟在访谈中的说法呈现,没有改写成独立核验过的行业事实。1
想听完整上下文、现场语气和这一期没有纳入的讨论,可以回听《于是转身向具身走去|对话王家伟:24 岁的具身智能首席科学家》
本节目是对原访谈的编辑性转译,不替代原节目。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel