1/10

Fei-Fei Li:空间智能要从看懂世界,走向在世界里行动

a16z Show 对谈 Fei-Fei Li、Yunzhu Li 与 Martin Casado:从 World Labs 收购 SceniX,到用空间智能和仿真把机器人学习推回真实世界。

这期《The a16z Show》邀请 Fei-Fei Li、Yunzhu Li 与 Martin Casado,围绕 World Labs 收购 SceniX、空间智能、世界模型和机器人学习展开 43 分钟对谈。真正的问题不是给机器人再接一个视觉模型,而是让它在一个可持续、可推演的世界里学习动作,并判断这些动作能不能迁移到现实。1

先看结论

  • 空间智能不止是识别一个物体。它要求系统在 3D 世界中感知、生成、推理,并与物理或虚拟空间互动。World Labs 对自己的定位正是构建这类 world models。2
  • World Labs 在 2026 年 7 月 21 日宣布 SceniX 加入公司。官方给出的结合点是空间智能、世界模型、学习型仿真,以及真实世界学习组成的闭环。3
  • 机器人训练需要同时依赖仿真和真实数据。仿真负责演练现实里尚未发生、很难大量采集,或根本不可能安全尝试的情况;真实数据负责把模型拉回硬件和具体任务。
  • 对机器人来说,评估不是训练之后的附属环节。它要回答一个很实际的问题:某个 checkpoint 到底是 95% 成功,还是 99.9% 成功?如果每次都用真实硬件验证,迭代速度会慢到无法规模化。

这三个人在谈什么

Fei-Fei Li:把空间智能放进真实世界

Fei-Fei Li 是 World Labs 联合创始人兼 CEO,也是斯坦福大学计算机科学系 Sequoia Professor、Stanford HAI 创始主任;她还是 ImageNet 与 ImageNet Challenge 的创建者。4
她在对谈里把空间智能说成 AI 的下一个前沿:系统要理解空间,推断空间中的变化,并在其中行动。她反复强调的个人目标很具体:
「我的北极星,是让机器人真正工作。」1
这也是她把机器人视为 world model 重要应用的原因。虚拟空间可以服务于游戏、视觉特效和设计,物理空间则把空间智能的判断交给真实的物体、摩擦、动作后果和部署约束。

Yunzhu Li:把真实环境映射成可训练的数字世界

Yunzhu Li 是 SceniX 联合创始人、哥伦比亚大学计算机科学助理教授,研究交叉于机器人、计算机视觉和机器学习。5
他的目标同样务实:让机器人更好地感知并与物理世界互动。SceniX 的切入点是 real-to-sim-to-real:先把真实环境重建成与现实对齐的数字环境,再在数字世界中生成训练和评估数据,最后回到硬件验证。

Martin Casado:把研究问题拉回基础设施

Martin Casado 是 Andreessen Horowitz 普通合伙人,负责基础设施方向;本期由他主持对谈。6
他的追问很有投资人和基础设施建设者的共同特点:这套系统具体服务谁?仿真怎样提高迭代速度?客户是在训练阶段接入,还是等到部署前再接入?这让一场关于空间智能的谈话,落到了平台形态、评估方法和客户工作流。

按对谈顺序整理

1. 收购 SceniX,补上的是机器人学习的缺口

World Labs 已经在构建能生成和理解 3D 世界的模型,SceniX 则从机器人、仿真、渲染和真实环境重建出发。两边组合后,目标不是给 Marble 增加一个孤立的机器人功能,而是把 world model、仿真环境、策略训练和硬件验证串起来。World Labs 官方公告也把机器人描述为「空间智能变成物理能力」的地方:机器人需要感知周围空间,理解物体如何运动和互动,预测动作后果,并可靠执行。3

2. 机器人最缺的不是一句漂亮的提示词,而是可用数据

语言模型可以从互联网上获得海量文本,机器人却必须面对具体的物体、视角、摩擦、光照、动作和安全限制。每一种真实试验都昂贵、缓慢,还很难覆盖失败情况。
因此,SceniX 的 real-to-sim-to-real 管道先做环境的密集重建:外观、几何形状和动态都要进入数字世界。World Labs 的 Marble 则提供了稀疏重建和生成式 3D 世界能力。对机器人来说,环境不能只在单帧看起来像真的,还要在时间、视角和交互上保持一致。

3. 一致性比「看起来像」更重要

对谈里有一个很直观的例子:如果机器人向前推一个物体,物体不应该在下一帧神秘消失。视频生成模型可以产生视觉上合理的画面,但机器人需要的是更稳定的因果信号:动作发生后,世界怎样变化,下一步还能不能继续行动。
因此,机器人基础模型可能同时承担两种角色:
  • 前向模拟器:输入动作,预测环境会怎样变化。
  • 策略模型:给定目标,预测机器人应该采取什么动作才能更接近目标。
这也是为什么本期讨论的基础模型,不只需要文本和图像,还要处理深度、世界状态和动作。

4. 仿真不是现实数据的替代品,而是反事实推理的机器

Fei-Fei Li 把仿真与人类智能联系起来:人会在脑中演练尚未发生、无法发生,或暂时没有足够数据让它发生的事情。这个能力可以理解为反事实推理。机器人也需要它,因为现实数据不可能覆盖所有情况。
Yunzhu Li 的说法更工程化:仿真是在预测机器人采取某个动作后,环境会怎样变化。它不必是纯物理模拟,也可以把物理结构和学习到的数据结合起来。真实数据会持续回流,形成数据飞轮:先用物理和几何建立结构,再用客户与硬件产生的数据修正模型,最后把改进后的策略送回真实世界。
World Labs 后续的技术文章把这一闭环写得更明确:真实任务被重建为交互式仿真环境,在仿真中训练、测试并主动寻找失败点,再回到硬件验证。7

5. 仿真首先是一层评估系统

对谈把 eval 放在了很靠前的位置。训练一个机器人 checkpoint 只是开始,团队还要知道它的成功率、稳定性和失败边界。现实环境当然是最终标准,但如果每个 checkpoint 都要在硬件上反复测试,就很难比较相近的策略,更无法快速迭代。
World Labs 后续公开的评估示例中,每个 checkpoint 使用 2,000 次模拟试验,其中 1,000 次是 ID、1,000 次是 OOD;真实世界对应 100 次试验,其中 50 次是 ID、50 次是 OOD。文章强调,仿真不必复制现实中的每一个数字,但要保留现实中同样的决策关系:策略排序是否一致,训练改进和平台期是否能被追踪,成功与失败区域是否相近。7

6. 先做半结构化环境,才是现实的落地路线

对谈没有把「通用机器人」说成一个马上交付的单一产品。团队把环境分成三层:工厂和汽车产线这样的结构化环境,仓库、餐馆、酒店这样的半结构化环境,以及家庭这样的非结构化环境。当前更适合从半结构化环境切入,因为它们既有真实业务价值,又没有家庭场景那样难以控制。
Fei-Fei Li 还提到,收集到的数千个任务中,约三分之一与清洁有关。人们不喜欢做枯燥、肮脏的工作,这类任务反而可能是机器人最早创造实际价值的地方。这个判断来自对谈中的用户任务调研,不是对机器人市场规模的估算。1

7. 人形不是默认答案,效率也不是免费得到的

人类身体经过进化,适应了非结构化环境,但不代表它对每一项机器人任务都是最优形态。对谈把人形机器人的难点归结到一整套系统:硬件、软件、模型、机械细节,以及摩擦等具体物理条件。
对谈还给出一个很有冲击力的参照:人脑运行功率约 30 瓦。机器人在狭窄的软件任务上可能很快接近人类表现,但要在开放的物理世界中同时达到人类的能力和能效,距离仍然很远。1

8. 「五年」不是这件事的时间表

节目中问到,具有人类水平效率的机器人是否可能在五年内出现。回答并没有给出一个乐观的短期承诺。真正的通用能力牵涉硬件、软件、模型和现实世界的细节,不能靠单次模型升级解决。
但这不是停滞判断。对谈中的语气是:机器人学习、仿真和系统工程的进展速度比过去预期更快,团队也已经在具体客户任务上推进部署。时间尺度变长,工程路线反而变得更清楚。

9. 客户可以从不同阶段接入

World Labs 与 SceniX 的平台方向是模型无关、机器人形态无关:客户可以把任务数字化后做评估,也可以把完整的训练、评估和硬件部署管道接入。平台不要求所有客户使用同一种机器人,也不要求所有客户从零训练同一个模型。
对谈结尾给出的信号很直接:如果你正在做机器人项目,可以尽早联系 World Labs,先把具体用例、任务约束和需要评估的环节说清楚。团队希望从真实任务开始,而不是等一个抽象的「通用机器人」产品成熟后再寻找用例。

读者可以带走的三点

  1. 机器人学习的瓶颈,往往是训练和评估数据,而不只是模型结构。
  2. 仿真的价值不在于做一段漂亮的 3D 演示,而在于让团队能够反复试错、主动找失败,并在回到硬件前筛掉不合格策略。
  3. 空间智能的产品化路径,可能先从能被定义、能被测量、能反复部署的半结构化任务开始,再逐步走向开放世界。

逐句全文翻译

以下内容按完整音频的时间顺序逐句整理,不做摘要或删减。本次完整音频转写没有提供可靠的说话人分离,因此统一标注「说话人未分离」,不根据语境猜测主持人与嘉宾。中文部分为机器辅助翻译整理,个别断句、专名和术语可能存在误差,原始音频仍是最终核对依据。
说话人未分离:我们正在建设下一个前沿。人工智能,。这就是我们所说的空间智能。SceniX,。我们正在开发我们所说的 real-to-sim-to-real 管道。我们可以替换。所有数据,。所有的评价都是我们真实需要的。通过使用该数据的环境。可以在我们的中以可扩展的方式生成。数字世界。想想人类的智能。我们在头脑中进行了很多模拟。你知道为什么吗?有一个非常重要的角色模拟。播放现实世界数据不播放的内容。这是反事实推理。什么。我们正在建设一个一致的世界。空间上的一致性。随着时间的推移,。不同的观点和不同的观点

00:42–01:24

说话人未分离:互动类型。我的北极星是。我想要机器人工作。我们的世界。生活在可以是多元宇宙的。我们创造技术来让人们,。建设者,.开发人员可以在不同的空间中行动。您相信我们能够做到吗?建造具有能源效率的机器人。一个人的?我们离这个还有多远?这是五年还是这样。绝不?。 TLDR 是,。语言模型改变了人工智能的理解方式。下一个前沿领域是教学。人工智能能够理解并在其中采取行动。物理世界。遵循 World Labs。收购 SceniX,。Martin Casado 和 Fei-Fei Li 坐在一起。李和 Yunzhu Li 解构愿景

01:24–02:07

说话人未分离:交易背后。他们讨论空间。智力,世界模型,。模拟,。以及为什么需要解决机器人问题。专为三人打造的新一代人工智能。 - 维度推理,。不仅仅是语言。好吧,。出色地,。很高兴你们俩都在这里。所以,。Fei-Fei Li,.对于可能没有的听众。背景,.也许你可以概述一下什么。World Labs 确实如此。是的,嗯。 World Labs 是一家成立两年的初创公司。我认为我们应该认识到它的存在。前沿模型实验室。我们正在建设。人工智能的下一个前沿。这就是我们所说的空间智能。空间智能就是创造

02:07–02:49

说话人未分离:具有生成能力的人工智能。理解,推理,。并与空间互动。无论是物理的还是虚拟的。并且。当然,。实现空间智能的手段。正在构建大型世界模型。就是这样。World Labs 主要关注的是什么......是的,.所以从那以后你就一直这么说。很开始,。这是机器的感知能力。以及关于空间的推理和对空间的行动..但我一直有这样的假设。对空间的作用有些长距离。射手的事,.但现在你正在获得机器人技术。公司。所以也许可以谈谈。关于这个和那个的及时性。意图。是的。所以首先,

02:49–03:31

说话人未分离:它不仅仅需要机器人来行动。在空间内或互动。正确的?。我的意思是,看看创意领域。无论是视觉特效、游戏还是设计。许多用例,。您可以在虚拟环境中进行创作和行动。空间。World Labs 的论文一直如此。我们生活的世界就是这样。多元宇宙,.我们创造技术让我们......建设者,.开发人员在不同的空间内行动。话虽如此,。在身体内行动的能力。太空是最令人兴奋的领域之一。最重要的能力

03:31–04:14

说话人未分离:未来人工智能世界的未来。机器人也是如此。非常喜欢。所以,。 World Labs 始终相信机器人技术。也是一个重要的应用。作为空间智能的用例。和世界建模。所以通过联手。邀请 SceniX 和 SceniX 团队。World Labs 是我们长期计划的一部分。愿景和使命。我们始终致力于。太棒了。所以 Yunzhu Li,。你是 SceniX 的联合创始人。所以也许吧。为每个人提供快速概览。你的背景以及 SceniX 的工作.. 是的,.所以我是 Yunzhu Li。所以我目前是联合创始人。 SceniX 的助理教授

04:14–04:57

说话人未分离:在哥伦比亚大学。这是我的研究。从我在麻省理工学院获得博士学位开始,然后。Fei-Fei Li 的博士后。真的吗?是的,那太好了。世界很小。世界很小。在我的职业生涯中,。我的目标很简单。试图帮助机器人更好地感知。并与物质世界互动。所以我是一个非常实际的人。我想要。我的机器人能够在真实的物理环境中工作。环境。所以对于 SceniX 来说,。我们看到的独特机会就是这样。存在很多瓶颈。现在我们看到事态发展所面临的。通用机器人,。尤其是在培训方面。围绕评估。所以在 SceniX,。我们正在开发我们所说的 real-to-sim-to-real 管道。好的。我们是

04:57–05:40

说话人未分离:将真实环境映射到。拥有最好的数字世界。与真实环境的对齐..通过对齐,.我们的意思是无论发生什么。数字世界也即将发生。在真实环境中,。这样我们就可以替换所有数据。所有的评价都是我们真实需要的。通过使用可以的数据环境。在我们的数字中以可扩展的方式生成。世界。这就是一切的开始。.在 SceniX 中,我们组合了一个非常..围绕机器人技术的非常强大和最好的团队。机器人学习,.还有模拟和渲染。试图建立这个真实到模拟的。真正的堆栈解决了一些关键。瓶颈。你们两个真是太神奇了。一起工作。是啊,。这里有一个有趣的故事,因为。你会认为因为我们一起工作,

05:40–06:23

说话人未分离:他是我了不起的博士后。我们一直在谈论这个 SceniX。与 World Labs 整合已久。时间。其实不是真的。他们来了。作为客户进入 World Labss。当我们。发布了我们的生成器的第一个版本。去年冬天,模特名叫 Marble。 11 月、12 月左右。 SceniX 刚刚注册。不开玩笑。作为客户?是的。我什至不知道那是什么。然后我意识到这是 Yunzhu Li 的。公司。我叫 Yunzhu Li,。我就像,哇,。这是你的公司。然后我们意识到。有如此多的协同作用。也许,。Fei-Fei Li,.只是快速描述一下 Marble 是什么.. 是的,. Marble 是底座的代号

06:23–07:05

说话人未分离:World Labs 一直在训练的模型。并迭代。基本能力。现在 Marble 是公开的。发布就是接受提示。可以的。成为一个图像,.它可以是一些图像或文本。并将其转化为几何代码。可以表示的一致世界。在 3D 几何中,。无论是高斯泼溅还是网格.. SceniX 团队真正正在做的是。试图解决这个问题极其困难。机器人技术中的问题,。这就是缺乏数据。缺乏。训练中的数据,。缺乏评估数据。这是非常、

07:05–07:47

说话人未分离:与语言模型非常不同。互联网上的数据非常丰富……我们知道这是为了机器人技术。去工作,。我们必须以某种方式释放力量。缩放定律。但是那是从哪里来的呢?从?。这是一件很深刻的事情。每个人都在努力解决的问题。在机器人技术领域。这实际上很棒。谈论这个能量。你已经投入了。在一起非常,。非常有才华的团队。你们组成的。一支非常有才华的团队。所以呢。是否存在重叠?这是延伸到什么程度?也许可以谈谈这个..是的,.这就是你如何赞美它。是.实际上是. TLDR 非常值得称赞。共同的使命。所以,。 World Labs 是三大技术之一。联合创始人,另外两位是长熙

07:47–08:29

说话人未分离:郑,.另一位哥伦比亚大学教授也曾是。世界级的模拟技术专家。张曦也有他的背景。 VFX。他在维塔工作过,他在腾讯工作过。他是一名企业家。然后就是。孙立虎,.他是一位杰出的工程领导者。他也在一家被收购的初创公司工作。亚马逊很多年前就出品了。所以他在许多不同的技术领域工作过。计算机视觉领域的堆栈。在亚马逊。所以当我们开始交谈时。更严重的是,。我认识到了这一点。 SceniX 从人才的角度来看。的观点是极其互补的

08:29–09:12

说话人未分离:World Labs.One 显然是安德鲁的。令人难以置信的思想领导力和正义。机器人领域的技术实力。对……所以从真正的硬件来看,。全栈机器人技术。甚至当他。是我在斯坦福大学的博士后。那时你已经有了你的师资。所以你只是为了一个。那一年,我想要你不止一年。年,。但他必须去做真正的工作……所以他是机器人技术的全栈研究员。从建模到硬件。当然,。 Yunzhu Li 和他在 SceniX 的学生是。World Labs 还没有这样的人才库。还没有。那么长溪这边是

09:12–09:54

说话人未分离:只是令人难以置信的模拟能力。正确的?。他是一位高级研究员和技术专家。模拟。以及 World Labs 是什么。做的事情非常多......接口。模拟世界。所以我想什么。显然,他们没有。是在生成模型方面。以及计算机视觉 3D 重建。边,。我们在 World Labs 也非常强大.. 所以这是 SceniX 需要的技术.. 所以在一起,..这两个方面结合在一起并形成。更加完整了。菲菲的动机。这就像这是一个扩展

09:54–10:36

说话人未分离:以及对进入机器人技术的赞美……经历过你的情况,。这决定了何时出售一家公司。很高兴收到您的来信。您如何看待加入 World Labs。和那里的适合程度以及为什么是你。决定这样做。是的,。所以一开始,。我们正在决定,好吧,。我们想继续前进吗?但和 Fei-Fei Li 聊天后。在看到所有的协同作用之后。发生在中间,。这对我们来说是非常有意义的。力量相互结合。所以在任何情况下。感觉,在 SceniX,。我们一直在做的事情看起来是真实的。至真实,.就是做密集重建了。环境。所以我们捕捉到了外观。环境的几何形状,环境的几何形状,。还有环境的动态。意味着环境的进展情况。当您应用操作时进行更改。所以

10:36–11:19

说话人未分离:现在正在进行密集的重建。还是稍微重了一点。以及 World Labs 现在拥有的。一直在做的事情涉及到很多深刻的东西。围绕稀疏重建和世代的能力。所以我们看到了很多机会。像 Marble 和其他这样的杠杆。World Labs 的能力按顺序排列。进行非常有效的重建。和环境建模。所以。我们可以期待一个基础模型吗?来自 World Labs 的机器人技术?World Labs 正在建立一个基础。模型,如你所知,。马丁。我们正在构建一个基本模型。随着技术的不断发展,。一些最令人兴奋的基础模型。是全向型号,对吧?

11:19–12:00

说话人未分离:他们采用多模式输入。他们有多模式输出。还有什么。是机器人技术的基础模型?它很可能会涉及到行动。它很可能会涉及到。除了动作的输出。世界的现状。我们绝对是。不排除这一点。是的,。太棒了。所以,例如,。对于基础模型,。它本质上需要是多式联运。模型。所以,。它必须考虑框架文本。图像、深度、。和不同种类的方式。并且。动作是非常、。该模式非常重要的一部分......所以,。如果你将框架动作视为。输入,。这本质上是一个前向模拟器。

12:01–12:43

说话人未分离:那将预测环境如何。当您应用 a 时,将会发生变化。具体动作。当动作输出时,。这本质上是一个政策模型。正在尝试预测,。给出一个具体的目标,。比如你应该采取什么行动。在真实的环境中拉近你们的距离。为了这个目标。所以这种全向模型。实际上可以受益匪浅。提供了巨大的价值。机器人社区试图理解。如何对环境和 at 进行建模。同时,。如何在环境中采取行动,还有这个。也可以充当你的支柱。微调到特定的机器人应用。确保它确实达到了要求。可靠性和效率。客户的期望。你知道,。Yunzhu Li,.如果你不介意成为一名外行投资者

12:43–13:24

说话人未分离:问题,。我看到很多机器人公司。而且。现在非常流行的方法。进来的机器人公司就像,我们将使用视频模型。你知道?。就像,你知道,。这是主要的方法。这是,你知道的。 3D 和模拟。这是非常不同的。所以也许你可以对比一下。你知道,。这种流行的方法就是使用。视频只是与某种野心相对。这里是。是啊,。所以为了用机器人创造单词。坎德勒,正如我提到的,这句话。需要捕捉基本结构。问题的关键。也是非常重要的问题之一。以及这些的必要要求。言语将是一致的。就是这样。我实际上看到的地方非常..与 Marble 有很强的协同作用,

13:25–14:09

说话人未分离:因为我们正在构建的是一致的。世界。空间上的一致性。随着时间的推移,随着不同的观点,。以及不同类型的互动……还有 Marble,。从 Marble 生成的单词。还提供了基础设施。整个世界的组成部分。我们相信这对于机器人来说是必要的。想象一下,如果一个机器人正在推动。一个物体向前,。物体就神奇地消失了。这一直是许多人的问题。现有的视频预测模型......它提供了足够好的信号。让机器人知道喜欢什么。正确的做法。但显然是正确的。现在,。已经有很多调查了。建设得越来越好、越来越强。并且像视频模型一样强大。所以我们。其实看到办法的地方还是有的。我们建造的基础设施可以提供。作为初始动力并进入

14:09–14:51

说话人未分离:这个数据飞轮从此更多。仿真驱动模型进入机器人。政策模型,.哪些将执行执行。在真实环境中,。收集新数据,。数据将返回,。其中模型不一定。必须是纯物理或学习。 -仅,但在中间的某个地方。能够捕捉到本质。问题的结构,.但同时,。能够扩展并变得更好。当你积累更多数据时效果会更好..你知道,我现在已经工作了。说,非常密切地一段时间,。而且……你一直都有这个北方。明星,这推动了这一点。而且,。你知道,。你曾以不同的方式表达过善意。 3D 和许多其他方式......我只是想知道,对于你来说,。是不是也有类似的哲学

14:51–15:33

说话人未分离:北极星,或者你更务实。就像我一样,构建系统。就像,做这件事?我的北极星是让机器人工作。在真实的环境中。我是一个很实际的人。人。我想让机器人工作。一。有趣的事情实际上即将到来。来自我与菲比的合作。我们的博士后,。我们正在建立这种基准。我们实际上发出了调查询问。普罗大众他们想要什么。机器人为他们做事。在数千个之中。我们收集的任务,。三分之一的任务是关于清洁的。人们只是不喜欢做那些喜欢的事情。枯燥又肮脏的任务。这些就是。我们真正想要的场景。确保我们有机器人解决方案。我真的很喜欢一件事。关于 SceniX,马丁,

15:33–16:17

说话人未分离:特别是继续你的问题。有很多机器人公司。建立模型等等。有一件事。我真正喜欢的是 Rindu 和 SceniX。他的联合创始人有这样一个令人难以置信的能力。机器人技术的务实方法。他们……尤其是他们来自学术界。正确的?。阳光明媚不,但 Yunzhu Li 和传熙来自学术界。但他们的第一本能是合作。真实的设计合作伙伴和客户。工业,无论是实验室。工业实验室或仓库或......电子产品。组装.电子组装.即

16:17–16:59

说话人未分离:事实上,这真是令人耳目一新。一种令人耳目一新的机器人技术……这真的让我非常兴奋。和他们一起工作。也许这是为了。你,云池,但我就只是,。这是个人好奇心,。在我看来,对于机器人技术来说。你必须非常准确。我的意思是,。不完美,。但非常接近。但对于创意来说。用例,。 Burl Epps 做了很多工作。你有点不需要因为,。你知道,。有时,犯错也是一种风格。或故意或其他什么。等等。从技术角度来看,。协调方面面临的挑战是什么?这两件事?或者他们永远不会和好?喜欢,。设计空间中总会有两个点吗?所以他们会在很长一段时间内和解

16:59–17:42

说话人未分离:学期,。当然。环境建模则不然。必须是完美的。模型却不然。必须在机器人技术方面做到完美。并且通过。顺便说一句,这纯粹是好奇心。但有没有像...更正式一点。这么说吧。比如,。不完美是什么意思?它必须非常接近。所以让我来吧。这么说吧,比如。一切发展的模型。不同类型的机器人应用。一直是一个非常重要的基石。如果你看看所有现有的机器人。应用程序,例如飞机。 Jones、Roomba,甚至四足机器人。双足机器人,.模型实际上是他们的方式。工作并能够从模拟转移。到真实的环境。但是如果你看的话。在那些运动机器人那里。比如四足机器人、双足机器人、

17:42–18:25

说话人未分离:他们可以在雪上行走。他们可以在灌木丛上行走。但你不需要有模拟器。他们可以模拟所有的灌木丛和。雪非常精确。你需要有。捕捉本质的模拟。问题的结构,并做整体。内部有不同类型的随机化。数字环境。就是这样。我们的目标是什么。所以基本上是。 SceniX 与 World Labs 一起。我们正在努力调查到底是什么。我们需要建模的保真度水平。巨大的,.除了机器人之外还有广阔的世界。这样我们就能够转移。机器人系统训练模拟。环境和数字世界回来了。进入真实场景。作为投资者,。我听过其他研究人员的说法。像谢尔盖·莱文那样说,说,。模拟最终总会出现偏差

18:25–19:08

说话人未分离:来自物理世界和现实世界。数据收集绝对至关重要。所以也许可以谈谈。喜欢这种方法的可行性。其中模拟是基石。反对其他一些方法。嗯嗯,。嗯嗯。所以他们并不矛盾。彼此。所以如果你正在考虑。模拟,.模拟本质上是试图预测。环境将如何变化。当你应用这些动作时。还有这个。本质上是世界的模型。但这并不一定是必须的。纯物理。它可以是组合。在物理和学习之间。我们正在收集现实世界的数据。我们。将使用那些现实世界的数据..只是处于不同的阶段。就像一个数据飞轮。也许在最开始。开始,。我们更加强调,

19:08–19:52

说话人未分离:我们还有更多的物理知识需要确定。我们有正确的一致性和正确性。我们学习世界的结构。让我们训练机器人策略..但是随着我们积累越来越多的数据,.既通过数据收集,又。通过与我们的客户的合作。我们将拥有正在移动的数据。走向更多基于学习的建模。环境的。所以这样的。转换以及此类数据。 Fly-On 确实是有利因素之一。两者都充分利用了两种物理原理。以及几何形状和一致性。以及所有的力量和魔法。从数据和计算中。我想。添加到此并稍微哲学化。这里,。之间没有二元选择吗

19:52–20:34

说话人未分离:模拟或不模拟。所有这一切。齐心协力,让机器人发挥作用。想想人类的智慧。我们做到了。我们脑子里有很多模拟。你。知道为什么吗?有一个非常重要的角色模拟。播放现实世界数据不播放的内容。这就是反事实推理。就是你玩了一些没有玩过的事件。发生或不可能发生,。或者你没有足够的数据来制作。它发生在现实世界中,而且是在你身边。玩出来,.你学习如何在其中行动。人类也是如此。一直都是这样。我们可能不会。你知道,我们只是,。我知道你参加了世界杯。我

20:34–21:17

说话人未分离:参加了世界杯。恭喜。西班牙获胜。我确信在计划中。每个游戏都有模拟。无论是数字的还是白板上的。或者什么,那个模拟,。模拟所扮演的角色是反事实的。推理。这非常重要。在机器人技术领域,因为我们没有。不可能有足够的现实世界。数据。这是一个现实生活中的例子。自动驾驶汽车行业。Waymo。已正式表示他们使用了数十亿美元。数小时的模拟。实际上。 Waymo 的模拟性更强。只是现实世界的数据很重。所以这些

21:17–22:00

说话人未分离:都是真实的例子。正如你所知,。马丁和婉如也一样。汽车是最简单的机器人..是的,2D,是的。是的,。显然,模拟发挥着巨大的作用。在机器人学习方面。我还想补充一点。对此。所以,就像,有,。如果你把事情说得更具体的话。模拟可以提供两个级别的。好处。第一个是可靠性。第二个是效率。所以,。为了可靠性,。如果您正在考虑机器人系统。在真实环境中可靠工作。你需要数据来提供系统性。覆盖所有状态空间和。机器人可能会遇到的变化..这就是您可以了解情况的方式。是稳健的。所以通过模拟,。你可以进行系统随机化

22:01–22:43

说话人未分离:以及照明的控制和变化。摩擦力、几何形状、物体类型。还有各种不同的身体活动。参数以确保您有足够的。状态空间的覆盖范围。所以这样。是可以给机器人系统带来的东西。可靠性。第二是关于效率。所以现在,。很多人都在做远程操作。而且。如果你看一下许多远程操作。设备,。想象你所有真实的骷髅。正在使用,.您实际上是在收集数据。以实际低于的速度。人类实际上正在执行任务。但是对于。我们的许多客户。人类的速度对他们来说还不够好。他们想要比人类的速度更快。所以对于机器人来说,移动得更快。这并不只是开车那么简单。机器人速度更快,因为重力不

22:43–23:26

说话人未分离:改变。但是在模拟中,。你可以做系统加速的。机器人的行为来训练机器人。这样它就考虑了所有的动态。环境的变化。所以是这样的。能为我们的客户带来什么。对于他们来说,.效率。所以两者都是为了可靠性。和效率,。有一些非常独特的价值观。模拟可以提供的地方。您已经。谈到了技术和。平台,。它是做什么的。也许说一下具体的。人们使用它的用例。嗯嗯..有必要的。就像两个特定的用例一样。尤其是围绕培训和。也围绕评估。好的。开始。从评价来看。所以评价是。人们经常忽视的事情。但如果你正在训练

23:26–24:08

说话人未分离:就像沃达丰的机器人一样。你必须知道它的效果如何......这是唯一的信息来源。供您迭代。顺便说一句,。很多,。每个人工智能人都真正明白什么。 evals 一直在使用它......非 AI 人。它通常意味着一些不同的东西......所以也许它甚至值得描述。具体来说你所说的评估是什么意思..好吧。所以我所说的评估的意思是。你就会明白这一点。具体检查点,。它的表现如何?例如,它是否执行。 95% 的时间还是 99.9% 的时间?以及人们在工业中使用的关键标准。需要多长时间?工作时间需要多长时间。你要区分一个检查点

24:08–24:50

说话人未分离:这是从检查点开始的 90%。 92 分?如果你只在现实中这样做。环境,。只是你需要花很长时间才能做到。区别。如果你真的的话。还要考虑机器人评估。现在人们正在做真实的事情。环境,.迭代速度是多个数量级。比迭代慢很多。这些语言模型。所以不仅如此。就像机器人的任务多种多样一样。非常多样化。哦,是的,。因为你实际上必须...去做。是的,是的,是的。是的,对,。对。就像原子必须穿过一样。空间。是的。完全正确。但只有这样。必须遵守物理定律……你看过那些机器人吗?视频?每个视频都有大约 10 倍。 8x,

24:50–25:33

说话人未分离:因为它移动得很慢。完全如此。不仅慢,而且危险。这是昂贵的,但同时,。速度也就像多个订单一样。我们的一些客户也是如此。实际上需要这个数字环境..可以用来评估他们的机器人。系统。而且因为我们的数字环境。已被证明与真实相符。世界,。所以意味着场景中发生的任何事情。现实中也有可能发生。环境。检查点是否正在工作。在模拟中效果更好。它也很有可能有效。在真实环境中效果更好。正如我们在中也已经讨论过的。博客文章。所以这实际上给了我们。客户实际上非常有信心。使用数据,。使用来自数字环境的信号

25:33–26:16

说话人未分离:做可扩展的,。安全且更快的评估。他们的机器人系统。太棒了。所以。是评估。然后是培训。所以在培训方面,。所以基本上,就像我也提到的那样。这是关于可控性的。所以你想要的。控制所有不同的可能。状态、参数的变化。照明、摩擦、物理参数。甚至像物体几何形状一样。对象类型。所以你要确定。您对所有内容都有足够的覆盖范围。不同类型的场景,。这样你就能够生成。为您的机器人提供信息数据。保持稳健。而这就是这样。在真实环境中很难做到。就像我们讨论的,如果你进行潮汐操作,。您收集的速度。数据很慢。你也受到限制。比如你有多少个机器人,

26:16–26:59

说话人未分离:你有多少个潮汐操作装置。有。就像一个完全不同的。围绕所有数据的挑战。围绕它进行操作。但是在模拟中,。一切都是可控的,一切都可以系统化,一切都可以。可以在你所在的水平上理解。确切地了解并提出主张。您所涵盖的到底是什么发行版.. 培养对内部的信心。分配,。我们知道机器人会工作。所以那些。各种信心和效率。可扩展性是我们客户所关心的。也重视使用我们的数字世界。用于机器人系统的训练.. 这就是疯狂的事情。甚至在 SceniX 之前。我们正在谈论,。我们的 Marble 入境客户是。已经看到了这种需求。

27:00–27:43

说话人未分离:我们只是无法为这些客户提供服务。但我们已经得到了很多。来自机器人的电话。早期的机器人公司是谁。一路开发他们的模型。至下游,.非常务实的用例。我们正在看到。这些需求。当人们听到你的时候。进入机器人领域,。他们会想象的是你。拿出一台 3D 打印机就可以了。然后将开始制造硬件。你将对大脑进行编程。机器人并将其粘贴在机器人中。然后你就有了一个机器人。而我没有。我想这就是你们所说的。关于这里。所以也许可以谈谈哪里。这符合创作的生命周期。一个机器人,你将在哪里结束以及在哪里

27:43–28:25

说话人未分离:生态系统的其余部分将结束..将开始。所以我们一直在建设。你可以想象,。是一个像软件一样的基础设施。围绕这些为人们服务的基础设施。到,为了他们,。构建机器人可以学习的单词。并评估。还有这个基础设施。自然是模型不可知论和具体化的。 -不可知论者。所以我只想变得非常。清除,。只是因为这其实是一个非常。微妙,我的意思是,对你来说这是显而易见的。但这是一个非常微妙的点。这是从你所说的。这不是建造机器人,而是建造。另一个公司的环境。可以放置他们的机器人大脑来导航。是的,对于我们的客户来说也是如此。现在,。他们有各种各样的机器人。

28:26–29:08

说话人未分离:例如,有些正在使用。单机械臂。有些使用双臂。有些使用固定臂。有些是。使用像移动操纵器。一些。正在使用夹具。有些正在使用一些。制造商的更复杂的版本......所以我们现在的平台是很自然的。体现不可知。我们可以很容易地做到。集成不同类型的机器人。实施例,。能够将它们放入世界中。我们生成,我们数字化,。这样我们就能够提供这些。单个机器人的执行能力。正确的任务和正确的级别。的可靠性和效率。真实的环境。我们也是。例如,。与模型无关。所以我们可以直接使用。我们的世界生成的数据。从头开始训练不同的模型。或者在现有基础上进行后期培训

29:08–29:50

说话人未分离:模型,.像视觉语言动作模型或。文字动作模型。所以对我们来说,。没关系。我们只是想做。当然我们有基础设施。我们有所有的话,。使机器人能够可靠地工作。在真实环境中。你知道,。你告诉我你想了很多。围绕人形机器人的预测。有点激进,我们也是。可能会看到更多受限的推出。比如仓库什么的。可以吗?谈论一下这个问题之类的。这如何影响你要做的事情。在……像 World Labs 一样?所以这是一个非常好的问题。所以如果。你看,例如,。机器人应用的所有进展。在真实环境中,。它一直紧随潮流

29:50–30:32

说话人未分离:来自完全结构化的环境。进入半结构化环境和。然后进入非结构化环境。对于完全结构化的环境,。我们的意思是你有知识。并控制所有配置。在环境中。像工厂。像工厂,或者例如,。汽车生产线。那些都是。自动化已经有几十年了。是的,。是的,是的。然后你就有了,。例如,半结构化环境。您对其有一定的控制权。环境,例如。比如亚马逊仓库。或者例如,像餐馆一样。酒店,.你有一定的控制权。刚刚完成任务的环境。对你的机器人来说更容易。但确实有。显然还有许多其他对象。或为。例如,衣服。这些是你没有的物品。控制。然后对于非结构化

30:32–31:13

说话人未分离:环境,.这就像你的家和我的家。是,我会说,。巨大的挑战。尤其是我的房子。相信我,三只狗。五岁的孩子。是的,。狗。完全正确。如果你在想的话。稳健性从何而来。稳健性来自于充足。覆盖机器人的场景。可能会遇到。所以就容易多了。并且更加平易近人,。至少像现在这样。更多地关注半结构化。在我们完全进入之前的环境。非结构化环境。所以我们会的。朝那个方向前进。只有我们。想要采取更可持续的方式。更现实的方法......我认为你的观点是人形机器人。模仿人体,

31:14–31:57

说话人未分离:进化优化了人体。对于非结构化环境。等等。我们的手指,我们的腿,。不是执行此操作的最佳设备。事物。例如,。如果我们作为一个物种的唯一目标就是这样做。爬树,.我们不一定会有这个身体。正确的?。所以我们会有不同类型的手指……但人类最终会拥有什么。都参与进来,演变成了这个,。这身材那可就很一般了。但不一定在所有事情上都是最好的……这是为了非结构化的生存。环境。但是从商业角度来看

31:57–32:39

说话人未分离:的观点,。从务实的技术角度来说。看法,。这种非结构化环境和。广义的身体其实是最难的。问题要解决,不一定。甚至是解决问题的正确方法..我们是专业的..所以我们采取更专门的机构来。解决一个更狭窄的问题。但是挑战。对于 SceniX 来说,。是不是更加不可知论身体呢?他们的基础设施可以服务。不同的身体和不同的半。 -结构化环境。通用镜头。这个问题具体看一下就是。经济镜头,对吗?

32:39–33:21

说话人未分离:这是,。如果你将它与生成法学硕士进行比较。他们可以创作一万篇散文或代码。比人类快几倍,。比人类便宜很多……所以经济情况是有道理的,因为。我们的大脑在这方面效率不高。那个。但是,。我们的大脑和身体都非常高效。 3D 导航,对吧?你知道,。就像世界各地的电影都在挑选。所以这只是一个预测。问题,。但你相信我们能做到吗?建造机器人,。至少在可预见的将来,。其电源效率为 a。当谈到卑微时,人类。任务?那么我们就说基本上吧。你知道,。最小重量或类似的东西......比如我们离这个还有多远?

33:22–34:04

说话人未分离:这是五年还是这样。绝不?。是的,我认为这需要很长时间。很长一段时间。所以如果你真的在思考的话。关于真实环境中的机器人。到底,。它永远是一个系统。所以每一个。在真实环境中工作的机器人。是一项系统工作。你需要非常。心思缜密,思考如何了。系统正在整合在一起。硬件。软件,大脑,。甚至细节,例如。的摩擦系数是多少。你的手指。所以有很多东西。你必须考虑做这些事情。现实。这需要迭代。但我感到兴奋的是。我一直处于这样的状态。机器人学习和尝试的艺术。推动最先进的技术向前发展..但最先进的技术总是在不断发展

34:04–34:46

说话人未分离:比我预期的要快。所以我正在关注什么。并立即尝试调查。与例如非常不同。当我开始攻读博士学位时。这是一次演讲。整个生态系统的速度有多快。一直在发展和所有移动的部分。开始聚集或建造。这些机器人系统。但我们也有。校准我们的预测..所以我们会看到很多进展。但是。实现,例如。人类水平的效率和能力。需要更长的时间。马丁,。当今人工智能中最难的事情就是。有正确衡量的乐观情绪。对……对。完全正确。是的。我的意思是,。即使是法学硕士也没有人脑

34:46–35:28

说话人未分离:效率。人脑的运行功率为 30 瓦。是的,。确实如此。所以我们离那还很远。但是,我的意思是,。性能...给它供电可能很接近。正确的?。在诸如软件工程之类的狭隘任务中……比如生成图像或软件。工程,就是这样,对吧?是的,我想是的。我不认为我们是。谈到机器人技术,这是否会改变您的想法?你的,就像战略上的那样。您的团队的雄心水平。可以去追吗?我是说,。它会改变这一点还是仍然如此。非常符合你的预期。做什么?你什么时候开始的?它确实改变了轨迹。以一种非常深刻的方式。所以我们看到了。能够做很多事情

35:28–36:11

说话人未分离:这整个过程通过建模。环境的效率更高。以及更具可扩展性的方式。尤其是在与. World Labs。我也想添加。Fei-Fei Li,如果你想想,。例如,。语言模型的当前状态。这些都是令人难以置信的模型。能力。但是,。你不只是空白地相信它可以预订。您的机票或预订酒店。保留。你仍然,希望,。他们仍然是一个正在读书的人。这些语言模型的输出……但这与如何输出有很大不同。例如,人们将使用。机器人模型。基于机器人模型,。开箱即用,。机器人必须在其中可靠地工作。真实环境。所以,。我们甚至没有数据。我们没有。甚至拥有所有必要的基础设施

36:11–36:55

说话人未分离:围绕着机器人的那些。开箱即用,工作可靠。真实的环境。因此,出于这个原因,。能够创造这个数字世界。那里有一个可扩展的数字世界。机器人可以在内部学习和评估……这将解锁更多。能够替代的潜力。中所有昂贵且不安全的数据。生成数据的真实环境。来自“机器人”一词。能够进行可扩展的学习和评估..我见过许多这样的集成..它们实际上在这方面工作得很好。当他们有如此多的对齐的阶段。这太棒了。但总有这个。的问题,.你现在融入正在发生的事情了吗?现在,。或者你把事情分开。提供一个长期轨迹

36:55–37:39

说话人未分离:会在年内实现吗?你怎么想这个,。Fei-Fei Li?这是正确整合的东西吗?离开,。或者这是一个单独的长期。事物?。这是一个很好的问题。我想。这一点,云珠你知道。昌熙,Sunny,Justin,Ben,。我一直在谈论这个..此时,.我们会深思熟虑。我们不会急于整合所有内容。从代码库到团队。因为我认为 SceniX 确实有一个非常。好想,。我不会将其称为完全独立的。但相当包含技术堆栈,

37:39–38:21

说话人未分离:以及他们的客户。以及它们的产品类型。建设。我们需要时间。我们一定会的,。我们已经有了一个模拟端。以及潜在的基础模型。动作条件模型侧,。我们已经开始交谈了。并且。他们还使用 Marble 作为内部。客户。所以我们将整合,。但我们并不急于整合团队。就像一个完整的沙拉碗。你好吗。思考地理?所以这与风景的举动,。它会留在同一个地方吗?我们要去……维云德拉要去。移动。哦,好吧,。欢迎。是的。我要搬到旧金山。

38:21–39:03

说话人未分离:是的,。佛罗伦萨到文艺复兴.完美.I.我认为我们...Aurora Labs 正式上线了。成为一家两岸公司。总部位于旧金山..我,你知道,.我住在帕洛阿尔托。我觉得我是。处于……不同的状态。但我实际上是。很高兴我们将有一个。纽约办事处可以帮助我们。吸引东海岸的人才..而且,.我们一直在谈论确保。在两个办公室,。我们设置了机器人以便我们得到。基本上测试并成熟我们的。工程堆栈以便我们可以工作

39:03–39:48

说话人未分离:远程使用机器人,因为我们有。无论如何,为我们的客户做到这一点......所以也许只是非常具体。Fei-Fei Li,也许我们就用铅笔写下来吧。两年内完美成功的案例是什么?你有什么产品?谁在参与其中?他们如何使用它?只是脆,。这会变成什么。我很高兴。 SceniX 团队和 World Apps 团队将会。已经在小范围内得到了验证的客户。重要垂直用例的数量。我们的系统在哪里,。我们的基础设施已被证明是。真正有利于他们的自动化

39:48–40:32

说话人未分离:需求。这些客户就成了我们的。灯塔示例来扩展我们的业务.. 多早,.假设有人在听这个。正在经营一家机器人公司。他们应该在什么阶段参与。World Labs?真的很早吗?是在中间的某个地方吗?所以现在,对于我们的客户来说。因为我们正在构建这种。real-to-sim-to-real 管道。本质上是模拟。我们要提供的话。培训和考核场地,。一些客户,。他们只需要真实到模拟的部分。他们希望将任务数字化。关心并能够进行评估

40:32–41:14

说话人未分离:他们的机器人系统。一些客户。需要这个真实的感觉。这整个管道,。这样他们就能拥有。在他们的硬件上运行的策略......所以我们的平台也是以一种灵活的方式设计的。取决于我们客户的需求......同时,.我们正在合作的客户实际上是。非常接近部署阶段。所以基本上,他们正在努力。非常实际的任务。那些任务,。更换时,.当我们有了机器人解决方案时。有吗,.可以立即创造价值。并且。他们至少有数十或数百。他们就是这种情况。正在考虑进行自动化。因为,就像与 World Labs 一起,

41:14–41:57

说话人未分离:我们将能够开发可靠的解决方案。对于这些场景。正如我们已经做到的那样。显示,.我们已经有很多场景了。在我们的博客文章中实例化了。我们将能够进一步开展调查。看看他们如何真正解决这个问题。关键是要求和约束。面对现实世界的部署..太棒了,.我想非常具体地说明这一点..是否太晚或太早。如果您是机器人专家,请致电 World Labs。公司?。不,。我们希望每个人都给我们打电话。我们愿意。了解您的用例。太棒了..如果您正在听这个并且您是。靠近机器人项目的任何地方。或机器人公司。请追踪 World Labs。是的,。谢谢。肯定可以营业了。是的,。我们已经开门营业了,不算太早。

41:57–42:40

说话人未分离:好吧。如果你正在研究机器人技术。致电 World Labs。非常感谢你们俩。非常感谢您的光临。谢谢。谢谢。听 A16Z 的这一集。播客。如果您喜欢这一集,.一定要点赞、评论、。订阅,给我们评分或评论。并与您的朋友和家人分享。欲了解更多剧集,请访问 YouTube。苹果播客,。和 Spotify。在 A16Z 的 X 上关注我们。在 a16z.substack 订阅我们的 Substack。 .com.再次感谢您的收听。我会在下一集中见到你..作为提醒,.这里的内容仅供参考。仅用于目的。不应采取。作为合法的商业,税收,。或投资建议,。或用于评估任何投资。或安全,。并且不针对任何投资者

42:40–42:55

说话人未分离:或任何 A16Z 基金的潜在投资者。请注意 A16Z 及其附属公司。也可能会维持投资。本播客中讨论的公司..欲了解更多详细信息,.包括我们投资的链接。请参阅 a16z.com 正斜杠披露。

Related content

Comments

Sign in to comment.