Fei-Fei Li:AI 正在争夺世界模型

Fei Fei Li:World Labs 如何让 AI 学会“换个位置看”

2026 年 9 月 4 日,a16z Show 发布《Fei Fei Li: The Race to Build World Models For AI》。本期由 Martin Casado 主持,嘉宾为 Fei-Fei Li、Justin Johnson 和 Ben Mildenhall。节目围绕 World Labs 的 Atlas 展开:模型接收图像、视频、文本、深度和摄像机位姿等输入,把它们放进共享的空间语境,再生成新视图、三维结果和仿真内容。1
这篇图片笔记把节目观点、World Labs 官方资料和嘉宾公开履历分开呈现。节目具体说法、数字与金句来自官方整集音频的 ASR 底稿;广告、重复幻觉、静音和说话人混淆的位置保留为明确标记。ASR 适合还原顺序,无法替代人工核对的官方逐字稿。

按原始播客顺序逐段精读

  1. Atlas 把“新视图预测”放在中心。 Justin Johnson 将 Atlas 概括为能生成、重建和仿真的新一代世界模型。模型可以从一张或多张图像出发,沿着用户指定的摄像机轨迹生成视频帧;也可以用稀疏视图重建真实场景,再输出新视角视频或显式三维结果。World Labs 官方页面还列出图像、视频、点云、三维 Gaussian splat 与显式几何等输出形式。2
  2. 核心变化是“相机换位后,世界仍然接得上”。 Atlas 把输入组合成共享的空间语境。虚拟摄像机可以被放到空间和时间中的新位置,模型据此生成对应视图。Fei-Fei Li 把摄像机位姿称为理解空间几何的关键信息;空间智能还要继续走向空间生成、空间推理、编辑、交互、仿真和行动规划。
  3. 生成与重建被放进同一架构。 传统三维重建需要大量视图来三角测量看得见的点;输入没有拍到的区域仍然会留下空洞。节目把生成能力放在这里:模型先利用可见证据建立空间,再对不可见部分做有依据的补全。Atlas 还可以接收几十乃至上百张输入图像,输入越多,模型需要想象的部分越少。2
  4. Marble 到 Atlas 的变化,是摆脱单一输出瓶颈。 节目把此前 Marble 的 Gaussian splat 输出作为对照。Atlas 的底层基本能力变成新视图预测,因此可以按需要生成 RGB 帧、三维结果或 Gaussian splat 世界。World Labs 官方资料称,Atlas 从头预训练,原生处理文本、图像、视频和三维。
  5. 扩展规律已经出现,但算力仍是当前约束。 嘉宾说,模型变大、训练更久、使用更多芯片时,效果会明显变好。团队在发布前沿着小模型到大模型的扩展阶梯逐步验证;节目中的“50 到 100 倍”是对捕捉数量下降的现场说法,读者应把它与官方页面列出的输入能力分开阅读。
  6. 创意、建筑和机器人共享同一条空间底稿。 创意工作者可以从旧图像、互联网素材或随手拍的视频里恢复可导航的空间;建筑与施工团队可以先预想需要建造的真实场景;机器人团队则需要把真实环境转成可随机化的仿真环境,再把策略送回现实。Fei-Fei Li 的 Stanford 官方资料显示,她是 Stanford 教授、HAI 创始联合主任、ImageNet 创建者,也是 World Labs 联合创始人兼 CEO。3
  7. 机器人场景最缺的是现实中的行动数据。 图像、视频和代码都能在网上找到大量静态样本;机器人策略要在环境里采取行动,环境还会用意外方式回应。节目提出数据驱动的神经仿真器:模型学习环境如何回应行动,再用仿真器训练机器人策略。随机化需要改变电缆弯曲方式、盒子的尺寸、颜色、盖子和摆放位置,避免机器人只记住一个固定场景。
  8. 动力学与可编辑性是下一阶段。 嘉宾认为 Atlas 的预训练已经包含部分动力学,但本次发布的后训练更多强调静态空间和摄像机运动。节目提到水面波浪和移动汽车等例子,也承认更丰富的时间变化仍然值得继续改进。Ben Mildenhall 将动态与静态的差异转译成“可编辑性”:用户需要控制场景、布局、物体身份、人物动作和时间,同时保持输出质量。
  9. 最后的判断。 Fei-Fei Li 认为,空间智能要把看见、体验和交互连起来。节目最后把新视图预测类比为语言模型的下一词元预测:动物通过移动获得新的视角,模型则需要学会在空间中回答“如果相机换到那里,会看到什么”。这句话是节目观点与类比,不等于已完成的通用物理理解。

嘉宾背景

  • Fei-Fei Li:Stanford 教授、Sequoia Professor、Stanford HAI 创始联合主任、ImageNet 创建者,World Labs 联合创始人兼 CEO。3
  • Justin Johnson:University of Michigan 助理教授、Meta FAIR 研究科学家,研究视觉推理、视觉语言、图像生成与三维深度学习推理。4
  • Ben Mildenhall:World Labs 联合创始人,曾任 Google Research 研究科学家;UC Berkeley 博士,NeRF、mip-NeRF 360、Zip-NeRF、DreamFusion 与三维视图合成研究者。5

逐句全文翻译

以下内容按官方整集 MP3 的 467 条 ASR 位置保留。每一行只保留中文译文;无法从音频识别结果可靠还原的内容,使用明确标记。时间码沿用音频时钟,部分广告、片头片尾和重复识别也保留在原位置。
0:00:00.03–0:00:10.17|Martin:在走向空间智能的路上,生成真正具有空间语境、并且扎根于空间的像素,是 Atlas 迈出的极难一步。 0:00:10.17–0:00:16.73|Martin:我们知道,大语言模型建立在下一词元预测上;视频模型被理解为建立在下一帧预测上。Atlas 真正做的是新视图预测。 0:00:16.74–0:00:21.78|Martin:这里可能是人工智能真正为人和工作流程释放大量价值的地方。 0:00:21.78–0:00:23.82|Martin:节目里提到,捕捉成本可能降低 50 到 100 倍。 0:00:23.82–0:00:27.34|Martin:《黑客帝国》第一部里有一个著名镜头:Neo 正在坠落。 0:00:27.34–0:00:31.34|Justin:当时他们用数百台摄像机,从绿幕周围拍下那个角度。 0:00:31.34–0:00:33.68|Justin:Atlas 只用三台摄像机就能做到。 0:00:33.68–0:00:36.72|Justin:不需要摄影棚捕捉、不需要绿幕,也不需要昂贵的校准。 0:00:36.72–0:00:38.94|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:00:39.13–0:00:41.17|Martin:你们开始做这件事时,知道它会成功吗? 0:00:41.17–0:00:43.59|Fei-Fei:我相当有把握。模型每次变大、训练时间每次变长,效果都会明显变好。 0:00:43.59–0:00:44.89|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:00:44.89–0:00:47.85|Martin:这是否意味着我们会得到四维视频,可以在场景里走动? 0:00:47.85–0:00:49.67|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:00:50.17–0:00:53.53|Martin:语言模型围绕下一词元预测建立。模型如果学会预测世界的下一个视图,会发生什么? 0:00:53.53–0:00:57.85|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:00:57.85–0:01:10.85|Martin:本期 Martin Casado 与 World Labs 联合创始人 Fei-Fei Li、Justin Johnson、Ben Mildenhall 讨论 Atlas,以及构建能够理解物理空间的人工智能所面对的更大问题。 0:01:10.84–0:01:22.66|Martin:三位嘉宾解释 Atlas 如何把生成与三维重建结合起来,为什么团队选择新视图预测作为底层基本能力,以及团队如何扩展一个此前未经验证的方法。 0:01:22.66–0:01:32.66|Martin:节目还讨论仍待补齐的部分,包括更丰富的动力学与交互,以及世界模型如何最终连接仿真、机器人和行动规划。 0:01:32.96–0:01:36.02|Martin:这些讨论背后有一个更大的假设:新视图预测能否像下一词元预测之于语言一样,成为空间智能的基础? 0:01:36.02–0:01:38.10|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:01:38.10–0:01:40.94|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:01:40.94–0:01:42.26|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:01:44.76–0:01:49.56|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:01:49.56–0:01:54.94|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:01:54.94–0:01:58.32|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:01:58.32–0:02:00.76|Justin:Atlas 是我们的新一代世界模型。它有三项基本能力:生成、重建和仿真世界。 0:02:00.76–0:02:04.08|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:04.35–0:02:06.59|Justin:Atlas 具备几项主要能力。 0:02:06.59–0:02:08.89|Justin:它很擅长受摄像机条件控制的生成。 0:02:08.89–0:02:11.09|Justin:你可以输入一张图和一条摄像机轨迹,让模型生成来自任意视角的视频帧。 0:02:11.09–0:02:13.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:13.49–0:02:17.27|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:17.27–0:02:20.11|Justin:Atlas 也很擅长从稀疏输入进行三维重建。 0:02:20.11–0:02:23.83|Justin:你可以输入一帧,或最多 100 帧真实世界的视图,让模型据此重建现实世界。 0:02:23.83–0:02:25.31|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:25.31–0:02:28.05|Justin:重建结果可以是穿过空间的新视频,也可以是空间的显式三维重建。 0:02:28.05–0:02:30.17|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:30.39–0:02:32.19|Justin:最后,Atlas 还可以用于仿真。 0:02:32.19–0:02:36.39|Justin:我们展示了很有冲击力的子弹时间视频,也展示了机器人仿真。 0:02:36.39–0:02:39.29|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:39.29–0:02:41.59|Justin:子弹时间这个说法来自《黑客帝国》。 0:02:41.59–0:02:45.09|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:45.09–0:02:51.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:51.49–0:02:55.09|Justin:《黑客帝国》的那个镜头用了围成一圈的数百台摄像机。 0:02:54.99–0:02:56.37|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:56.37–0:02:59.35|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:02:59.55–0:03:03.23|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:03.31–0:03:05.99|Justin:现在用 Atlas,最少三台摄像机就能做到。 0:03:06.23–0:03:09.35|Justin:三台 iPhone 放在三脚架上,就可以拍摄正在发生的事情,例如有人投篮,或草莓掉进牛奶碗。 0:03:09.55–0:03:18.67|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:18.89–0:03:27.99|Justin:Atlas 可以从三段 iPhone 视频重新构图,仿佛冻结时间,让摄像机飞近飞溅的牛奶,得到冻结时刻的视图。 0:03:28.31–0:03:29.87|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:30.39–0:03:33.09|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:33.09–0:03:34.45|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:34.85–0:03:39.67|Justin:Atlas 最核心的原则之一,是新视图预测。 0:03:39.99–0:03:46.31|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:46.73–0:03:49.07|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:49.07–0:03:52.31|Justin:大语言模型建立在下一词元预测上,视频模型建立在下一帧预测上;Atlas 做的是新视图预测。 0:03:52.31–0:03:54.51|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:54.51–0:03:56.93|Justin:给定场景的若干视图,或者场景描述,输入会进入我们称为“空间语境”的东西。 0:03:56.93–0:03:58.37|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:03:58.37–0:04:00.57|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:00.57–0:04:02.49|Justin:空间语境隐式描述了我们要讨论的世界。 0:04:02.49–0:04:05.45|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:05.45–0:04:07.55|Justin:你可以把虚拟摄像机指向空间和时间中的任意位置,Atlas 会理解世界从那个位置看起来应该是什么样。 0:04:07.55–0:04:09.25|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:09.25–0:04:10.73|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:10.73–0:04:17.97|Martin:很多视频模型都声称自己是世界模型,也声称能生成新视图。它们与此前的模型具体差在哪里? 0:04:17.97–0:04:24.81|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:25.31–0:04:29.27|Ben:Justin 提到的空间语境非常重要。 0:04:29.27–0:04:33.53|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:33.54–0:04:56.70|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:55.55–0:04:56.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:56.55–0:04:58.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:04:58.55–0:05:00.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:00.55–0:05:02.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:02.55–0:05:04.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:04.55–0:05:06.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:06.55–0:05:08.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:08.55–0:05:10.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:10.55–0:05:12.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:12.55–0:05:14.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:14.55–0:05:16.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:16.55–0:05:18.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:18.55–0:05:20.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:20.55–0:05:22.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:22.55–0:05:46.21|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:46.21–0:05:50.41|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:05:50.42–0:05:54.62|Martin:Atlas 是传统视频模型的扩展版本,还是一种新的架构? 0:05:54.62–0:05:57.62|Justin:它在几个方面都很新。第一,它在同一个模型里联合进行生成与重建。 0:05:57.62–0:06:02.52|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:06:02.52–0:06:07.92|Justin:模型可以接收这个房间的几张视图,然后重建你看到的整个房间。 0:06:08.06–0:06:14.30|Justin:过去,重建是计算机视觉中的独立领域,有自己的任务和专用模型。 0:06:14.30–0:06:20.58|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:06:20.58–0:06:22.30|Justin:生成模型很适合创意应用,例如想象一个此前从未存在的东西。 0:06:22.30–0:06:24.58|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:06:24.58–0:06:30.62|Justin:Atlas 第一次把视觉智能中的生成与三维重建放进同一个模型。 0:06:30.62–0:06:34.78|Justin:因此,Atlas 可以在同一架构中同时进行三维重建和生成。 0:06:35.11–0:06:37.21|Justin:为了做到这一点,团队做了几项改变。 0:06:37.21–0:06:40.15|Justin:Atlas 从一开始就是多模态的。 0:06:40.15–0:06:42.99|Justin:它原生处理文本、图像、视频,也原生处理摄像机位姿。 0:06:42.99–0:06:45.83|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:06:45.83–0:06:47.15|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:06:47.15–0:06:48.43|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:06:48.43–0:06:52.79|Justin:模型还把三维作为原生模态来处理。 0:06:52.79–0:06:56.97|Justin:Atlas 从一开始就被设计成原生多模态。 0:06:56.97–0:06:59.13|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:06:59.13–0:07:03.93|Martin:这里的三维指的是深度、模型,还是别的东西? 0:07:03.93–0:07:06.63|Justin:目前使用的表达方式是深度图。 0:07:06.63–0:07:11.61|Justin:一帧画面可以带有虚拟摄像机,用来说明摄像机在三维空间中的位置。 0:07:11.61–0:07:22.61|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:07:44.11–0:07:44.91|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:07:51.11–0:07:51.91|Justin:文本、图像、视频和三维摄像机是 Atlas 联合处理的模态。 0:07:41.76–0:07:42.56|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:07:48.16–0:07:48.96|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:07:53.38–0:07:54.18|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:09.20–0:08:33.32|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:33.40–0:08:35.60|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:35.60–0:08:41.00|Martin:World Labs 一开始就想解决空间智能。这个新模型为什么是迈向一般空间智能的重要一步? 0:08:41.00–0:08:45.62|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:45.62–0:08:48.68|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:48.68–0:08:49.68|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:49.68–0:08:53.06|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:53.06–0:08:57.92|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:08:57.92–0:09:01.52|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:09:01.94–0:09:14.20|Fei-Fei:空间智能最终必须让我们生成空间、在空间中推理,并且能够编辑和交互。 0:09:14.20–0:09:16.42|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:09:16.42–0:09:21.98|Fei-Fei:如果加上时间维度,最终是四维;即使先看三维,这些也是基础能力。 0:09:22.12–0:09:40.72|Fei-Fei:空间智能需要支持渲染、仿真和行动规划。要做到这一点,模型必须理解空间的几何、结构和物理。 0:09:40.72–0:09:54.86|Fei-Fei:Atlas 的重要进步在于,每一帧都能生成并估计一个关键信息:视点,也就是摄像机位姿。 0:09:54.86–0:10:00.32|Fei-Fei:摄像机位姿是理解空间几何最关键的信息。 0:10:00.32–0:10:07.26|Fei-Fei:这个信息可以带来模型下游出现的各种涌现行为。 0:10:07.26–0:10:10.64|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:10:10.86–0:10:18.62|Fei-Fei:生成像素只是早期步骤;生成真正具有空间语境、并且扎根于空间的像素,是另一项重大进步。 0:10:18.62–0:10:26.34|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:10:26.34–0:10:30.30|Fei-Fei:Atlas 迈过的正是这一步。 0:10:30.30–0:10:33.18|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:10:33.79–0:10:34.85|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:10:34.85–0:10:45.23|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:10:45.23–0:10:50.45|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:10:50.45–0:10:57.69|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:10:57.69–0:11:00.29|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:00.29–0:11:03.23|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:03.24–0:11:05.78|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:05.78–0:11:08.00|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:10.46–0:11:12.46|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:12.46–0:11:14.46|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:14.46–0:11:16.46|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:16.46–0:11:23.46|Justin:去年我们发布了 Marble 世界模型,它是 World Labs 推出的第一个大型世界模型。 0:11:23.46–0:11:25.46|Justin:Marble 可以接收图像、视频和文本提示,生成三维世界。 0:11:25.46–0:11:31.46|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:31.46–0:11:35.46|Justin:Marble 与 Atlas 最大的区别之一,在于输出模态。 0:11:35.46–0:11:39.46|Justin:Marble 主要把 Gaussian splat 作为输出表示。 0:12:10.44–0:12:11.24|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:45.87–0:11:46.67|Justin:Gaussian splat 很有用,渲染方便。 0:11:46.43–0:11:47.29|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:50.95–0:11:51.75|Justin:它可以在移动设备和虚拟现实设备上高效渲染,也能与游戏引擎和仿真引擎互操作。 0:11:54.97–0:11:55.77|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:11:57.01–0:11:57.81|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:12:00.95–0:12:01.75|Justin:但 Gaussian splat 也成为此前 Marble 模型的一个瓶颈。 0:12:03.36–0:12:04.16|Justin:Atlas 因此重新设计了这套系统。 0:12:11.56–0:12:12.36|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:12:17.04–0:12:17.84|Justin:Atlas 的基础能力是新视图预测,而不是只能生成 Gaussian splat 世界。 0:12:20.08–0:12:20.88|Justin:新视图预测可以生成 RGB 帧,也可以生成三维结果;需要时,团队仍然可以用这些结果生成漂亮的 Gaussian splat 世界。 0:12:38.78–0:12:39.58|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:12:39.40–0:12:51.03|Justin:另一个部分是沿着扩展阶梯向上走:先做小实验和小模型,建立对方法能否扩展的判断。 0:13:00.07–0:13:00.87|Fei-Fei:公司成立时,空间智能还没有现成的扩展规律。 0:13:03.35–0:13:04.15|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:13:03.69–0:13:04.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:13:06.63–0:13:07.43|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:13:07.95–0:13:08.75|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:13:18.31–0:13:19.25|Fei-Fei:团队有清晰的目标,但经过几轮迭代后,才找到认为可以扩展的表达方式。 0:13:34.75–0:13:35.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:13:58.25–0:13:59.05|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:13:59.25–0:14:00.32|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:03.58–0:14:04.38|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:20.00–0:14:20.80|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:21.40–0:14:22.20|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:22.82–0:14:23.62|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:23.42–0:14:24.22|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:26.30–0:14:30.18|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:41.88–0:14:42.83|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:14:58.61–0:14:59.41|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:15:21.94–0:15:22.74|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:15:17.11–0:15:20.11|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:15:21.11–0:15:25.11|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:15:26.11–0:15:30.11|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:15:31.11–0:15:35.11|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:15:36.11–0:15:39.28|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:07.62–0:16:08.42|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:10.45–0:16:11.25|Justin:过去需要拍摄这个房间的 100、200、300 张照片;团队想把数量降到大约三张。 0:16:12.95–0:16:13.75|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:13.79–0:16:15.91|Justin:节目把这个变化概括为捕捉量减少 50 到 100 倍。 0:16:18.59–0:16:19.39|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:21.05–0:16:21.85|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:22.85–0:16:23.65|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:24.89–0:16:25.69|Justin:这样就可以回到已有图像,也可以利用互联网上找到的素材,甚至从随手拍的视频中重建场景。 0:16:27.19–0:16:27.99|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:28.39–0:16:31.17|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:32.33–0:16:34.71|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:37.13–0:16:37.93|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:16:58.42–0:16:59.22|Justin:团队把过去无法使用的旧素材放进 Atlas,也尝试丢掉原来拍摄的 95% 图片,只保留少量视图。 0:17:07.99–0:17:32.75|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:17:33.13–0:17:38.21|Justin:生成与重建必须以非常基础的方式互相配合。 0:17:38.21–0:17:41.81|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:17:41.81–0:17:46.25|Justin:传统重建需要从多个视角看到同一个点,再用三角测量定位三维空间中的位置。 0:17:46.25–0:17:50.25|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:17:50.25–0:17:53.89|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:17:53.89–0:17:57.43|Justin:输入视图没有拍到的像素,会在三维重建中留下空洞。 0:17:57.43–0:18:02.13|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:18:02.11–0:18:08.03|Justin:如果输入视图看不到某个东西,模型就需要想象它来填补空缺。 0:18:08.03–0:18:09.95|Justin:填补这些空缺本质上属于生成过程。 0:18:09.95–0:18:16.15|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:18:16.15–0:18:20.35|Justin:即使专家用单反拍下房间的数百个视图,也会漏掉麦克风下方、桌子下方和椅子腿之间的区域。 0:18:20.35–0:18:25.87|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:18:25.87–0:18:28.45|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:18:28.45–0:18:33.81|Justin:无论拍多少视图,总会漏掉一些东西。 0:18:34.23–0:18:46.25|Justin:模型需要生成能力:先对看得见的部分做三角测量,再想象那些不可避免没有被拍到的部分。 0:18:46.25–0:18:47.05|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:18:47.28–0:18:51.92|Justin:大语言模型很早就理解了上下文的价值。 0:18:51.92–0:18:57.62|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:18:57.62–0:18:58.76|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:18:58.76–0:19:05.16|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:05.16–0:19:07.64|Justin:图像和视频模型还没有用同样系统的方式,推动上下文长度。 0:19:07.64–0:19:12.38|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:12.38–0:19:14.54|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:14.55–0:19:19.55|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:19.55–0:19:27.23|Justin:重建可以看作带有很长上下文的生成:把大量内容放进去,再生成一致的空间。 0:19:27.23–0:19:28.03|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:27.53–0:19:29.95|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:29.96–0:19:31.72|Justin:Atlas 可以把两者连接起来。 0:19:31.72–0:19:35.60|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:35.60–0:19:41.14|Justin:Marble 很难一次放入超过几张图;Atlas 可以接收 64 张图,穿过整栋房子生成飞行路径。 0:19:41.14–0:19:47.44|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:47.44–0:19:53.36|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:53.36–0:19:58.02|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:19:58.02–0:20:20.02|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:22.34–0:20:23.14|Martin:Atlas 是先创建剩下的视图,再使用经典重建技术吗? 0:20:23.72–0:20:24.52|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:26.02–0:20:26.82|Justin:你可以把手头的任意数量输入降到单一视图,再把 Atlas 当作渲染引擎,生成你想要的其他内容。 0:20:29.08–0:20:29.88|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:31.98–0:20:32.78|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:34.80–0:20:35.60|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:37.56–0:20:38.36|Justin:你也可以用虚拟摄像机在空间里导航。 0:20:39.64–0:20:40.44|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:42.28–0:20:43.08|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:44.36–0:20:45.16|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:45.52–0:20:46.32|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:49.00–0:20:49.80|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:51.10–0:20:51.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:53.10–0:20:53.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:55.10–0:20:55.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:57.10–0:20:57.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:20:59.10–0:20:59.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:01.10–0:21:01.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:03.10–0:21:03.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:05.10–0:21:05.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:07.10–0:21:07.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:09.10–0:21:09.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:11.10–0:21:11.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:13.10–0:21:13.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:14.86–0:21:15.66|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:20.94–0:21:21.74|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:23.88–0:21:24.68|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:25.84–0:21:26.64|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:29.24–0:21:30.04|Justin:这部分建立在对扩展假设的信念上。 0:21:34.62–0:21:35.68|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:36.32–0:21:42.16|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:46.46–0:21:47.26|Fei-Fei:三个人都相信这套扩展规律;真正困难的细节在于具体架构选择和数据配比。 0:21:48.62–0:21:53.70|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:21:56.36–0:21:57.16|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:01.36–0:22:02.16|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:04.70–0:22:05.50|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:07.82–0:22:08.62|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:29.14–0:22:29.94|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:46.91–0:22:47.71|Justin:第一次用新架构、新范式预训练就达到目标质量,已经非常罕见;团队原本做好了再进行几轮预训练的准备。 0:22:52.14–0:22:52.94|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:54.10–0:22:54.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:55.60–0:22:56.40|Justin:我们还处在开始阶段。 0:22:57.84–0:22:58.64|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:22:58.98–0:22:59.78|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:23:02.40–0:23:03.20|Justin:团队基本还在开始阶段,目前主要受训练算力限制。 0:23:26.08–0:23:26.88|Justin:数据很重要,但继续扩展 Atlas 的主要瓶颈其实是训练算力。模型变大、训练更久、使用更多芯片时,效果都会明显变好。 0:23:31.46–0:23:32.26|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:23:35.66–0:23:36.46|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:23:41.50–0:23:42.30|Justin:模型规模受发布截止时间限制,团队只能根据期限倒推能负担的训练规模。 0:23:44.42–0:23:45.22|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:23:52.76–0:23:53.56|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:00.92–0:24:01.72|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:02.08–0:24:07.22|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:13.46–0:24:14.26|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:16.74–0:24:17.54|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:19.22–0:24:20.02|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:22.28–0:24:23.08|Fei-Fei:某天夜里,Ben 发来消息:摄像机穿过了桌子下方。 0:24:23.36–0:24:24.76|Fei-Fei:画面里还有一个足球。 0:24:27.26–0:24:28.06|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:29.26–0:24:30.06|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:29.96–0:24:34.28|Fei-Fei:三个人看着彼此,几秒内就决定要把这件事做成。 0:24:37.08–0:24:37.88|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:40.32–0:24:41.12|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:24:44.18–0:24:44.98|Fei-Fei:这是此前没有人见过的结果。 0:24:48.86–0:24:49.66|Martin:Ben,可以具体谈谈使用场景吗? 0:24:53.90–0:24:54.70|Ben:World Labs 过去有很多创意工作者用户,他们用产品保持二维图像、电影、三维内容和游戏中的一致性。 0:24:58.50–0:24:59.30|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:01.42–0:25:02.22|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:05.54–0:25:06.34|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:07.42–0:25:08.22|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:08.34–0:25:09.14|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:17.69–0:25:18.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:20.33–0:25:21.13|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:20.83–0:25:28.65|Ben:用户把一张图放进 Marble,得到一个 Gaussian splat 三维场景,从不同视点截图后离开。 0:25:29.65–0:25:30.61|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:33.69–0:25:34.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:36.19–0:25:36.99|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:37.61–0:25:38.41|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:40.27–0:25:41.07|Ben:如果直接对这些视角做生成建模,就可以保留精确的控制方式。 0:25:41.77–0:25:42.57|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:25:47.03–0:25:47.83|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:26:10.19–0:26:10.99|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:26:18.92–0:26:19.72|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:26:31.56–0:26:32.36|Ben:Marble 的一个具体用途,是让生成结果扎根在具有三维一致性的世界里。 0:26:47.70–0:27:04.82|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:27:05.08–0:27:28.24|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:27:27.45–0:27:50.61|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:27:46.05–0:27:57.17|Ben:同样的能力也可以用于虚拟复制或预先想象需要建造的真实空间,例如建筑和施工。 0:27:57.17–0:28:00.33|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:28:00.33–0:28:03.51|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:28:03.63–0:28:07.95|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:28:08.23–0:28:10.25|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:28:10.43–0:28:33.59|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:28:31.31–0:28:54.47|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:28:48.54–0:28:58.08|Ben:无论是创意应用、工业设计还是其他流程,AI 真正能释放大量价值的地方,是帮助人完成原本很费力的过程。 0:28:58.08–0:29:05.04|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:05.36–0:29:13.24|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:13.24–0:29:15.74|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:15.74–0:29:19.24|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:19.24–0:29:23.94|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:23.94–0:29:25.58|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:25.58–0:29:30.42|Fei-Fei:Atlas 是机器人问题中的关键一块。 0:29:30.96–0:29:34.80|Fei-Fei:World Labs 收购了原名 Cinex 的公司。 0:29:34.80–0:29:36.60|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:36.60–0:29:43.06|Fei-Fei:这家公司目前的关键技术,是从真实世界到仿真,再从仿真回到真实世界。 0:29:43.06–0:29:45.56|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:45.56–0:29:50.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:29:51.23–0:30:33.40|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:30:33.47–0:30:35.47|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:31:27.47–0:31:28.27|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:31:04.29–0:31:05.09|Fei-Fei:未来某一天瓶颈可能变成芯片,但眼下的瓶颈是数据。 0:31:07.91–0:31:08.71|Fei-Fei:机器人工作环境中的现实数据非常难收集。 0:31:11.35–0:31:17.04|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:31:22.34–0:31:23.14|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:31:25.86–0:31:26.66|Fei-Fei:还有一个非常重要的步骤叫随机化。 0:31:30.16–0:31:30.96|Fei-Fei:同一个环境需要在不同条件下被随机化。 0:31:34.86–0:31:35.66|Fei-Fei:电缆不能只沿一个方向弯曲。 0:31:40.34–0:31:41.14|Fei-Fei:电缆可以换一种弯法,盒子也可以有不同尺寸、颜色、盖子和位置。 0:31:43.02–0:31:43.82|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:31:46.74–0:31:47.54|Fei-Fei:因此,团队需要经历从真实世界到仿真的过程。 0:32:13.22–0:32:14.02|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:32:18.59–0:32:19.79|Martin:Atlas 是全能模型,也是多模态模型。 0:32:21.81–0:32:24.49|Martin:Atlas 接收不同种类的输入,也生成不同种类的输出。 0:32:29.21–0:32:30.01|Martin:下一步可以让 Atlas 接收动态数据,开始连接行动规划、机器人和 Atlas 的输出。 0:32:34.21–0:32:47.92|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:32:50.10–0:32:50.90|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:32:57.52–0:32:58.32|Justin:训练机器人策略与训练其他 AI 应用有一个根本区别。 0:33:04.71–0:33:05.51|Justin:生成代码、图像或视频时,模型主要是在创建一个产物。 0:33:10.35–0:33:11.15|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:33:12.19–0:33:12.99|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:33:14.05–0:33:14.85|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:33:17.11–0:33:17.91|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:33:17.43–0:33:32.53|Justin:机器人策略会走进世界、采取行动并尝试完成目标;世界的反应可能出乎预期。 0:33:43.53–0:34:10.58|Ben:仿真对机器人很关键。经典仿真需要人类设计者想象任务中可能发生的各种场景,再写出明确代码。 0:34:15.58–0:34:16.38|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:34:19.32–0:34:20.12|Ben:另一条路径是数据驱动的仿真。 0:34:26.32–0:34:27.12|Ben:团队可以训练一个模型,理解环境和世界将如何回应行动。 0:34:29.32–0:34:30.12|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:34:40.32–0:34:41.12|Ben:神经仿真器可以用尽可能多的数据训练,再作为训练机器人策略的仿真场地。 0:34:43.08–0:34:43.88|Ben:这会成为 Atlas 很有吸引力的未来方向。 0:34:45.54–0:34:46.34|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:34:58.18–0:34:58.98|Ben:学习型仿真器本身已经带有关于世界的内部理解,也能理解世界如何回应行动。 0:35:01.48–0:35:02.28|Ben:既然如此,仿真器为什么不能自己成为规划器? 0:35:24.94–0:35:25.74|Ben:生成世界、仿真世界、理解世界在不同情况下如何出现,以及理解世界如何回应行动,这些能力高度相关。 0:35:46.29–0:35:47.09|Martin:有位领域专家对 Atlas 的反馈是:模型很棒,但还需要更多动力学。 0:35:51.82–0:35:52.62|Martin:对于机器人和更广泛的应用来说,一个会运动的世界似乎更有用。 0:35:59.30–0:36:00.10|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:36:20.70–0:36:21.50|Justin:动力学一定会继续加入。Atlas 已经有初步动力学;此前 Marble 从根本上是静态的。 0:36:24.53–0:36:25.33|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:36:28.53–0:36:29.33|Justin:Atlas 的架构从根本上支持动力学。 0:36:31.19–0:36:31.99|Justin:Atlas 的训练数据也包含动力学。 0:36:34.07–0:36:34.87|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:36:35.53–0:36:37.03|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:36:38.81–0:36:39.61|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:36:41.39–0:36:42.19|Justin:有些例子里已经出现水面波浪和移动的小汽车。 0:36:45.45–0:36:46.25|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:36:48.11–0:36:48.91|Justin:动力学已经存在于这个模型中。 0:36:53.45–0:36:54.25|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:36:54.45–0:36:55.95|Martin:如果从多个视图重建三维,动力学似乎会带来问题。两者是否冲突? 0:37:01.95–0:37:02.75|Justin:如果要做基础的三维重建,模型反而需要精确冻结时间,才能表示场景的准确视图。 0:37:06.13–0:37:06.93|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:37:07.13–0:37:09.88|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:37:31.82–0:37:32.62|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:37:40.31–0:37:41.11|Justin:Atlas 预训练已经看过大量动力学;本次发布的后训练更多聚焦静态内容和空间移动,较少聚焦时间变化。 0:37:45.91–0:37:46.71|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:37:49.03–0:37:49.83|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:37:55.27–0:37:56.07|Justin:预训练检查点里可能已经有大量潜在动力学,团队会继续改进。 0:37:58.15–0:37:58.95|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:38:00.55–0:38:01.35|Martin:Ben,这是否意味着我们会得到可以走动、看见人物表情变化的四维视频? 0:38:02.50–0:38:03.30|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:38:05.50–0:38:06.30|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:38:16.50–0:38:17.30|Ben:只要继续把模型做得更大、更快、更好,几乎可以建立一整个行业。 0:38:19.80–0:38:20.60|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:38:27.30–0:38:28.10|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:38:42.83–0:38:43.63|Ben:团队很期待继续推进多模态控制。加入控制条件,让模型把内部能力释放出来,非常关键。 0:38:44.41–0:38:45.21|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:38:48.95–0:38:49.75|Martin:用普通人的话说,动态与静态的区别就是可编辑性。 0:38:51.41–0:38:52.21|Ben:可编辑性是关键。 0:39:12.81–0:39:13.61|Ben:单图模型和视频模型正在逐步解锁多轮控制:用户可以直觉地指定人物、物体和动作,把它们组合到一幅画面里。 0:39:15.29–0:39:16.09|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:39:38.69–0:39:39.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:39:44.15–0:39:44.95|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:39:40.28–0:39:41.08|Ben:关键是增加控制,同时维持模型输出质量;控制变多、质量下降,就会变成噱头。 0:39:50.70–0:39:51.50|Ben:如果增加几个旋钮却让质量下降,用户不会用它替代前沿视频模型。 0:40:10.30–0:40:11.10|Ben:团队要在维持现有输出标准的同时,增加对场景、布局、物体身份和时间的控制。 0:40:33.46–0:40:34.26|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:40:36.76–0:40:37.56|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:40:41.96–0:40:42.76|Fei-Fei:回到智能的第一原则:空间智能不是停在那里看见或解释,而是把观察、体验和交互闭合起来。 0:40:49.54–0:40:50.34|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:40:55.76–0:40:56.56|Fei-Fei:空间智能需要把看见、经历和交互连接起来。 0:40:59.60–0:41:00.40|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:00.15–0:41:02.99|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:03.69–0:41:04.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:04.65–0:41:05.45|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:05.19–0:41:08.11|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:12.69–0:41:13.49|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:16.73–0:41:17.53|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:20.19–0:41:20.99|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:24.77–0:41:25.57|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:29.07–0:41:29.87|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:41:49.21–0:42:04.45|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:42:04.45–0:42:08.33|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:42:08.33–0:42:11.89|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:42:11.92–0:42:23.30|Ben:新视图预测,尤其是生成式新视图预测,也可能是一项“AI 完备”的基础能力。 0:42:23.30–0:42:25.56|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:42:25.56–0:42:33.18|Ben:可以把一部电影的所有帧都输入进去,再预测最后走出来的凶手是谁。 0:42:33.18–0:42:41.22|Justin:也可以要求生成一个世界:Martin 正在黑板上写黎曼猜想的证明。 0:42:41.22–0:42:55.92|Fei-Fei:从进化角度看,新视图预测正是动物通过移动必须解决的问题。 0:42:55.92–0:43:05.55|Fei-Fei:自然给了动物眼睛,却没有给树眼睛。 0:43:05.55–0:43:09.51|Fei-Fei:因为动物移动时,会看到新的视角。 0:43:09.51–0:43:14.43|Fei-Fei:无论叫它 AI 完备还是智能完备,新视图预测都对应着这种能力。 0:43:14.43–0:43:18.85|Fei-Fei:团队非常相信,下一视点预测相当于语言里的下一词元预测。 0:43:18.85–0:43:22.79|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:22.79–0:43:27.17|Martin:祝贺三位嘉宾完成这次重要的模型发布。 0:43:27.17–0:43:30.21|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:30.21–0:43:31.23|嘉宾:谢谢。 0:43:33.82–0:43:37.30|节目口播:感谢收听本期 a16z 播客。 0:43:37.30–0:43:39.82|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:39.82–0:43:42.36|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:42.36–0:43:44.52|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:44.52–0:43:47.36|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:47.36–0:43:50.76|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:50.76–0:43:54.72|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:54.72–0:43:55.88|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:55.88–0:43:57.52|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:43:59.13–0:44:02.13|节目口播:本节目内容仅供信息参考。 0:44:02.13–0:44:12.13|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】 0:44:12.13–0:44:18.13|节目口播:a16z 及其关联方可能持有本期讨论公司的投资。 0:44:18.13–0:44:25.13|说话人未能可靠确认:【此处 ASR 无法可靠辨认,未据常识补写】

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

Comments