李飞飞刚发Atlas,中国开源“同款”已抢跑半年?

李飞飞刚发Atlas,中国开源“同款”已抢跑半年?

量子位报道Atlas与影溯InSpatio-World如何把世界模型从视频生成推进到空间建模,并解释WorldArena榜首成绩与当前评测边界。

转载说明:本文转载自微信公众号「量子位」,作者署名:henry,发自凹非寺;公众号 QbitAI;发表于 2026 年 9 月 3 日。本文保留原文报道内容、主要表述和判断,并清理微信页面导航、关注引导、二维码、作者头像及装饰性残留。
量子位作者 henry 的这篇报道,从李飞飞创办的 World Labs 发布 Atlas 写起,解释世界模型怎样从“生成一段视频”走向构建可持续的空间与时间状态;文章也把国内团队影溯的 InSpatio-World 放进同一条技术脉络,最后落到一个更具体的问题:空间智能要真正服务机器人,还缺什么样的数据和评测基础设施。1

Atlas 把世界模型带进空间上下文

9 月 2 日,World Labs 发布 Atlas,并将其称为全球首个多模态世界模型。Atlas 把文字、图像、视频和 3D 信息放进同一个空间上下文里,让模型可以从一张或几张图片重建三维场景、生成新的观察视角,还能让相机沿指定轨迹移动,同时保持场景结构的一致性。1
World Labs 发布 Atlas 的官方信息截图
截图展示了 World Labs 对 Atlas 的定义:用像素级相机控制生成图像和视频帧,并在 3D 中重建它们;图片来自量子位微信公众号原文。1
原文把 Atlas 的能力拆成四类:相机控制生成、空间重建、时空模拟和图像生成。Atlas 可以根据文本生成图片与 360° 全景图,也可以根据输入视频同时建模空间和时间;在机器人模拟场景中,几张照片就能生成 RGB 与深度数据,为机器人提供更多模拟训练空间。1
技术架构上,Atlas 是一个多模态自回归扩散 Transformer。文本、图像、视频和 3D 数据都会被锚定在三维空间中,模型再根据这组空间上下文生成多模态输出。原文的解释是:不同任务可以被看成不同类型的序列,前面是输入,后面是输出;扩散模型负责逐步去噪,Transformer 负责处理序列关系。1

影溯走的是另一条路

影溯在今年 3 月开源的 InSpatio-World,也能把普通视频变成可以继续探索的动态 4D 场景。用户可以改变原始相机轨迹,从此前没有拍摄过的位置观察场景;在 InSpatio-World 中,时间本身也成为模型需要显式处理的维度,用户可以改变观察时刻,再从新的视角观察同一段动态过程。1
两套模型的输入不同:Atlas 从图像出发,把相机位置变成访问空间世界的坐标;InSpatio-World 从视频出发,把时间也纳入动态世界的建模。原文用一个形象的说法概括两者:Atlas 像一座可以选择机位的 AI 虚拟片场,InSpatio-World 则试图把现实录像变成能给物理 AI 当陪练的可驱动世界。1

榜一靠的不是画面漂亮

影溯最近一次受到关注,是 InSpatio-Curious 登上 WorldArena 2.0 榜首。截至 8 月 27 日,在首版阶段性公开榜单中,InSpatio-Curious 在 77 个参评模型中以 66.11 分排名第一,并在 Physics Adherence、Trajectory Accuracy、JEPA Similarity 和 Depth Accuracy 四项指标上都排名第一。1
WorldArena 2.0 阶段性榜单中的模型与指标
榜单图显示 InSpatio-Curious_0.1 以 66.11 分排名第一;表格同时列出物理遵循、图像质量、轨迹准确、深度准确和 3D 准确等指标。图片来自量子位微信公众号原文。1
四项指标对应四种能力。InSpatio-Curious 的 Trajectory Accuracy 得分为 64.89,比第二名高 3.02 分;Depth Accuracy 为 99.29;JEPA Similarity 为 98.36;Physics Adherence 为 73.24。这些分数分别对应运动轨迹、三维深度、时空表征一致性,以及交互质量和轨迹准确性。1
InSpatio-Curious 在四项关键能力上的对比结果
四项对比图把轨迹准确、JEPA 表征相似度、物理遵循和深度准确分别与其他模型比较;InSpatio-Curious 在四项中均列第一。图片来自量子位微信公众号原文。1
原文特别指出,InSpatio-Curious 的 Image Quality 得分是 60.64,比综合排名第二的模型低近 9 分,却仍然拿下总分第一。这个结果把读者的注意力从“画面够不够漂亮”移到了轨迹、深度、时空表征和物理交互这些更接近机器人使用的指标上。1

高分距离通用空间智能还有多远

WorldArena 2.0 由清华大学、上海交通大学、香港大学等高校联合发起,面向具身世界模型考察机械臂运动轨迹、场景深度与空间关系,以及物体受到作用后能否按照物理逻辑继续运动。它比只看视频清晰度的测试更接近机器人任务,因此榜单成绩有明确的诊断价值。1
这套评测仍主要围绕标准化仿真环境和机器人操作任务展开,真实世界中的工厂、家庭、城市和户外场景还包含大量长尾情况。InSpatio-Curious 所在的 Track 1 主要由 15 项生成与视觉代理指标构成,榜单可以判断碰撞在视觉和运动上是否合理,却没有直接测量真实世界中的力、摩擦、质量和惯性。1
因此,这次第一名说明 InSpatio-Curious 在特定任务和数据分布下展现出较强的空间与物理相关能力。换到新的场景、新的机器人或从未见过的物体时,模型能否继续稳定工作,还需要更广泛的任务和数据来验证。原文把这个边界说得很清楚:WorldArena 2.0 是评测工具,榜单第一还不是通用空间智能的“毕业证”。1

空间智能需要自己的“ImageNet 时刻”

8 月 29 日,在武汉举行的第二届中国空间智能大会上,影溯联合 20 多家高校团队和行业机构启动了大规模空间智能 3D 数据开放计划 SIDO。参与方覆盖高校、激光雷达、机器人、3D 生成、数字空间和产业应用等环节,目标是把数据生产、模型训练和真实任务检验接起来。1
SIDO 计划在未来两年逐步建设百万级 3D/4D 场景数据底座,并推进评测基准建设,覆盖 3D 重建与生成、场景理解、空间推理、动态预测和具身规划等任务。原文将三者的分工概括为:模型负责学习世界,数据负责提供足够丰富的世界,Benchmark 负责判断模型究竟学会了多少。1

原文摘录

“世界模型正在从‘生成一段看起来合理的视频’,走向‘围绕一个持续存在的空间或时空状态,生成不同位置、不同视角下的观测结果’。”
——量子位官方公众号原文。1

Fuentes de referencia

  1. 1
    量子位原文

    mp.weixin.qq.com

Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.

Contenido relacionado

More from this channel