
世界模型的三维难题新思路:原生一体生成左右眼完整视频流
量子位转载 StereoWorld 双目世界模型文章:它从生成开始联合建模左右视图,并探索灵活双相机、长视频和跨视图补全。
转载说明:本文转载自微信公众号「量子位」,发表于 2026 年 8 月 31 日。作者署名:StereoWorld 团队;公众号 QbitAI。本文保留原文报道内容、主要表述和判断,并清理微信页面导航、关注引导、二维码及装饰性残留。
VAST、香港大学和 PICO 开源了一个双目世界模型——StereoWorld。1
与“先生成单目视频,再估计深度、变换视角并修补遮挡”的多阶段方案不同,StereoWorld 从生成开始就同时建模左右视图,让视觉外观和双目几何在同一个模型里共同演化。模型训练只使用 RGB 双目视频,不依赖显式深度监督,而是从左右视图之间的视差里学习几何关系。1
世界模型看起来真实,为什么仍然不够懂三维
近年来,视频生成模型已经能够合成逼真的动态画面。模型再接收相机轨迹或动作指令后,还可以向前移动、转向和探索新的视角,逐渐具备世界模型的雏形。1
问题在于,大多数世界模型仍然用单目 RGB 视频表示世界。单张图像无法唯一确定三维结构:一个物体可能体积很小、距离很近,也可能体积很大、距离很远,但两种情况在二维画面里可以产生相同的投影。因此,单目模型里的深度通常是隐式的,尺度也不确定。1
当相机持续移动时,这种不确定性会不断积累,最后表现为空间结构漂移、物体形状改变,甚至生成原本不存在的内容。另一类方案会额外生成深度图,构建 RGB-D 世界模型,但深度图和大规模 RGB 视频预训练模型之间存在模态差异。单目深度经过
depth warp,再通过 inpaint 补出新视角时,误差也可能累积,视频细节会丢失,例如铁丝网这样的细小结构。1双目视觉提供了另一条路径。人类通过左右眼看到的细微位置差异感知距离。当相机焦距和双目基线已知时,视差可以直接关联到真实尺度下的深度。双目图像因此多提供了一张画面,也为模型提供了一个稳定的三维“物理锚点”。1
StereoWorld 的出发点是:与其让世界模型在生成完成后再猜测深度,不如让它从一开始就用“双眼”观察和生成世界。
双目视频生成
给定一张图像、一段场景文本描述,以及由 WASD 键控制的平移和由方向键控制的方向,StereoWorld 通过统一建模相机与视频帧 RoPE 编码,同时生成后续的左眼视频和右眼视频。1

从固定水平基线到灵活的双相机运动
最初的双目生成设置面向标准的校正双目相机:左右相机保持固定的水平基线,并沿着相同轨迹同步运动。研究团队进一步用统一的 Camera-Frame RoPE 显式建模相机内外参和相对位姿,让相对关系随时间变化的双相机轨迹也能被模型处理。1
在新的 Flexible Stereo 模式下,左右相机不必始终保持固定、平行的水平关系,而可以拥有相对独立的运动轨迹:1
- 左右相机从初始基线状态逐步汇聚;
- 右相机相对左相机发生水平方向的位移;
- 两台相机之间出现竖直方向的高度差;
- 右相机沿前后方向移动,形成深度方向的相对偏移。

自回归长视频生成
原始 StereoWorld 使用双向注意力,一次生成的视频长度受到 81 帧限制。研究团队随后把模型蒸馏为四步生成的因果自回归模型,并为左右视图分别维护带有相机位置编码的 KV Cache。1
蒸馏后的模型能够生成约 10 秒的双目视频,速度从 0.25 FPS 提升到约 3 FPS,速度提升约 10 倍。量子位原文将其视为长时、交互式立体世界生成的初步基础。1
从“双目同时生成”到“给定左视频,补全右视频”
StereoWorld 还可以切换到另一种推理模式:给定一段完整的左视图视频,再给出另一条目标相机轨迹,模型补全与之对应的右视图视频。这个能力来自模型学习到的双目联合分布。1
换句话说,StereoWorld 先学习左右视图视频与对应相机轨迹之间的联合关系。双目同时生成时,模型从这套联合关系里同时生成左右视频;左视频已经给定时,模型则根据左视图内容和两条相机轨迹生成匹配的右视图视频。1

展望
此次开源版本展示了灵活双相机控制和跨视图补全能力。原文认为,StereoWorld 学到的可能不是某一种固定的视差模式,而是相机运动、场景内容和跨视图几何之间更一般的联合分布关系。1
沿着这条路线,StereoWorld 有望从双相机扩展到更多视角,支持数量不固定的相机和更复杂的相对轨迹。跨视图补全也有望把大规模单目视频资源转化为可控的立体或多视角内容,并服务于 VR/AR、虚拟摄影和沉浸式内容创作。1
该开源模型主要基于研究团队发表于 CVPR 2026 的工作 Stereo World Model。代码在 VAST-AI-Research/StereoWorld,项目主页为 StereoWorld。这两个入口均保留自量子位官方公众号原文。1
原文摘录
“与其让世界模型在生成完成后再猜测深度,不如让它从一开始就用‘双眼’观察和生成世界。”——StereoWorld 团队,量子位官方公众号原文
“StereoWorld 的双目联合生成学习到的并非某一种固定视差模式,而是相机运动、场景内容与跨视图几何之间更一般的联合分布关系。”——StereoWorld 团队,量子位官方公众号原文
Fuentes de referencia
- 1量子位原文
mp.weixin.qq.com
Este contenido lo produjo un canal automáticamente. Con una sola frase, Neodrop puede seguir produciendo para ti.
