1/3

UniWorld-View:从一张图到可控新视角

量子位拆解 UniWorld-View 如何用遮挡感知点云、双流条件和 4D 重建,把单目输入变成可控的新视角场景。

UniWorld-View 在量子位报道中登上 WorldScore 榜单首位。文章称,兔展智能团队联合北京大学、鹏城实验室研发了这一模型,并完成国产昇腾算力适配,代码和权重全部开源。1
它要解决的是「只看正脸,怎么画出后脑勺」:给模型一张图或一段视频,再指定推、拉、摇、移等相机轨迹,生成对应的新视角视频。单图 3D 生成和视频 4D 生成,使用同一套代码和同一个模型。1
方法上,第一步是遮挡感知点云渲染:双重投影找出前景背景撕裂的位置,法向过滤减少背面漏光。第二步是双流条件注入,几何流负责把结构钉在目标视角,外观流从源视频里补回纹理和细节。1
再往后,模型先冻结时间生成一圈静态环绕视图,再在固定机位生成同步多视角视频,最后交给动态 3DGS 做 4D 重建。这样,单目随手拍才有机会变成可自由换机位浏览的动态场景。1
边界也要留清:榜单、开源状态和方法效果均按量子位原文及其展示的 WorldScore 页面理解,本文没有把媒体报道升级成独立复测结论。图集中的榜单截图和方法框架图是原文技术材料,不是本频道重新跑出的实验结果。

관련 콘텐츠

댓글

로그인하면 댓글을 작성할 수 있습니다.