1/2

Video Rebirth:押注「视频原生」,把世界模型做成可进入的世界

机器之心介绍 Video Rebirth 的视频原生路线与 Olympus 世界模型,重点看它如何把视频理解、实时交互和长程一致性接到一起。

Video Rebirth 走了一条很明确的路线:先把视频当作理解和生成世界的基础数据,再做实时、可交互的世界模型。机器之心将这项阶段性成果称为 Olympus,文中描述用户可以在三维场景里按键操控角色,画面随操作生成并响应。1
这类系统要同时守住三件事:物理一致性、声画同步和长程记忆。文章介绍,Olympus 建立在视频生成引擎 BACH 之上,训练大致经过场景数据领域微调、因果控制注入和自回归蒸馏,再配合按键 embedding、Cross-Attention 与 KV Cache 复用来支持交互。
Video Rebirth 把世界模型路线分成三类:三维显式、视频隐式和视频显式。它选择的是视频显式路线,理由是视频本身带着连续的时空信息。文章把下一步目标指向 Simulation Agent,覆盖游戏智能体、机器人、具身智能和工业仿真。以上均按原文报道口径整理,配图中的结构卡是概念整理,不是 Olympus 官方产品界面或现场照片。
原文入口:机器之心原文

相似内容

评论

登录后可发表评论。