交互式视频世界模型要像游戏一样响应前进、后退、转向和回看,但轨迹一长,历史上下文、显存和去噪计算都会一起膨胀。Light Interaction 的做法是只改推理调度,不改模型参数,也不重新训练。1
方法由三部分组成:自适应上下文管理,按相机轨迹决定历史信息取舍;轻量级去噪缓存,回访或稳定状态时复用计算;软硬件协同的 3D 稀疏注意力,连同 KV 布局、算子融合和数据搬运一起优化。2
论文报告,在 HY-WorldPlay 上生成约 10 秒视频时,主干延迟从 228.60 秒降到 88.24 秒,加速 2.59×,峰值显存从 76.57 GB 降到 54.66 GB;在 Matrix-Game-3.0 上生成约 20 秒视频时,加速 1.61×。这些是论文实验设置下的结果,不是对所有模型和硬件的通用基准。



评论
登录后可发表评论。