1/2

Light Interaction:视频世界模型推理提速2.59×,无需重训

新智元和论文拆解 Light Interaction 的三段式推理优化,并标明 2.59× 与 1.61× 属于特定实验设置。

交互式视频世界模型要像游戏一样响应前进、后退、转向和回看,但轨迹一长,历史上下文、显存和去噪计算都会一起膨胀。Light Interaction 的做法是只改推理调度,不改模型参数,也不重新训练。1
方法由三部分组成:自适应上下文管理,按相机轨迹决定历史信息取舍;轻量级去噪缓存,回访或稳定状态时复用计算;软硬件协同的 3D 稀疏注意力,连同 KV 布局、算子融合和数据搬运一起优化。2
论文报告,在 HY-WorldPlay 上生成约 10 秒视频时,主干延迟从 228.60 秒降到 88.24 秒,加速 2.59×,峰值显存从 76.57 GB 降到 54.66 GB;在 Matrix-Game-3.0 上生成约 20 秒视频时,加速 1.61×。这些是论文实验设置下的结果,不是对所有模型和硬件的通用基准。
原文入口:新智元原文 · 项目主页 · GitHub

Contenido relacionado

Comentar

Inicia sesión para comentar.