北京大学等提出 HDR:让视频模型先保留多条计划,再把正确路径写成画面

北京大学等提出 HDR:让视频模型先保留多条计划,再把正确路径写成画面

HDR 用粗到细的层级 latent 和稀疏注意力,把视频模型的多步规划放到流式生成之前,在接近自回归延迟的同时显著提高迷宫、拼图和机器人交互任务的完成率。

认知提取

1. 北京大学等提出 HDR:让视频模型先保留多条计划,再把正确路径写成画面
信号源: 北京大学、香港科技大学、北京航空航天大学、福州大学、Muka Robotics;论文发表于 arXiv cs.CV 2026 年 7 月 17 日更新列表的首条。1

论文摘要

视频生成模型开始承担世界模型和视觉推理任务,但生成方式里有一个很难绕开的矛盾:流式自回归模型速度快,却容易在早期一步走错后一路错下去;双向扩散模型可以反复修改整段视频,却要在每轮去噪时更新全部帧,难以满足低延迟交互。
论文提出 HDR(Hierarchical Denoising for Visual Reasoning),把视频 latent 组织成从粗到细的树状层级。粗层先保留带有不确定性的高层假设,细层再把假设逐步落实为具体画面,最后才进入流式输出。作者还设计了 SHAP(Sparse Hierarchical Attention Pattern),让 token 只读取同层局部、父节点及其邻近父节点等固定范围的信息,避免完整的密集时序注意力。2

方法:把「不可撤销的早期决定」前移成「可修正的中间计划」

1. 先看两种旧范式各自卡在哪里

双向扩散的优势是整段序列都保持在噪声状态,模型可以在多个去噪步骤里让前后信息互相流动。代价也很直接:序列长度固定,推理时需要反复更新整段视频,流式输出很慢。
流式自回归扩散正好相反。它每生成一个 latent 就能继续往后推,缓存也可以复用,适合实时输出;但一旦前面把错误决定写进历史,后面的 token 只能围绕这段错误历史继续生成。迷宫里第一步选错岔路,后面生成得再快也只是更快地走向失败。
视频生成范式对比:HDR在流式生成前加入层级化规划
图 1:论文对比双向扩散、流式扩散、自回归生成与 HDR。HDR 的折中不是让所有 token 都互相注意,而是先在粗层保留计划,再在细层生成画面。2

2. HDR 的三层设计

第一层是树状 latent。 论文把视频表示成多个时间分辨率的层级。最粗的层概括一段较长时间内的整体走向,越往下越接近局部动作和画面细节。每个细层 token 都有一个更粗层的父节点,因此「当前画面要做什么」和「局部像素怎么变化」被放进同一棵树里。
第二层是分层去噪。 HDR 不给每个层级相同的去噪预算,而是让粗层停留在更高噪声水平,保留多个可能的全局计划;细层获得更强的去噪,把其中一个计划变成连续的视觉状态。论文的六层配置使用了 [5, 8, 13, 20, 32, 50] 的去噪步数,层级越细,去噪越充分。这里的关键不在于「多做几轮计算」,而在于把不确定性放在仍然能修改的位置。
第三层是 SHAP 稀疏注意力。 在展平后的粗到细序列中,一个 token 主要访问四类上下文:同层前一个 token、第一帧条件、它的父 token,以及父 token 左右的邻居。粗层信息会写入共享 KV cache,细层再按需读取。这样,模型拥有跨层的规划信息,但不需要对整段视频做全连接注意力。2
HDR 方法总览:树状 latent、分层去噪与 SHAP 注意力
图 2:HDR 的训练与推理流程。训练阶段对层级 token 加噪并学习 flow-matching 速度场;推理阶段按粗到细的顺序生成,并通过 SHAP 读取固定范围的层级上下文。2

3. 这套结构解决的不是「看得更清楚」,而是「允许更晚做决定」

普通视频生成的中间状态通常只是去噪过程中的过渡结果。HDR 把中间状态赋予了明确职责:粗层负责回答「接下来可能怎么走」,细层负责回答「这一帧具体长什么样」。前者有意保留模糊和多解,后者才逐步收敛。
这让模型的推理路径出现了一个缓冲区。模型可以在高层先比较候选路线,再把选择传递给局部生成。对于迷宫、汉诺塔、推箱子这类任务,错误往往不是出在画面质量,而是出在很早的动作选择上。HDR 针对的正是这个位置。

实验成果:成功率、过程一致性和速度同时改善

论文构建了一个分层难度、多步视频推理基准,包含迷宫、汉诺塔、一笔画、滑块拼图、Sokoban 和倒水六类任务,并加入分布外案例。评测集包含 370 个留出视频,用 Success 衡量最终任务是否完成,用 Average Progress 衡量中间过程走了多远。2
六类多步视频推理任务:从迷宫到倒水
图 3:论文构造的六类任务。它们要求模型连续维持规则和状态,而不是只生成局部看起来合理的动作。2

1. 主结果

方法Overall SuccessOverall Avg. Progress流式延迟
双向扩散60.0087.1337.92 秒
CausalForcing34.2276.000.72 秒
HDR60.2989.560.70 秒
表中数字来自论文主实验。HDR 相比流式基线 CausalForcing,把成功率从 34.22 提高到 60.29,论文报告的相对增幅为 76.2%;平均进度从 76.00 提高到 89.56。与此同时,HDR 的单个流式生成步骤为 0.70 秒,接近 CausalForcing,并明显低于双向扩散的 37.92 秒。2
这个结果有一个需要保留的细节:HDR 并不是在每个子任务上都超过双向扩散。双向扩散在 Maze、One-line 和 Sokoban 上的成功率分别为 90.00、81.67 和 90.00,高于 HDR 的 78.00、70.00 和 78.33;HDR 的整体优势主要来自它在保持流式速度的同时,显著超过了流式基线。把「全局最强」和「效率最好的折中」混成一句,会误读这张表。

2. 定性对比:错误发生在决策点,而不是最后一帧

在迷宫案例中,CausalForcing 在一个岔路口过早选择了错误方向,后续轨迹只能沿着这条路径继续;一笔画案例里,它漏掉顶部区块,最后输出看起来仍然连续,却已经无法完成任务。HDR 先用层级规划处理岔路,再把路线落实成细粒度画面。2
定性对比:流式基线过早承诺,HDR先规划再完成任务
图 4:论文 Figure 4。红色标注的是基线的早期错误承诺,绿色标注的是 HDR 的层级规划和成功轨迹。2

3. 消融与数据效率

层级数量从 1 增加到 6 时,Success 从 34.22 逐步上升到 60.29,Average Progress 从 76.00 上升到 89.56。单层设置基本等价于流式基线,说明 HDR 的收益不是只来自最后的细节 refinement,而是来自中间的多层规划。
在降低推理预算时,HDR 也更稳。去噪步数降到 1 时,HDR 的成功率为 34.72,CausalForcing 为 11.25,双向扩散为 17.78。训练数据只保留 2% 时,HDR 仍保留完整数据成功率的 82.9%,双向扩散为 52.0%。论文把这归因于层级结构提供了比纯记忆更强的任务规则偏置。2
HDR 的层级数量、去噪预算与数据规模消融
图 5:左图是去噪步数减少时的成功率和平均进度,右图是训练数据缩减时的表现。HDR 在极低推理预算和少量数据下都保持了更高的曲线。2

4. 从合成任务走向机器人

作者还做了实体机器人迷宫实验:先用 3,000 个虚拟迷宫视频预训练,再用 50 个真实机器人视频微调,并通过逆动力学模型把生成视频转换成机器人动作。论文报告,在 Easy、Medium、Hard 和 OOD 四种迷宫上,HDR 的成功率分别为 100%、100%、80% 和 80%;CausalForcing 分别为 80%、60%、0% 和 20%。其中 OOD 迷宫包含斜放或堆叠的木块,布局不再是规则网格。2
实体机器人迷宫实验:HDR在规则与不规则布局上的成功率
图 6:论文 Figure 7。每一列对应不同难度的实体迷宫,底部给出 CausalForcing 与 HDR 的成功率。2

总结与反思

HDR 给出的工程答案很清楚:想让视频模型做多步推理,不必把所有 token 都放进昂贵的全局注意力,也不能让模型一生成就永久承诺。先在粗层保存可修改的路线,再在细层落实动作,是把「规划」嵌入流式视频生成的一种方式。
这篇论文最有价值的地方,在于它把一个常被混在一起的问题拆开了。推理能力对应的是高层状态是否能被保留和修正,生成效率对应的是细层是否能按流式方式推进。HDR 用同一棵 latent 树把两者连接起来,SHAP 则把连接成本控制在局部上下文范围内。
但实验也限定了结论边界。第一,六类基准由作者构建,主要是规则明确的任务;实体世界只验证了机器人迷宫,不能直接推出模型已经具备通用物理推理能力。第二,HDR 的整体成功率略高于双向扩散,优势更准确的表述是「接近双向扩散的推理表现,同时保留自回归流式效率」,而不是全面替代双向扩散。第三,论文主结果给出了延迟、成功率和数据缩减曲线,但没有在主文中用统一表格展开额外参数量、训练总成本和部署显存,因此 0.70 秒只能说明单步流式延迟,不能单独证明完整系统成本最低。
如果后续工作能在更开放的长时序交互、更多真实环境和统一算力预算下复现这组结果,HDR 的意义会从「一种有效的层级视频生成架构」进一步变成「视频世界模型如何在行动前保留可修正计划」的具体答案。当前证据已经支持前一个判断,后一个判断仍需要更广泛的任务和硬件验证。

관련 콘텐츠

  • 로그인하면 댓글을 작성할 수 있습니다.
More from this channel