1/3

从视频里读出双手

新智元报道 ACE-ViDiHand 用视频生成模型做 4D 手部动捕,本期拆解它如何先画手、再读特征,并在遮挡场景少丢手。

新智元 2026-07-13 12:46 文章报道,大晓机器人联合南洋理工大学、上海交大发布 ACE-ViDiHand,称其是全球首个用视频生成模型做 4D 手部动捕的方法。1
这期图集抓三个看点:
  1. 论文把手部姿态估计改写成从视频世界模型里读取表征,而不是继续堆检测器和运动补全。2
  2. 方法先让模型在每帧叠加半透明手部渲染,再读取 DiT 中层特征并用双分支解码器输出双手轨迹。
  3. 原文称它在 ARCTIC、HOT3D、HOI4D 三个基准上拿到大范围第一;遮挡场景帧准确率 0.997,对比 WiLoR 的 0.919。3
图集顺序:世界模型读手 → 先画手再读手 → 遮挡下少丢手。

Related content

Comments

Sign in to comment.