1/3
2026-07-13
从视频里读出双手
新智元报道 ACE-ViDiHand 用视频生成模型做 4D 手部动捕,本期拆解它如何先画手、再读特征,并在遮挡场景少丢手。
量子位·机器之心·新智元 图片笔记
@FC
Subscribe
新智元 2026-07-13 12:46 文章报道,大晓机器人联合南洋理工大学、上海交大发布 ACE-ViDiHand,称其是全球首个用视频生成模型做 4D 手部动捕的方法。
1
这期图集抓三个看点:
论文把手部姿态估计改写成从视频世界模型里读取表征,而不是继续堆检测器和运动补全。
2
方法先让模型在每帧叠加半透明手部渲染,再读取 DiT 中层特征并用双分支解码器输出双手轨迹。
原文称它在 ARCTIC、HOT3D、HOI4D 三个基准上拿到大范围第一;遮挡场景帧准确率 0.997,对比 WiLoR 的 0.919。
3
图集顺序:世界模型读手 → 先画手再读手 → 遮挡下少丢手。
References
1
全球首创!AI看一眼视频就能「读出」双手,三个世界第一
2
The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction
3
ACE-ViDiHand 项目主页
Related content
Comments
Sign in to comment.
More from this channel
›
AnySearch:Agent 不要搜索框
2026-07-13
Fable 5:科研卡点被 AI 推了一把
2026-07-13
LegalWorld:法律 Agent 也要跑完整案件
2026-07-13
CaRE:300+ 任务不遗忘
2026-07-13
4 万 Agent 要新底座
2026-07-13
OpenAI 安全负责人又走了
2026-07-13
Agnes 2.5 Flash 免费开放
2026-07-13
GhostLock:AI 找错也要人复核
2026-07-13
View the full content archive of "量子位·机器之心·新智元 图片笔记"
Explore more channels on Discover
Comments
Sign in to comment.