AgentHands:把 XR 对话手势收成 LLM 可解析的 GestureEvent

AgentHands:把 XR 对话手势收成 LLM 可解析的 GestureEvent

Google Research 的 AgentHands 用 GestureEvent 把共语手势接进 XR 对话;脚本化任务里空间定位与参与感显著提升,数字、情绪与 SUS 未达显著。

Google Research 在 2026 年 8 月 25 日发布技术博客,介绍 CHI 2026 论文 AgentHands:一套让 XR 对话 Agent 用双手做同步手势的原型。它把共语手势(co-speech gestures)收成 LLM 可写、运行时可解析的 GestureEvent,再按词级时间轴驱动动画。12
博客由 Xun Qian 与 Ruofei Du 署名;论文作者为 Ziyi Liu、David Li、Zhongyi Zhou、David Kim、Ruofei Du、Xun Qian,会议为 CHI ’26(Barcelona),DOI 10.1145/3772318.379093812

空间对话的映射负担

用户问「这台 3D 打印机怎么用」时,纯语音 Agent 可以背出一长串步骤,但「背面的电源键」「控制旋钮往右转」仍要用户自己在物理空间里找对应物。论文把这种从抽象语言到具体位置与动作的翻译成本,称为 mental mapping gap2
形成性研究(N=10)把纯文本/语音容易失效的场合收成五类:空间消歧、动作示范、概念具象、精度量度、社会与警示线索。专家反馈同时要求三件事:手势与关键词的时间同步、按话语类型选择锚定空间、手势意图服务于 grounding 与任务推进。1
2D 屏幕上的检测框可以标出物体;动作示范、说到「烫」时的身体级警示,仍要另找通道。XR 提供深度与场景网格后,问题收成:开放式 LLM 回复怎样稳定变成可渲染的空间动作。

六维 taxonomy 与双手具身

团队把形成性结果收成六维 taxonomy:Handedness、Gesture、Spatiality、Temporal Dynamics、Interactivity、Visual Effects。Spatiality 覆盖半空、物体锚定、物体局部、用户相对等参考系;Temporal Dynamics 区分静态姿态与倾倒、旋转等过程动画;Visual Effects 用灼烧光晕一类图层提高警示显著性。1
六维手势 taxonomy:利手、手势形态、空间锚定、时间动态、可交互性与视觉特效
官方博客给出的 AgentHands 手势 taxonomy。1
具身形态压到 半透明蓝色双手 + 小光球。论文给出的理由是:任务导向场景里,全身角色容易遮挡工作区、引入 uncanny valley,并把效果归因搅进面部与身姿;极简双手保留「有人在带我」的伙伴感,同时让手可以瞬移到喷嘴旁、钻进桌面缝隙,不必遵守走路时间与碰撞。1
手势库按语义分成三类,方便 LLM 选型:deictic(指物、指方向)、iconic(比划形状、尺寸、动作)、expression(赞许、否定、警示等社会线索)。1

从物体注册到 GestureEvent

流水线分会话前与会话中两段。
会话前,用户用注视与场景重建给可交互物体打标签。系统为每个物体保存语义标签与 3D 包围盒,形成 object registry。论文承认这是在设备侧全量 3D 追踪成本与精度限制下的轻量方案,后续局限章节也把它标为静态场景假设。1
会话中,后端 LLM 收到用户语音转写、第一人称画面与注视交点、当前 registry,按 meta-instruction 生成「带内嵌手势事件的回复」。每个事件绑定触发词,并带上 taxonomy 参数,格式形如:
[PointObject; spatiality:wateringcan_F_middle_center]this
[Action; gesture:hold, spatiality:orchid_R_bottom_center, dynamics:pitchRotation]pour
论文把这种结构化片段称为 GestureEvent。默认属性可省略以省 token;若手势对应短语而非单字,模型被要求绑在语义结合最紧的词上,以服务时间同步。1
AgentHands 工作流:用户提问与注视进入 LLM,输出带 GestureEvent 的文本与同步语音
官方博客的系统工作流:从用户语音与第一人称视角,到内嵌 GestureEvent 的回复与 XR 渲染。1
头戴端解析器抽出事件后,用 TTS 音频的平滑 RMS 能量轮廓微调词边界,得到词级起止时间;手势在触发词被读出时落地。每只手是有限状态机,状态拆成 transform、gesture、vfx 三路;双手事件同时驱动两只手,空闲超时回到 idle。击掌、握手等交互手势用碰撞检测异步完成,超时则回退。1
实现栈写得很具体:Unity 6000.1.5f1,Android SpeechRecognizer,回复模型 gemini-2.5-flash-exp,TTS gemini-2.5-flash-preview-tts,用户研究部署在 Samsung Galaxy XR。1
机制上可以读成三层契约:
  1. 场景契约:registry 告诉模型「哪些物体可指、坐标在哪」。
  2. 语言契约:GestureEvent 把「指什么、怎么动、何时动」写成可解析字段。
  3. 时间契约:词级时间轴把字段绑定到 TTS 播放位置,让「this」落下时手已经到位。
对做 Agent 产品的人,可迁移的往往是第 2、3 层接口,而不是双手 mesh 本身。

用户研究证明了什么

研究采用 within-subjects 设计(N=12),对照为 speech-only 基线;两条件使用研究者脚本化的相同口头内容,只差有没有同步双手与手势,顺序做了平衡。任务是兰花护理与 3D 打印机操作,各约 10 步。1
用户研究场景:兰花护理台与 3D 打印机操作台,均叠加蓝色半透明虚拟手
用户研究两个任务环境:(a)兰花护理,(b)3D 打印机操作。1
在 7 点 Likert 上(Wilcoxon 符号秩检验,正态性未满足时使用),AgentHands 相对基线显著更好的项如下。1
题项AgentHands 均值显著性
更容易定位被指物体(Q1)6.50p < 0.05
更容易识别方向(Q2)6.33p < 0.05
更容易定位物体部件/局部(Q3)6.00p < 0.05
更容易跟上所需动作(Q4)6.33p < 0.05
更容易注意到警告(Q5)6.25p < 0.05
对话更有参与感(Q8)6.08p < 0.05
回复更难理解(Q9,反向)1.83p < 0.05
回复更难记住(Q10,反向)2.17p < 0.01
系统特征体验问卷:AgentHands 与 speech-only 基线在十项 7 点量表上的对比
官方博客汇总的系统特征体验结果;图中 * 表示 p < .05,* 表示 p < .01。1*
定性材料与数字同向。有人说直到看到「抬起」手势,才意识到要把兰花端起来沥水;有人把喷嘴烫伤的灼烧特效称为「really impressive」。也有人描述「手就像句子的一部分」,不必停下来想系统在干什么。1
以下几项在两组之间未达显著:
  • 数字信息(Q6,M = 5.42,p > 0.05):参与者觉得语音里的数字本来就够记,或数字手势停留太短。
  • 情绪表达(Q7,M = 5.25,p > 0.05):共享 TTS 的语气已经承担大部分情绪;击掌让人想继续,却未必抬高情绪量表。
  • SUS:AgentHands 平均 80.6,基线 70.4,配对 t = 1.69,p = 0.118。论文据此写的是:清晰度与参与感上升的同时,可用性分数至少保持同级;整体 SUS 优势本身未达显著。1
脚本化口头内容保证了条件可比,也框住了结论外延:研究检验的是「同样一句话,加上同步空间手势是否更好懂」。开放对话里 LLM 自主选型 GestureEvent 的稳定性,仍在本次对照之外。附录写明兰花任务脚本含 37 个 GestureEvent、打印机任务 29 个,评测路径上的手势编排是受控的。

局限与后续可关注点

论文 Limitation 章节列得很清楚,和博客的未来方向一致:
  1. 场景理解依赖预注册,适合相对静态环境;连续 3D 感知、细粒度部件(如电路装配)仍待接。
  2. 手势库是 taxonomy 指导下的有限实例集;下一步才是让模型按 schema 现场合成新 GestureEvent,并靠本地校验回退。
  3. 系统仍是独立 Agent,尚未深入 XR 操作系统与应用级 API(指到文档句子、按 UI 控件、跨应用传意图)。
  4. 证据来自 N=12 单次实验室 within-subjects 研究,统计外推与长期使用效应都不足。1
讨论部分还提出几条产品向问题:双手能否同时做输出通道与输入面(抓住手暂停、击掌确认);具身细节是否应按任务在「抽象双手 / 更完整形象」之间切换;空间记忆与用户惯用手、舒适触及区能否写成可演进的 profile。这些仍停留在研究议程。1

怎么判断这篇材料的价值

AgentHands 把「具身对话」收成一条可实现的接口链:物体 registry → 内嵌 GestureEvent 的 LLM 输出 → 词级 TTS 对齐 → 双手状态机。在脚本化的兰花护理与 3D 打印机任务里,这条链相对纯语音改善了定位、动作跟随、警告显著性与参与感;数字信息、情绪表达与 SUS 的组间差异未达显著。
做 XR / 现场指导 Agent 时,可直接对照 GestureEvent 字段设计、默认属性省 token 的策略,以及评测里「控制口头内容、只改具身通道」的对照方式。材料主体是交互系统与用户研究;模型侧用的是既有 Gemini 2.5 Flash 与对应 TTS。完整论文与 PDF 见 Google Research 论文页

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.