返回 文章 学习 CMS 文章

AgentHands:为 XR 中的空间对话智能体生成同步交互手势

让 XR 中的 AI 智能体一边说话一边用手势指向、描绘和演示,把口头指令变成空间中的物理动作。

XRLLM具身智能体手势生成
成长分 / 100 79 综合收获、行动、留存与影响

AgentHands:为 XR 中的空间对话智能体生成同步交互手势
为什么值得读了解 Google XR 如何将 LLM 推理输出映射为实时、与语音同步的手部动画,是空间计算与多模态交互的前沿实践。

提供了从形成性研究到分类体系、行为库、系统工作流再到用户研究的完整设计链路,可作为具身智能体交互设计的参考框架。

关键洞察
  1. AgentHands 通过轻量级物体注册模块,利用眼动追踪和场景重建让用户快速标记物品,建立带 3D 边界框的空间注册表供智能体引用。
  2. 手势行为库按语义分为指示性、象似性和表达性三类,供 LLM 选择并编码为手势事件。
  3. 后端 LLM 生成含内联 GestureEvents 的响应,每个事件绑定触发词并按分类维度编码手部行为基元。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:8092

2026年8月25日

Xun Qian,研究科学家;Ruofei Du,交互感知与图形负责人,Google XR

AgentHands 是一款由 LLM 驱动的 XR 原型,它为对话式智能体赋予同步的、富有表现力的手势,以提供具有空间依据的指导,弥合心理映射上的差距,并提升用户在物理任务中的参与度。

随着 AI 助手从简单的文本界面演变为多模态伙伴,我们正看到一种向更主动、更具情境性的协助转变的趋势。近期的创新,如 Project AstraGemini 3.1 Flash Live,已经允许用户实时讨论其周围的物理环境,通常利用视觉边界框叠加来识别摄像头画面中的物体。虽然这些叠加层在 2D 屏幕上非常有效,但向 Android XR 等沉浸式平台的过渡带来了一个独特的挑战:我们如何超越扁平 UI,创造出真正具身化、具有空间感知能力的对话?

为弥合这一差距,我们推出了 AgentHands,该研究成果发表于 CHI 2026。这一研究原型将伴随言语的手势的力量带入 3D 世界。在人类交流中,我们的双手不仅仅是指点;它们还描述形状、模仿动作并强调要点,所有这些都与我们的声音同步。通过利用扩展现实(XR)的空间理解能力,AgentHands 复现了这种自然的协同作用。继我们此前在 Human I/OSensible Agent 中的研究之后,AgentHands 进一步为 AI 智能体配备了富有表现力、同步的手势,将抽象的口头指令转化为直观的、物理性的演示,使关于周围环境的对话更加自然、更具吸引力。

AgentHands 演示:为 AI 智能体赋予富有表现力、同步的手势,以在 XR 中实现具有空间依据的对话。

首先,我们与 Google 的 XR 和人机交互(HCI)专家进行了一项形成性研究,以确定是什么让虚拟手在 3D 环境中“可被理解”。我们将这些洞见提炼为一个多维分类体系,定义了智能体应如何使用其双手,将对话锚定在用户的物理空间中。

AgentHands 分类体系图展示了六个维度:左右手性、手势、空间性、时间动态、交互性和视觉效果。

AgentHands 的核心创新在于,它能够将 LLM 的高层推理映射为精确的、实时的物理动作,并与智能体的“声音”和用户的 XR 环境相匹配。我们引入以下关键步骤来构建 AgentHands 工作流程。

系统以一个轻量级物体注册模块开始。利用眼动追踪和场景重建,用户可以快速“标记”物品——比如一株兰花或一台笔记本电脑——创建一个带有3D边界框的空间注册表,供智能体参考。

AgentHands利用眼动追踪和场景理解将物理对象注册到3D注册表中。

我们构建了一个包含三个语义类别的手势行为库:a) 指示性 用于指代,b) 象似性 用于描绘动作或形态,c) 表达性 用于传达社交线索和情感。

按语义目的分组的一组代表性行为,以便于LLM选择。

当用户提问时,后端LLM生成一个包含内联GestureEvents的响应。每个事件附加到特定的触发词,并根据分类维度编码手部行为的基元。

XR头显上的本地解析器协调文本转语音(TTS)播放与动画引擎。通过使用词级时间戳,智能体的手部执行与语音同步的手势,与所说的话完美同步,提供清晰、富有表现力的空间参考。

通过集成这些模块,AgentHands在语言意图和物理动作之间创建了无缝桥梁。系统将标准LLM输出转换为丰富的多模态表演,其中智能体生成的响应通过语音和空间精确的运动表现出来,允许在用户环境中准确演示复杂指令。

完整的AgentHands系统工作流程,展示了从用户语音和第一人称视角(FPV)到LLM生成的GestureEvents和同步XR渲染的流程。

我们展示了这些具身手势,结合XR的空间意识,如何增强我们对物理环境的理解。

互动辅导: 在兰花护理场景中,智能体不仅说“检查根部”;它将手移到植物基部,勾勒出气生根,同时解释它们的功能。

AgentHands在兰花护理任务中使用空间手势指出气生根。

技术演示: 对于3D打印机操作,智能体可以演示导航控制旋钮和选择文件所需的精确“旋转并点击”序列,使复杂的物理界面步骤变得直观。

AgentHands演示了3D打印机菜单导航的精确旋钮交互。

生活方式陪伴: 智能体可以充当健康教练,与您的物理选择互动。例如,智能体可以通过握住用户的手和执行视觉效果来执行交互式“警告”手势,以警告用户避免不健康行为。

AgentHands执行微妙的交互手势以支持健康的日常习惯。

为了评估这些手势的影响,我们进行了一项受试者内研究(N = 12),比较AgentHands与仅语音基线。两种条件使用相同的研究人员脚本化口头内容,确保唯一区别是具身手及其同步手势的存在。参与者完成了两项程序性任务,平衡了日常护理与技术操作。

用户研究设置显示两个任务环境:(a) 兰花植物护理站和 (b) 3D打印机操作站。

结果证实,XR 与共语手势的结合对于空间锚定的交互极为有效。我们围绕沟通有效性的几个关键指标对数据进行了分析。

系统功能体验问卷的统计结果显示,AgentHands 在位置、动作理解和警告可察觉性方面显著优于基线。

AgentHands 代表着迈向未来的一步:AI 系统不仅分析我们的世界,还能在其中动态运作。通过利用共语手势和 XR 的空间能力,将对话锚定在身体动作中,我们可以降低复杂任务的认知负荷,使空间计算更易获取、更以人为本。

在我们持续为 Android XR 生态系统进行开发的过程中,我们正在探索让这些手势更加个性化的方式——适应用户的惯用手,或学习其特定的空间习惯——以打造更无缝的人机协作。

本研究主要由 Ziyi Liu 在 Google 担任学生研究员期间完成,是多个团队联合协作的一部分。我们衷心感谢主要贡献者 David Li、Zhongyi Zhou 和 David Kim 的支持,以及 Adarsh Kowdle、Guru Somadder 和 Shahram Izadi 的战略指导与悉心审阅。