2026年8月25日
Xun Qian,研究科学家;Ruofei Du,交互感知与图形负责人,Google XR
AgentHands 是一款由 LLM 驱动的 XR 原型,它为对话式智能体赋予同步的、富有表现力的手势,以提供具有空间依据的指导,弥合心理映射上的差距,并提升用户在物理任务中的参与度。
随着 AI 助手从简单的文本界面演变为多模态伙伴,我们正看到一种向更主动、更具情境性的协助转变的趋势。近期的创新,如 Project Astra 和 Gemini 3.1 Flash Live,已经允许用户实时讨论其周围的物理环境,通常利用视觉边界框叠加来识别摄像头画面中的物体。虽然这些叠加层在 2D 屏幕上非常有效,但向 Android XR 等沉浸式平台的过渡带来了一个独特的挑战:我们如何超越扁平 UI,创造出真正具身化、具有空间感知能力的对话?
为弥合这一差距,我们推出了 AgentHands,该研究成果发表于 CHI 2026。这一研究原型将伴随言语的手势的力量带入 3D 世界。在人类交流中,我们的双手不仅仅是指点;它们还描述形状、模仿动作并强调要点,所有这些都与我们的声音同步。通过利用扩展现实(XR)的空间理解能力,AgentHands 复现了这种自然的协同作用。继我们此前在 Human I/O 和 Sensible Agent 中的研究之后,AgentHands 进一步为 AI 智能体配备了富有表现力、同步的手势,将抽象的口头指令转化为直观的、物理性的演示,使关于周围环境的对话更加自然、更具吸引力。
AgentHands 演示:为 AI 智能体赋予富有表现力、同步的手势,以在 XR 中实现具有空间依据的对话。
首先,我们与 Google 的 XR 和人机交互(HCI)专家进行了一项形成性研究,以确定是什么让虚拟手在 3D 环境中“可被理解”。我们将这些洞见提炼为一个多维分类体系,定义了智能体应如何使用其双手,将对话锚定在用户的物理空间中。
AgentHands 分类体系图展示了六个维度:左右手性、手势、空间性、时间动态、交互性和视觉效果。
AgentHands 的核心创新在于,它能够将 LLM 的高层推理映射为精确的、实时的物理动作,并与智能体的“声音”和用户的 XR 环境相匹配。我们引入以下关键步骤来构建 AgentHands 工作流程。
系统以一个轻量级物体注册模块开始。利用眼动追踪和场景重建,用户可以快速“标记”物品——比如一株兰花或一台笔记本电脑——创建一个带有3D边界框的空间注册表,供智能体参考。
AgentHands利用眼动追踪和场景理解将物理对象注册到3D注册表中。
我们构建了一个包含三个语义类别的手势行为库:a) 指示性 用于指代,b) 象似性 用于描绘动作或形态,c) 表达性 用于传达社交线索和情感。
按语义目的分组的一组代表性行为,以便于LLM选择。
当用户提问时,后端LLM生成一个包含内联GestureEvents的响应。每个事件附加到特定的触发词,并根据分类维度编码手部行为的基元。
XR头显上的本地解析器协调文本转语音(TTS)播放与动画引擎。通过使用词级时间戳,智能体的手部执行与语音同步的手势,与所说的话完美同步,提供清晰、富有表现力的空间参考。
通过集成这些模块,AgentHands在语言意图和物理动作之间创建了无缝桥梁。系统将标准LLM输出转换为丰富的多模态表演,其中智能体生成的响应通过语音和空间精确的运动表现出来,允许在用户环境中准确演示复杂指令。
完整的AgentHands系统工作流程,展示了从用户语音和第一人称视角(FPV)到LLM生成的GestureEvents和同步XR渲染的流程。
我们展示了这些具身手势,结合XR的空间意识,如何增强我们对物理环境的理解。
互动辅导: 在兰花护理场景中,智能体不仅说“检查根部”;它将手移到植物基部,勾勒出气生根,同时解释它们的功能。
AgentHands在兰花护理任务中使用空间手势指出气生根。
技术演示: 对于3D打印机操作,智能体可以演示导航控制旋钮和选择文件所需的精确“旋转并点击”序列,使复杂的物理界面步骤变得直观。
AgentHands演示了3D打印机菜单导航的精确旋钮交互。
生活方式陪伴: 智能体可以充当健康教练,与您的物理选择互动。例如,智能体可以通过握住用户的手和执行视觉效果来执行交互式“警告”手势,以警告用户避免不健康行为。
AgentHands执行微妙的交互手势以支持健康的日常习惯。
为了评估这些手势的影响,我们进行了一项受试者内研究(N = 12),比较AgentHands与仅语音基线。两种条件使用相同的研究人员脚本化口头内容,确保唯一区别是具身手及其同步手势的存在。参与者完成了两项程序性任务,平衡了日常护理与技术操作。
用户研究设置显示两个任务环境:(a) 兰花植物护理站和 (b) 3D打印机操作站。
结果证实,XR 与共语手势的结合对于空间锚定的交互极为有效。我们围绕沟通有效性的几个关键指标对数据进行了分析。
系统功能体验问卷的统计结果显示,AgentHands 在位置、动作理解和警告可察觉性方面显著优于基线。
AgentHands 代表着迈向未来的一步:AI 系统不仅分析我们的世界,还能在其中动态运作。通过利用共语手势和 XR 的空间能力,将对话锚定在身体动作中,我们可以降低复杂任务的认知负荷,使空间计算更易获取、更以人为本。
在我们持续为 Android XR 生态系统进行开发的过程中,我们正在探索让这些手势更加个性化的方式——适应用户的惯用手,或学习其特定的空间习惯——以打造更无缝的人机协作。
本研究主要由 Ziyi Liu 在 Google 担任学生研究员期间完成,是多个团队联合协作的一部分。我们衷心感谢主要贡献者 David Li、Zhongyi Zhou 和 David Kim 的支持,以及 Adarsh Kowdle、Guru Somadder 和 Shahram Izadi 的战略指导与悉心审阅。
