返回 文章 apply CMS 文章

Meta AI 视觉模型如何助力匹兹堡大学变革辅助机器人技术

Meta 开源视觉模型 DINOv3 和 SAM 被用于辅助机器人 RAMMP 项目,在边缘设备上实现实时感知,帮助行动障碍者更独立地生活。

Meta AI辅助机器人DINOv3SAM
成长分 / 100 79 综合收获、行动、留存与影响

Meta AI 视觉模型如何助力匹兹堡大学变革辅助机器人技术
为什么值得读了解前沿 AI 视觉模型如何从通用研究走向辅助机器人这一高影响力现实场景。

洞察边缘计算在辅助技术中的关键工程挑战与权衡,如电池寿命、散热和实时性。

关键洞察
  1. RAMMP 项目整合 DINOv3 和 SAM 等模型,在设备端处理摄像头和传感器数据,实现不依赖网络的实时感知。
  2. DINOv3 作为紧凑的‘视觉大脑’,可分层任务特定模块,实现视觉数据重用并节省电量。
  3. SAM 的自动标注能力与 DINOv2 的视觉表示结合,用于训练轻量级检测模型 RF-DETR,实现 360 度环境感知。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:9867

在匹兹堡的中心,一场静悄悄的革命正在进行——这场革命有望重新定义残疾人的独立意味着什么。这场运动的核心是人类工程研究实验室(HERL),这是匹兹堡大学的一个开创性研究所,目前正牵头一项计划,该计划获得了高达4150万美元的资金支持,来自

对于美国估计550万轮椅使用者而言,保持行动能力确保了个人的机会和对日常生活的参与。当辅助技术不能反映现实世界的复杂性时,它可能会削弱信心、独立性和人身安全。统计数据令人警醒:超过

RAMMP:辅助移动的新时代

由ARPA-H支持的机器人辅助移动与操作平台(RAMMP)项目旨在通过整合先进机器人技术、新型操作系统和数字孪生技术,解决当前机器人移动平台设计的缺陷——创建一个用于安全、可扩展测试和开发的虚拟仿真环境。RAMMP的方法还整合了人工智能,包括使用Meta的多个开源AI视觉模型,其中包括

DINO和SAM已经协助了从医学成像到野生动物保护等各种项目。DINO是一种自监督视觉变换器,擅长从未标记数据中学习视觉表示,使其非常适合标注数据集稀缺的环境。另一方面,SAM旨在“分割一切”,能够以最少的提示识别并勾勒出图像或视频中的任何物体。Segment Anything的多功能性和准确性使其成为精确物体识别至关重要的领域的基础工具。

面向现实世界的工程:在边缘设备上运行DINOv3和SAM

对于依赖辅助设备的人来说,每一秒都至关重要。日常环境不可预测的性质,例如孩子突然冲过人行道、突然出现的路缘或掉落的钥匙,都需要立即反应。直接在设备上处理摄像头图像和传感器数据,即边缘计算,使机器人移动平台能够作为响应工具发挥作用。这些工具必须在人们生活的各种动态环境中保持稳健和一致。

与此同时,在有限的电池供电硬件上部署像DINOv3和SAM这样强大的AI模型带来了重大的工程挑战。现实世界的部署必须考虑实际因素,包括电池寿命、散热、不可靠的网络连接以及严格的尺寸和重量要求。

然而,如果最终用户无法使用这些新型机器人系统进行日常生活活动,那么克服这些限制对他们来说就毫无意义。这些较新的方法允许用户更自然地与机器人交互,利用周围环境作为上下文,使工程师和用户都无需设计和操作复杂、耗时的界面。使用自然语言结合图像数据来查询用户和机器人的环境,并直接提供更直接的命令,这直接减少了用户完成诸如从桌子上拿起杯子这样简单的事情所需的认知负荷和上下文切换量。

RAMMP 团队已经将这一功能集成到他们的第一个原型中。利用基于 DINO 构建的工具,使机器人的图像传感器能够查询以检测自动门按钮、杯子和用于导航辅助的路缘/地面。随着这一功能现已准备好进行真实世界测试,工程师们正专注于语音和触摸输入,让用户能够选择和交互周围环境中的特定物体。除了确保模型输出的准确性和时间一致性的现有挑战之外,这还带来了确保用户提示和输入的鲁棒性和可预测性的额外挑战。

DINOv3 作为设备的一个紧凑、高效的“视觉大脑”——一个通用的基础,可以在其上分层任务特定的轻量级模块,用于物体检测或运动跟踪等操作,从而实现视觉数据的重用并节省电量。

将这两种模型作为机器人系统开发的一部分应用,工程师们针对边缘设备优化模型,减少内存占用,在适当的时候使用较低精度,并以适合真实世界条件的格式部署。这确保了用户可靠、实时的操作。通过以实用的分辨率和高效批处理运行,两种模型即使在机器人移动平台和机械臂使用的紧凑、电池供电的硬件上也能保持快速和可靠——有时为了移动用户所需的速度和稳定性,会牺牲一点边界精度和/或特征细节。这种精度与实用性之间的平衡是该项目理念的核心。

“对于辅助机器人来说,性能不仅仅通过基准准确性来衡量,而是通过系统能否在日常生活的不可预测性中可靠运行来衡量,”RAMMP 项目幕僚长 Sivashankar Sivakanthan 说。“在设备上运行 DINOv3 和 SAM 等模型,才能实现用户可以信任的实时感知——而不依赖连接或牺牲安全性。”

RAMMP 的感知系统建立在 RF-DETR 之上,这是一个使用 DINOv2 嵌入进行微调的轻量级检测模型。训练数据使用 SAM 自动标记,使团队能够快速生成高质量的注释,涵盖辅助设备在现实世界中遇到的各种角度、高度、背景和光照情况。数据增强和多视图策略进一步增强了不同视角之间的一致性。结果是一个智能、自适应且提供更安全、更自信移动的系统。

通过在微调的 RF-DETR 模型中将 SAM 的标记能力与 DINOv2 丰富的视觉表示相结合,RAMMP 实现了实时 360 度环境感知和自适应物体检测。

面向未来的协作愿景

HERL 和 ATDev 作为 RAMMP 联盟中的关键合作伙伴携手合作,各自为项目带来独特的优势。HERL 凭借其在生物医学工程和以用户为中心的研究方面的深厚专业知识引领该计划,为下一代辅助移动出行设定愿景。ATDev 带来强大的工程视角,将 HERL 的转化研究付诸实践,使其在真实设备中发挥作用。HERL 和 ATDev 共同展示了学术领导力与技术创新的结合如何创造出既具有开创性又深度契合用户生活体验的移动出行解决方案。

除了集成尖端人工智能之外,HERL 的方法还高度注重协作,在整个设计过程中让轮椅使用者、临床医生和倡导团体参与其中。这种参与式行动方法论确保技术解决的是现实世界的需求,而不仅仅是假设的需求。RAMMP 背后的全国性联盟包括 Kinova Robotics、LUCI Mobility、ATDev 等合作伙伴,以及卡内基梅隆大学、康奈尔大学、东北大学和普渡大学的学术领袖。

“通过 RAMMP,ARPA-H 旨在创造一个未来,让行动能力受限的美国人能够借助先进机器人技术更轻松地独立生活、从事工作并享受休闲活动,”ARPA-H 项目经理 Mansoor Khan__ 表示。“Meta 的视觉模型是一项关键技术,使机器人平台能够‘看见’。这些模型帮助机器人理解场景、导航世界并拾取正确的物体——显著减轻用户的认知负担并增强独立性。”

除了增强个人移动能力之外,RAMMP 还旨在促进匹兹堡和宾夕法尼亚州各地新的劳动力和制造业机会,培育先进的移动出行解决方案和国内生产。这一愿景将技术进步与经济和社会发展交织在一起。

“RAMMP 团队通过 ARPA-H 所构建的,是对美国健康创新面貌的一瞥——当我们不再接受现状时,它就是这个样子,”ARPA-H 主任 Alicia Jackson 博士 表示。“数百万行动能力受限的美国人理应获得在他们所在之处满足他们需求的技术,而不是要求他们去适应的技术。与 Meta 等世界级创新者合作,将前沿 AI 引入辅助机器人技术,正是我们以超乎任何人想象的速度实现这一目标的方式。”

展望未来,RAMMP 团队将继续推进下一代感知模型的集成,包括 SAM 3.1 和 DINOv3,以进一步改善实时环境理解和交互。未来的工作将侧重于加强时间一致性、在多样化现实条件下的鲁棒性,以及与决策和控制系统的更紧密集成。通过结合这些进展,RAMMP 旨在迈向这样的辅助系统:不仅能准确感知其环境,还能随时间推移适应每位用户的独特需求、行为和环境。下一代辅助机器人技术将不仅仅运送人——它将推动社会更接近一个无论能力如何,每个人都能充分且独立参与的世界。

我们的最新动态已发送至您的收件箱

订阅 我们的新闻通讯,随时了解 Meta AI 新闻、活动、研究突破等更多内容。