Gemini Robotics 2 为机器人带来全身智能
从脚趾到指尖——我们正在教机器人智能的全身控制、精细灵巧操作和团队协作,以完成广泛的复杂任务
几十年来,我们一直梦想着机器人能够无缝地步入我们的世界并伸出援手。如今,这一愿景向前迈出了重要一步。
大多数机器人都是预先编程或远程操作的,只能执行狭窄、重复的任务序列。它们缺乏真正自我学习或适应不可预测环境的能力。此外,将学到的技能从一个机器人本体迁移到另一个机器人本体仍然极其困难。为了大规模应对最困难的问题,各种形状和尺寸的机器人都需要 AI 模型,赋予它们智能思考、行动和交互的能力,以安全地完成任务。
我们通过 Gemini Robotics 展示了 Gemini 的多模态理解如何驱动现实世界的行动。今天,我们推出 Gemini Robotics 2——为下一代真正具有适应性的机器人提供动力的智能层。随着它迈出字面意义上的第一步,这一重大进展解锁了智能全身控制、高级灵巧操作和多机器人协作。
Gemini Robotics 2 使机器人能够对每一个动作进行推理,解锁广泛的任务。例如,它可以让一个人形机器人行走、蹲下、伸展和操作物体来清理杂乱的房间。它甚至可以与其他机器人组队,更快地完成工作。而这种深刻的智能还可以在设备本地运行,同时在短短几小时内无缝适应全新的机器人本体。
我们通过三个能力强大的模型实现了这一点:
Gemini Robotics 2:我们最先进的视觉-语言-动作模型(VLA),将视觉和语言输入转化为运动控制,使机器人能够采取行动。该模型能够控制完整的人形机器人,从脚趾到指尖,以及其他双臂机器人。它还为双手和夹爪带来了新水平的灵巧操作。Gemini Robotics ER 2:我们能力最强的具身推理(ER)模型。它是一个视觉语言模型(VLM),充当我们的智能体,使机器人能够与人类交流、理解物理世界并规划持续数分钟的多步骤任务。我们还引入了机器人团队协作的能力。Gemini Robotics On-Device 2:我们最高效的视觉-语言-动作模型(VLA),针对在机器人设备上本地运行进行了优化。该模型现在可以通过几小时的数据实现对全新机器人本体的快速适应。
Gemini Robotics ER 2,我们的推理模型,现已在 Google AI Studio 上提供,并在 Gemini Enterprise Agent Platform 上开放私人预览。我们的 VLA 和 On-Device 模型已向早期访问合作伙伴开放。请阅读我们的开发者博客,了解如何将这些模型引入您的硬件。
运动中的类人机器人:管理全身任务
世界是为人类运动而构建的;它要求我们在狭窄、杂乱的空间中伸手、弯腰和保持平衡。虽然我们之前的模型控制类人机器人的上半身来完成桌面任务,但 Gemini Robotics 2 将物理 AI 扩展到全身运动。
我们的模型现在首次能够控制整个类人机器人,将意图转化为智能的全身控制。例如,在控制 Apptronik 的 Apollo 2 类人机器人时,我们可以要求它*“将浇水壶放入底层架子的绿色垃圾桶中。”* Apollo 处理指令,走到桌子旁,拿起浇水壶,走几步到架子前,并将其精确地放入目的地。虽然我们的机器人在移动速度上还有更多进步空间,但这是朝着完成更复杂、需要全身协调的现实世界任务所需技能迈出的重要一步。
为手部和夹爪带来高级灵巧性
为了在家庭和工作场所中真正有用,机器人需要精细操作。Gemini Robotics 2 在不同末端执行器上解锁了新的物理灵巧性水平,无论机器人使用的是手还是夹爪,都能使机器人比以往更有用。
该模型现在可以控制 Apollo 2 机器人上的五指、22 自由度的 SharpaWave 手,完成打结或密封自封袋等精细动作。它还可以操作 Franka Duo 平台上的标准两指平行夹爪,执行复杂的灵巧任务(例如紧密包装)。我们正在继续提升精度和速度水平,以实现人类级别的灵巧性。
通过代理推理和多机器人协作解锁高级任务
大多数现实世界任务需要在较长时间内完成多个步骤。为了管理这种复杂性,我们的具身推理(ER)模型 Gemini Robotics ER 2 充当机器人的高级大脑,处理用户指令并与人类沟通。它观察房间,推理完成任务所需的步骤,与 VLA 协调执行动作,并跟踪进度直到任务完成。这种设置允许机器人执行复杂的多步骤任务,在步骤失败时自我纠正,并泛化到新情况和目标。
在本次更新中,我们使机器人能够更可靠地执行更长的任务序列,持续数分钟并涉及数百个决策。Gemini Robotics ER 2 现在能够理解任务何时开始和结束,并能精确定位关键事件发生的时刻,标志着进度理解方面的阶跃变化。
此外,我们正在引入多机器人协作。这使得不同类型的机器人能够相互通信并协同工作,以解决单个机器人无法独立完成的复杂工作流程。
为任何机器人快速适配端侧模型
许多机器人应用需要在没有网络延迟或互联网连接的情况下运行。Gemini Robotics On-Device 2 正是为应对这些限制而专门构建的——它是我们最高效的视觉-语言-动作模型(VLA),经过优化可在机器人设备上本地运行。
该模型原生支持多形态,并继承了我们在 Gemini Robotics 1.5 中的先进“动作迁移”技术。现在,我们只需几个小时的适配时间、通常少于 200 个示例,就能适配新的双臂机器人形态。即使面对形状、传感器和自由度截然不同的新形态,这一方法也同样有效,如下所示,Dexmate、SO101 和 Trossen 平台正在执行一系列多样化的任务。
推进我们对安全与负责任机器人的承诺
安全是我们机器人研究的基石。随着机器人获得更多物理能力,我们致力于确保端到端的安全与对齐。在每一次发布中,我们都采取多层方法,将传统的物理安全措施与稳健的 AI 安全框架相结合。
Gemini Robotics 2 专门提升了机器人安全性,以应对现实世界的不确定性并与人类协作。
我们推出了 ASIMOV-Agentic,这是一个用于智能体安全编排和不确定性解决的新基准。例如,它衡量具身推理智能体拒绝来自 VLA 的不安全工具调用的能力。它还衡量智能体预测任务是否可能完成,并在不确定时主动请求人工干预的能力。
此外,凭借增强的具身推理,Gemini Robotics ER 2 是我们在安全约束遵循和人类接近基准方面迄今为止最安全的机器人模型。它能更好地检测人类何时在附近,触发安全工具调用,并在有人过于靠近时将机器人安全停止。这是协作安全标准中的一项关键要求。更多详情请阅读我们的 Gemini Robotics 2:安全技术报告。
迈向通用物理 AI
Gemini Robotics 2 是在物理世界中解决 AGI 道路上的一个重要里程碑。释放机器人的真正潜力需要超越单任务自动化,迈向通用智能。通过构建这一核心智能,我们的目标是让物理世界中的 AI 能够与人类并肩工作,解决复杂挑战。
探索 Gemini Robotics 2
致谢
本工作由 Gemini Robotics 团队开发:Abhijit Ogale、Abhishek Jindal、Adil Dostmohamed、Adrian Collister、Alan Thompson、Alessio Quaglino、Alex Bewley、Alex Hofer、Alex Taeho Kim、Alex X. Lee、Alex Zihao Zhu、Allen Chai、Amaris Paryag、Amit Hampaul、Amy Nommeots-Nomm、Amy Shen、Andre Araujo、Andrew Gallagher、Anirudha Majumdar、Anna Volosina、Annie S. Chen、Annie Xie、Anthony Brohan、Antoine Laurens、Arunkumar Byravan、Asaf Revach、Assaf Hurwitz Michaely、Baruch Tabanpour、Ben Moran、Benoit Landry、Bingyi Cao、Bogdan Mazoure、Brandon Hernaez、Brijen Thananjeyan、Bryan Anenberg、Caden Lu、Carl Doersch、Carolina Parada、Caroline Pantofaru、Charles Shu、Chengda Wu、Christine Chan、Christy Koh、Chuyuan Fu、Claire Cui、Clare Lee、Claudio Fantacci、Connor Schenck、David Rendleman、Deepali Jain、Demetra Brady、Dennis Li、Dhruv Shah、Dimple Vijaykumar、Dirk Ehrlich、Divya Garikapati、Dmitry Kalashnikov、Dre Mahaarachchi、Dushyant Rao、Erik Frey、Fangchen Liu、Federico Casarini、Francesco Nori、Francesco Romano、Frankie Garcia、Gabor Simko、Gautam Salhotra、Giulia Vezzani、Grace Popple、Grace Vesom、Graziano Misuraca、Guangyao Zhou、Hagen Soltau、Hanzi Mao、Hao-Tien Lewis Chiang、Harris Chan、Hila Noga、Howard Zhou、Ian Storz、Idan Lev-Yehudi、Ignacio Rocco、Inessa Konstanz、Isaac Reid、Ishita Prasad、Ivan Kapelyukh、J. Chase Kew、Jacky Liang、Jake Varley、James Susilo、Jasmine Hsu、Jerad Kirkland、Jeremy Plassmann、Jessica Lo、Jie Tan、Jimmy Yan、Jingwei Zhang、Jinyu Xie、Jose Enrique Chen、Joshua Ainslie、Joss Moore、Juanita Bawagan、Junkyung Kim、Justin Lidard、Kanishka Rao、Kathryn Quinn Shea、Kaustubh Sridhar、Keerthana Gopalakrishnan、Ken Caluwaerts、Kenneth Oslund、Khimya Khetarpal、Konstantinos Bousmalis、Krista Reymann、Krzysztof Choromanski、Ksenia Konyushkova、Kun Zhang、Kunal Aneja、Laura Graesser、Leen Verburgh、Leonard Hasenclever、Li-Heng Lin、London Chappellet-Volpini、Lucie Kerley、Maria Attarian、Maria Bauza Villalonga、Marissa Giustina、Max McCabe、Meet Kirankumar Dave、Mehdi S. M. Sajjadi、Metin Tokosz-Exley、Michael Neunert、Michael Noseworthy、Michiel Blokzijl、Miguel Rivas、Mithun George Jacob、Mitsuhiko Nakamoto、Mo Dawoud、Mohan Kumar Srirama、Mohit Sharma、Mohit Shridhar、Muinat Abdul、Murilo F. Martins、Nadav Olmert、Nathan Batchelor、Nicolas Heess、Niko Milonopoulos、Norman Di Palo、Oliver Groth、Ouais Alsharif、Padmini Copparapu、Parth Parekh、Paul Ruiz、Paul Wohlhart、Peide Huang、Peng Xu、Pengfei Xing、Peter Pastor、Petko Yotov、Phil Duffy、Philemon Brakel、Rachel Sterneck、Rajkumar Vasudeva Raju、Ravin Kumar、Razvan Surdulescu、René Wagner、Reza Sanatinia、Robert Baruch、Robert McDonald、Robert Moreno、Rohan Thakker、Roland Hafner、Ryan Doss、Sajjad Zafar、Sally Jesmonth、Sam Haves、Saminda Abeyruwan、Sandy Han Huang、Scott Crowell、Seliem El-Sayed、Sergey Yaroshenko、Sergio Martinez Abad、Serkan Cabi、Sharath Maddineni、Shuang Li、Sichun Xu、Silvia Cruciani、Skanda Koppula、Skye Yang、Soo Sung、Stefan Welker、Stefani Karp、Stefano Saliceti、Steven Hansen、Stuart Bowers、Sumeet Singh、Svetlana Grant、Takahiro Miki、Takuma Yoneda、Thomas Buschmann、Thomas Lampe、Thomas Power、Thor Schaeff、Tim Hertweck、Tingnan Zhang、Todd McInally、Todor Davchev、Tong Zhao、Travers Rhodes、Tsang-Wei Edward Lee、Vika Koriakin、Vikas Sindhwani、Wenhao Yu、Wentao Yuan、Xiaolin Fang、Yahav Nussbaum、Ying Sheng、Ying Xu、Yuheng Kuang、Yuxiang Yang、Yuxiang Zhou
对于他们的领导和对此项工作的支持,我们要感谢:Jean-Baptiste Alayrac、Zoubin Ghahramani、Koray Kavukcuoglu 和 Demis Hassabis。我们要表彰 Google 和 Google DeepMind 中为此项工作做出贡献的众多团队,包括法务、市场、传播、责任与安全委员会、负责任开发与创新、政策、战略与运营,以及我们的业务与企业发展团队。我们要感谢机器人团队中未在上文明确提及的所有人,感谢他们持续的支持与指导。最后,我们要感谢我们的合作伙伴:Apptronik、Boston Dynamics 和 Agile Robots 团队的支持。
