返回 文章 学习 CMS 文章

SIMA 2:基于 Gemini 的 3D 虚拟世界 AI 智能体

SIMA 2 用 Gemini 驱动,让 AI 在 3D 虚拟世界中从听指令升级为会思考、能对话、可自我改进的游戏伙伴。

SIMA 2Gemini具身智能通用智能体
成长分 / 100 79 综合收获、行动、留存与影响

SIMA 2:基于 Gemini 的 3D 虚拟世界 AI 智能体
为什么值得读了解 Google DeepMind 如何将 Gemini 的推理能力嵌入具身智能体,推动 AI 从指令跟随走向交互式合作。

SIMA 2 在未见过的游戏和 Genie 3 生成的全新世界中展现出泛化能力,为通用具身智能提供关键验证。

关键洞察
  1. SIMA 2 将 Gemini 模型作为智能体核心,使其能对指令进行思考和推理,并向用户描述意图和步骤。
  2. SIMA 2 在从未训练过的游戏(如 ASKA 和 MineDojo)中成功完成任务,泛化性能显著提升,缩小了与人类玩家的差距。
  3. SIMA 2 能理解多模态提示、不同语言甚至表情符号,并能将概念从一个游戏迁移到另一个游戏。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:11993

SIMA 2:在虚拟 3D 世界中与你一起游玩、推理和学习的智能体

去年,我们推出了 SIMA(可扩展可指令多世界智能体),这是一个通用人工智能,能够在各种虚拟环境中遵循基本指令。SIMA 是教会人工智能在丰富的 3D 世界中将语言转化为有意义行动的关键第一步。

今天,我们推出 SIMA 2,这是我们研究创造通用且有用的人工智能体过程中的下一个里程碑。通过整合我们 Gemini 模型的先进能力,SIMA 正在从指令跟随者演变为交互式游戏伴侣。SIMA 2 不仅能在虚拟世界中遵循人类语言指令,现在还能思考其目标、与用户对话,并随时间自我改进。

这是朝着通用人工智能(AGI)方向迈出的重要一步,对机器人技术和 AI 具身化的未来具有重要影响。

推理的力量

第一版 SIMA 学会了在多种商业视频游戏中执行超过 600 种语言跟随技能,如“向左转”、“爬梯子”和“打开地图”。它在这些环境中像人一样操作,通过“看”屏幕并使用虚拟键盘和鼠标导航,而无法访问底层游戏机制。

借助 SIMA 2,我们超越了指令跟随。通过将 Gemini 模型嵌入为智能体的核心,SIMA 2 不仅能响应指令,还能对指令进行思考和推理。

MineDojo:SIMA 1(左)尝试遵循指令,而 SIMA 2(右)在从未见过的游戏中成功完成任务。

ASKA:SIMA 1(左)尝试遵循指令“找到篝火”,而 SIMA 2(右)在从未见过的游戏中成功完成任务。

SIMA 2 的新架构整合了 Gemini 强大的推理能力,帮助其理解用户的高层目标,在追求目标时进行复杂推理,并在游戏中熟练执行目标导向的行动。

我们使用人类演示视频与语言标签以及 Gemini 生成的标签的混合数据来训练 SIMA 2。因此,SIMA 2 现在可以向用户描述其意图,并详细说明为实现目标所采取的步骤。

在测试中,我们发现与智能体交互感觉不像是在下达命令,而更像是在与一位能够对当前任务进行推理的伙伴合作。

得益于我们与现有及新游戏合作伙伴的合作(见致谢),我们能够在更广泛的游戏上训练和评估 SIMA 2。

这就是 Gemini 为具身 AI 带来的力量:一个世界级的推理引擎,现在能够在复杂的交互式 3D 环境中感知、理解并采取行动。

泛化性能的飞跃

Gemini 的加入也带来了更好的泛化和可靠性。SIMA 2 现在能理解比其前身更复杂、更细微的指令,并且在执行这些指令方面成功得多,尤其是在它从未训练过的情况或游戏中,例如新的维京生存游戏 ASKA,或 MineDojo——流行开放世界沙盒游戏 Minecraft 的研究实现。

SIMA 2 能够理解并完成长时程复杂任务

SIMA 2 能够理解多模态提示

SIMA 2 能够理解不同语言甚至表情符号

此外,它迁移所学概念的能力——例如,将在一个游戏中对“采矿”的理解应用到另一个游戏中的“采集”上——是实现人类认知中那种广泛泛化能力的基础。事实上,正是由于这种能力,SIMA 2 在广泛任务上的表现显著更接近人类玩家。

SIMA 2 能够在多个游戏之间泛化动作,包括它未曾训练过的游戏(如 MineDojo 和 ASKA)。

SIMA 1、SIMA 2 和人类在所有训练游戏环境的一组评估任务上的任务完成成功率,显示 SIMA 2 大幅缩小了与人类表现之间的差距。请注意,此处报告的 SIMA 1 表现是针对我们新的、扩展的且难度大幅提升的评估集,涵盖更广泛的环境和更复杂的指令。

SIMA 1 和 SIMA 2 在留出(训练期间从未见过)游戏上的任务完成成功率:ASKA 和 MineDojo(一个 Minecraft 研究实现)。

终极测试:在全新想象的世界中游玩

为了测试 SIMA 2 泛化能力的极限,我们将其与另一个开创性研究项目 Genie 3 结合,后者能够根据单张图像或文本提示生成全新的实时 3D 模拟世界。

当我们让 SIMA 2 在这些新生成的世界中游玩时,我们发现它能够合理地定位自身、理解用户指令,并朝着目标采取有意义的行动,尽管此前从未见过此类环境。它展现出了前所未有的适应能力。

迈向可扩展的多任务自我改进

SIMA 2 最令人兴奋的新能力之一是其自我改进的能力。我们观察到,在整个训练过程中,SIMA 2 智能体能够执行越来越复杂和新颖的任务,这得益于试错和基于 Gemini 的反馈。

例如,在最初从人类演示中学习之后,SIMA 2 可以完全通过自主游玩过渡到在新游戏中学习,在无需额外人类生成数据的情况下,在先前未见过的世界中发展其技能。在后续训练中,SIMA 2 自身的经验数据可用于训练下一代能力更强的智能体。我们甚至能够在新创建的 Genie 环境中利用 SIMA 2 的自我改进能力——这是朝着在多样化生成世界中训练通用智能体迈出的重要里程碑。

SIMA 2 的自我改进循环始于 Gemini 提供初始任务和对 SIMA 2 行为的估计奖励。然后,这些信息被添加到自我生成经验库中,智能体在后续世代中利用该经验库进行进一步训练。这一过程使智能体能够完全独立于人类生成的演示和干预,改进先前失败的任务。

这种迭代改进的良性循环为未来铺平了道路:智能体能够在最少人类干预下学习和成长,成为具身 AI 中的开放式学习者。

展望未来:通往通用具身智能的旅程

SIMA 2 能够在多样化的游戏环境中运行,这是通用智能的一个关键试验场,使智能体能够掌握技能、练习复杂推理,并通过自主导向的游玩持续学习。

尽管 SIMA 2 是迈向通用、交互式、具身智能的重要一步,但它从根本上仍是一项研究性工作,其当前的局限性凸显了未来工作的关键领域。我们发现,智能体在需要大量多步推理和目标验证的超长时程、复杂任务上仍面临挑战。SIMA 2 对其交互的记忆也相对短暂——它必须使用有限的上下文窗口来实现低延迟交互。最后,通过键盘和鼠标界面执行精确的底层动作,以及对复杂 3D 场景实现稳健的视觉理解,仍然是整个领域持续应对的开放挑战。

这项研究为面向行动的 AI 的一条新路径提供了根本性验证。SIMA 2 证实,一个为广泛能力而训练、利用多样化多世界数据和 Gemini 强大推理能力的 AI,能够成功地将许多专用系统的能力统一为一个连贯的通用智能体。

SIMA 2 还为机器人领域的应用提供了一条强有力的路径。它学到的技能——从导航和工具使用到协作任务执行——是未来物理世界中的 AI 助手所需的智能物理具身化的一些基本构建模块。

负责任的发展

SIMA 2 是一个交互式、以人为本的智能体,与之互动很有趣,尤其是它解释自身推理的方式颇具娱乐性。与我们所有的先进和基础技术一样,我们从一开始就深深致力于负责任地开发 SIMA 2。在其技术创新方面尤其如此,特别是自我改进的能力。

在构建 SIMA 2 的过程中,我们与我们的负责任发展与创新团队合作。在我们继续探索潜在应用的同时,我们将 SIMA 2 作为有限的研究预览发布,并向一小批学者和游戏开发者提供早期访问。这种方法使我们能够在探索这一新领域并继续加深对风险及其适当缓解措施的理解时,收集关键反馈和跨学科视角。我们期待与社区进一步合作,以负责任的方式开发这项技术。

了解更多关于 SIMA 的信息

致谢

这项研究由 SIMA 2 团队开发:Maria Abi Raad、John Agapiou、Frederic Besse、Andrew Bolt、Sarah Chakera、Harris Chan、Jeff Clune、Alexandra Cordell、Martin Engelcke、Ryan Faulkner、Maxime Gazeau、Arne Olav Hallingstad、Tim Harley、Ed Hirst、Drew Hudson、Laura Kampis、Sheleem Kashem、Thomas Keck、Matija Kecman、Oscar Knagg、Alexander Lerchner、Bonnie Li、Yulan Liu、Cong Lu、Maria Loks-Thompson、Joseph Marino、Kay McKinney、Piermaria Mendolicchio、Anna Mitenkova、Alexandre Moufarek、Fabio Pardo、Ollie Purkiss、David Reichert、John Reid、Tyson Roberts、Daniel P. Sawyer、Tim Scholtes、Daniel Slater、Hubert Soyer、Kaustubh Sridhar、Peter Stys、Tayfun Terzi、Davide Vercelli、Bojan Vujatovic、Jane X. Wang、Luyu Wang、Duncan Williams 和 Lei M. Zhang。

感谢以下人士的领导、指导与支持:Satinder Singh Baveja、Adrian Bolton、Zoubin Ghahramani、Raia Hadsell、Demis Hassabis、Shane Legg、Volodymyr Mnih 和 Daan Wierstra。

衷心感谢部分贡献者和过往成员:Alex Cullum、Karol Gregor、Rosemary Ke、Junkyung Kim、Matthew Jackson、Andrew Lampinen、Loic Matthey、Hannah Openshaw 和 Zhengdong Wang。

特别感谢所有与我们合作的游戏开发者:Coffee Stain(Valheim、Satisfactory、Goat Simulator 3)、Foulball Hangover(Hydroneer)、Hello Games(No Man's Sky)、Keen Software House(Space Engineers)、RubberbandGames(Wobbly Life)、Strange Loop Games(Eco)、Thunderful Games(ASKA、The Gunk、Steamworld Build)、Digixart(Road 96)以及 Tuxedo Labs & Saber Interactive(Teardown)。

我们感谢 Vika Koriakin、Duncan Smith、Nilesh Ray、Matt Miller、Leen Verburgh、Ashyana Kachra、Phil Esposito、Dimple Vijaykumar、Piers Wingfield、Lucie Kerley 在开发和改进本项目关键组件过程中给予的宝贵合作。

我们还感谢 Jack Parker-Holder、Shlomi Fruchter 以及 Genie 团队的其他成员提供 Genie 3 模型的使用权限。

我们要感谢 Google 和 Google DeepMind 中为本项工作做出贡献的众多团队,包括法务、营销、传播、责任与安全委员会、负责任发展与创新、政策、战略与运营,以及我们的业务与企业发展团队。我们还要感谢此处未明确提及的所有 GDM 团队一直以来的支持。

最后,我们将这项工作献给我们的同事 Felix Hill 和 Fabio Pardo 的纪念,他们对我们领域的贡献继续激励着我们。