从雅达利到《EVE Online》:建立在 15 年游戏 AI 研究之上
从雅达利到围棋再到《星际争霸》,游戏推动了一些 AI 领域最重大的突破。如今,我们正与游戏开发者合作,共同打造新的游戏体验原型,推动游戏与 AI 两者的前沿发展。
自 2010 年 DeepMind 成立以来,游戏这种受限却丰富的世界在理解智能方面发挥了关键作用。它们推动了我们一些最重大的 AI 突破,从精通雅达利到帮助解决蛋白质结构预测——它们至今仍是我们工作的核心。
游戏根植于 GDM 的基因之中。Google DeepMind 的创始人之一 Demis Hassabis 本人就曾是一名游戏开发者,我们 GDM 团队中的许多人也同样如此。我们共同拥有数十年的游戏开发实践经验,并对游戏制作这门技艺怀有深深的敬意。
我们始终明确,用游戏开展 AI 研究需要与游戏开发者建立深度合作——例如我们与 Fenris Creations 的重大新研究合作以及我们今年早些时候揭晓的 EVE 宇宙,还有我们与 Hello Games、Coffee Stain Studios、Foulball Hangover 等知名工作室共同开展的工作。
游戏作为 AI 研究的引擎
我们的旅程始于一个小团队训练深度神经网络,直接从原始像素玩雅达利 2600 游戏。深度 Q 网络(DQN)学会了玩 49 款不同的游戏——从《乒乓》到《打砖块》再到《太空侵略者》——无需任何针对特定游戏的工程。关于 DQN 的2015 年《自然》论文助推了现代深度强化学习时代的到来。
此后,我们尝试攻克更复杂的游戏,每一个里程碑都催生出能力更强、更通用的系统。AlphaGo 于 2016 年击败了世界围棋冠军李世石——这一壮举许多专家曾认为还需十年才能实现。AlphaGo Zero 完全通过自我对弈学习,不使用任何人类数据,超越了此前所有版本。AlphaZero 将这一方法推广开来,用同一种算法精通国际象棋、将棋和围棋,而 MuZero 甚至无需了解规则就学会了玩游戏。2019 年,AlphaStar 在《星际争霸 II》中达到宗师级别,驾驭了实时复杂性与不完美信息。
对于每一款游戏,AI 都丰富了游玩体验。AlphaGo 著名的第 37 手是一步出人意料的棋,以至于专业解说员起初以为这是个失误,它颠覆了围棋界数百年来被奉为圭臬的定式,并激励专家们探索新的策略。AlphaZero 同样在国际象棋中激发了全新的行棋路线。至关重要的是,在游戏中取得成功的这种探索精神对其他 AI 系统产生了深远影响:AlphaFold 应用这些基础成果,帮助解决了蛋白质结构预测这一长达 50 年的重大挑战,这一突破获得了 2024 年诺贝尔化学奖的认可。
从精通游戏到理解游戏
我们早期的工作表明,只要给定明确的目标和足够的训练,AI 就能精通任何游戏。但现实世界并没有分数和规则手册——这促使我们提出一个根本不同的问题:AI 能否像人一样理解和与任何游戏世界互动?
这正是 SIMA 背后的挑战,它是我们的可扩展可指令多世界智能体(Scalable Instructable Multiworld Agent)。SIMA 并非为追求高分而优化,而是一个通用智能体,它‘看到’玩家在屏幕上所看到的内容,理解自然语言指令,并通过普通的键盘和鼠标控制进行操作——无需 API 或源代码访问权限。
由我们的前沿 AI 模型 Gemini 驱动,SIMA 2 充当一个能够实时推理和对话的交互式伙伴。它在复杂的 3D 研究环境和电子游戏中实现了类人游玩,包括 No Man's Sky、Valheim、Hydroneer 等。
对于游戏开发者而言,一个真正通用的游戏智能体将解锁可与现有游戏配合使用的 AI 能力——无需修改游戏代码。这可以驱动全新的玩法,从真正理解游戏世界的 AI 伙伴,到以脚本化系统永远无法做到的方式适应和响应的非玩家角色(NPC)。
通用游戏智能体还可以改变游戏的制作方式。在开发过程中,当游戏随着每一次提交而发生变化时,此类智能体可以实现真正稳健的 QA 测试。在发布之后,当引入新内容或玩家行为难以预测时,它们可以实时适应——泛化到新情况而无需重新编写脚本。
为了安全、负责任地开发 SIMA 智能体,我们与知名游戏工作室合作,并正在构建一个不断扩大的游戏组合用于 AI 研究。这使我们能够用越来越复杂的任务来挑战我们的智能体,这些任务有朝一日或许能迁移到解决现实世界中的问题。
与游戏开发者合作,探索 AI 与游戏研究的新前沿
游戏工作室带来精湛的技艺、非凡的游戏世界以及对玩家的深刻了解。我们带来前沿 AI——从 Gemini 到生成式交互环境和具身智能体的研究——研究专长,以及我们团队独特的游戏开发背景和多年为交互环境构建 AI 的经验。我们携手专注于发现突破性体验——没有 AI 就不可能实现的、前所未见的玩法。
关键不在于技术,而在于有趣的体验。因此,我们与合作伙伴采取“展示而非讲述”的方式。我们的团队与游戏开发者携手合作,探索新想法并构建可玩原型以寻找乐趣。
我们与 Fenris Creations 的最新研究合作——这家独立工作室是 EVE 宇宙的幕后推手——代表了我们在游戏 AI 研究历史上的新篇章。
Fenris Creations 花费了二十多年时间打造了游戏界最非凡的持久世界之一。EVE Online 于 2003 年推出,是一款大型多人在线太空模拟游戏,数千名玩家共享一个持续进化了 20 多年的单一宇宙。其由玩家驱动的经济体系具有真实的供需动态和跨越数千个星系的贸易网络。其格局——由联盟、冲突和外交塑造——由人类互动驱动。
对于 AI 研究而言,这是一个黄金机会。这是一个活生生的、不断进化的世界,它所需要的正是我们相信对前沿 AI 至关重要的能力:
持续学习:在不断变化的世界中获取新技能而不遗忘已有知识。记忆:在远超当今模型上下文窗口的时间尺度上积累和检索知识。长时程规划:对数周、数月甚至数年进行推理。复杂多智能体动态:在大规模下驾驭合作、竞争、谈判、经济和涌现的社会行为。
这些挑战是我们更广泛研究计划的核心,该计划旨在创建能够从经验中持续学习的系统,且学习速度随时间加快。我们相信这些前沿能力未来可能解锁新的游戏体验。
EVE Online 从第一天起就被设想为一个具有持久后果的沙盒,由玩家塑造。数十年来,这推动了无数玩家和员工的人类成长故事。与 Google DeepMind 一起,我们正在进入未知领域,AI 必须在其他游戏环境所不要求的时间尺度上学习、适应和记忆,同时帮助我们理解人类和 AI 如何在虚拟环境中共存,以免我们在现实生活中不得不面对同样的问题。
我们的研究合作延伸到 Fenris Creations 不断扩展的宇宙,为 AI 开发提供了独特的环境。虽然 EVE Online 提供了大规模单分片持久宇宙,但 EVE Vanguard 以第一人称视角进行游戏,将地面层面、快节奏的战术决策带入更广泛的持久世界。这创造了研究跨多个抽象层次运行的智能体的机会,从瞬间反应战术到星系级战略。
此外,EVE Frontier——凭借其可编程的“智能组件”及其开放、可扩展的架构——提供了一个开放式的环境,其中世界的规则本身可以改变,要求智能体适应全新的游戏机制。
与 Google DeepMind 和 Fenris Creations 的研讨会期间的一场“展示而非讲述”环节,我们的团队在此分享可玩原型、反馈并讨论新游戏体验的想法
我们的合作已经为玩家带来了实实在在的价值:Aura Guidance 系统利用 Gemini 提供玩家生成的知识,这些知识基于真实的新手帮助问答,以帮助新飞行员。
我们的长期研究计划从 EVE Online 的离线实例开始,这是一个安全的沙盒,与在线玩家分离。然后,它通过 EVE Frontier 作为研究人类和代理如何在持久且开放的世界中共存的空间。只有当能力成熟时,我们才会考虑将它们引入 EVE Online 和 EVE Vanguard,以丰富人类游戏体验。
前路漫漫
游戏一直是智能的镜子。随着它们变得更加复杂、更加持久、更加开放,我们为驾驭它们而构建的 AI 系统也是如此。
我们始终追求同一个终极目标:AI 作为催化剂,而非替代品。我们的长期愿景是解锁突破性的游戏体验,让游戏更易上手、更个性化,并且——正如我们从 AlphaGo 到 AlphaFold 所看到的——将我们在游戏中学到的应用于现实世界的问题,并推动科学发现。
我们感谢所有在这段旅程中的游戏合作伙伴,以及 Fenris Creations 加入我们的下一篇章。我们迫不及待地想分享我们的发现。
致谢
我们要感谢 Google DeepMind 的众多团队多年来为在游戏中安全、负责任地推进 AI 研究所做的贡献。
特别感谢所有与我们合作的游戏开发者:Coffee Stain(Valheim, Satisfactory, Goat Simulator 3)、Fenris Creations(EVE Online, EVE Vanguard, EVE Frontier)、Foulball Hangover(Hydroneer)、Hello Games(No Man's Sky)、Keen Software House(Space Engineers)、RubberbandGames(Wobbly Life)、Strange Loop Games(Eco)、Thunderful Games(ASKA, The Gunk, Steamworld Build)、Digixart(Road 96)以及 Tuxedo Labs & Saber Interactive(Teardown)。
