保障 AI 智能体的未来
我们如何保护内部系统,以应对能力日益强大且对齐并不完美的 AI
AI 智能体正在改变我们与技术的关系。通过自主执行复杂任务——从网络防御到科学发现和产品开发——这些系统正在开启一个生产力新时代。仅在美国,到 2030 年,AI 智能体就可能创造 2.9 万亿美元的经济价值。
随着这些智能体能力不断增强,它们也需要更复杂的保障措施。这就是为什么我们制定了 AI 控制路线图:一个用于构建和管理我们在 Google 内部部署的先进 AI 的框架。这种“纵深防御”方法可以成为更广泛行业的范本,它超越了传统的模型对齐,增加了一层关键的系统级安全,即使对齐并不完美也能提供保障。
理解 AI 控制
我们的安全方法始于坚实的基础,融合了沙箱、端点安全和提示注入抵抗等传统保障措施。在此基础上,AI 控制路线图将模型对齐——即训练 AI 使其本质上安全且有用——作为主要防御手段。它通过将内部智能体视为可能未对齐的对象,提供了额外一层安全保障,即使对齐并不完美也能提供保证。
可以把它想象成一位带有双控制装置的驾驶教练。教练信任学员,但随时准备在出现错误时接管方向盘或踩下刹车。同样,我们的 AI 控制系统会根据 AI 智能体经过验证的行为授予其权限,使我们能够通过受控的、渐进式的访问来建立信任。
我们的路线图建立在一个简单但谨慎的假设之上:如果一个能力极强的 AI 智能体并未与我们的目标对齐,并以意想不到的方式行事,会怎样?为了解决这个问题,我们的计划聚焦于三个关键领域。
首先,遵循网络安全最佳实践,我们开发了一个新颖的 AI 威胁建模框架。该路线图将不受信任的 AI 智能体视为潜在的“内部威胁”——类似于公司对待一名已经拥有办公室访问权限、可能行为不端的员工。通过建立在行业标准的 MITRE ATT&CK 框架之上——这是一个基于现实世界观察、全球可访问的对手战术和技术知识库——我们将潜在攻击分解为更小的战术和技术。这使我们能够有条不紊地跟踪风险,在不良行为造成损害之前发现它,并安全地开展演练,以测试我们的防御是否真的站得住脚。
其次,我们制定了一项计划,部署 AI 控制缓解措施来应对这些风险。
- 识别问题(检测):监控是 AI 控制的支柱。我们使用其他受信任的 AI 系统作为“监督者”,持续审查工作智能体的推理、行动和计划,以判断它是否偏离轨道。
- 管理问题(预防与响应):如果监督者发现智能体试图做出有害行为,它可以在损害发生之前介入阻止该行动。
最后,为确保我们的系统正常运行,我们持续从三个关键指标衡量性能:覆盖率(被监控的流量比例)、召回率(被捕获的错位行为比例)以及响应时间。
随着 AI 变得更智能,扩展安全保障
随着 AI 模型不断进步,我们的防御也必须同步加强。在我们的 AI 控制路线图中,我们将安全协议映射到 AI 能力在两个关键方面的可衡量里程碑:
规避检测的能力: 如今,我们监控模型可见的思维链。然而,随着模型学会隐藏其推理过程——无论是通过监督意识(知道自己正被监控)还是不透明推理(不使用可见文本进行推理)——仅仅阅读它们口头表达的推理将不再足够。我们需要分析它们的行为,并可能检查模型的内部运作。潜在危害的能力: 对于低风险和可逆的操作,我们可以依赖延迟审查记录,并在问题发生后迅速补救(异步响应)。对于特别高风险的操作,例如重大网络攻击,我们必须转向实时预防,在有害操作执行之前就将其阻止(同步响应)。换言之,我们的响应策略必须与威胁的严重程度相匹配。
AI 控制路线图根据所部署模型的能力推荐安全措施。模型的检测规避能力决定检测级别(D1-D4),模型的攻击执行能力决定预防与响应级别(R1-R3)。
分析百万条智能体轨迹以指导实时监控
要构建这些系统,我们需要数据。我们的团队构建了一个异步监控系统的内部原型,用于审查编码智能体的轨迹,并将发现的问题上报供人工审查。每个被标记的事件都会根据我们路线图中的威胁分类法进行分类。
我们已经分析了百万个编码智能体任务,这为我们提供了宝贵的洞见,用以完善我们的安全协议,并使我们能够超越简单的关键词过滤,转而识别高信号的行为模式。例如,这项研究在构建 Gemini Spark 智能体的实时监控器方面发挥了重要作用,使我们能够实时响应新出现的问题,例如无意的数据删除。
值得注意的是,我们的数据显示,大多数被标记的事件并非源于对抗性意图;相反,它们往往源于智能体对用户目标的误解或过度热心。理解这些细微差别对于完善我们的安全与保障协议至关重要。
防御智能体生态系统是共同的责任
AI 控制路线图是我们多层智能体安全方法中的一个关键要素。通过将这些协议与我们更广泛的基础设施相结合,我们正在扩展内部安全能力,以安全管理我们最先进的 AI 模型。
此外,这种多层代理安全方法应成为行业、政策制定者和学术界的共同优先事项。通过围绕最佳实践和标准协调生态系统,我们可以赋能网络防御者并构建社会韧性。因此,我们今天还发布了一份面向政策制定者的技术框架,'代理安全的三层’。该论文详细阐述了我们需要在单个代理层面、多代理系统中改进安全性;并赋能网络防御者,在更广泛的生态系统中构建韧性。
我们打算在这些框架的基础上,自信地部署当今强大的AI,同时继续为未来构建安全的基础。
在此阅读完整技术报告:
研究作者
Mary Phuong, Erik Jenner, Laurent Simon, Lewis Ho, Rohin Shah, Sebastian Farquhar, and Scott Coull.
致谢
Four Flynn, Anca Dragan, Alan Cooney, Bilal Chughtai, Buck Shlegeris, Cody Wild, David Lindner, Julian Stastny, Kevin Klyman, Li Ding, Myriam Khan, Raluca Ada Popa, Roland Zimmermann, Ryan Greenblatt, Senthooran Rajamanoharan, Victoria Krakovna and Xerxes Dotiwalla.
