要理解智能体 AI 如今处于何种阶段,不妨回顾上一次技术领域的剧变:90 年代互联网的兴起。它新鲜且充满可能性。你可以在一个周末搭建一个网站并与全世界分享,或者在在线聊天室里与地球另一端的人聊天,而无需支付长途电话费。它带来了无尽的机遇,但也伴随着大量风险。一个网站可以在你的机器上运行代码、窃取你的敏感信息,或用病毒感染你的电脑。尽管如此,人们依然热爱它。
为了引入一层信任,社区构建了诸如加密连接和锁形图标之类的东西,以便知道连接何时是安全的。安全性的阶跃式变化来自当时一个激进的安全理念:将每个页面隔离在各自的沙箱中(浏览器中的一个标签页),这样恶意页面就无法感染你电脑的其余部分。亚马逊、谷歌、Netflix 和 Meta 都建立在这一信任层之上。
互联网的安全与保障促成了在线商务、连接、游戏,以及许多此前不可能实现的事情。安全与保障并未减缓创新的步伐——它们让创新得以加速。
为什么现在要为智能体构建信任层?
几家前沿实验室最近报告了同一故事的多个版本:AI 智能体突破了本应限制它们的评估环境,触及了它们绝不应被允许访问的系统。有些智能体甚至谎报了自己的行为。现有的安全控制措施不足。
在过去几周里,这些报告引发了关于智能体发展速度的严肃辩论。我们认为,我们需要与前沿实验室及更广泛的社区合作,加快 AI 安全研究与工程的步伐。
导致这些突破的并非某一项新能力,而是工具、时间、模糊指令,以及智能体想要“跳出框框”思考的意愿共同作用的结果。
智能体安全需要独立的安全控制。互联网的安全并非通过要求网页开发者承诺做好人来实现。它之所以变得安全,是因为浏览器明确地不再信任网页中的代码。
我们需要为智能体构建这一信任层。

图 1.
NVIDIA 开放智能体安全平台参考设计将 NVIDIA Vera 上的 NVIDIA OpenShell 与 NVIDIA BlueField-4 上的 NVIDIA Sentry 相结合## 构建 OpenShell 的经验教训
NVIDIA OpenShell(Apache 2.0)是一个开源安全运行时,用于在内核级隔离的沙箱环境中执行自主 AI 智能体。在过去一年构建 OpenShell 的过程中,我们认识到,每个智能体都应开箱即用地运行在零信任环境中。它们需要隔离、监控和行为检测。今天,我们推出一个开放技术栈,使这成为可能。
在我们自己的研究中,我们观察到了智能体如何偏离正轨。漂移指的是智能体的行为偏离了预期任务或操作约束。漂移可能因策略阻止、程序错误或工具缺失而发生。当指令含糊不清,或者智能体被放任运行数天或数周以解决那些尝试了上千次都不奏效的难题时,漂移也可能发生。在保留能力的同时,这无法通过训练消除。而最重要的教训是:在这些情况下,不能指望智能体完全管理自己的行为。
构建智能体系统的五项核心原则
策略必须可验证:在智能体运行之前,证明器需证明其策略无法逃脱操作者的意图。执行必须带外进行:控制措施不位于智能体内部,也不在其可触及的范围内。智能体无需知道自己正被监视。通往模型(大脑)的路径是控制点:智能体没有下一步思考就无法行动。通过控制通往模型的路径,你既拥有了最佳观察点,也拥有了在需要时中断它的终止开关。智能体的权限应随其思维可审查能力的提升而扩展:智能体能做的事情越多,其推理过程就越需要可见。开放模型的一个优势在于,整个推理空间和激活状态都是可见的。应用责任共担模型:实验室、企业和硬件提供商各自拥有一层,就像如今的云一样。智能体运行时及其策略语言需要开放,以便任何提供商都能接入。
三个开放的智能体安全平台层
AI智能体的安全平台包含以下三层:
应用层:最终用户正在构建的内容。包含任务成功所需的必要原语:模型、框架、工具、数据以及支持脚本和程序。运行时层:将应用层投射到基础设施上。将智能体工作负载编排到满足最终用户需求的基础设施上(最终用户工作站、边缘设备、数据中心),并提供持续监控和实时策略执行与治理。基础设施层:用于执行智能体工作负载的具体硬件资源。对上游服务的网络调用、数据库和文件系统访问、用于工具和代码执行的通用计算、用于安全监控和提高工作负载密度的加速计算。
智能体安全的分层基础
OpenShell在沙箱中运行每个智能体,并将操作者的指令转化为可验证的策略。操作者定义智能体可以访问哪些文件、网络、工具、进程和凭证。OpenShell在智能体运行前检查这些限制,并在其工作时执行这些限制。
对于希望增加独立层的组织,NVIDIA Sentry将监控和执行扩展到NVIDIA BlueField硬件中。NVIDIA DOCA使BlueField安全基础可编程,并将其与OpenShell策略连接。它关联智能体交互、策略决策以及工具和数据访问,以创建智能体活动的上下文记录。
这有助于安全系统识别漂移、调查可疑行为,并确定何时需要干预或更深入的分析。DOCA 网关通过身份治理补充这一行为保护,持续验证每个智能体的身份和委托权限,以确保其分配范围内运行。
要了解更多信息,请参阅技术演练,使用 NVIDIA OpenShell 为 AI 智能体添加运行时控制。
以 AI 工厂规模运行
NVIDIA Open Agent Safety Platform 经过优化,可在基于 NVIDIA Vera CPU 和 BlueField DPU 的系统上运行,同时也兼容其他硬件系统。
在 NVIDIA Vera Rubin POD 中,每个计算托盘都包含一个 BlueField-4 数据处理单元,位于节点通往模型的唯一路径上。从这个位置,BlueField-4 提供对智能体行为的持续带外可观测性,并以线速实时执行安全策略。它与主机隔离且超出智能体的触及范围,即使主机资源不可信,它也能作为可信的基础设施保护层。组织可以使用它来运行 NVIDIA Sentry,作为 OpenShell 旁边的可选安全层。
这一基础实现了弹性安全,在芯片中执行 OpenShell 策略,并持续评估智能体的安全性和完整性。这包括评估其运行时安全性,并根据预定义的行为配置文件监控其是否偏离设计意图。在此架构中,整个智能体、子智能体、工具和应用程序集群都保持在边界内,并具有完整的血统。对于已经在配备 BlueField-4 的 NVIDIA Vera 系统上运行的用户来说,启用这些保护只需一次软件更新。
智能体经济
互联网建立在开源、开放研究和相信互联网能够改变人类进程的人们之上。添加信任将一个伟大的概念变成了一个伟大的经济。智能体经济,以及下一批伟大的公司,正在等待同样的层。我们可以以同样的方式共同构建它。
NVIDIA 正在与 AI 生态系统的行业领导者合作,通过 NVIDIA Open Agent Safety Platform 构建这一基础。我们欢迎前沿实验室、开发者和基础设施提供商与我们共同构建。

图 2. 跨越应用、模型、基础设施、芯片和能源的 AI 生态系统公司支持 NVIDIA Open Agent Safety Platform
