在今年早些时候承认其 AI 模型曾在少数情况下入侵其他公司系统后,Anthropic 于周三发布了一份新报告,详细说明了这些攻击。报告披露了一系列事件,显示出 Anthropic 认为其模型所表现出的那种一门心思的“鲁莽”——这很可能会加剧本已甚嚣尘上的、关于网络安全与 AI 的担忧。
Anthropic 本周因网络安全问题陷入困境
一名研究人员的辞职信疯传,就在该公司披露四款模型失控细节之前。


Anthropic 本周因网络安全问题陷入困境
一名研究人员的辞职信疯传,就在该公司披露四款模型失控细节之前。
在 Anthropic 的报告中,它详细描述了今年发生的四起事件,其中其自家 AI 模型入侵了一家外部公司或利用了漏洞。在其中一起事件中,一个“内部的通用研究模型”闯入了第三方系统,使用访问令牌和密码并下载文件。在另一起事件中,一个 Claude 模型攻击了一家公司,该公司有一个可在公共互联网上访问的实时 Web 应用,并处理用户数据。第三个模型访问了“一台属于第三方、它能够访问的机器”——据 Anthropic 称,它显然认为这是其评估演练的一部分——随后利用它在一个文件中找到的密码获得了对第三方内部系统的管理员访问权限,进而收集凭据、修改系统设置,并读取某人的个人信息。据 Anthropic 称,这一系列事件直到该模型“耗尽了自己的 token 预算”才结束。
最令人担忧的事件涉及 Claude Mythos 5,这是 Anthropic 专注于网络安全的前沿模型;该公司表示,事实证明,它是在测试中最有可能执行“严重有害”操作的模型。该公司称,Mythos 5 为向一个许多工程师使用的公共代码仓库上传“恶意软件包”而“费尽心机”,并且它似乎试图在其“思维链”(AI 研究人员用来评估 AI 模型对齐情况的一种思维草稿区)中掩盖其真实目标。Anthropic 表示,在许多情况下,Claude 模型似乎是在假定自己处于模拟环境的情况下采取了有害行动,但研究人员也无法确认这些模型是真的“相信”这一点,还是只是表现得像是如此。
Anthropic 的这些事件虽然仍令人担忧,但相比今年夏天引发全行业网络安全危机的那起 OpenAI 事件,协调性和普遍性都要低一些。话虽如此,二者仍有显著的相似之处。Anthropic 表示,它发现的最普遍问题包括“为了狭隘地推进某项任务而愿意采取有害行动”,这类似于 Hugging Face 攻击之前出现的“奖励黑客”行为。与 OpenAI 很像的是,它表示其发布前测试和评估未能发现严重风险。
Anthropic 表示,它已与 METR 签署协议,后者是 AI 行业最知名的第三方 AI 评估机构之一,双方首先达成为期八周的研究协议。该协议授予 METR 访问“事件发生窗口之外”的记录的权限(这很可能是在含蓄地讽刺 OpenAI——在 Hugging Face 遭攻击后,OpenAI 因在与 METR 达成的协议中限制访问权限而受到批评)。Anthropic 还表示,METR 将能够直接与 Anthropic 员工交谈,“这些员工将被允许分享机密信息”。
Anthropic 的这份报告发布之际,正值 Jacob Coxon 辞职。Coxon 自 5 月起在 Anthropic 从事 AI 预训练工作,此前曾在 OpenAI 工作多年。周二,他辞职并在 X 上发布了一封公开信,阐述他的理由。“构建 AI 的人们真心相信,它可能在这个十年结束前杀死我们所有人,”他写道,并补充说 OpenAI 和 Anthropic 都没有“负责任地行事”,而是“径直冲向自我改进的超级智能,拿我们的生命赌博”。Coxon 还说:“不要低估这项技术的力量。这些很快将成为超人系统,能够入侵任何东西,一夜之间彻底改变任何领域,并获取真正的权力和资源。我们都目睹了每个领域的进展,而进展并未放缓。”
Coxon 远不是第一个发出这类警报的 AI 研究员,甚至也不是第一个这样做的 Anthropic 研究员——今年 2 月,Anthropic 的 Mrinank Sharma 辞职,并在 X 上写道,警告“世界正处于危险之中”。
但 Coxon 的帖子因其发布时机——正值 OpenAI 和 Anthropic 黑客事件曝光之际——而具有额外的分量。尽管 AI 行业经历的炒作已远超合理程度,但近期由 AI 智能体实施的网络攻击——由创造它们的实验室所促成——是真实且令人担忧的。许多领先 AI 实验室的其他研究员也附和了他的担忧,并呼吁 AI 行业员工签署一份 7 月的公开信,该信呼吁放缓 AI 发展。
“我不知道你怎么能看着这一连串接连不断的新闻和事件——这些事件是模型突破自身遏制、入侵其他公司,以及这些公司越来越无法控制自己的模型……然后认为这只是炒作,”未来生命研究所美国政策负责人 Michael Kleinman 说。
他补充说:“绝大多数美国人,无论党派——共和党、独立人士、民主党——都在审视 AI 的发展、其推进的速度,以及这些公司对其行为毫无护栏这一事实,并且都在说:‘哇,我们不想要这个。’”
关注本报道的话题和作者,以便在您的个性化主页信息流中看到更多类似内容,并接收电子邮件更新。
