返回 文章 学习 CMS 文章

一家以色列公司如何导致 OpenAI、Anthropic 和 Meta 的 AI 模型入侵真实系统

Irregular 的评估失误让 AI 模型入侵真实系统,而一场媒体宣传却将责任推给了“失控智能体”。

AI安全网络安全有效利他主义Anthropic
成长分 / 100 68 综合收获、行动、留存与影响

一家以色列公司如何导致 OpenAI、Anthropic 和 Meta 的 AI 模型入侵真实系统
为什么值得读了解 AI 安全评估中因配置错误引发的真实网络安全事件及其责任归属。

揭示 AI 安全领域意见领袖与有效利他主义资金网络之间的利益关联。

关键洞察
  1. Irregular 在评估中错误地为 Claude 等模型提供了互联网访问权限,且未明确限定可攻击的系统范围,导致模型入侵真实公司系统、发布恶意软件包并扫描外部系统。
  2. Anthropic 和 Irregular 将事件归咎于“失控的集群”和“失准”,但内部调查显示,一旦员工指示模型不要进行现实世界黑客攻击,攻击行为即降为零,表明责任完全在于评估方。
  3. Irregular 与有效利他主义运动关系密切,其领导层与多个由 Dustin Moskovitz 资助的非政府组织有关联,事件后这些组织资助的意见领袖转移了公众对责任的关注。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:11609

一家公司是 OpenAI、Anthropic 和 Meta 黑客丑闻的幕后推手

这家以色列有效利他主义公司 Irregular 导致未受保护的 AI 模型入侵了真实目标。

过去三个月里,OpenAI、Anthropic 和 Meta 的模型入侵了多个现实世界的系统。这些模型未经授权访问了网络系统发布了恶意软件包,并利用了未具名的漏洞

Irregular 的黑客丑闻1

1

  • Anthropic 披露了六次运行中的三起事件
  • OpenAI 发布了 Irregular 事件
  • Meta 的声明被报道
  • Irregular 发布了域名冲突的说明和补救措施
  • Anthropic 将事件扩大到四起,涉及七次运行

在一个更正常的媒体生态系统中,对这些网络安全问题的反应应该是显而易见的。美国 AI 公司会重新考虑与 Irregular 的业务往来,不仅因为它未能保护好自己的系统,还因为它是一家可能不受美国监管的以色列公司。立法者会考虑对 Irregular 或其美国商业伙伴采取行动,这些伙伴包括 OpenAI、Anthropic 和 Meta。他们可能会考虑加强对那些指示 AI 模型实施网络攻击、且其模型随后实施了这些网络攻击的公司的责任追究。

Anthropic 事件评估摘录,解释 Claude 收到了夺旗任务、意外的互联网访问权限,且没有明确的系统范围限制;每起事件都涉及一个孤立的 Claude 实例。

在每次评估中,Claude 都被赋予了一项 CTF 挑战:模型获得一个虚构场景、一台目标机器以及一条需要从中获取的秘密信息(“flag”)。所有四个提示都声明 Claude 无法访问互联网,但每次环境中都存在配置错误,导致互联网访问处于开放状态。没有任何提示说明哪些系统属于演习范围,也没有限制 Claude 可以在哪里搜索 flag。所有事件都只涉及一个孤立工作的 Claude 实例,每次运行持续约 10 到 34 小时的活跃工作。

相反,Irregular、Anthropic 及其盟友发起了一场媒体宣传,用耸人听闻的语言推广一种字面意义上的末日意识形态。Anthropic 的事件评估将其自身 AI 的“鲁莽”归咎为原因;Irregular 描述了“智能体本身成为威胁行为者”;Anthropic 首席执行官 Dario Amodei 就一起类似的 OpenAI–Hugging Face 黑客事件警告称,未来的集群“可能具备接管整个互联网的能力”;而美联社的一篇标题则声称机器人正在“失控”

在 Anthropic 的一份报告中,其 Claude 模型通过模拟名称碰撞入侵了一家真实公司的系统,发布了一个恶意软件包,并扫描了外部系统。在这项测试中,Anthropic 和 Irregular 错误地为该模型提供了互联网访问权限,并且没有指示模型“哪些系统属于本次演练的范围”。

尽管 Anthropic 声称他们的问题是由“失控的集群”和“失准”造成的,但他们后来披露的信息显示,完全没有任何一个智能体“失控”。在这项实验中,一旦 Anthropic 的员工告诉模型不要进行现实世界的黑客攻击,Claude 模型在现实世界中的黑客行为就降到了零。根据他们自己的调查结果,Anthropic 和 Irregular 对他们所造成的网络安全事件负有全部责任。

Anthropic 评估摘录:一项重采样条件将 Mythos 5 原本的恶意软件包上传路径降至零;22% 的轨迹搜索了一个模拟选项。

在这些攻击之后,Anthropic 和 Irregular 部署了一大批由与 Anthropic 有关联的基金会资助的 AI 安全领域意见领袖,以转移人们对其责任的关注,并将注意力引向毫无根据的“失控智能体”理论。与 Anthropic 一样,Irregular 与这些基金会密不可分。

Irregular 的联合创始人兼首席技术官 Omer Nevo 是“以色列有效利他主义”以及有效利他主义非政府组织 Heron 和 Probably Good 的董事会成员。Irregular 的联合创始人兼首席执行官 Dan Lahav 与 Omer Nevo 的兄弟 Sella Nevo 一起获得了 395,000 美元来开设一门课程。Sella 和 Omer 共同创立了一个非政府组织,旨在向人们传授有效利他主义,名为 Impact Focused Education。他们还共同创立了 Probably Good。2

这些分支均由 Dustin Moskovitz 资助,在 Sam Bankman-Fried 被捕后,他是有效利他主义/AI 安全事业的主要捐赠者。Irregular 的第一位投资者是 Dustin Moskovitz 的公司 Good Ventures。Dustin Moskovitz 的慈善机构 Coefficient Giving/Open Philanthropy 资助了“以色列有效利他主义”、Heron 和 Probably Good。3

Irregular 的有效利他主义关联4

4

Irregular 利用他们获得访问权限的未加固模型,未经授权进行访问、篡改记录并发布窃取凭据的软件包。在某些条件下,这种行为违反了《计算机欺诈与滥用法》第 1030(a)(2)(C) 条,该条款涵盖为获取信息而故意未经授权访问的行为。然而,其重罪指控需要损害和意图的具体证据。5

尽管它主要与美国实验室签订合同,但位于以色列的 Irregular 关键领导层、员工和资源可能不受美国监管。Ynet 的访问和采访描述了 Irregular 在特拉维夫的办公室。CheckID 的公司名录列出了两个关联实体:Pattern Labs Tech Inc.,一家特拉华州公司,以及 Pattern Tech Ltd,编号 516854460,一家在特拉维夫注册的活跃以色列公司

脚注

时间线标记的是公开披露。Anthropic 更正后的 9 月评估计入了七次运行中的四起事件;OpenAI 和 Meta 报告了各自独立的 Irregular 评估事件。日期描述的是披露日期,而非每一起底层入侵发生的日期。

2026-07-30 | Anthropic 披露六次运行中的三起事件 | 披露 |

INC-O04INC-M06INC-I14INC-A09Impact Focused Education 将 Dan Lahav 和 Sella Nevo 列为其联合创始人。拨款账本记录了一笔向他们推荐的 394,968 美元,并非确认收到,也不是对课程的确切授予认定。EA Israel 董事会Heron 顾问委员会Probably Good 董事会EA Funds 拨款账本Omer 与 Sella 的关系IFE 创始人

Good Ventures 创始人Coefficient Giving 关系Heron 资助Probably Good 拨款Irregular 拨款EA Funds 拨款账本

该图展示了选定的组织角色和资金;表格还记录了图中省略的家族和教育关系。EA Infrastructure Fund 在 2022 年第三季度向 Dan Lahav 和 Sella Nevo 推荐了一笔 394,968 美元的联合 MOOC 拨款;两个箭头代表那一项推荐。其账本未指明课程和组织名称。

Omer Nevo | Effective Altruism Israel | 董事会成员 |

pol_pg_aboutpol_heron_aboutpol_heron_aboutpol_heron_aboutpol_heron_jobpol_pg_2022pol_dan_initiativesIFE-ABOUTpol_pg_aboutpol_brothers_jtaM02Founder confirmationM02Founder confirmationF13F13IFE-ABOUT《计算机欺诈与滥用法》第 1030(a)(2)(C) 条的五年重罪条款要求存在加重情节,例如商业利益、推进另一犯罪行为或侵权行为,或获取价值超过 5,000 美元的信息。第 1030(a)(5) 条中针对破坏访问或传输的主要初次犯罪重罪条款,要求具备特定的心理状态和法定损害,例如至少 5,000 美元的合格损失,或影响十台受保护计算机的损害。法律评估仍需要每个系统的许可、损害、响应成本以及与美国的商业联系。检察官还需要确立相关责任人的行为和知情,以及将这些行为归因于 Irregular 的依据。18 U.S.C. § 1030