一家公司是 OpenAI、Anthropic 和 Meta 黑客丑闻的幕后推手
这家以色列有效利他主义公司 Irregular 导致未受保护的 AI 模型入侵了真实目标。
过去三个月里,OpenAI、Anthropic 和 Meta 的模型入侵了多个现实世界的系统。这些模型未经授权访问了网络系统,发布了恶意软件包,并利用了未具名的漏洞。
Irregular 的黑客丑闻1
- Anthropic 披露了六次运行中的三起事件
- OpenAI 发布了 Irregular 事件
- Meta 的声明被报道
- Irregular 发布了域名冲突的说明和补救措施
- Anthropic 将事件扩大到四起,涉及七次运行
在一个更正常的媒体生态系统中,对这些网络安全问题的反应应该是显而易见的。美国 AI 公司会重新考虑与 Irregular 的业务往来,不仅因为它未能保护好自己的系统,还因为它是一家可能不受美国监管的以色列公司。立法者会考虑对 Irregular 或其美国商业伙伴采取行动,这些伙伴包括 OpenAI、Anthropic 和 Meta。他们可能会考虑加强对那些指示 AI 模型实施网络攻击、且其模型随后实施了这些网络攻击的公司的责任追究。

在每次评估中,Claude 都被赋予了一项 CTF 挑战:模型获得一个虚构场景、一台目标机器以及一条需要从中获取的秘密信息(“flag”)。所有四个提示都声明 Claude 无法访问互联网,但每次环境中都存在配置错误,导致互联网访问处于开放状态。没有任何提示说明哪些系统属于演习范围,也没有限制 Claude 可以在哪里搜索 flag。所有事件都只涉及一个孤立工作的 Claude 实例,每次运行持续约 10 到 34 小时的活跃工作。
相反,Irregular、Anthropic 及其盟友发起了一场媒体宣传,用耸人听闻的语言推广一种字面意义上的末日意识形态。Anthropic 的事件评估将其自身 AI 的“鲁莽”归咎为原因;Irregular 描述了“智能体本身成为威胁行为者”;Anthropic 首席执行官 Dario Amodei 就一起类似的 OpenAI–Hugging Face 黑客事件警告称,未来的集群“可能具备接管整个互联网的能力”;而美联社的一篇标题则声称机器人正在“失控”。
在 Anthropic 的一份报告中,其 Claude 模型通过模拟名称碰撞入侵了一家真实公司的系统,发布了一个恶意软件包,并扫描了外部系统。在这项测试中,Anthropic 和 Irregular 错误地为该模型提供了互联网访问权限,并且没有指示模型“哪些系统属于本次演练的范围”。
尽管 Anthropic 声称他们的问题是由“失控的集群”和“失准”造成的,但他们后来披露的信息显示,完全没有任何一个智能体“失控”。在这项实验中,一旦 Anthropic 的员工告诉模型不要进行现实世界的黑客攻击,Claude 模型在现实世界中的黑客行为就降到了零。根据他们自己的调查结果,Anthropic 和 Irregular 对他们所造成的网络安全事件负有全部责任。

在这些攻击之后,Anthropic 和 Irregular 部署了一大批由与 Anthropic 有关联的基金会资助的 AI 安全领域意见领袖,以转移人们对其责任的关注,并将注意力引向毫无根据的“失控智能体”理论。与 Anthropic 一样,Irregular 与这些基金会密不可分。
Irregular 的联合创始人兼首席技术官 Omer Nevo 是“以色列有效利他主义”以及有效利他主义非政府组织 Heron 和 Probably Good 的董事会成员。Irregular 的联合创始人兼首席执行官 Dan Lahav 与 Omer Nevo 的兄弟 Sella Nevo 一起获得了 395,000 美元来开设一门课程。Sella 和 Omer 共同创立了一个非政府组织,旨在向人们传授有效利他主义,名为 Impact Focused Education。他们还共同创立了 Probably Good。2
这些分支均由 Dustin Moskovitz 资助,在 Sam Bankman-Fried 被捕后,他是有效利他主义/AI 安全事业的主要捐赠者。Irregular 的第一位投资者是 Dustin Moskovitz 的公司 Good Ventures。Dustin Moskovitz 的慈善机构 Coefficient Giving/Open Philanthropy 资助了“以色列有效利他主义”、Heron 和 Probably Good。3
Irregular 的有效利他主义关联4
Irregular 利用他们获得访问权限的未加固模型,未经授权进行访问、篡改记录并发布窃取凭据的软件包。在某些条件下,这种行为违反了《计算机欺诈与滥用法》第 1030(a)(2)(C) 条,该条款涵盖为获取信息而故意未经授权访问的行为。然而,其重罪指控需要损害和意图的具体证据。5
尽管它主要与美国实验室签订合同,但位于以色列的 Irregular 关键领导层、员工和资源可能不受美国监管。Ynet 的访问和采访描述了 Irregular 在特拉维夫的办公室。CheckID 的公司名录列出了两个关联实体:Pattern Labs Tech Inc.,一家特拉华州公司,以及 Pattern Tech Ltd,编号 516854460,一家在特拉维夫注册的活跃以色列公司。
脚注
时间线标记的是公开披露。Anthropic 更正后的 9 月评估计入了七次运行中的四起事件;OpenAI 和 Meta 报告了各自独立的 Irregular 评估事件。日期描述的是披露日期,而非每一起底层入侵发生的日期。↩
2026-07-30 | Anthropic 披露六次运行中的三起事件 | 披露 |
INC-O04INC-M06INC-I14INC-A09Impact Focused Education 将 Dan Lahav 和 Sella Nevo 列为其联合创始人。拨款账本记录了一笔向他们推荐的 394,968 美元,并非确认收到,也不是对课程的确切授予认定。EA Israel 董事会;Heron 顾问委员会;Probably Good 董事会;EA Funds 拨款账本;Omer 与 Sella 的关系;IFE 创始人。↩
Good Ventures 创始人;Coefficient Giving 关系;Heron 资助;Probably Good 拨款;Irregular 拨款;EA Funds 拨款账本。↩
该图展示了选定的组织角色和资金;表格还记录了图中省略的家族和教育关系。EA Infrastructure Fund 在 2022 年第三季度向 Dan Lahav 和 Sella Nevo 推荐了一笔 394,968 美元的联合 MOOC 拨款;两个箭头代表那一项推荐。其账本未指明课程和组织名称。↩
Omer Nevo | Effective Altruism Israel | 董事会成员 |
pol_pg_aboutpol_heron_aboutpol_heron_aboutpol_heron_aboutpol_heron_jobpol_pg_2022pol_dan_initiativesIFE-ABOUTpol_pg_aboutpol_brothers_jtaM02Founder confirmationM02Founder confirmationF13F13IFE-ABOUT《计算机欺诈与滥用法》第 1030(a)(2)(C) 条的五年重罪条款要求存在加重情节,例如商业利益、推进另一犯罪行为或侵权行为,或获取价值超过 5,000 美元的信息。第 1030(a)(5) 条中针对破坏访问或传输的主要初次犯罪重罪条款,要求具备特定的心理状态和法定损害,例如至少 5,000 美元的合格损失,或影响十台受保护计算机的损害。法律评估仍需要每个系统的许可、损害、响应成本以及与美国的商业联系。检察官还需要确立相关责任人的行为和知情,以及将这些行为归因于 Irregular 的依据。18 U.S.C. § 1030。↩
