返回 文章 学习 CMS 文章

Anthropic CEO 澄清:从未主张禁止开放权重模型

Anthropic CEO 明确反对禁止开放权重模型,并提出以芯片管制、反蒸馏和强制安全测试应对 AI 风险。

开放权重模型AI 安全AnthropicDario Amodei
成长分 / 100 70 综合收获、行动、留存与影响

Anthropic CEO 澄清:从未主张禁止开放权重模型
为什么值得读了解 Anthropic 在开放权重模型争议中的官方立场,澄清外界对其主张禁令的误解。

理解 Dario Amodei 对 AI 国家安全风险的核心担忧及三项具体政策建议。

关键洞察
  1. Anthropic 从未主张禁止开放权重模型,认为不具备危险能力的开放权重模型是一种公共产品。
  2. 主要担忧是威权政府构建更强大 AI 模型以实现军事优势或深度镇压,次要担忧是模型被滥用于网络或生物攻击。
  3. 支持三项措施:不向中国出售强大芯片及制造设备、打击工业规模蒸馏、要求所有强能力模型进行强制性安全测试。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:9446

我们对开放权重模型的立场

Anthropic 首席执行官 Dario Amodei 的一篇文章

过去几天,关于开放权重模型的讨论很多,尤其是来自中国的那些。有报道称,一些美国官员正在考虑禁止美国公司使用中国的开放权重模型。作为回应,许多科技公司签署了一封公开信支持开放权重模型,一些人甚至指责 Anthropic 想要禁止开放权重模型以保护我们的业务。任何读过我过去文章的人都知道,我不认为此类禁令是有用的措施,但让我明确声明,以免有任何疑问:Anthropic 从未主张禁止开放权重模型。

不具备危险能力的开放权重模型是一种公共产品:除了运行它们所需的算力之外,它们不花费任何成本,并且为企业、开发者和研究人员提供价值。

保护主义禁令不会解决我最严重的国家安全担忧。具体来说,我担心两个噩梦般的场景。我在六个月前的文章《技术的青春期》中阐述了这些场景

,并且多年来一直坚持这些立场:

1- 我的主要担忧是,威权政府——不仅仅是中国共产党(CCP),尽管中共显然是最有能力的威胁——构建出比美国构建的更强大的人工智能模型,并利用它们实现永久军事优势或对自己人民进行极其深度的镇压。这种担忧在美国政府内部广泛存在:副总统万斯

去年在巴黎警告说“威权政权窃取并利用人工智能来增强其军事、情报和监视能力”,而情报界的2026年度威胁评估发现“其他全球大国在人工智能方面的强劲进展正在挑战美国的经济竞争力和国家安全优势。”这些模型是否以开放权重发布无关紧要,当然它们是否被美国企业使用也无关紧要。事实上,最危险的模型可能是在秘密中训练,只交给中国人民解放军用于无人机,以及交给国家安全部用于监视和镇压的模型。 - 我的次要担忧是,强大的人工智能模型可能被滥用于实施网络攻击或生物攻击,并且可能具有

严重的对齐问题。开放权重模型——无论它们来自中国还是其他地方——确实可能比闭源模型带来更高的风险,因为很难对它们施加防护措施或监控其使用,而且一旦权重发布就无法收回。但禁止美国企业使用这些模型对解决这一风险毫无帮助,因为恶意行为者不太可能是合法的美国企业。这2确实会保护美国 AI 公司免受竞争,但这从来不是我的目标。

为了解决这些担忧,我确实支持以下三项措施,我和 Anthropic 一直倡导这些措施:

我们不应向中国出售强大的芯片或芯片制造设备,并且应当打击猖獗的走私以及为获取此类芯片而使用的规避手段。中国的国内产能有限,因此,由于3规模定律,没有美国的芯片,中国就无法构建比美国更强大的模型。这是阻断威胁 #1 最有效、最直接的方式,而且通过阻碍训练美国法律无法触及的模型,它也能间接帮助应对威胁 #2。我们应当打击工业规模的蒸馏是一种比从头训练模型在算力上高效得多的过程。它使中国能够构建出远超其芯片数量通常所能支撑的更好的模型,从而部分规避芯片禁令。蒸馏并不能让中共获得与美国同等或更优越的 AI 能力,但它可以将中国的前沿拉近到距美国前沿蒸馏行动仅几个月的范围内。诚然,开展这些行动的许多公司会发布开放权重模型——但开放权重远不如这些行动由一个试图在前沿领域超越美国的威权国家支持这一事实重要。我们应当采取政策干预来遏制这种行为。全面禁止开放权重模型既不是正确的补救措施,也不是我们所呼吁的做法。4所有能力足够强的模型,无论开放还是封闭,都应经过强制性安全测试。应对威胁 #2 的最佳方式就是在发布前直接测试模型在网络、生物和对齐方面的风险。我认为这一想法实际上已接近共识:令我感到鼓舞的是,特朗普政府近几个月已朝这个方向行动,而且近期的行业提案也主张对能力最强的模型实施此类测试,无论其来源国为何、无论其是开放还是封闭(同时完全豁免能力较弱的模型,例如来自初创公司和学术界的模型)。开放模型是否会带来更大的风险,以及这种风险能否被缓解,应当是测试得出的结果,而不是事先决定的——而且可能存在有前景的方法来提高开放权重模型的安全性,包括 AE Studio 和 Anthropic 近期关于模块化训练策略的研究。请注意,要有效,测试必须是全球性的,这意味着甚至连中共也需要参与其中。我认为这实际上可能是可行的:正如我在*《技术的青春期》*中所写,围绕防止 AI 生物武器的有限合作可能是可行的,因为这也符合中国的利益。

这让我想到那封公开信。我同意其中的许多观点:开放权重扩大了人们进入人工智能经济的渠道,至少在某些用例中加强了竞争,并且让客户拥有更大的控制权。对蒸馏的担忧应当通过有针对性的法律和商业框架来解决——也就是我上文所描述的那套同样的措施。但我不同意这封信中的一些论断,即开放权重模型必然会让开发安全保障措施变得更容易,或者广泛获取能力必然对防御方比对攻击方更有利。在我看来,相反的情况至少同样有可能成立。例如,我担心生物学领域会存在强烈的攻防不对称,即能力足够强的模型或许能够利用广泛可得的材料迅速将大流行级别的病毒武器化,而针对这些病原体的防御即便在最理想的情况下也是一项耗时多年的运营任务(正如我们在“曲速行动”中所看到的那样)5。诸如此类的问题应当通过严格的发布前测试以实证方式加以回答,而不是事先假定。

总结我和 Anthropic 的立场:我们过去没有、现在也不主张将开放权重模型作为一个类别予以禁止。我们应当转而专注于让强大的芯片不落入威权者之手、阻止工业规模的蒸馏,并要求对所有能力足够强的模型——无论开放还是闭源——进行安全测试。

7 月 28 日编辑:已更新,注明所引用的关于模块化训练策略的研究是 Anthropic 与 AE Studio 的合作成果。

相关内容

与我们的客户共同制定企业前沿安全保障

阅读更多

改进我们的对齐与安全工作

7 月 30 日,我们报告了三起 Claude 模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与 METR 合作开展独立审查。与此同时,我们分享过去一个月中所做的一些改动。

阅读更多

预览模型硬件标准

我们正在向首批科学研究实验室和先进制造商开放模型硬件标准(MHS)的研究预览,这是一项供 AI 智能体安全操作物理设备的共享规范。

阅读更多