返回 文章 学习 CMS 文章

Anthropic 与埃森哲合作:在前沿 AI 内部嵌入独立评估

Anthropic 与埃森哲合作,将独立评估人员嵌入公司内部,以更可验证的方式监督前沿 AI 安全。

Anthropic埃森哲嵌入式评估AI安全
成长分 / 100 68 综合收获、行动、留存与影响

Anthropic 与埃森哲合作:在前沿 AI 内部嵌入独立评估
为什么值得读了解前沿 AI 安全评估的一种新范式——嵌入式评估,及其与传统外部评估的区别。

把握 Anthropic 在 AI 安全治理上的最新动作和资金承诺,及其对行业评估生态的潜在影响。

关键洞察
  1. 嵌入式评估人员将在 AI 公司内部工作,拥有与员工相当的访问权限,能观察模型训练过程、跟踪决策并直接与员工交流。
  2. 该合作由埃森哲旗下专业 AI 业务部门 Faculty 牵头,内容包括评估和红队测试模型、进行对齐评估以及测试模型防护措施。
  3. Anthropic 和埃森哲预计未来五年内各自至少投资 10 亿美元用于建设该领域能力。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:4147

与埃森哲合作开展嵌入式评估

我们正与埃森哲合作,对前沿人工智能进行独立评估。这是我们CEO在文章《我们必须把握前沿的节奏》中所做承诺——在Anthropic内部嵌入评估人员——的重要一步。

该合作将由埃森哲旗下专业AI业务部门Faculty牵头,内容包括评估和红队测试模型、进行对齐评估以及测试模型防护措施。埃森哲帮助企业和政府在许多行业部署AI。他们对企业如何在实践中使用AI的理解为其安全方法提供了依据,他们也将把这一视角带入对我们模型的评估中。

Anthropic和埃森哲预计在未来五年内各自至少投资10亿美元用于建设该领域的能力。

嵌入式评估是新生事物,关于其运作方式的许多细节仍在制定中。与当前的外部评估人员不同,嵌入式评估人员将在AI公司内部工作,拥有与员工相当的访问权限。这种访问权限使他们能够观察模型在训练中逐步成型的过程,跟踪支配这些模型如何构建和部署的决策,并直接与员工交流。从这个有利位置,嵌入式评估人员可以评估一家公司如何运作,核实其是否遵守安全承诺,并识别盲点。他们还可以报告事件,并向公众提供关于益处和风险的更知情说明。

需要明确的是,独立的嵌入式评估人员并不会减轻我们的责任,而是有助于使责任更可验证。我们模型的安全仍然是我们的责任。

目前,对于嵌入式评估人员应有权访问哪些信息,或他们应如何报告发现,尚无标准。也没有一个确定的独立评估资助体系。长期来看,我们认为资金应来自汇集资金或政府来源,正如我们在6月的Advanced AI Framework中所呼吁的那样。由于目前两者都不存在,我们计划以不同的资助安排与不同的评估方合作。

鉴于这项工作的重要性和紧迫性,Anthropic将直接资助埃森哲的工作。我们也在与METR和其他非营利评估方对话,以利用他们自己的资金试点嵌入式评估的要素。最终,我们认为前沿AI需要一个以共同标准运作的评估方生态系统。

我们预计前沿实验室将同时与多个组织合作。我们的合作是非排他性的;Anthropic将与其他评估方合作,并将在未来几周内公布,埃森哲也将以类似身份与其他AI开发者合作。

我们将继续训练和发布前沿模型,我们希望独立评估人员在我们这样做时与我们并肩工作。我们现在分享这些早期努力,以便人们和其他AI开发者能看到我们的流程。我们预计随着该领域成熟,我们的方法也会演变,我们将在工作开始以及引入更多评估方时分享更多信息。

相关内容

推出生命科学验证计划

生命科学验证计划(LSVP)为生命科学专业人士提供对Claude Mythos、Opus和Sonnet模型的访问权限,并配备了一套经过优化的防护措施,对生物学相关工作更为宽松。

阅读更多

与我们的客户共同制定企业前沿保障措施

阅读更多

改进我们的对齐与安全工作

7月30日,我们报告了三起Claude模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与METR合作开展独立审查。与此同时,我们分享过去一个月所做的一些变更。

阅读更多