与埃森哲合作开展嵌入式评估
我们正与埃森哲合作,对前沿人工智能进行独立评估。这是我们CEO在文章《我们必须把握前沿的节奏》中所做承诺——在Anthropic内部嵌入评估人员——的重要一步。
该合作将由埃森哲旗下专业AI业务部门Faculty牵头,内容包括评估和红队测试模型、进行对齐评估以及测试模型防护措施。埃森哲帮助企业和政府在许多行业部署AI。他们对企业如何在实践中使用AI的理解为其安全方法提供了依据,他们也将把这一视角带入对我们模型的评估中。
Anthropic和埃森哲预计在未来五年内各自至少投资10亿美元用于建设该领域的能力。
嵌入式评估是新生事物,关于其运作方式的许多细节仍在制定中。与当前的外部评估人员不同,嵌入式评估人员将在AI公司内部工作,拥有与员工相当的访问权限。这种访问权限使他们能够观察模型在训练中逐步成型的过程,跟踪支配这些模型如何构建和部署的决策,并直接与员工交流。从这个有利位置,嵌入式评估人员可以评估一家公司如何运作,核实其是否遵守安全承诺,并识别盲点。他们还可以报告事件,并向公众提供关于益处和风险的更知情说明。
需要明确的是,独立的嵌入式评估人员并不会减轻我们的责任,而是有助于使责任更可验证。我们模型的安全仍然是我们的责任。
目前,对于嵌入式评估人员应有权访问哪些信息,或他们应如何报告发现,尚无标准。也没有一个确定的独立评估资助体系。长期来看,我们认为资金应来自汇集资金或政府来源,正如我们在6月的Advanced AI Framework中所呼吁的那样。由于目前两者都不存在,我们计划以不同的资助安排与不同的评估方合作。
鉴于这项工作的重要性和紧迫性,Anthropic将直接资助埃森哲的工作。我们也在与METR和其他非营利评估方对话,以利用他们自己的资金试点嵌入式评估的要素。最终,我们认为前沿AI需要一个以共同标准运作的评估方生态系统。
我们预计前沿实验室将同时与多个组织合作。我们的合作是非排他性的;Anthropic将与其他评估方合作,并将在未来几周内公布,埃森哲也将以类似身份与其他AI开发者合作。
我们将继续训练和发布前沿模型,我们希望独立评估人员在我们这样做时与我们并肩工作。我们现在分享这些早期努力,以便人们和其他AI开发者能看到我们的流程。我们预计随着该领域成熟,我们的方法也会演变,我们将在工作开始以及引入更多评估方时分享更多信息。
相关内容
推出生命科学验证计划
生命科学验证计划(LSVP)为生命科学专业人士提供对Claude Mythos、Opus和Sonnet模型的访问权限,并配备了一套经过优化的防护措施,对生物学相关工作更为宽松。
与我们的客户共同制定企业前沿保障措施
改进我们的对齐与安全工作
7月30日,我们报告了三起Claude模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与METR合作开展独立审查。与此同时,我们分享过去一个月所做的一些变更。
