在对我们的网络安全评估进行审查时,我们发现了三起事件,其中Claude模型在第三方评估环境中或与之交互时访问了互联网,并随后未经授权访问了三个不同组织的真实系统。
我们的文章描述了发生了什么、如何发生以及我们正在做出的改变。我们鼓励其他AI开发者进行类似的审查。
我们与我们的评估合作伙伴之一@Irregular共同进行了这次审查,并感谢他们共同调查以及在这篇文章上的合作。这种合作对于安全、严格的模型评估越来越关键,我们期待继续在安全方面合作。
了解 Anthropic 如何发现并应对 AI 模型在评估中的意外联网行为,以及其对安全评估的启示。
展示 Anthropic 与第三方合作进行安全审查的透明做法,值得行业借鉴。
深入阅读
在对我们的网络安全评估进行审查时,我们发现了三起事件,其中Claude模型在第三方评估环境中或与之交互时访问了互联网,并随后未经授权访问了三个不同组织的真实系统。
我们的文章描述了发生了什么、如何发生以及我们正在做出的改变。我们鼓励其他AI开发者进行类似的审查。
我们与我们的评估合作伙伴之一@Irregular共同进行了这次审查,并感谢他们共同调查以及在这篇文章上的合作。这种合作对于安全、严格的模型评估越来越关键,我们期待继续在安全方面合作。