英国的人工智能安全研究所(AISI)发布了一份关于他们对Anthropic的Claude Mythos 5和OpenAI的GPT-5.6 Sol进行的最新网络安全评估的报告。这些模型在正常防护措施被移除且被故意赋予互联网访问权限的设置下尝试完成一项任务。AISI报告称,这些模型“针对真实个人和组织进行了持续、潜在有害的活动”。
我们感谢AISI在关于如何评估日益强大的AI代理的重要讨论中发挥的领导作用。我们正在与他们密切合作,以收集该事件的更多细节,同时我们也在进行自己的调查。通过检查Claude的推理记录并运行我们自己的分析,来清晰了解Claude对其处境的理解,将有助于我们找出其行为的原因。
评估中的提示没有对互联网的使用方式施加任何具体限制。这一点加上防护措施的移除,意味着模型是在“故意宽松的条件”下进行测试的,这并不代表我们任何生产模型的情况。请注意,这里没有证据表明存在从安全环境中逃逸的情况。
AISI对该事件的披露可在此处找到:https://t.co/cJ3hCBtBU7