瓦解一场协同的模型蒸馏行动
我们最近识别并瓦解了一场协同行动,该行动旨在从我们的模型中提取受保护的推理内容,最早观察到的活动发生在7月第一周。这一活动与对抗性蒸馏一致:即系统性地、未经授权地利用一个模型的输出或推理来帮助训练、复制或改进另一个模型。受保护的推理是模型处理任务时的内部记录;提取它可以揭示最终答案中未披露的信息,并帮助他人复制模型的能力。
操作者并未破解我们的加密、入侵数据库,也未直接访问存储的用户对话。相反,他们操纵模型交互,使受保护的推理能够以请求者可见的形式被复制,且以协同、规模化的方式进行,违反了我们的服务条款。这种操纵并非OpenAI模型独有的漏洞,我们已通过前沿模型论坛与行业伙伴分享了相关信息,以加强对对抗性蒸馏的集体防御。
在发布之前,我们调查了其范围和潜在影响,部署了我们自己的缓解措施,并与研究人员和行业伙伴分享并采纳了反馈,以确保针对此类攻击的防护措施到位。额外的缓解和调查工作仍在继续。我们相信,现在分享我们所了解的情况将有助于更广泛的生态系统加强其防御。
我们看到操作者尝试以新颖的方式提取受保护的推理,包括从一段对话中复制加密的推理内容,并在另一段对话中要求模型解密并转录隐藏的推理内容。
独立安全研究人员(在新窗口中打开) 也通过负责任披露向我们提请注意相关的跨模型和对话压缩漏洞。我们调查了他们的发现,并确认他们识别的攻击路径是真实的。他们的工作帮助我们理解了更广泛的攻击类别,并加快了缓解措施。
该活动始于7月1日,最初规模较小,直到我们观察到7月24日和25日出现高流量峰值,包含来自4,000多名用户的16,000次请求¹,使用了相关的提取模式。进一步调查发现了涉及超过15,000名用户集群的相关提示模式活动,我们已于7月28日将其完全瓦解。
该活动随时间演变,这进一步表明对抗性蒸馏是一个更广泛的安全挑战,需要分层、自适应的防御。
目前尚不清楚我们在相关时间段内观察到的所有操作者是否来自单一行为者。然而,我们将该活动的核心集群归因于与Moonshot AI(Kimi的开发者)有关联的个人。
对抗性蒸馏带来安全和国家安全风险。提取的推理可能被用于训练另一个模型,而无需保留应用于原始模型面向用户输出的保障措施。在规模上,蒸馏还可以加速先进能力的转移,而无需在安全方面进行同等投资。随着模型在双重用途领域获得能力,这些担忧变得更加突出。
这一风险并非OpenAI独有。如上文所述,类似技术可能影响其他先进AI系统,使其成为一项需要全行业协调应对的共同安全挑战。
我们通过账户执法、技术控制和合作伙伴协调相结合的方式,缓解了近期这起蒸馏行动。我们封禁或限制了欺诈性账户,加强了注册和基础设施控制,并扩大了对相关网络的监控。
我们还加强了跨用户、工作区、组织和模型系列的隐藏推理保护。我们关闭了一条路径,该路径允许已经拥有另一用户加密推理内容的人重放该内容并恢复其内容,并增加了检查措施,以检测和暂扣可能暴露推理的流式输出。当相关活动通过第三方服务进行时,我们与这些提供商合作,识别并中断了涉及的账户。
最后,我们通过Frontier Model Forum和适当的政府信息共享渠道分享了相关发现,以便其他前沿开发者及公共部门合作伙伴能够查找类似活动并加强自身防御。支持可移植或可重放推理产物的系统可能面临相关风险。
我们预计,随着前沿模型不断改进,以及行为者寻找更廉价的方式来模仿其能力,对抗性蒸馏尝试将变得更加复杂。防御此类活动需要分层控制和持续适应。
这项工作尚未完成。合作伙伴托管的部署需要与第一方服务相同的保护,而工具输出攻击需要能够检查普通可见文本之外内容的保护措施。我们正在继续改进工具防御、分类器覆盖范围、模型拒绝能力,并在云合作伙伴之间传播相关控制措施。
我们的应对将继续聚焦三个领域:针对提取的更强技术保护、针对协同行动的更好检测与执法,以及跨行业和政府的更深入威胁信息共享。
