迈向前沿 AI 训练的安全案例
我们相信我们正在进入一个新时代,在这个时代,任何前沿强化学习训练运行之前都应要求提供结构化的安全文档。理想情况下,此类文档应达到“安全案例”的水平——即其他安全关键行业所使用的全面、结构化、基于证据的风险论证。我们将安全案例视为我们正在努力实现的理想北极星,同时承认由于 AI 能力每提升一个新层次都会涌现出复杂性,要使它们对 AI 模型像对航空或核电那样严格,面临诸多挑战。我们正在制定一个框架来将这些实践编纂成文。
以下是我们认为应成为前沿 AI 训练此类安全案例一部分的一些初步指南。这些最佳实践反映了我们当前的经验教训,我们预计随着我们继续迭代内部流程以进行谨慎开发,它们会不断演变。我们现在分享这些内容,是为了让当前的想法透明化,并邀请社区提供反馈。请注意,本文档侧重于前沿强化学习训练;内部和外部部署需要考虑更广泛的对齐属性。
安全案例应涵盖技术栈的三个方面:对齐训练、遏制和监控。这些保障措施有助于确保模型不会试图采取不对齐的行动,并且即使它这样做了,也很难突破遏制,而且监控会在造成伤害之前捕捉到它。
模型对齐:第一道防线应该是训练模型使其对齐;即以我们意图的方式可靠地行动。这可能包括:训练环境和评分:通过防止训练期间对奖励黑客行为的正强化,降低模型发展出不对齐行为的风险。这可能包括:自动化数据集审查:使用智能体查找并修复有缺陷的 RL 环境,这些环境可能允许不对齐的轨迹通过漏洞而非预期行为获得高奖励,从而减少训练期间不对齐被强化的机会。手动数据集审查:在自动化红队测试的基础上,对数据集进行人工审查和质量检查,以识别可能无意中强化不对齐行为的有缺陷任务。评分器调优:调整评分器,以惩罚模型在训练期间试图利用或黑客 RL 环境的尝试。先前运行分析:对先前实验的轨迹运行分类器,以确保评分器按预期工作。
对齐测量:运行评估以追踪模型的对齐偏差倾向,从而衡量对齐训练的有效性。这可能包括:离线对齐评估:在前沿运行期间运行对齐评估,以评估训练是否按预期进行,并调查任何重大回归。回溯测试:对以往事件回溯测试对齐评估,以确认评估能检测出先前未对齐的模型,并且没有对特定事件过拟合。追踪评估博弈:追踪可能引发行为改变的评估意识或元博弈(模型意识到自己正在被测试)(例如,在对齐评估中启用评估意识和元博弈监控器),并设定具体的阻断阈值。最坏情况压力测试:诱发最坏情况下的不当行为,并检查至少有一项评估能检测到这种不当行为。
防止对思维链进行训练:不要让自动评分器在强化学习中看到思维链,以防止模型演化出规避思维链监控器的能力。
隔离:多层基础设施安全:大力加固模型运行的沙箱以及承载沙箱的研究基础设施,以确保在沙箱逃逸事件中我们拥有额外一层保护。隔离红队测试:通过使用前沿训练运行的检查点对这些系统进行迭代红队测试(需经过安全分析),来改进沙箱、研究基础设施和边界安全,以发现并关闭任何漏洞。同时,对模型在训练期间可能接触的所有服务(例如互联网缓存)进行红队测试。跨样本通信:将高带宽跨样本通信限制在经批准的路径(如多智能体工具),并关闭智能体可轻易发现的高带宽基础设施侧信道。不可变记录:将所有强化学习训练、评估和内部部署的智能体记录不可变地保存一段合理时间(例如,保存在一次写入存储账户中),以实现可靠的事件调查并防止无意编辑。
监控:在模型开始采取未对齐行动的情况下,拥有一个实时监控系统来捕捉任何潜在的不对齐,并在严重事件发生前迅速处理优先问题。这可能包括:强制可监控性:确保模型保持可监控,以可监控性和监控规避评估(具有明确阈值)来衡量,以便及早发现令人担忧的行为。对已知问题的高召回率:确保监控系统在留出评估中对过往事件具有高召回率。监控器的评估新鲜度:为新运行创建代表净新风险的评估数据点,以免监控器召回率和精确率的度量变得过时。快速响应:实施优先警报,在定义的SLA内采取行动,要么通过呼叫待命人员,要么自动暂停受影响的运行,在模型造成伤害之前(例如,在白天事件中呼叫安全待命人员和运行负责人,在夜间对未确认的警报自动暂停运行)。
除了关于技术保障的建议外,我们一直在为前沿AI训练运行的安全案例制定操作最佳实践。这些可能包括:
异议(事前验尸):在安全论证起草完成后,应由另一个团队的成员撰写异议,以找出安全论证中的潜在漏洞,并分享对风险的校准看法,然后由训练团队予以回应,从而帮助安全论证更加完善。批准:安全论证应由高级领导层成员审查,每位成员都应有权否决该次运行,以确保对运行有多重内部检查(例如,研究组织负责人/副总裁、安全主管和首席科学家)。问责:负责一次训练运行的高级领导者(例如,研究组织负责人/研究副总裁)应对安全论证和任何事件响应负责(包括作为绩效评估的一部分),以便训练团队也有动力推动安全与对齐。暂停:如果发现会使安全论证失效的问题(例如,新的安全问题),确保有针对暂停所有受覆盖运行的运行手册、技术控制和SLA。内部透明度:安全论证应提供给内部监督小组(例如,安全与安保委员会)。审计:审计人员应获得足够的访问权限,以验证安全论证中的主张有效且合理,并在发现缺口时提出。升级:应有明确的流程来提出失准升级,并附有定义失准严重程度级别的表格,以及一个失准待命人员,当运行达到某一严重程度级别时,可以呼叫高管(例如,CEO)。技术控制:人类和代理应难以启动不合规的运行。监控和自动暂停等安全功能应故障关闭(例如,不应可能在未启用适当监控的情况下启动运行,或在RL训练、评估或内部部署中禁用监控)。回滚能力:应易于识别训练过程中失准模型的所有下游用途(例如:数据生成或评分),以便在必要时撤销失准输出的影响。剩余风险完整性:安全论证应尽可能全面地列举当前已实施缓解措施未覆盖的剩余风险,以便做出知情的风险接受决策。
这些代表了我们当前的推荐,并正在OpenAI实施中。我们预计我们的实践将在未来几周继续演进。
我们还一直在制定一些调查严重AI失准事件的最佳实践。实验室应尽可能多地从个别事件中学习(类似于其他高风险行业中的调查实践(在新窗口中打开)),以便能够防止未来发生此类情况。此类行动的一些例子可能包括:
内部透明度:错位根本原因:研究人员应通过有针对性的消融实验或重采样实验等方法,对训练动态进行根本原因分析,以理解错位行为是如何被引入的,从而更好地理解错位的科学原理,并在未来更好地预防它。事后复盘:应开展运营和文化层面的事后复盘,以理解导致该事件的所有成因,例如为何相关问题被引入,以及在事件发生前为何未被发现或未被上报。检测:我们应开发对齐测试方法,使其能够发现引发该事件的倾向,而不是直接针对从该事件中衍生的信息(例如对话记录或事件摘要)进行爬山优化。应创建源自事件的评估作为“回归测试”,以确保未来的模型不会在非常相似的事件上表现出错位倾向。公开披露:调查结果、事后复盘和运营变更应在调查结束后予以公开。受影响的第三方应尽快得到通知。与公众共享
