改进 Fable 5 的生物学安全防护
我们正在更新 Claude Fable 5 的生物学安全防护措施,以大幅减少误报。Fable 5 用户现在遇到的“回退”情况将大大减少——即用户提出生物学相关查询后,系统切换到能力较弱的模型。在我们的测试中,此次更新使各产品界面中与生物学相关的回退减少了约 85%。1
因此,Fable 5 将能够协助处理更广泛的生物学任务。
实际上,用户在日常健康和教育问题上遇到的回退将大幅减少——例如解读化验结果、理解症状,以及在教育场景中学习生物学。医疗专业人员将能够在临床任务上获得 Fable 5 更多的支持。
我们相信,AI 对世界产生积极影响的最大机会在生物学和医学领域,我们正在大力投入,以负责任的方式让生物学家获得前沿能力的使用权限。目前,对于我们认为具有两用性质的请求——包括病毒学、毒理学和分子设计——Fable 仍会回退到 Opus 5,因此它尚不能用于专业生物学研究和药物开发。我们致力于通过可信访问途径提供前沿生物学能力,以弥合这一差距。
我们为何构建强大的生物学安全防护
我们的目标是尽快将 Fable 5 的前沿能力交到尽可能多的用户手中。然而,要做到这一点,我们需要管理如此强大的模型所带来的日益增长的风险。其中一个风险就在生物学领域:Fable 5 现在能在一些高度复杂的生物学任务上超越专家,并在其他任务上提供操作支持。这意味着它可以为开发新医疗疗法的研究人员提供真正的帮助(这正是我们如此热衷于通过分类器改进和可信访问计划来扩大该模型使用范围的原因)。但如果落入坏人之手,这些同样的能力可能被恶意行为者利用,例如用于开发生物武器。我们的能力评估显示,Fable 5 可以为此类行为者提供显著的能力提升——也就是说,它可以为他们提供在其他任何地方都无法获得的能力。
在生物学领域,区分 AI 的有益用途和有害用途往往很困难。例如,在某些情况下,研究某种疾病的治疗方法需要科学家制造出导致该疾病的危险化合物。这在活疫苗中最为明显,因为活疫苗需要科学家培养他们旨在预防的同一病原体。一些药物也是如此。为了开发治疗高血压的药物卡托普利,科学家分离出了蛇毒中能使人血压骤降的有毒成分。随着新的生物学能力在 AI 前沿不断发展,我们需要保持谨慎,确保其带来的新风险不会在其潜在科学益处之前成为现实。
那些希望利用我们的模型从事有害活动的老练行为者,深知如何利用这种模糊性来掩盖其意图,使危险的任务看起来像是普通的研究工作。美国情报界的2026年度威胁评估明确指出,此类行为者确实存在,而且包括合成生物学和基因组编辑在内的生物技术进步*"可能导致新型生物威胁"*。该评估指出,若干国家行为体很可能维持着活跃的进攻性生物和化学武器计划——而获取前沿AI模型的原始能力可能会加速这些计划。
出于对这些"两用"能力(既可用于有益目的也可用于有害目的、且两者之间的界限并不总是容易划清的能力)的担忧,我们在推出 Fable 5 时有意屏蔽了几乎所有生物学查询。这使我们能够将该模型提供给其他领域的用户使用。我们知道这会让合法的生物学用户感到沮丧:短期内会导致大量误报,即提出生物学相关问题的用户,其请求会被拦截并转交给能力较弱的模型处理。尽管如此,我们仍选择做出这一权衡,因为 Fable 在生物学这样的两用领域被滥用的代价可能是灾难性的。
我们的生物学防护措施如何运作
我们在生物学领域防范滥用的核心方式之一是通过安全分类器:这是一种较小的自动化AI系统,用于检测 Fable 5 何时被要求执行受保护的生物学任务,或产生有害输出(我们此前曾撰文介绍过我们在网络安全领域的类似分类器)。
就 Fable 5 而言,当分类器触发时,模型会将用户的请求重新路由至 Opus 5——这是一个能力较强的模型,但不具备 Fable 5 同等级别的生物学能力,因此无法为恶意用户提供同样多的帮助。这就是用户在其请求被拦截时所看到的回退方案。
开发精确、稳健的分类器并非易事。分类器要快速且稳定地运作,就必须学会区分我们视为潜在有害的主题和查询中,哪些属于"范围内"、哪些属于"范围外"。调整分类器需要时间和反复迭代,既要避免误报(分类器对范围外内容触发),也要避免漏报(范围内内容被遗漏)。我们还要求分类器能够抵御绕过它们的尝试(即所谓的越狱),这需要进一步的研究和测试。
从非常宽泛的生物学分类器起步,意味着我们可以在继续研究以完善它的同时,让用户使用 Fable 5。另一种选择——在取得更多防护进展之前暂不发布该模型——会使该模型的普遍开放及其对用户的潜在益处推迟数周或数月。
过去几周,我们仔细重写了分类器的章程(该章程由一系列规则组成,旨在帮助模型区分受保护内容和允许内容),并特别注重详细界定良性用途。我们向来自Anthropic内部和外部的多元化专家征求了对这些修改的反馈。随后,我们基于该章程为分类器开发了更新的训练数据,并对其进行了重新训练,同时验证了新分类器仍会普遍对有害和两用研究生物学内容触发,但现在能够支持更广泛的良性和有益用途。
如下图所示,这些更新意味着——与Fable 5发布时相比——分类器将对更少的良性生物学相关请求触发。

我们的生物学分类器示意图。位于分类器边界左侧的内容被允许;位于右侧的内容受保护(因此被阻止,转而发送给能力较弱的模型);。明显有害的内容(红色)和两用内容(橙色)会触发分类器并被阻止。我们设置了一个安全边际,其中包含极可能良性但出于充分谨慎仍被阻止的内容(浅绿色)。明显良性的内容为深绿色。
Fable 5发布时,其分类器(A)非常宽泛,会对大量请求触发——甚至包括几乎肯定良性的请求(即安全边际内的那些请求)。因此,分类器边界在图中非常靠左。我们今天宣布的更新(B)意味着分类器允许更多良性请求,它已能更好地区分良性查询与两用查询之间的细微差别。因此,图中的分类器边界已进一步向右移动。
结论
在完善我们的保护措施方面,仍有更多工作要做。误报将不可避免地存在——即那些落在分类器安全边际内的请求,这些请求风险极低,但分类器仍会触发。正如我们上面所指出的,Fable将继续阻止两用专业生物学和药物开发查询,因为存在潜在的两用风险。我们完全致力于为研究人员开发一条安全、可扩展的途径,通过可信访问路径使用我们最强大的模型。
我们希望您继续与我们分享反馈,以便我们进一步完善保护措施。
相关内容
与客户共同开发企业前沿保护措施
改进我们的对齐和安全工作
7月30日,我们报告了三起Claude模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与METR合作进行独立审查。与此同时,我们分享过去一个月所做的一些改变。
预览模型硬件标准
我们正在向首批科学研究实验室和先进制造商开放模型硬件标准(MHS)的研究预览版,这是一项供 AI 智能体安全操作物理设备的共享规范。
