
思考
摘要
Shieldstral 推出了一款 3B 开放权重多模态安全分类器,通过将内容审核构建为策略自适应问答任务,其性能超越了参数量最高达其 7 倍的模型。与传统护栏模型不同,它在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。该模型以 Apache 2.0 许可发布,在多样化基准测试中提供校准的安全评分,同时可在单块 16GB NVIDIA GPU 上高效运行。
一款 3B 开放权重、策略自适应的多模态安全分类器,在文本安全方面可匹敌参数量最高达其 7 倍的模型,并在多模态审核方面树立了新的最先进水平。
“此内容是否宣扬针对受保护群体的暴力?此图像是否适合向未成年人展示?助手是否拒绝了该请求?”
每一个搭载模型的产品都需要回答这类问题——但正确答案取决于产品、受众和具体情境。同样的内容对网络安全研究工具而言可能无妨,但在心理健康平台上则可能有害。大多数护栏模型将固定的危害类别分类体系固化在权重中,因此要将其重新定位到新的部署场景就意味着重新训练。而且,由于安全定义因应用和领域而异,从一开始就不存在一套单一的“正确”类别可供建模。
Shieldstral 采取了不同的方法:你在推理时以自然语言问题形式编写策略,模型返回校准后的安全评分。无需重新训练,文本和图像共用一个接口,一个 token 即可给出判定。请参阅我们的技术报告。
作为与 NVIDIA 及其他组织共同发起的 Open Secure AI Alliance 的创始成员,今天我们以 Apache 2.0 许可开放 Shieldstral 的权重,可在此处下载。
将审核视为一个问题
Shieldstral 将内容审核构建为二元问答任务。每个请求包含三个部分:
<Instruct>
——评估上下文、严格程度,以及(可选)对何种内容算作不安全的定义。<Query>
——一个单一的 yes/no 问题,例如*“此内容是否宣扬身体暴力?”*<Document>
——待判断的内容:一个提示、一个回复、一个提示–回复对,或一张带可选文本的图像。
推理时,模型仅读取 yes
和 no
的 logits,并通过 softmax 归一化为连续的安全评分。这一简单公式发挥了巨大作用:它将提示分类、回复审核、拒绝检测和毒性检测统一为单一问题;它让策略完全存在于提示中,因此一个检查点即可在部署时适应新策略。
亮点
强劲性能——在文本安全、拒绝检测、策略适应性和多模态基准测试中,与规模最多为其7倍的开源防护模型持平或表现更优。自适应且灵活——单一自然语言接口覆盖文本、图像及文本+图像内容,适用于提示、响应及提示-响应对。策略以自由形式查询提供,并在推理时重新定位,无需重新训练。小巧,基于异构源训练——一个3B模型,可在单个16GB GPU上运行,基于真实和合成数据训练,具有多样化的标签格式和分类体系,统一到一个框架中。连续安全评分——单次前向传递返回校准的yes
/no
概率,因此您可以根据置信度进行阈值设置或排序,而不是依赖离散标签。开放——Apache 2.0权重。
基准测试
我们在四个维度上评估Shieldstral,与规模最多为其7倍的开源防护模型进行比较。所有评估样本均未用于训练。
我们如何构建
核心思想是,如果数据正确,小模型可以击败大得多的模型。确保数据正确意味着解决四个问题:
统一异构数据。公共安全数据集在分类体系、标签和标注约定上存在分歧——从二元安全/不安全标志到细粒度多标签分类体系。我们使用每个数据集处理器将每个数据集转换为相同的指令-查询-文档格式,并改变指令、查询和提示-响应分隔符的措辞,使模型能够跨表述泛化,而不是过拟合于一种风格。我们还根据来源校准严格度——对对抗性越狱严格,对响应质量数据宽松——使模型学习校准的决策边界。这使我们能够整合原本不兼容的来源。
教授区分,而非记忆。如果在固定的策略标签集上训练,模型只学会分类那些预定义的策略,而不是推理给定策略的精确边界。这阻碍了对新策略的泛化。相反,我们构建一组故意相似、容易混淆的策略,并让LLM将安全文本重写为对比对:每个重写都设计为违反一个策略但不违反其兄弟策略。这训练模型区分一段内容违反哪个具体策略,这种技能在推理时转移到未见过的、用户定义的策略。
将安全建立在图像中。不安全的图像无法像文本那样由LLM合成,因此视觉安全数据稀缺。我们用通用图像数据集作为高质量负样本补充有限的审核数据集,变异查询以增强数据集,并通过视觉-语言重排序器过滤每个图像-查询对,以减少错误标记数据和幻觉。
组合互补检查点。我们使用LoRA进行微调,并通过SLERP合并——一个在公共数据上校准的检查点、一个从生成数据中添加细粒度策略区分的检查点,以及基础指令模型。合并恢复了单一模型中的常见策略校准和策略适应性,并且基础模型的指令遵循能力转移到审核任务。
Forge。我们在 Forge 上端到端构建了 Shieldstral,这是我们用于训练、对齐和评估自定义模型的平台。Forge 在最先进的分布式训练之上管理基础设施、数据和模型分片、指标和日志记录,因此团队可以专注于数据,而数据正是决定安全模型质量的关键。
下一步
Shieldstral 是迈向能够适应上下文而非迫使每个产品都通过一套固定分类体系的审核方式的一步。我们将继续推进多语言覆盖、更长文档的稳健性以及更广泛的多模态安全——我们也非常期待看到社区在此基础上构建出什么。
顺便说一句,我们正在招聘!如果你想帮助让 AI 变得更好,请查看我们的 招聘页面。
