返回 动态 学习 CMS 文章

Claude Fable 5 全球重新上线:新增安全分类器与行业共识框架

了解 Claude Fable 5 重新上线的安全措施、行业合作及对开发者的影响。

AI安全ClaudeAnthropic模型部署
成长分 / 100 59 综合收获、行动、留存与影响

为什么值得读了解 Anthropic 如何应对 AI 安全挑战并重新部署模型。

获取关于 AI 越狱评估和行业合作的最新动态。

关键洞察
  1. Claude Fable 5 将配备新分类器,针对并阻止更多网络安全任务。
  2. 短期内,编码和调试等常规任务将回退到 Opus 4.8。
  3. Anthropic 与亚马逊、微软、谷歌等合作起草 AI 越狱评估共识框架。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1251

Claude Fable 5 将于明天在全球范围内重新可用。

在与美国政府进行了一系列富有成效的对话后,我们正在重新部署该模型,并配备一套新的分类器,以针对并阻止更多网络安全任务。短期内,一些常规任务(如编码和调试)将回退到 Opus 4.8。我们将在未来几周内继续优化这些分类器,以减少误报,并更好地区分真正的滥用与合法请求。

我们还开始起草一份共识框架——与亚马逊、微软、谷歌及其他 Glasswing 合作伙伴——用于评估 AI 越狱的严重性以及 AI 开发者应如何应对。我们邀请其他行业合作伙伴和模型提供商加入我们的这一努力。

最后,我们正在扩大与美国政府在模型测试和安全保障方面的合作。这将包括提前提供模型和安全保障以供评估,共享关于越狱和滥用的信息,以及为联合研究提供专门资源。

感谢我们的用户的耐心,也感谢政府、行业和研究界的合作伙伴与我们并肩工作,使 Fable 5 得以重新可用。

阅读我们的完整博客:https://t.co/VHyum831ri