返回 文章 学习 CMS 文章

Anthropic 评估:GLM-5.3 在 4% 的二进制漏洞利用试验中实现完整控制流劫持

Anthropic 的评估显示,GLM-5.3 首次在二进制漏洞利用任务中跨过完整控制流劫持的门槛,标志着高级网络能力正在向更多模型扩散。

AI安全二进制漏洞利用控制流劫持Anthropic
成长分 / 100 67 综合收获、行动、留存与影响

为什么值得读了解前沿模型在二进制漏洞利用这一高难度安全任务上的最新能力边界。

通过 Anthropic Frontier Red Team 的基准数据,观察高级网络能力在不同模型间的扩散趋势。

关键洞察
  1. 评估在内部二进制漏洞利用基准的 100 个随机任务上进行,覆盖多个模型。
  2. GLM-5.3 在 4% 的试验中实现了完整的控制流劫持。
  3. Claude Mythos Preview 在相同评估中的比例为 6%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:1004

2026年9月29日

我们在来自[内部二进制漏洞利用基准测试]的100个任务(随机选取)上评估了若干模型,发现 GLM-5.3 在 4% 的试验中实现了完整的控制流劫持;Claude Mythos Preview 的这一比例为 6%。尽管 GLM-5.3 在此处的表现低于 Claude Mythos Preview,但显然已经跨过了一个有意义的门槛:更早的模型,如 Claude Opus 4.6 和 GLM-5.2,在任何一次试验中都未能成功。

— Anthropic Frontier Red Team,GLM-5.3 与高级网络能力的扩散

近期文章

OpenAI DevDay 2026 实时博客- 2026年9月29日2026 年 LLM 进展(截至目前)- 2026年9月27日Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna,以及一场新的价格战- 2026年9月22日