2026年9月29日
我们在来自[内部二进制漏洞利用基准测试]的100个任务(随机选取)上评估了若干模型,发现 GLM-5.3 在 4% 的试验中实现了完整的控制流劫持;Claude Mythos Preview 的这一比例为 6%。尽管 GLM-5.3 在此处的表现低于 Claude Mythos Preview,但显然已经跨过了一个有意义的门槛:更早的模型,如 Claude Opus 4.6 和 GLM-5.2,在任何一次试验中都未能成功。
— Anthropic Frontier Red Team,GLM-5.3 与高级网络能力的扩散
近期文章
OpenAI DevDay 2026 实时博客- 2026年9月29日2026 年 LLM 进展(截至目前)- 2026年9月27日Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna,以及一场新的价格战- 2026年9月22日