返回 动态 学习 CMS 文章

OpenAI GPT-5.6 Sol 在 Agents' Last Exam 中创下 53.6 新高,成本大幅降低

了解 GPT-5.6 Sol 如何以更低成本实现更高性能,以及 Terra 和 Luna 的性价比表现。

OpenAIGPT-5.6Agents' Last ExamClaude Fable 5
成长分 / 100 72 综合收获、行动、留存与影响

OpenAI GPT-5.6 Sol 在 Agents' Last Exam 中创下 53.6 新高,成本大幅降低
为什么值得读获取 OpenAI 最新模型在基准测试中的具体表现数据。

了解不同推理水平下的性能与成本对比,为模型选择提供参考。

关键洞察
  1. GPT-5.6 Sol 在 Agents' Last Exam 中得分 53.6,领先 Claude Fable 5(自适应)13.1 分。
  2. 在中等推理水平下,Sol 以约四分之一成本领先 Fable 5 达 11.4 分。
  3. GPT-5.6 Terra 和 Luna 以约十六分之一的成本优于 Fable 5。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:374

在 Agents' Last Exam 中,GPT‑5.6 Sol 创下 53.6 的新高,领先 Claude Fable 5(自适应)13.1 分。

在中等推理水平下,它以约为四分之一估计成本的优势领先 Fable 5 达 11.4 分。GPT‑5.6 Terra 和 Luna 也以约为十六分之一的成本优于 Fable 5。