GPT-5.6 Sol 已被用于解决数学中的开放问题。那么,为什么它在 ARC-AGI-3(一个二维拼图游戏基准测试)上表现挣扎呢?
我们进行了调查。问题在于测试环境没有让它记住所学到的内容。
我们发现,启用两个 API 设置后,我们的得分提高了三倍,而输出令牌减少了 6 倍。

了解 GPT-5.6 Sol 在 ARC-AGI-3 上表现不佳的根因,以及如何通过简单设置大幅提升性能。

提供可操作的 API 设置建议,显著提升模型在类似任务上的表现。
深入阅读
GPT-5.6 Sol 已被用于解决数学中的开放问题。那么,为什么它在 ARC-AGI-3(一个二维拼图游戏基准测试)上表现挣扎呢?
我们进行了调查。问题在于测试环境没有让它记住所学到的内容。
我们发现,启用两个 API 设置后,我们的得分提高了三倍,而输出令牌减少了 6 倍。
