我们对 SWE-Bench Pro(最广泛使用的 AI 编程基准之一)进行了审计,发现它不再能可靠地衡量前沿编程能力。
我们发现 SWE-Bench Pro 中 30% 的任务存在问题,因此撤回我们先前关于研究社区将其作为主要编程评估工具的建议。
了解 OpenAI 为何撤回对 SWE-Bench Pro 的推荐,以及这对 AI 编程评估意味着什么。
获取 OpenAI 对基准评估的最新观点。
深入阅读
我们对 SWE-Bench Pro(最广泛使用的 AI 编程基准之一)进行了审计,发现它不再能可靠地衡量前沿编程能力。
我们发现 SWE-Bench Pro 中 30% 的任务存在问题,因此撤回我们先前关于研究社区将其作为主要编程评估工具的建议。