返回 动态 学习 CMS 文章

OpenAI 审计发现 SWE-Bench Pro 基准 30% 任务存在问题,撤回推荐

了解 OpenAI 为何撤回对 SWE-Bench Pro 的推荐,以及这对 AI 编程评估意味着什么。

OpenAISWE-Bench ProAI编程基准测试
成长分 / 100 72 综合收获、行动、留存与影响

为什么值得读了解当前主流 AI 编程基准的可靠性问题。

获取 OpenAI 对基准评估的最新观点。

关键洞察
  1. SWE-Bench Pro 中 30% 的任务存在问题。
  2. 该基准不再能可靠衡量前沿编程能力。
  3. OpenAI 撤回先前推荐,建议社区重新评估。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:326

我们对 SWE-Bench Pro(最广泛使用的 AI 编程基准之一)进行了审计,发现它不再能可靠地衡量前沿编程能力。

我们发现 SWE-Bench Pro 中 30% 的任务存在问题,因此撤回我们先前关于研究社区将其作为主要编程评估工具的建议。

https://t.co/wDdSEjBe4F