我们对 SWE-Bench Pro 的审计发现,相当一部分公开任务包含可能扭曲结果的问题。
一些正确的解决方案因隐藏要求、矛盾指令、过于严格的测试或不完整的评分标准而失败。https://t.co/s07aJbNks6

了解 OpenAI 如何发现并分析 SWE-Bench Pro 基准测试中的系统性缺陷,以及这些缺陷对 AI 编码模型评估的影响。

提供具体问题类型(隐藏要求、矛盾指令等),为改进测试设计提供参考。
深入阅读
我们对 SWE-Bench Pro 的审计发现,相当一部分公开任务包含可能扭曲结果的问题。
一些正确的解决方案因隐藏要求、矛盾指令、过于严格的测试或不完整的评分标准而失败。https://t.co/s07aJbNks6
