关键要点
先运行 DeepSeek V4 Pro 0813,仅在失败时升级到 Claude Fable 5。这种级联解决了 DeepSWE 任务的 82.7%,每次成本为 8.28 美元。仅使用 Fable 解决 69.7%,成本为 21.63 美元。高出 13 个百分点,便宜 62%。
- Fable 在首次尝试中胜出。pass@1 为 69.7% 对比 62.8%,领先 7 个百分点。
- Pro 在后续每次尝试中胜出。pass@2 持平(78.5% 对比 77.1%),pass@4 领先(88.5% 对比 84.1%)。
- 价格差距为 90 倍。每次运行 0.24 美元对比 21.63 美元。每花费 100 美元,Pro 解决 260 个任务,Fable 解决 3 个。
- 它们在不同任务上失败。每任务相关性为 0.39,这是我们测量过的分歧最大的一对。它们共同覆盖了 113 个任务中的 107 个。这种分歧正是路由有效的全部原因。
在我们对 DeepSeek V4 Pro 0813 与 Claude Fable 5 在 DeepSWE 上的对比中,该基准测试模型在多种任务类型和编程语言上的软件工程能力,这两个模型位于价格表的两端。Claude Fable 5 是 DeepSWE 榜单上最昂贵的运行。DeepSeek V4 Pro 0813 是最便宜的之一。Fable 在首次尝试中准确率高出 7 个百分点,但每次运行成本高出 90 倍,因此真正的问题不是哪个模型更好,而是这 90 倍的溢价实际买到了什么,以及何时值得支付。
我们在所有 113 个 DeepSWE 任务上运行了 DeepSeek V4 Pro 0813(最大)与 Claude Fable 5(最大),每个任务四次试验,基于已发布的每次试验记录:总共 904 次运行(各 452 次)。Fable 是昂贵的工匠;Pro 是价值异常值。两者在此数据集中的分歧也超过任何其他配对,这被证明是它们最有趣的特点。以下每个数字均来自本次运行,因此可能与其他公开的 DeepSeek V4 Pro 0813 与 Claude Fable 5 记分卡不同。

DeepSWE 记分板:pass@1 和 pass@k
单次尝试,Fable 领先:pass@1 为 69.7%,Pro 为 62.8%(官方评分)。但领先优势脆弱。在两次尝试时 Pro 追平(78.5 对比 77.1),在四次尝试时 Pro 的 88.5% pass@4 超过 Fable 的 84.1% 超过 4 个百分点。对于成本高出 90 倍的模型,Fable 既没有占据上限,也没有在重试时保持首次尝试的优势。成本较低的模型在覆盖范围和最佳 k 值方面都更高。

成本对比:DeepSeek V4 Pro 0813 与 Claude Fable 5 定价
每次运行 0.24 美元,DeepSeek V4 Pro 0813 比 Fable(21.63 美元)便宜 90 倍:每 100 美元解决 260 个任务,而 Fable 为 3 个。这是我们测量过的任何配对中最宽的成本差距,Fable 是榜单上最昂贵的配置。而且不同寻常的是,较低的价格并没有带来你预期的速度惩罚:Fable 的中位运行时间为 31 分钟,Pro 为 35 分钟,大致相当,因为 Fable 是榜单上最冗长的模型(115k 输出令牌),尽管它采取的步骤更少(79 对比 146)。Pro 采取更多步骤;Fable 每步写更多。两个模型都没有明显更快。

失败模式:每个模型如何出错
两者在避免破坏现有功能方面都很自律:DeepSeek V4 Pro 0813 和 Fable 在失败案例中分别仅使现有测试套件回归 11%,远低于 GPT 系列的 20%。差异在于另一个方向:Fable 在此处的大失误占比最高(18%,而 Pro 为 10%),这意味着当 Fable 出错时,往往错得离谱,解决方案与目标相去甚远,而非仅差一个边界情况。Pro 更常接近正确答案(接近失误占 66%,而 Fable 为 57%)。因此,两者都可以在无需严格回归门禁的情况下安全接受,但 Fable 的失误属于更昂贵的调试类型。

按任务类型划分的各自优势
Fable 的工艺在推理密集、精确契约的领域表现突出:它在 8 个领域中赢得 6 个,其中数据建模和序列化以 88% 领先(超出 Pro 24 个百分点),语言内部机制为 78%。但 DeepSeek V4 Pro 0813 赢得两个领域,且两者都意义重大:状态响应式(66 对 64)以及具有说明性的并发与持久性(58 对 45):在 Fable 最薄弱的领域领先 13 个百分点。Fable 在并发方面 45% 的得分是其最弱的单元,也是低成本模型不仅是更便宜,而是更优秀工程师的唯一领域。

DeepSeek V4 Pro 0813 与 Claude Fable 5 按编程语言对比
Fable 在五种语言中赢得四种,但证明其价格合理的是 Rust:85% 对 Pro 的 65%,领先 20 个百分点,是本次对比中最大的单一差距。Fable 显然是序列化和 Rust 的专家。在其他方面,差距比价格所暗示的要小(Python 70 对 60,Go 71 对 67,JavaScript 75 对 65),而 DeepSeek V4 Pro 0813 实际上在 TypeScript 上获胜(61 对 57)。除了 Rust 和序列化,很难为支付 90 倍的价格找到理由。

DeepSeek V4 Pro 0813 与 Claude Fable 5 有何不同?
这是可取之处。每任务相关性仅为 0.39,是任何 DeepSeek-Pro 配对中最低的,因此这两者确实存在分歧。它们都解决了 88 个任务;Pro 单独解决 12 个,Fable 单独解决 7 个,只有 6 个两者都失败。它们的并集覆盖了 113 个中的 107 个(94.7%),且分歧是双向的:DeepSeek V4 Pro 0813 在 awilix-async-container-initialization 上四战四胜,而 Fable 从未成功;Fable 在四个任务上四战四胜,而 Pro 为零(包括 koota-query-predicates 和 testem-bail-on-test-failure)。这是真正的互补性,而非冗余。

在两者之间路由:组合策略
这种多样性加上价格使得级联方案颇具吸引力。先运行 DeepSeek V4 Pro 0813,仅当测试套件拒绝答案时才升级到 Fable:82.7% 的任务以每任务 8.28 美元解决。这比单独使用 Fable(69.7%)高出 13 个百分点,而成本仅为 Fable 每任务价格(21.63 美元)的一半以下。低成本的第一阶段清除了大部分队列,因此 Fable 的溢价仅适用于剩余的困难任务,而这些任务在之上还获得了第二次独立尝试。级联方案也优于完美的单次预言机路由器(78.8%)。顺序不是可选的:Pro 优先成本为 8.28 美元,Fable 优先成本为 21.71 美元,但准确率相同。

这意味着什么
Fable 5 是此榜单上最难证明其作为默认选择合理性的单一模型:迄今为止最昂贵的部署,首次尝试的领先优势会被重试抹平,并且没有四次尝试的上限优势。购买它只为两件事:Rust(85%)和序列化密集型工作(88%),在这些方面其质量确实配得上这个价格。
DeepSeek V4 Pro 0813 则是相反的情况:首次尝试的准确率接近 Fable,上限更高,失败情况相同或更好,成本低 90 倍,尽管它在 Rust 和精确契约领域有所不及。由于这两者是我们测量过的差异最大的配对,Fable 的最佳用途不是作为默认选择,而是作为低成本 Pro 第一阶段之后的选择性升级,仅在少数确实需要 Rust 或序列化专家的任务上付费。
数据表:DeepSeek V4 Pro 0813 与 Claude Fable 5 的完整结果
常见问题
DeepSeek V4 Pro 0813 比 Claude Fable 5 更好吗?
这取决于衡量标准。Claude Fable 5 在 DeepSWE 上的单次尝试质量更优(pass@1 69.7% 对 62.8%),并且四次尝试全部解决的任务更多(56 对 35)。DeepSeek V4 Pro 0813 在 pass@2 上持平,并在 pass@4 上胜出(88.5% 对 84.1%),而每次部署成本低 90 倍,因此对于高容量或可重试的代理工作,它是更具价值的选择。
DeepSeek V4 Pro 0813 比 Claude Fable 5 便宜多少?
在我们的运行中,DeepSeek V4 Pro 0813 每次部署成本为 0.24 美元,而 Claude Fable 5 在最大努力下为 21.63 美元,大约便宜 90 倍。按每个已解决任务计算,Pro 每 100 美元返回 260 个解决方案,而 Fable 为 3 个,每美元解决的工作量约为 80 倍。
对于编码,DeepSeek V4 Pro 0813 和 Claude Fable 5 哪个更好?
对于大多数编码工作,它们的差距比价格所暗示的要小。Claude Fable 5 在 Rust(85 对 65)、Python、Go 和 JavaScript 上领先,并在 8 个任务领域中赢得 6 个,其中数据建模和序列化领先。DeepSeek V4 Pro 0813 在 TypeScript(61 对 57)、有状态响应式以及并发和持久性(58 对 45)上胜出,后者是 Fable 最弱的领域。
我应该在 DeepSeek V4 Pro 0813 和 Claude Fable 5 之间进行路由吗?
是的,如果你能验证结果的话。这两个模型在我们测量的任何配对中具有最低的任务间相关性(0.39),并且共同覆盖了 113 个任务中的 107 个。先运行 DeepSeek V4 Pro 0813,当你的测试套件拒绝输出时升级到 Claude Fable 5,可以达到 82.7% 的准确率,每个任务成本为 8.28 美元,优于单独使用 Fable 以及完美的单次尝试预言机路由器。
DeepSWE 上的 pass@k 是什么?
pass@k 衡量的是在 k 次尝试中至少有一次通过隐藏测试套件的概率。pass@1 奖励首次尝试就正确;更高的 k 奖励模型在多次尝试中最终能达到解决方案的能力。DeepSeek V4 Pro 0813 的优势随着 k 的增加而增长。
