返回 文章 apply CMS 文章

DeepSeek V4 Pro 0813 vs GPT-5.6 Sol:成本、编码能力与路由策略的深度对比

在 DeepSWE 上,GPT-5.6 Sol 单次尝试更强但贵 35 倍,DeepSeek V4 Pro 0813 多次尝试更划算,级联路由可兼顾成本与准确率。

DeepSeek V4 Pro 0813GPT-5.6 SolDeepSWE模型对比
成长分 / 100 82 综合收获、行动、留存与影响

DeepSeek V4 Pro 0813 vs GPT-5.6 Sol:成本、编码能力与路由策略的深度对比
为什么值得读了解两个前沿模型在真实软件工程基准上的性能差异,包括准确率、成本、速度和失败模式。

获取可操作的模型路由策略:先跑便宜模型,失败时升级到昂贵模型,以更低成本获得更高解决率。

关键洞察
  1. Sol 在 pass@1 上领先 10 个百分点(72.7% vs 62.8%),但成本是 Pro 的 35 倍(每次 8.37 美元 vs 0.24 美元)。
  2. Pro 在 pass@4 上反超(88.5% vs 85.8%),因为多次尝试几乎免费,覆盖更广。
  3. Pro 优先的级联方案(先 Pro 后 Sol)解决 83.0% 任务,成本 3.35 美元,优于单独使用 Sol(72.7%,8.37 美元)和完美神谕路由器(80.8%)。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:9400

关键要点

不要只选一个。先运行 DeepSeek V4 Pro 0813,测试失败时升级到 GPT-5.6 Sol。这种级联方案以每个 3.35 美元的成本解决了 DeepSWE 任务的 83.0%。Sol 单独解决 72.7%,成本为 8.37 美元。准确率高出十个百分点,成本降低 60%。

  • Sol 在早期尝试中胜出。pass@1 为 72.7% 对比 62.8%,并且在 pass@2 中保持领先(81.0% 对比 78.5%)。
  • Pro 在最后一次尝试中胜出。pass@4 为 88.5% 对比 85.8%。给定四次尝试,廉价模型能找到更多问题。
  • 价格差距为 35 倍。每次运行 0.24 美元对比 8.37 美元。每花费 100 美元,Pro 解决 261 个任务,Sol 解决 9 个。
  • Sol 更快更稳定。每次运行 17 分钟和 53 步,对比 Pro 的 35 分钟和 146 步,并且四次全对的任务数为 61 对比 35。
  • Sol 的失败更混乱。其中 20% 破坏了已通过的测试,而 Pro 为 11%。对 Sol 的输出进行回归门控。

在我们对 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 在 DeepSWE 上的比较中,DeepSWE 是一个测试模型在多种任务类型和编程语言上的软件工程能力的基准,GPT-5.6 Sol 是榜单上最佳的单次尝试工程师,而 DeepSeek V4 Pro 0813 的成本仅为前者的三十五分之一。有趣的问题不是哪个在第一次尝试时更准确(显然是 Sol),而是这 35 倍的价格差距实际买到了什么,以及低成本模型的上限是否能弥补这一差距。

我们在所有 113 个 DeepSWE 任务上运行了 DeepSeek V4 Pro 0813(最大)和 GPT-5.6 Sol(最大),每个任务四次试验,基于发布的每次试验记录:总共 904 次运行(各 452 次)。Sol 是精度旗舰;Pro 是价值异常值。以下每个数字均来自本次运行,因此可能与其他公开的 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 记分卡不同。

DeepSWE 记分板:pass@1 和 pass@k

单次尝试,Sol 明显领先:pass@1 为 72.7%,Pro 为 62.8%(官方评分)。但差距随着每次重试而缩小,然后反转:在两次尝试时 Pro 已经接近(78.5 对比 81.0),在四次尝试时 Pro 的 pass@4 为 88.5%,超过 Sol 的 85.8%。低成本模型覆盖更广;它需要多次尝试,而其尝试几乎免费。如果您的工作负载允许运行 best-of-k,那么 Sol 的准确性优势基本消失。

成本比较:DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 定价

每次运行 0.24 美元,DeepSeek V4 Pro 0813 比 Sol(8.37 美元)便宜 35 倍,按价值计算,每 100 美元可解决 260 个问题,而 Sol 为 9 个。更低的价格并未带来速度或简洁性:Pro 中位数需要 146 步和 35 分钟,并生成 101k 输出 token,而 Sol 只需 53 步、17 分钟和 59k token。Sol 是快速、简洁的专家;Pro 以迂回方式达到类似的覆盖范围。如果有人类在等待,Sol 仅凭延迟就值得其溢价;如果有预算或队列在等待,这里没有任何东西能与 Pro 相提并论。

覆盖范围与可靠性:精度与广度

将 pass@1 分解为覆盖率和可靠性,这种划分是清晰的。Sol 是精度方面的代表:可靠性 84.5%,61 个任务四题全对,这是模型精准命中的标志。DeepSeek V4 Pro 0813 则偏向另一个维度:覆盖率更广(88.5% 对 85.8%),但可靠性低得多(71.0%),且扎实完成的任务更少(35 对 61)。这就是从侧面看到的 pass@4 交叉:Pro 比 Sol 触及更多基准测试,但每次尝试的转化率较低。

失败模式:每个模型如何出错

失败特征差异显著。Sol 在 20% 的失败中破坏了仓库现有的测试套件,这是 GPT 家族回归的典型特征。DeepSeek V4 Pro 0813 则保守得多,仅为 11%;当它失败时,通常是接近成功但基线未破坏。因此,更便宜的模型在未经审查的情况下接受也更安全:在采用 Sol 的差异之前,应对其进行全面回归测试,而 Pro 则较少需要这种保护。

按任务类型划分,各自的优势

Sol 的质量优势广泛:在 8 个领域中赢得 6 个,其中数据建模和序列化达到 92%(领先 Pro 28 个百分点),此外还有查询/配置(80)、并发(72)、构建/运维(73)、程序分析(64)和协议一致性(59)。它未赢得的两个领域差距很小:语言和运行时内部是 75-75 平局,而 DeepSeek V4 Pro 0813 在状态响应式(66 对 64)上略胜一筹,这是它唯一赢得的领域。凡是要求精确序列化契约的任务,Sol 都会拉开差距。

DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 按编程语言对比

Sol 在五种语言中赢得四种(Python 74、Go 79、TypeScript 66、JavaScript 75),且在 Python 和 Go 上优势明显。例外是 Rust,DeepSeek V4 Pro 0813 以 65 对 60 略胜一筹:这是 Sol 唯一表现低于其类别的语言,也是 Pro 唯一完全获胜的语言。如果你的技术栈是 Python 或 Go,Sol 以舒适的优势领先;如果是 Rust,Pro 略好且便宜得多。

DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 有多大差异?

中等程度。每任务相关性为 0.54,是 DeepSeek-Pro 配对中最接近的。它们都解决了 90 个任务;Pro 单独解决 10 个,Sol 单独解决 7 个,6 个两者都未解决。它们的并集覆盖了 113 个中的 107 个(94.7%)。一个不对称性对组合投资很重要:DeepSeek V4 Pro 0813 没有完全解决 Sol 完全遗漏的任务,而 Sol 在两个 Pro 从未解决的任务上四题全对(pebble-durability-wait-apis、textual-kitty-key-phases)。因此,Pro 在 Sol 之上并没有增加太多新的覆盖范围;它增加的是以最低成本清除共享任务的能力。

在它们之间路由:组合策略

这正是级联方案胜出的原因。先运行 DeepSeek V4 Pro 0813,仅当你的测试套件拒绝答案时再升级到 Sol:每个任务成本 3.35 美元,解决率 83.0%。这比单独使用 Sol(72.7%)高出十个百分点,而成本不到 Sol 每任务价格(8.37 美元)的一半。近乎免费的第一阶段清除了大部分队列,因此 Sol 的高价仅适用于剩余的难题,而且到达 Sol 的任务会获得第二次独立尝试。级联方案甚至击败了完美的一次性神谕路由器(80.8%),因为两次独立尝试胜过一次完美选择。无论哪个模型领先,准确率都相同,但 Pro 优先便宜得多(3.35 美元对 8.44 美元),因此始终以成本较低的模型领先。

这意味着什么

GPT-5.6 Sol 是当正确性和延迟在首次尝试时都重要时的单模型选择:最高的 pass@1、最高的可靠性、最快且最简洁,以及八个领域中的六个。你为此支付 35 倍于 DeepSeek V4 Pro 0813 的价格,并且必须防范其 20% 的回归率。DeepSeek V4 Pro 0813 是价值之选和 best-of-k 选择:接近旗舰的覆盖率、更高的四次尝试上限、更干净的失败特征,每次部署成本 0.24 美元。但这对组合最犀利的用法不是单独使用,而是将 Pro 作为 Sol 的前端。一个低成本的第一阶段清除了大部分工作,使 Sol 的成本仅在你需要它的任务上支付,并以低于 Sol 一半的价格获得超越旗舰的覆盖率。

数据表:DeepSeek V4 Pro 0813 与 GPT-5.6 Sol 的完整结果

常见问题

DeepSeek V4 Pro 0813 比 GPT-5.6 Sol 更好吗?

这取决于指标。GPT-5.6 Sol 在 DeepSWE 上的单次尝试质量胜出(pass@1 72.7% 对 62.8%),四次尝试全部解决的任务更多(61 对 35),并且每次部署快得多。DeepSeek V4 Pro 0813 在 pass@4 上胜出(88.5% 对 85.8%),每次部署成本低 35 倍,因此对于高容量或可重试的代理工作,它是更强的价值选择。

DeepSeek V4 Pro 0813 比 GPT-5.6 Sol 便宜多少?

在我们的运行中,DeepSeek V4 Pro 0813 每次部署成本 0.24 美元,而 GPT-5.6 Sol 在最大努力下为 8.37 美元,大约便宜 35 倍。按每个解决任务衡量,Pro 每 100 美元返回 260 个解决任务,而 Sol 为 9 个,每美元解决的工作量约为 30 倍。

对于编码,DeepSeek V4 Pro 0813 和 GPT-5.6 Sol 哪个更好?

GPT-5.6 Sol 在 Python(74)、Go(79)、TypeScript(66)和 JavaScript(75)上领先,并在 8 个任务域中赢得 6 个,其中数据建模和序列化以 92% 领先。DeepSeek V4 Pro 0813 在 Rust(65 对 60)上胜出,并在有状态响应式(66 对 64)上略胜一筹。Sol 也是每次部署更快的模型;Pro 在多次尝试中覆盖更广。

我应该在 DeepSeek V4 Pro 0813 和 GPT-5.6 Sol 之间路由吗?

是的,如果你能验证结果。先运行 DeepSeek V4 Pro 0813,当你的测试套件拒绝输出时升级到 GPT-5.6 Sol,达到 83.0% 的解决率,每任务成本 3.35 美元,击败单独使用 Sol(72.7%,8.37 美元)和完美的一次性神谕路由器(80.8%)。两者合计覆盖 113 个任务中的 107 个。

DeepSWE 上的 pass@k 是什么?

pass@k 衡量一个任务的 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励首次尝试正确;更高的 k 奖励模型在多次尝试中最终达到解决方案的能力。DeepSeek V4 Pro 0813 的优势随着 k 的增加而增长。