关键要点
虽然 GPT-5.6 Luna 在各项质量指标上都是更强的工程师,但 DeepSeek-V4 Flash 0731 足够便宜,以至于 DeepSeek 优先的级联在准确性和成本上都优于单独使用 Luna。
- GPT-5.6 Luna 在 DeepSWE pass@1 上以 67.2% 对 53.3% 的决定性优势领先,差距为 14 个百分点,并且在每个相同的尝试次数下都保持领先。
- DeepSeek-V4 Flash 是 DeepSWE 排行榜上最便宜的模型:每次运行 0.10 美元,而 Luna 为 0.61 美元,每 100 美元可解决 532 个任务,而 Luna 为 110 个。
- DeepSeek-V4 Flash 失败得更干净,在 9% 的失败中破坏了仓库现有的测试套件,而 Luna 为 15%。
- 先运行 DeepSeek-V4 Flash,仅在失败时升级到 Luna,可以以每个任务 0.385 美元的成本解决 78.9% 的任务:比单独使用 Luna 更准确,且便宜 37%。
DeepSeek-V4 Flash 0731 是整个 DeepSWE 排行榜上最便宜的模型:每个任务大约十美分!GPT-5.6 Luna 是一款坚实的高端旗舰,每个任务运行成本为 0.61 美元,大约是 DeepSeek 价格的六倍。因此,问题不在于哪个模型赢得了排行榜(Luna 轻松获胜),而在于便宜六倍能给你带来什么,代价是什么,以及两者结合是否优于单独使用任何一个。
我们在所有 113 个 DeepSWE 任务上运行了 DeepSeek-V4 Flash 0731(最大)与 GPT-5.6 Luna(最大)的对比:这些任务来自活跃的开源仓库的真实、长期功能请求,每个任务进行四次试验,由隐藏测试套件评定通过/失败。根据已发布的每次试验记录,总共进行了 900 次运行(DeepSeek 侧 452 次,Luna 侧 448 次)。以下每个数字都来自这次运行,因此可能与其他公开记分卡有所不同。
概览
Luna 的成本约为 6 倍,但准确率高出约 14 个百分点;DeepSeek 使用更多的输出令牌和步骤来取得更少的进展,但以 0.10 美元的价格,它是该组中迄今为止最便宜的运行。

DeepSWE 记分板:pass@1 和 pass@k
Luna 在单次尝试中明显获胜:根据 DeepSWE 官方评分,pass@1 为 67.2%,而 DeepSeek 为 53.3%,领先 14 个百分点,相对而言准确率高出约 26%。在相同尝试次数下,Luna 在每个 k 值下都保持领先(两次尝试时为 81.6 对 70.1,四次尝试时为 90.3 对 80.5)。就原始解决能力而言,这不是一场势均力敌的比赛。
但 DeepSWE 正是那种可以并行展开多次尝试的工作负载,而在那里,经济性改变了局面。DeepSeek 的 pass@2(70.1%)已经略高于 Luna 的单次尝试(67.2%),而两次 DeepSeek 尝试的成本约为 0.20 美元,而 Luna 为 0.61 美元。如果验证器能够选择成功的运行,那么便宜的模型以三分之一的价格就能达到旗舰模型的首次尝试质量,这还不包括下面提到的任何路由技巧。

成本比较:DeepSeek-V4 Flash 与 GPT-5.6 Luna 定价
- 每个任务 0.61 美元,Luna 每 100 美元可解决 110 个任务,而 DeepSeek 为 532 个:便宜模型的价值优势为 4.8 倍。每次运行的成本差距约为 6 倍。
- 便宜模型唯一不能给你带来的是速度,这是与通常的“闪存”模型故事不同的地方:DeepSeek 在这里是两者中较慢的,中位时间 23 分钟和 148 步,而 Luna 为 16 分钟和 92 步。它需要更多时间(并产生更多输出,中位令牌数 104k,而 Luna 为 70k)。DeepSeek 的优势是金钱,而不是时间。
- 这种挂钟时间的差距部分是由于模型太新造成的;随着推理引擎针对其进行优化,预计差距会缩小。

失败模式:DeepSeek 比旗舰模型更优雅地失败
廉价模型悄悄赢得的另一件事是纪律性。当 DeepSeek 失败时,它仅在 9% 的失败中破坏仓库现有的测试套件。Luna 则在 15% 的情况下这样做:这是 GPT 家族的回归特征,与我们在 Sol 和其他 OpenAI 血统模型中看到的 15% 到 20% 相同。两者主要都是接近命中失败(DeepSeek 69%,Luna 66%),但更昂贵的模型更可能干扰已经正常工作的代码。如果你部署 Luna,请在其后设置完整的回归测试;DeepSeek 则不那么需要这种护栏。

DeepSeek-V4 Flash 与 GPT-5.6 Luna 按任务领域对比
按代码实际内容对 113 个任务进行分类,Luna 在 8 个领域中赢得 7 个。其最大优势恰恰在于推理密集型工作:程序分析(69 对 33)、并发与持久性(70 对 38)、语言与运行时内部(86 对 59),每个领域大约有 30 分的差距。这是模型能力真正显现的地方,而 DeepSeek 在此严重落后。
DeepSeek 仅在一个领域保持优势,而且这个领域很能说明问题:查询与配置语言,78 对 70。SQL 构建器、窗口函数、键集分页、配置解析器。结构化、模式化、遵循惯例的工作是廉价模型真正具有竞争力甚至领先的地方。凡是任务要求在整个系统中保持硬不变量的地方,Luna 的能力就会拉开差距。

DeepSeek-V4 Flash 与 GPT-5.6 Luna 按编程语言对比
Luna 赢得了全部五种语言,但差距告诉你使用 DeepSeek 时需谨慎的地方。它在 Rust(55 对 60)和 Go(62 对 79)上表现尚可,但其 JavaScript 是崩溃性的:35 对 Luna 的 60,是整个对比中最弱的单个单元格,存在 25 分的差距。DeepSeek 的 Python 也较弱(49 对 65)。如果你的技术栈以 JS 为主,廉价模型是虚假的经济;如果是配置、查询或 Rust,DeepSeek 则能缩小大部分差距。

DeepSeek-V4 Flash 与 GPT-5.6 Luna 有多相似?
比廉价层级配对更不相似。每任务相关性为 0.50,且多样性是不平衡的:它们共同解决了 87 个任务,Luna 单独解决 15 个,而 DeepSeek 单独解决仅 4 个。关键在于,没有 DeepSeek 横扫而 Luna 完全未命中的任务(DeepSeek 没有零个四对零的角落),而 Luna 横扫了四个 DeepSeek 从未命中的任务(go-critic-doc-link-checker、langchain-request-coalescing、meriyah-explicit-resource-declarations、superjson-error-stack-serialization)。它们的并集覆盖了 113 个中的 106 个(93.8%),但几乎全部是 Luna 自身的覆盖范围。作为纯粹的多样性策略,DeepSeek 贡献甚微。

组合策略:为什么级联仍然有效
因此,这种配对似乎毫无意义。但事实并非如此,原因在于价格。先运行 DeepSeek,仅当你的测试套件拒绝答案时才升级到 Luna:以每任务 0.385 美元的成本解决了 78.9% 的任务。请仔细阅读这一点。它比单独使用 Luna 更准确(67.2%,提升 11.7 个百分点),且比单独使用 Luna 更便宜(0.61 美元),成本约为 Luna 每任务成本的 63%。
近乎免费的第一阶段是整个技巧的关键:DeepSeek 以每任务一毛钱的价格清除了约53%的队列,因此 Luna 的费用只触及剩余的硬骨头,而到达 Luna 的任务在此基础上获得了第二次独立尝试。这种级联甚至胜过完美的单次预言机路由器(74.3%),因为两次尝试胜过一次完美选择。无论哪个模型领先,准确率都相同,但 DeepSeek 优先要便宜得多($0.385 对比 $0.64),所以始终用便宜的模型打头阵。
这对组合的上限是93.8%;两者都从未解决的7个任务(包括 gql-incremental-graphql-delivery 和 bandit-structured-nosec-directives)需要更强的第三个模型,而不是更好的路由器。

这意味着什么
就其本身而言,DeepSeek-V4 Flash 0731 是一个中等水平的模型,只有一个真正的领域(查询和配置),失败模式清晰,JavaScript 方面存在灾难性弱点,但价格无与伦比。GPT-5.6 Luna 在各项质量指标上都是更好的工程师:pass@1 高出14个百分点,8个领域中的7个,全部5种语言,速度也更快。你需要为此支付约6倍的价格,还要防范 GPT 家族的回归习惯。每任务 $0.61 的价格对于旗舰模型来说确实便宜,当你关心质量时,它是简单的默认选择。但 DeepSeek 最犀利的用途不是作为 Luna 的替代品,而是作为 Luna 的前端。一个花费一毛钱并清除一半工作的第一阶段,让你以低于旗舰模型本身的价格获得超越旗舰的准确率。当廉价模型如此便宜时,级联不再是妥协,而是榜单上最好的选择。
附录:数据表
常见问题
GPT-5.6 Luna 比 DeepSeek-V4 Flash 更好吗?
在质量上,是的。GPT-5.6 Luna 在 DeepSWE pass@1 上以67.2%对53.3%获胜,在每次尝试次数相同的情况下领先,赢得8个任务领域中的7个和全部5种语言,并且速度更快。DeepSeek-V4 Flash 在价格上获胜,每次部署约便宜6倍,并且在失败时失败得更干净。
DeepSeek-V4 Flash 比 GPT-5.6 Luna 便宜多少?
在我们的运行中,DeepSeek-V4 Flash 每次部署约花费 $0.10,而 GPT-5.6 Luna 为 $0.61,约为其价格的六分之一。按每个解决任务计算,DeepSeek 每 $100 返回532个解决任务,而 Luna 为110个,每美元完成的工作量约为4.8倍。
应该同时使用 DeepSeek-V4 Flash 和 GPT-5.6 Luna 吗?
是的,以级联方式。在我们的运行中,先运行 DeepSeek,仅在测试套件拒绝答案时才升级到 Luna,解决了78.9%的任务,每个任务花费 $0.385:比单独使用 Luna(67.2%)更准确,也比单独使用 Luna($0.61)更便宜。始终用便宜的模型打头阵;无论哪种方式准确率都相同,但 DeepSeek 优先成本更低。
对于编码,DeepSeek-V4 Flash 和 GPT-5.6 Luna 哪个更好?
在我们的细分中,Luna 在每种语言上都获胜,但差距各不相同。DeepSeek 在 Rust 上表现不错,在查询和配置工作上具有竞争力,实际上在那里领先。它的 JavaScript 是这场对决中最弱的环节(35对60),因此重度依赖 JS 的技术栈不应仅依赖廉价模型。
DeepSWE 上的 pass@k 是什么?
pass@k 衡量一个任务的 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励第一次尝试就做对;更高的 k 奖励模型在多次尝试中最终能达成解决方案的能力。DeepSeek 的 pass@2(70.1%)已经略高于 Luna 的 pass@1(67.2%),这正是并行尝试和级联经济性可行的原因。
