摘要
GPT-5.6 Sol 在单次生成质量上略胜 Kimi K3,但 Kimi 在 k > 1 的 pass@k 指标上胜出,且每完成任务的成本低 64%。两个模型成功和失败的方式不同,因此在它们之间进行路由选择是该基准测试中最强的策略。
- Kimi K3 与 GPT-5.6 Sol 在 DeepSWE pass@1 上差距很小:Sol 以 72.7% 领先 68.5%,差距 4.2 个百分点。
- 给模型更多尝试次数,Kimi K3 会反超。它在 pass@2(82.0 对 81.0)和 pass@4(89.4% 对 85.8%)上胜出。
- Kimi K3 便宜得多:每次运行 4.65 美元对 8.37 美元,每美元解决的任务数多 2.8 倍。
- GPT-5.6 Sol 是更可靠的模型:它在全部 4/4 次尝试中解决的任务更多(61 对 45)。
- 两个模型存在分歧(它们正确和错误解决的任务之间相关性为 0.46),且失败方式不同,因此先使用 Kimi 再升级到 Sol 的级联策略覆盖了 113 个任务中的 108 个,达到约 85.6%。
在我们对 Kimi K3 与 GPT-5.6 Sol 在 DeepSWE 上的比较中(该基准测试评估模型在多种任务类型和编程语言上的软件工程能力),关键不在于谁位居排行榜榜首。GPT-5.6 Sol 两周前以 DeepSWE 官方评分下的 72.7% 夺得 pass@1 桂冠,这是该基准测试有史以来最强的单次生成和最高可靠性。开源新秀 Kimi K3 则在另一个维度上作答:pass@4 达到 89.4%,优于包括 Sol 在内的所有旗舰模型,而每次运行成本为 4.65 美元,Sol 为 8.37 美元。我们分析了 deepswe.datacurve.ai 上公布的每次试验记录中所有 904 次分级运行(113 个任务,每个任务四次试验,双方均以最大努力进行)。
DeepSWE 记分板:pass@1 和 pass@k
在单次尝试下,Sol 明显胜出:DeepSWE 官方评分下为 72.7% 对 68.5%。但差距迅速缩小。两次尝试时 Kimi K3 已经领先,82.0 对 81.0。四次尝试时,Kimi 的 89.4% 以 3.6 个百分点击败 Sol 的 85.8%,是排行榜上所有旗舰配置中最佳的 pass@4。

成本比较:Kimi K3 与 GPT-5.6 Sol 定价
- Kimi K3:每次运行 4.65 美元。GPT-5.6 Sol:8.37 美元。
- 每解决一个任务,Kimi 每 100 美元可解决 14.7 个任务,而 Sol 为 5.3 个,每美元工作量约为 2.8 倍。
- 权衡在于速度和步骤:Sol 的中位运行时间为 17 分钟,而 Kimi 为 66 分钟(使用 Moonshot 截至 7 月 25 日的 Kimi K3 API),Sol 使用的步骤数大约少 40%。随着推理提供商优化 Kimi K3,端到端延迟应会改善,尽管额外的步骤是模型行为特征。

Kimi K3 与 GPT-5.6 Sol 按编程语言对比
两者在 Go 上持平(均为 79)。Sol 在 Python(74-68)、TypeScript(66-60)和 JavaScript(75-65)上领先。Kimi K3 在 Rust(65-60)上胜出。

覆盖率与可靠性:平面的两个对角
将 pass@1 和 pass@4 分解为覆盖率(四次尝试中至少解决一次的任务)和可靠性(全部四次都解决的任务),两个模型位于对角。Sol 的可靠性为 84.5%,有 61 个任务四次全对,覆盖基准测试的 85.8%。Kimi K3 的覆盖率达到 89.4%,比任何旗舰模型都广,但可靠性仅为 76.6%,有 45 个稳固任务。Sol 更稳定、更确定;Kimi K3 撒网更广。

Kimi K3 与 GPT-5.6 Sol 有何不同?
如果说 Kimi K3 与 Fable 的比较基本是回音室效应(相关性 0.72),那么 Kimi K3 与 Sol 则存在分歧:每项任务的相关性为 0.46,双方各有四次全胜对四次全败的极端情况。这两个模型以真正不同的方式成功和失败。这正是它们成为路由和级联强组合的原因:两者共同覆盖了 113 项任务中的 108 项(95.6%),是该基准测试中最佳的双模型组合。

在它们之间路由能带来多高的性能?
由于两者在 113 项任务中有 18 项意见不一致,路由将这种分歧转化为免费的准确性。你能获得多少提升取决于你是否有一个验证器(你的测试套件)来捕获错误答案并升级处理。
实际答案约为 85.6%:先运行 Kimi K3,仅当测试套件拒绝结果时才升级到 Sol。这优于单独使用任一模型,甚至优于完美的一次性路由器(83.4%),因为级联给困难任务提供了两次独立尝试,而不是只依赖一次。而且每次求解的成本低于单独使用 Sol,因为在调用 Sol 之前,Kimi K3 大约清除了 70% 的队列。验证器承担了繁重的工作:如果没有验证器,一个实际的路由器性能会落在 70% 左右,83.4% 是上限。
这对组合的硬上限是 95.6%。113 项任务中有 5 项在全部八次组合尝试中均未被任一模型解决。超过 95.6% 你需要第三个模型,而不是更好的路由器。

按任务类型划分,各自胜出的领域
要良好路由,需根据编码任务的实际类型进行分类。Sol 在 8 个领域中的 5 个领先,Kimi K3 在 3 个领域领先。将序列化(92-79)、并发(72-55)和程序分析(64-56)交给 Sol。将运维工具(79-73)和运行时内部(77-75)交给 Kimi K3。一致性是 61-59 的抛硬币结果。这里的任务类型由 LLM 根据每个基准测试提示进行分类。

失败模式
它们以非常不同的方式失败——Kimi K3 接近通过但未通过所有测试,而 Sol 破坏了更多基线测试。Sol 在 20% 的失败中破坏了仓库的现有测试——这实际上与其他 GPT 模型相当一致。Kimi K3:11% 的基线测试失败,但 65% 是接近成功,其中超过 80% 的新测试通过但部分失败!

在 Together AI 上运行 Kimi K3
Kimi K3 以开放权重模型的形式发布,这使得 pass@4 可达、低成本以及上述路由故事能够按你自己的方式使用。一旦权重可用,Together AI 的推理栈旨在以生产规模服务像 Kimi K3 这样的开放模型,因此你可以运行 Kimi 优先的级联,并追求更广泛的 pass@k 网络,而无需前沿代币价格。
参见 Together AI 推理定价 以根据你的工作负载进行规模评估。
Kimi K3 vs GPT-5.6 Sol 常见问题
Kimi K3 比 GPT-5.6 Sol 更好吗?
这取决于具体指标。GPT-5.6 Sol 在 DeepSWE 上的单次尝试质量(pass@1 72.7% 对 68.5%)更优,并且能一次性解决更多任务。Kimi K3 在 pass@2 和 pass@4 上胜出,且成本远低于对手,因此对于高吞吐量或可容忍重试的智能体工作而言,它是更具性价比的选择。对大多数团队来说,最佳方案是在两者之间进行路由。
Kimi K3 比 GPT-5.6 Sol 便宜多少?
在我们的运行中,Kimi K3 每次部署成本为 4.65 美元,而 GPT-5.6 Sol 为 8.37 美元,价格略高于后者的一半。按每解决一个任务计算,Kimi K3 每 100 美元可解决 14.7 个任务,而 Sol 为 5.3 个,即每美元完成的工作量约为后者的 2.8 倍。
我是否应该在 Kimi K3 和 GPT-5.6 Sol 之间进行路由?
是的,如果你能验证结果的话。这两个模型存在差异(相关性为 0.46),且失败模式不同,因此先运行 Kimi,当你的测试套件拒绝输出时再升级到 Sol,可达到约 85.6% 的成功率,超过单独使用任一模型,甚至优于完美的单次路由。两者结合可覆盖 113 个任务中的 108 个。
对于编程,Kimi K3 和 GPT-5.6 Sol 哪个更好?
在编程方面,两者接近。它们在 Go 语言上持平;Sol 在 Python、TypeScript 和 JavaScript 上领先;Kimi 在 Rust 上占优。Sol 在单次尝试上更稳定,而 Kimi 在多次尝试中覆盖范围更广。
DeepSWE 上的 pass@k 是什么?
pass@k 衡量的是在某个任务的 k 次尝试中,至少有一次通过隐藏测试套件的概率。pass@1 奖励首次尝试即成功;更高的 k 值则奖励那些经过多次尝试最终能达成解决方案的模型。随着 k 的增加,Kimi K3 的优势逐渐扩大。
