返回 文章 apply CMS 文章

GLM-5.3 vs GPT-5.6 Sol:成本、编码与路由的深度对比

在 DeepSWE 上,GLM-5.3 与 GPT-5.6 Sol 各有优势,但级联使用两者能以更低成本获得更高解决率。

GLM-5.3GPT-5.6 SolDeepSWE模型对比
成长分 / 100 82 综合收获、行动、留存与影响

GLM-5.3 vs GPT-5.6 Sol:成本、编码与路由的深度对比
为什么值得读了解两个模型在真实编码基准上的详细性能对比,包括 pass@k、成本、延迟和失败模式。

学习如何通过模型路由和级联策略优化成本与效果,而非单纯选择单一模型。

关键洞察
  1. Sol 在 pass@1 上领先 3.7 个百分点(72.7% vs 69.0%),但 GLM-5.3 在 pass@4 上反超(87.6% vs 85.8%)。
  2. GLM-5.3 每次运行成本 3.99 美元,仅为 Sol(8.37 美元)的一半,每 100 美元解决 17 个任务 vs 9 个。
  3. Sol 更快更稳定(19 分钟/61 步 vs 35 分钟/124 步),但 GLM-5.3 失败时更少破坏现有测试(11% vs 20%)。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10888

关键要点

不要只选一个。先运行 GLM-5.3,测试失败时升级到 GPT-5.6 Sol。该级联方案以每次 6.61 美元的成本解决了 85.9% 的 DeepSWE 任务。单独使用 Sol 以 8.37 美元的成本解决了 72.7%。高出 13 个百分点,便宜 21%。

  • Sol 在单次尝试中险胜。pass@1 为 72.7%,而 GLM-5.3 为 69.0%,差距 3.7 个百分点,在几个标准差之内。
  • GLM-5.3 在之后的每次重试中均胜出。在 pass@2 上与 Sol 持平(81.1% 对 81.0%),并在 pass@4 上领先(87.6% 对 85.8%)。
  • 价格差距为 2.1 倍。每次运行 3.99 美元对 8.37 美元。每花费 100 美元,GLM-5.3 解决 17 个任务,而 Sol 解决 9 个。
  • Sol 更快更稳定:每次运行 19 分钟和 61 步,而 GLM 为 35 分钟和 124 步,四次全对的任务数为 61 对 48。
  • GLM-5.3 的失败更干净。在 11% 的失败中破坏了已通过的测试,而 Sol 为 20%。在回归问题上对 Sol 的差异进行门控。
  • 两者存在分歧(每任务相关性 0.43),共同覆盖了 113 个任务中的 106 个,这正是级联方案有效的原因。

我们在所有 113 个 DeepSWE 任务上运行了 GLM-5.3 (最大)与 GPT-5.6 Sol(最大)的对比,每个任务四次试验,基于已发布的每次试验记录:总共 904 次运行,每侧 452 次。Sol 是精度旗舰。GLM-5.3 是缩小差距的开放权重挑战者。以下所有数据均来自本次运行,因此可能与其他公开的 GLM-5.3 与 GPT-5.6 Sol 对比结果不同。

GPT-5.6 Sol 在 DeepSWE 上仍保持单次尝试的领先地位,该基准测试跨多种任务类型和编程语言测试模型的软件工程能力。GLM-5.3 以不到 4 个百分点的差距紧随其后,价格减半,并且一旦允许多次尝试便反超。这是开放层级最接近前沿的一次,值得回答的问题是 Sol 的剩余溢价究竟买到了什么。

DeepSWE 记分牌:pass@1 和 pass@k

单次尝试,Sol 略微领先:在 DeepSWE 官方评分下,pass@1 为 72.7%,而 GLM-5.3 为 69.0%。允许重试后,顺序反转。两次尝试时,GLM-5.3(81.1%)已与 Sol(81.0%)持平;四次时,GLM-5.3 的 pass@4 为 87.6%,领先于 85.8%。开放模型覆盖面更广,因此在任何 best-of-k 设置中,它是更准确的选择,并且其额外尝试的成本仅为 Sol 的一半。

成本对比:GLM-5.3 与 GPT-5.6 Sol 定价

每次运行 3.99 美元,GLM-5.3 比 Sol(8.37 美元)便宜 2.1 倍,按价值计算,每 100 美元解决 17 个任务,而 Sol 为 9 个。Sol 在延迟方面买回了这一溢价:平均 19 分钟和 61 步,而 GLM 为 35 分钟和 124 步,输出 token 为 60k,GLM 为 80k。这种权衡异常清晰。Sol 是更快、更简洁的工人;GLM-5.3 是成本更低但走长路的选择。如果有人等待,Sol 仅凭延迟就值得溢价。如果预算或批处理队列在等待,GLM-5.3 是更好的选择。

覆盖范围与可靠性:精度与广度

将 pass@1 和 pass@4 分解为覆盖率(在四次尝试中至少解决一次的任务)和可靠性(在全部四次中都解决的任务),这种分解是清晰的。Sol 是精确性的代表:可靠性为 84.5%,有 61 个任务四次全部解决,这是模型“出手必中”的标志。GLM-5.3 则偏向另一个维度:覆盖率更广,为 87.6% 对比 85.8%,但可靠性较低,为 78.8%,且完全解决的任务更少,为 48 个对比 61 个。覆盖率的优势与其 pass@4 领先是同一事实。GLM-5.3 触及了基准测试中更多的任务,但每次尝试的转化率略低。

失败模式:每个模型如何出错

失败特征差异显著,这种差异有利于开源模型。Sol 在 20% 的失败中破坏了仓库现有的测试套件,这是 GPT 家族回归的典型特征。GLM-5.3 的这一比例为 11%;当它出错时,通常是向前出错,即基线完好时的接近命中,其接近命中率为 61%,而 Sol 为 54%。因此,成本更低的模型在无需严格回归门控的情况下接受起来也更安全。在采用 Sol 的差异之前,请对其运行完整的回归测试。GLM-5.3 则不太需要这种防护措施。

按任务类型划分,各自胜出的领域

领域分布均匀,各占四个。Sol 在数据建模与序列化(92%)、构建与运维工具(73%)、并发与持久性(72%)以及协议符合性(59%)方面胜出,这些是精确契约、系统密集型工作。GLM-5.3 在查询与配置语言(88%,整个榜单中最高单项)、语言与运行时内部机制(83%)、状态响应式(73%)以及程序分析(64 对 64 平局,但按数量占优)方面胜出。这些是结构化、解释器风格的工作。GLM-5.3 的一个明显弱点是协议符合性,仅为 44%,落后 Sol 15 个百分点。Sol 没有明显的弱项领域,它在各方面都很强。这里的任务类型由 LLM 根据每个基准提示进行分类。

GLM-5.3 与 GPT-5.6 Sol 按编程语言对比

GLM-5.3 的突出表现是 JavaScript,达到 90%,领先 Sol 的 75% 15 个百分点,也是榜单上所有模型中最好的 JS 成绩。它还在 Rust 上胜出,70 对 60。Sol 则在 Python(74 对 66)、Go(79 对 76)和 TypeScript(66 对 61)上回应。路由规则很简单:JavaScript 和 Rust 交给 GLM-5.3,其余交给 Sol,而 GLM-5.3 在几乎所有地方都是成本更低且接近第二的选择。

GLM-5.3 与 GPT-5.6 Sol 有多大差异?

差异大到足以进行路由。任务级相关性为 0.43,对于两个在总体上如此接近的模型来说,这是真正的分歧。它们都解决了 90 个任务;GLM-5.3 单独解决 9 个,Sol 单独解决 7 个,还有 7 个两者都未解决。它们的并集覆盖了 113 个任务中的 106 个(93.8%),而困难的分歧是单向的:GLM-5.3 有两个任务四次全部解决而 Sol 从未成功(koota-pair-relation-tracking、participle-grammar-conflict-analysis),而 Sol 没有在 GLM-5.3 为零的任务上实现全胜。开源模型触及了旗舰模型未能达到的地方。

在它们之间路由:组合策略

这种分歧加上价格,使得级联成为榜单上最好的方案。先运行 GLM-5.3,只有当你的测试套件拒绝答案时才升级到 Sol:85.9% 的解决率,每个任务成本 6.61 美元。这比单独使用 Sol(72.7%)高出 13 个百分点,并且仍然比一次 Sol 展开(8.37 美元)便宜,因为开放模型以 Sol 一半的价格清除了大部分队列,而困难的剩余部分则获得第二次独立尝试。级联还击败了完美的一次性预言机路由器(83.8%),因为两次独立尝试胜过一次完美选择。无论哪个模型领先,预期准确率相同,但 GLM 优先更便宜(6.61 美元对 9.47 美元),因此应以成本较低的模型为先。

这意味着什么

GPT-5.6 Sol 保持了单次尝试的桂冠及其附带的一切:最高的首次尝试率、最高的可靠性,以及迄今为止最快和最简洁的运行。你为此支付大约两倍的价格,并且必须为其 20% 的回归率设置护栏。GLM-5.3 是性价比之选和 best-of-k 选择:首次尝试仅差 4 个百分点,在 pass@2、pass@4 和覆盖率上领先,价格减半,失败特征更干净,并且是榜单上最好的 JavaScript 模型。它相对于 Sol 的真正弱点是协议符合性和原始速度。由于两者确实存在分歧,最锐利的部署不是单独使用任何一个,而是将 GLM-5.3 作为低成本前端,Sol 作为验证器门控的升级,以低于旗舰自身每任务价格的价格实现超越旗舰的覆盖率。

常见问题

GLM-5.3 比 GPT-5.6 Sol 更好吗?

这取决于指标。GPT-5.6 Sol 在 DeepSWE 上的单次尝试质量胜出(pass@1 72.7% 对 69.0%),四次尝试全部解决的任务更多(61 对 48),并且每次展开的速度大约快两倍。GLM-5.3 在 pass@2 上持平,在 pass@4 上胜出(87.6% 对 85.8%),每次展开成本减半,因此对于高容量或可容忍重试的代理工作,它是更强的价值选择。

GLM-5.3 比 GPT-5.6 Sol 便宜多少?

在我们的运行中,GLM-5.3 每次展开成本为 3.99 美元,而 GPT-5.6 Sol 在最大努力下为 8.37 美元,大约低 2.1 倍。按每个已解决任务计算,GLM-5.3 每 100 美元返回 17 个解决任务,而 Sol 为 9 个,每美元解决的工作量大约翻倍。

对于编码,GLM-5.3 和 GPT-5.6 Sol 哪个更好?

它们平分秋色。GLM-5.3 在 JavaScript(90 对 75)和 Rust(70 对 60)上胜出;Sol 在 Python(74 对 66)、Go(79 对 76)和 TypeScript(66 对 61)上胜出。按任务领域,各赢四场:Sol 在精确契约和系统工作上领先,GLM-5.3 在查询和配置语言、运行时内部以及有状态响应性上领先。

我应该在 GLM-5.3 和 GPT-5.6 Sol 之间路由吗?

是的,如果你能验证结果。两者存在分歧(相关性 0.43)并且失败方式不同,因此先运行 GLM-5.3,当你的测试套件拒绝输出时升级到 Sol,可以达到 85.9% 的解决率,每个任务成本 6.61 美元,击败单独使用 Sol(72.7%,8.37 美元)和完美的一次性预言机路由器(83.8%)。两者合计覆盖 113 个任务中的 106 个。

DeepSWE 上的 pass@k 是什么?

pass@k 衡量一个任务的 k 次尝试中是否至少有一次通过隐藏测试套件。pass@1 奖励首次尝试就做对;更高的 k 奖励模型在多次尝试中最终能达成解决方案。GLM-5.3 的优势随着 k 的增加而增长。

方法和注意事项

  • 数据:DeepSWE v1.1 导出,113 个任务,每个配置 4 次试验,均在最大努力下,来自已发布的逐试验记录。每侧 452 次试验。
  • 评分:标题通过率使用 DeepSWE 的官方评分(included_in_score,基础设施错误除外)。GLM-5.3 有 1 个基础设施错误和 Sol 2,因此官方评分和严格评分几乎一致。pass@2、pass@4、覆盖率、并集和相关性使用每个任务的通过次数。
  • 成本是索引中发布的每次试验 cost_usd。分析时,GLM-5.3 批次的逐轮轨迹 JSON 不在公共 CDN 上,因此此分析是索引级别的。
  • 失败剖析使用已发布的每个测试的比例。接近成功是指基线完好时至少 80% 的新测试通过;回归意味着基线测试失败。领域使用基于工件的任务分类法。
  • 级联假设验证者根据任务决定升级和独立性。预期准确率在顺序上是对称的,但成本不是,因此以较低成本的模型为先。预言机路由器是每个任务的最佳单次选择,是任何单次路由器的上限。