关键要点
GLM-5.3 和 Claude Fable 5 在 DeepSWE 准确率上不分伯仲,但 GLM-5.3 每次任务成本仅为五分之一,并在所有多次尝试指标上胜出。当两个模型质量如此接近时,价格差距就成了决定因素。
- 首次尝试持平。Fable 5 的 pass@1 为 69.7%,GLM-5.3 为 69.0%,差距 0.7 个百分点,在双方的误差范围内。
- GLM-5.3 在重试上占优。它在 pass@2(81.1% 对 77.1%)和 pass@4(87.6% 对 84.1%)上领先,因此上限更高,价格也更低。
- 成本差距为 5.4 倍。每次运行 3.99 美元对 21.63 美元。每花费 100 美元,GLM-5.3 解决 17 个任务,而 Fable 解决 3 个。
- 它们近乎可替代。任务间相关性为 0.65,是本次评测中最高的一致性,因此同时运行两者增加覆盖有限。保留成本较低的模型,仅在 Rust 和序列化工作中升级到 Fable。
在我们对 GLM-5.3 和 Claude Fable 5 在 DeepSWE 上的对比中,该基准测试模型在多种任务类型和编程语言上的软件工程能力,两个模型在质量上几乎无法区分。Fable 5 在 pass@1 上领先 0.7 个百分点,但每次运行成本高出 5.4 倍,是 DeepSWE 榜单上最昂贵的配置。这种组合使得有趣的问题变得狭窄:当准确率相同时,溢价买到了什么?
我们在所有 113 个 DeepSWE 任务上运行了 GLM-5.3(最大)和 Claude Fable 5(最大),每个任务四次尝试,基于公开的每次尝试记录:总共 904 次运行,每个模型 452 次。两者都属于纪律严明、低回归的流派,因此行为非常相似。以下所有数据均来自本次运行,可能与其他公开的 GLM-5.3 与 Claude Fable 5 对比结果不同。

DeepSWE 记分板:pass@1 和 pass@k
单次尝试打成平手。在 DeepSWE 官方评分下,Fable 5 首次尝试解决 69.7% 的任务,GLM-5.3 解决 69.0%,差距在噪声范围内。允许重试后,模型开始分化,且分化有利于 GLM。两次尝试时,GLM-5.3 以 81.1% 对 77.1% 领先;四次尝试时,以 87.6% 对 84.1% 领先。
开源模型以极低的价格匹配了 Fable 的首次尝试准确率,并且在允许重试时拥有更高的上限。在任何尝试次数下,为 Fable 支付 5.4 倍价格都不会带来更多覆盖。

成本对比:GLM-5.3 与 Claude Fable 5 定价
每次运行 3.99 美元,GLM-5.3 比 Fable 的 21.63 美元低 5.4 倍:每 100 美元解决 17 个任务,而 Fable 解决 3 个。Fable 是榜单上最昂贵的配置,而且价格并未带来速度惩罚。GLM-5.3 平均每次运行 35 分钟,Fable 为 34 分钟,大致相当。
令牌概况解释了运行的特征。GLM-5.3 是更简洁的模型(输出 80k 令牌,Fable 为 114k),尽管步骤更多(124 对 85)。Fable 每步写更多,GLM 步骤更多但成本更低。两者都不更快,但只有一个成本为五分之一。

覆盖与可靠性:GLM-5.3 和 Fable 5 的差异
将 pass@1 分解为覆盖率(至少解决一次的任务)和可靠性(这些任务上的通过率),两者落在平面的同一角落附近,GLM 略进一步。GLM-5.3 的覆盖率更高,为 87.6%,而 Fable 为 84.1%。Fable 每次尝试略稳定,可靠性为 82.0%,而 GLM 为 78.8%,并且四次全对的任务更多(56 对 48)。
在实践中,两者都表现得像纪律严明的通才,GLM 以少量单次可靠性换取基准测试中更广泛的覆盖。
失败模式:每个模型如何出错
这是家族相似性最明显的地方。两个模型在仅 11% 的失败中回归现有测试套件,远低于 GPT 家族的 20%,因此两者都可以安全接受,无需严格的回归门控。
差异很小。Fable 承担了更大的大失误份额(18% 对 GLM 的 16%),这意味着当它出错时,更常是严重错误。GLM 更常因接近失误而失败(61% 对 57%)。总的来说,这两个模型以同样纪律严明的方式失败,这正是它们结果高度相关的原因。

按任务类型划分,各自胜出的领域
尽管 pass@1 持平,但领域地图并不相同。GLM-5.3 擅长结构化、解释器风格的工作:查询和配置(88 对 72)、语言和运行时内部(83 对 78)、有状态响应式(73 对 64)、并发和持久性(62 对 45)以及程序分析(64 对 56)。并发结果是 Fable 最弱领域上 17 分的差距。
Fable 在精确契约领域做出回应:数据建模和序列化(88 对 79)、构建和运维(71 对 68)以及协议一致性(55 对 44),后者是 GLM 最弱的领域。GLM 赢得五个领域,Fable 赢得三个,而 Fable 在并发上的 45% 是使其无法完全进入的唯一通道。

GLM-5.3 与 Claude Fable 5 按编程语言对比
Fable 的案例几乎完全依赖于一种语言。其 Rust 为 85%,而 GLM 为 70,相差 15 个百分点,是本次对决中单语言差距最大的。序列化密集型工作是这种优势的自然伴侣。
GLM 以最佳 JavaScript 回应(90 对 75),Go 接近持平(76 对 71),TypeScript 为 61 对 57。Fable 在 Python 上保持优势(70 对 66)。除了 Rust 和序列化密集型工作外,没有一种语言能让 Fable 的 5.4 倍溢价带来有意义的准确性优势。

GLM-5.3 与 Claude Fable 5 有多相似?
这是希望同时运行两者的任何人需要注意的地方。GLM-5.3 与 Fable 之间的每任务相关性为 0.65,是本组中任何配对中最高的。两者都解决了 88 个任务。GLM 单独解决 11 个,Fable 单独解决 7 个,7 个两者都失败,且没有四对零的分歧。
它们的并集覆盖了 113 个任务中的 106 个(93.8%),但由于它们在很大程度上相同的任务上成功和失败,配对它们比与 GPT 家族模型配对增加更少的多样性。它们是近似替代品,当两个模型可替代时,你保留成本较低的那个。

在它们之间路由:组合策略
如果你确实同时运行两者,顺序和经济性仍然倾向于将开放模型作为前端。先运行 GLM-5.3,只有当你的测试套件拒绝答案时才升级到 Fable:81.1% 的解决率,每个任务成本为 10.74 美元。这比单独使用 Fable(69.7%)高出 11 个百分点,而成本仅为 Fable 每个任务价格(21.63 美元)的一半。
鉴于 0.65 的相关性,诚实的建议更简单:对于大多数工作,单独使用 GLM-5.3 几乎能捕获 Fable 能做的所有事情,而成本仅为五分之一,Fable 只值得在其 Rust 和序列化专长上升级使用。

这意味着什么
Fable 5 和 GLM-5.3 在首次尝试准确率上统计持平,而平等就此结束。GLM-5.3 成本低 5.4 倍,在 pass@2、pass@4 和覆盖率上更高,输出更简洁,在回归方面同样严谨,并且在八个领域中赢得五个,还拥有最佳的 JavaScript 表现。
Fable 是这里测量中最昂贵的模型,与 GLM 相比,仅赢得三个领域,外加真正的 Rust 和序列化优势。由于两者在 0.65 的相关性下近乎替代品,同时运行两者的组合收益很小。实际立场是默认使用 GLM-5.3,而 Fable 作为针对 Rust 密集型或序列化关键任务的狭窄、昂贵的升级选项。
常见问题
GLM-5.3 比 Claude Fable 5 更好吗?
在 DeepSWE 上,它们在首次尝试上统计持平:Fable 5 的 pass@1 为 69.7%,GLM-5.3 为 69.0%。此后 GLM-5.3 在每项指标上均胜出,包括 pass@2(81.1% 对 77.1%)、pass@4(87.6% 对 84.1%)和覆盖率,且每次运行成本低 5.4 倍。Fable 在四次尝试中全部解决的任务更多(56 对 48),因此在单次尝试上略稳定。
GLM-5.3 比 Claude Fable 5 便宜多少?
在我们的运行中,GLM-5.3 每次运行成本为 3.99 美元,而 Claude Fable 5 在最大努力下为 21.63 美元,差距为 5.4 倍。按每个解决任务计算,GLM-5.3 每 100 美元解决 17 个任务,而 Fable 为 3 个。
对于编码,GLM-5.3 和 Claude Fable 5 哪个更好?
这取决于语言和任务类型。GLM-5.3 在 JavaScript(90 对 75)、Go(76 对 71)和 TypeScript(61 对 57)上领先,并在八个任务领域中赢得五个,包括并发和持久性,以 62 对 45 领先。Claude Fable 5 在 Rust(85 对 70)、Python(70 对 66)以及精确契约领域领先,其中数据建模和序列化以 88 对 79 领先。
我应该在 GLM-5.3 和 Claude Fable 5 之间路由吗?
仅选择性路由。这两个模型在我们测量的任何配对中具有最高的每任务相关性(0.65),因此它们在很大程度上在相同任务上成功或失败,它们的并集覆盖了 113 个中的 106 个。GLM 优先的级联确实达到 81.1%,每个任务成本为 10.74 美元,远超单独使用 Fable,但对大多数团队来说,更大的收益是直接默认使用 GLM-5.3,并将 Fable 保留用于 Rust 密集型或序列化关键的工作。
GLM-5.3 是开放权重吗?
是的。GLM-5.3 是一个开放权重模型,因此可以自托管或通过推理提供商(如 Together AI)提供服务。Claude Fable 5 是一个封闭模型,只能通过 Anthropic 及其合作伙伴使用。
DeepSWE 上的 pass@k 是什么?
pass@k 衡量一个任务在 k 次尝试中至少有一次通过隐藏测试套件的概率。pass@1 奖励第一次尝试就正确,更高的 k 奖励模型在多次尝试中最终达到解决方案的能力。随着 k 的增加,GLM-5.3 的优势会增长。
方法和注意事项
- 数据:DeepSWE v1.1 导出,113 个任务 × 每个配置 4 次试验,均以最大努力进行,来自已发布的逐试验记录。每侧 452 次试验。
- 评分:标题通过率使用 DeepSWE 的官方评分(included_in_score,基础设施错误除外)。Fable 有 16 个来自模型路由的基础设施错误,因此其严格错误即失败的得分为 67.3,而官方得分为 69.7。GLM-5.3 有 1 个。
- pass@2、pass@4、覆盖率、并集和相关性使用每个任务的通过次数。
- 成本是已发布的每次试验成本(cost_usd)。Fable 的成本与轨迹总成本(total_cost_usd)完全匹配,而 GLM 的成本仅基于索引。分析时,GLM-5.3 批次的逐轮轨迹 JSON 未在公共 CDN 上提供。
- 失败剖析使用已发布的每个测试的失败比例。接近通过意味着在基线完整的情况下,至少 80% 的新测试通过。回归意味着基线测试失败。领域使用基于工件的任务分类法。
- 级联假设验证器根据任务决定升级和独立性。预期准确率在顺序上是对称的,但成本不是,因此应以成本较低的模型为先。鉴于 0.65 的相关性,组合收益有限。预言机路由器是每个任务的最佳单次选择,是任何单次路由器的上限。
