返回 文章 学习 CMS 文章

Vercel AI Gateway 9月指数:开放权重模型首次占据token量多数,Astra发布两天拿下OpenAI支出三分之一

Vercel AI Gateway 9月指数揭示:开放权重模型首次占据token量多数,前沿模型支出格局因价格与能力匹配而重塑。

AI Gateway开放权重模型token成本模型支出
成长分 / 100 68 综合收获、行动、留存与影响

Vercel AI Gateway 9月指数:开放权重模型首次占据token量多数,Astra发布两天拿下OpenAI支出三分之一
为什么值得读了解开放权重模型在真实生产流量中首次占据token量多数的里程碑,以及其对成本结构的实际影响。

洞察前沿模型支出份额的快速转移,例如Fable 5到Opus 5的降级迁移,以及Astra发布初期的强劲表现。

关键洞察
  1. 开放权重模型在8月运行了AI Gateway上所有token的56%,首次占据流量多数,而2025年12月这一比例不到十分之一。
  2. 8月网关平均每token价格下降23.2%,为连续第三个月下降;中位数团队每token支付减少7.6%。
  3. Fable 5在网关支出中的份额从7月的13.2%降至8月的4.9%,而Opus 5份额升至22.5%,Anthropic仍保留全部支出的64%。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:8410

AI Gateway 生产指数 — 2026 年 9 月

每个月,AI Gateway 在生产应用与 AI 实验室之间路由数十万亿个 token。这些流量让我们得以一窥当今企业中 AI 使用的真实面貌,我们每月在此发布。请参阅 6 月7 月8 月 的生产指数报告。

复制标题链接2026 年 9 月摘要

9 月指数报告的是截至 2026 年 8 月收集的 AI Gateway 数据。

开放权重模型首次承担了网关 token 的大多数,从 12 月的 7% 上升到 8 月的 56%。平均 token 成本不到五个月前的一半。8 月每 token 价格下降 23.2%,为连续第三个月下降,中位数团队支付减少了 7.6%。Fable 5,Anthropic 能力最强的模型,在一个月内失去了其网关支出份额的三分之二。价格减半的 Opus 5 份额增长了两倍。Anthropic 保留了全部支出的 64%。Gemini 3 Flash 自 5 月以来失去了其网关 token 份额的 95%,其失去的流量中超过四分之三流向了其他实验室的模型。

特别报告:OpenAI 发布 Astra,9 月 3 日

GPT-6 Astra 在发布后两天内占据了 OpenAI 支出的三分之一,其网关支出份额是 Fable 5.1 的两倍。两者相隔两天以相同价格推出,Astra 在头十二天内占据了全部网关支出的 7.7%,而 Fable 5.1 为 3.7%。

复制标题链接开放权重模型首次占据 token 量的大多数

8 月,开放权重模型运行了 AI Gateway 上所有 token 的 56%,这是它们首次占据流量的大多数。

2025 年 12 月,它们处理的 token 不到十分之一,仅八个月后,它们运行的 token 量就超过了所有闭源权重模型的总和。

尽管前沿模型仍占据支出的大多数,开放权重的美元份额正在加速增长。随着开放权重模型能力增强,客户正在将更多生产工作负载转移到它们上面。

开放权重模型采用率的增长帮助推动了 8 月网关平均每 token 价格下降 23.2%,这是连续第三个月下降,也是自 4 月以来最陡峭的降幅。在两个月内运行超过一千万 token 的团队中,中位数团队每 token 支付减少了 7.6%,是 7 月 2.9% 降幅的两倍多。

团队现在可以用相同的预算获得更多推理,并仅将前沿模型保留给那些值得支付溢价的任​​务。

复制标题链接前沿模型趋于平稳,Fable 支出流向 Opus 5

值得使用前沿模型的生产工作负载并不总是需要最昂贵的那个。它们需要一个足够好的。

Fable 是 Anthropic 出售的最强大的模型。Opus 是低一档的层级,每 token 价格约为 Fable 的一半。当美国对 Fable 5 的出口管制解除、其访问权限于 7 月 1 日恢复后,其在网关支出中的份额飙升至 13.2%。同月月底,Opus 5 上线。

8 月,Fable 5 在网关支出中的份额降至 4.9%,而 Opus 5 的份额升至 22.5%。使用 Fable 的团队中,每十个就有九个削减了用量,其中更多团队将工作负载迁移到 Opus 5,而非其他任何模型。Fable 的额外能力不值双倍的价格。

团队离开了 Fable——Anthropic 最昂贵、最强大的模型,但该实验室仍保住了网关支出中的最大份额,因为这些工作负载降级到了 Opus 5,而非其他实验室。

自 12 月以来,Anthropic 每月都拿下了通过 AI Gateway 支出的每一美元中的至少 61 美分,8 月为 64 美分。自 12 月以来,其模型每月都占据支出排名的前两位,即便占据这些位置的模型发生了变化。

复制标题链接客户忠诚度追随的是模型画像,而非实验室

实验室忠诚度追随的不是品牌,而是模型画像,而一致性是制胜关键。

当新模型保留了用户在前代模型中所看重的特性时,实验室就能留住客户。当它做不到时,这些客户就会通过其他提供商来满足需求。

当 Claude Opus 5 发布时,它获得的份额几乎是 Fable 失去的两倍,因为它以一半的价格处理相同的工作负载。而在 Z.ai 发布 GLM-5.3-Flash 后的五天内,其日处理量就达到了 GLM-5.2 的三倍。

Google 难以用其新模型留住客户。由于新推出的产品在能力或价格上没有提供相对优势,Gemini 3 Flash 的大部分工作负载流向了 OpenAI、Anthropic 和 DeepSeek。

离开 Gemini 3 Flash 的用量中,约有一半流向了更便宜的模型,以 GPT-5.6 Luna 为首,其每 token 价格不到前者的一半。另一半中的大部分流向了价格更高的模型,以 Claude Opus 5 和 Sonnet 5 为首,其价格分别约为 Gemini 3 Flash 的九倍和三倍。

这种向更契合模型的外流意味着,在同一时期,Google 在网关 token 量中的份额从 30% 降至 5%,其中 Gemini 3 Flash 占了所失去的 25 个百分点中的 22 个。

复制标题链接特别报道:Astra 在 48 小时内拿下 OpenAI 支出的三分之一,发布时使用量以二比一超过 Fable 5.1

GPT-6 Astra 于 9 月 3 日在 AI Gateway 上线,价格与 Fable 5.1 相同,是 GPT-5.6 Sol 价格的两倍半。两天后,它占了通过网关在 OpenAI 模型上支出的每三美元中的一美元。此后其支出份额一直保持,徘徊在 28% 至 39% 之间。

在 OpenAI 的模型阵容中,9 月 4 日至 16 日期间,Astra 和 Sol 处理了 OpenAI 27% 的 token,却占了其支出的 71%。Luna 和 Nano 处理的 token 量是其两倍多,而支出仅约为其九分之一。

Anthropic 于 9 月 1 日发布 Fable 5.1,比 Astra 早两天。在各模型上线网关后的前十二天里,Astra 拿下了全部网关支出的 7.7%,是 Fable 5.1 的 3.7% 份额的两倍多,且使用它的团队数量也是后者的两倍。

OpenAI 更便宜的模型承担了其用量,而 Astra 对 Fable 的早期领先表明它也能吸引最高价位区间的团队。两者结合,让 OpenAI 能够在规模和高价支出两方面与其他前沿实验室竞争。

敬请期待下个月报告中的更多内容。

复制标题链接八月数据中的其他内容

Google 的 Nano Banana 首次在图像支出上领先,占比 50%,而 GPT Image 为 44%,尽管 GPT Image 在生成图像数量上重新夺回领先,占比 46% 对 39%。Google 的 Veo 在视频支出上升至第二,占比 20%,高于 7 月的 15%。Seedance 在生成视频数量和视频支出上均保持第一。xAI 的 Grok Imagine 生成的视频份额自 6 月以来已减少一半以上,从 42% 降至 31%,再降至 19%。

复制标题链接此前的 AI Gateway Production Index 报告

复制标题链接关于本报告

本报告使用截至 2026 年 8 月通过 Vercel AI Gateway 路由的匿名化聚合流量。

关于衡量方式的几点说明:

Token 量包括输入、输出、推理、缓存输入和缓存创建 token。

支出使用各实验室公布的标价估算;实际账单可能有所不同。每 token 平均价格是用估算支出除以 token 量得出。

关于用量变动方向的陈述比较的是同一批团队之间的变化。它们并不追踪单个 token 在不同模型之间的流向。

开放权重分类遵循当前的 AI Gateway 模型列表,该列表比早期报告中使用的定义更宽泛。

所有数字均使用可获得的最新数据;随着方法更新,此前月份的数据可能会被修订。