摘要
我们很高兴推出预置吞吐量(Provisioned Throughput),这是一种为前沿开放模型预留的推理容量,采用基于令牌的定价,并提供 99% 正常运行时间的 SLA。
开放权重模型已成为任何希望实现丰富 AI 未来的公司不可或缺的要素。但历史上,使用开放权重模型的公司必须在便捷但尽力而为的无服务器推理与强大但可调优的专用推理之间做出选择。预置吞吐量是一种新的推理形式,它提供了另一种选择:以令牌价格提供预优化模型的简洁性,同时具备有可用性 SLA 保证的容量可预测性。成本比 Claude Opus 4.8 标价低 90%。
即日起适用于 MiniMax M3 和 GLM-5.2,覆盖北美、EMEA 及其他地区,最低期限一个月。
推理支出已成为董事会关注的项目。
在不久的将来,每位知识工作者都将拥有多个代理为其工作,但公司正努力在不产生天文数字般的推理预算的情况下实现这一目标。要成功,公司需要消费一系列跨越帕累托前沿的模型,将任务难度与模型质量(和成本)相匹配。开放权重模型占据了该前沿越来越大的部分。
随着公司转向多模型、多框架设置,开放模型正为越来越多的日常代理提供动力,用于编码、财务、营销和工作流自动化。
已切换的公司报告称,与专有替代方案相比,开放模型的推理成本降低了 6-20 倍。我们从自己的数据中看到了这一转变:在九个月内,通过 Together AI API 的令牌量从每月 300 亿增长到超过 400 万亿。其中很大一部分流量是以前在封闭 API 上运行的工作负载。
缺失的是什么:你可以信赖的令牌容量
丰富 AI 需要的不仅仅是帕累托前沿上的开放模型。丰富 AI 还需要安心:承诺的容量、可预测(且可影响)的定价,以及客户可以依赖的 SLA。到目前为止,开放模型市场提供了两种选择,但都不符合这种形态。无服务器推理基本上是尽力而为:适合开发,但对生产工作负载不可预测。专用推理(即专用 GPU)提供保证和对服务环境的完全控制,但许多团队不想管理完全可配置推理平台的复杂性。他们想要一个简单 API 背后可靠的模型提供商,而不是 GPU 小时计算、容量规划和需要配置的服务栈。
团队真正想要的是简单的:与他们已经拥有的封闭模型提供商相同的基于令牌的容量协议,但面向前沿开放模型。这就是我们构建的产品。
介绍预置吞吐量
Together AI 的无服务器推理是“按使用付费”,带有尽力而为的 SLA,而预置吞吐量是“为有保证的容量付费”,带有正常运行时间 SLA。
您购买预置吞吐量单元(PTU)。每个 PTU 是一个固定的容量切片:为您运行的模型提供每分钟保证的令牌速率,专属于您,价格为每分钟每个 PTU 0.05 美元。预置吞吐量可应对您流量的变化;输入令牌、缓存输入令牌和输出令牌以不同方式消耗 PTU,使您能够针对流量模式优化支出。无需 GPU 小时计算,也无需管理基础设施。预置吞吐量、专用推理和无服务器推理的推理 API 完全相同。
预置吞吐量目前可用于 MiniMax M3 和 GLM-5.2,更多模型即将推出。我们在北美、EMEA 及其他地区均有可用容量,最低期限为一个月,更高承诺级别可享受折扣。
“我们的模型专为要求严苛的生产工作负载而构建,Together AI 的预置吞吐量为团队提供了一种以这些工作负载所需的可靠性运行模型的方式。随着团队将流量从封闭 API 转移,Together AI 的基础设施使他们能够大规模采用 M3,并做出可赖以建立业务的承诺。这正是我们希望为模型提供的访问方式。”
— Linda Sheng,MiniMax 全球业务总裁
经济性
一个 PTU 涵盖三种类型的流量:输入令牌、缓存输入令牌和输出令牌,每种流量以不同速率消耗您的容量。在 MiniMax M3 上,一个 PTU 每分钟可提供 138,840 个输入令牌、694,200 个缓存输入令牌、23,140 个输出令牌,或三者的任意组合。

实际工作负载具有不同形态。输出密集型流量比缓存高效流量消耗容量更快,但流量形态不会改变 SLA。它只会改变您消耗容量的速度。
在完全利用率下,MiniMax M3 上的一个 PTU 大约相当于每百万输入令牌 0.36 美元,每百万输出令牌 2.16 美元,而 Claude Opus 4.8 的标价分别为 5 美元和 25 美元。在三个代表性生产配置文件中:

这些是估算值。实际 PTU 使用量将根据您的流量形态而变化。在定价计算器中自行计算
适用场景
无服务器推理是在开放模型上开始构建的最快方式。预置吞吐量适用于需要保证的标准开放模型的生产工作负载。如果您需要微调或自定义模型,并对服务环境进行深度控制,专用推理是合适的选择。
如果您正在专有 API 上运行生产流量,而前沿开放模型可以处理这些流量,那么迁移路径现已完整:前沿质量的模型、可规划的基于令牌的定价、客户可以依赖的可靠性保证,成本降低高达 90%。
