地球上没有哪个首席信息官不担心当前的AI支出。首席财务官们也日益紧张。
由于担心落后,许多公司已推动员工尽可能积极地使用AI。指令很明确:“快速行动,账单我们稍后处理。”在大多数情况下,这确实奏效:AI对于积极投入的团队来说确实具有变革性。
但成本是真实的:我们听过无数关于巨额账单和令牌消耗超支的恐怖故事。
今天,我们宣布在Cloudflare AI Gateway中推出支出控制,以及基于身份驱动的预算和路由的封闭测试版,该功能使用Cloudflare Access和您现有的身份提供商。
在与数百家公司讨论其AI战略时,我们看到了一个常见的故事:公司通过共享API密钥让每位工程师都能访问前沿模型。使用量激增。月底,财务部门拿出账单,却没人能解释钱花在了哪里。是机器学习团队在训练新管道?还是实习生用Claude Opus处理邮件分类?抑或是一个失控的持续集成作业在周末消耗了5000万个令牌?没人知道,因为API密钥无法告知谁使用了它。
没有指导方针,员工通常会选择可用的最大模型。他们为什么不呢?如果没有预算、没有可见性、没有路由逻辑,理性的做法就是为所有任务使用最强大的模型。问题是大多数任务并不需要前沿模型。代码审查摘要不需要与复杂架构重构相同的模型。日志解析器不需要与面向客户的内容生成器相同的模型。应该很容易为任务选择正确的工具,而不是默认使用最强大且最昂贵的工具。并且应该能简单明了地看到支出去向。
没有对支出的可见性,就无法计算AI支出的投资回报率;没有控制措施,就无法保护该投资回报率。企业中的每个其他支出项目都有预算和按团队归属,AI支出也不应例外。
AI Gateway 位于您的应用程序和AI提供商之间。您的请求首先通过AI Gateway路由,而不是直接调用OpenAI、Anthropic、Google或任何其他提供商。
这立即为您提供了几个有用的工具:
然而,AI Gateway之前没有简单的方法来回答谁在花费什么,或者如何设置AI支出的限制。
您可以看到账户的总体使用情况。但您无法看到工程部的Jane本月在Claude上花费了2000美元,而整个数据科学团队只用了400美元。您无法设置预算,比如“工程部每月在前沿模型上花费5000美元,实习生每月在Kimi K2.6上花费200美元。”
今天,这一切都改变了。
支出限制:AI使用的预算
AI Gateway现在支持__支出限制__作为核心功能。这些是真正的成本控制措施,以美元(而非令牌)设定的预算形式,跟踪所有请求的累计支出,独立于传统的速率限制运行。
您可以将限制范围限定为任意维度的组合:模型、提供商或管理员定义的自定义属性(如用户、团队或应用程序)。时间窗口可以是固定的(在每月第一天、周一或午夜重置)或滚动的,并可设置为每日、每周或每月。
AI Gateway 根据模型定价计算每次请求的成本,并实时跟踪累计支出与您的限额。您可以通过分析仪表板轻松跟踪模型支出,并按模型、提供商或任何自定义属性进行筛选。
您可以设置达到预算限额时的处理方式。默认情况下,AI Gateway 会阻止后续请求。或者,您可以通过 动态路由 设置规则,在达到支出限额后将请求路由到备用模型,这样硬性支出上限就不会影响工程师的工作流程。我们正在努力增加在达到限额时发送警报的功能。
支出限额现已面向所有 AI Gateway 用户开放公测,适用于所有套餐。您可以在仪表板的网关设置中或通过 API 进行配置。
我们已经在 Cloudflare 内部跟踪令牌成本。每位 Cloudflare 员工每天都使用 AI 工具,每月通过 AI Gateway 路由数百万个请求和数十亿个令牌。我们面临着每家公司在这种规模下都会遇到的问题:谁在使用什么,以及我们如何为此做预算?
我们通过让 AI Gateway 为每个请求添加身份标识来解决这个问题。当员工通过 Cloudflare Access 进行身份验证时,我们从 JSON Web 令牌 (JWT) 中提取其身份,并将其作为元数据附加到 AI Gateway 请求中。这样,每个用户的令牌消耗、团队级别的使用细分以及整个组织的成本归属都可以在一个地方查看。
基于身份的预算和策略(封闭测试)
除了支出限额,今天我们还将宣布基于身份的预算和策略作为封闭测试。
AI Gateway 中的支出限额允许您按模型、提供商或自定义属性设置预算。但您的应用程序必须传递该元数据,并且 AI Gateway 信任它收到的任何内容。对于经过验证的自动归属,您需要身份标识。
当与 Cloudflare Access 结合使用时,AI Gateway 可以看到谁在发出每个请求——不仅仅是哪个账户,而是哪个员工、哪个身份提供商 (IdP) 组、哪个服务等。
以下是实际应用中的情况。
您可以设置每个用户的预算,例如个人贡献者每月 500 美元,高级工程师每月 2000 美元。当用户达到限额时,请求可以降级到更便宜的模型或被阻止。
您可以设置每个团队的模型策略。例如,您的机器学习团队可以使用 Claude Opus 和 GPT-4o。品牌设计团队可以访问生成式图像和视频模型。实习生使用 Workers AI 上的开源模型。这些策略直接映射到您现有的 IdP 组,即您已经管理的同一身份提供商组。
对于 CI/CD 流水线和自主代理,Access 服务令牌 允许您为每个代理赋予一个命名身份。您可以看到您的代码审查机器人本周使用了 500 万个令牌,而您的文档生成器使用了 50 万个。如果某个代理失控,您可以对其应用预算策略,而不会影响其他代理。
每个 AI Gateway 日志条目都将包含经过身份验证的身份:电子邮件、IdP 组、服务令牌名称。将这些导出到您的分析平台,您就可以获得按用户和团队划分的成本明细,而无需构建任何自定义内容。
在底层,您为 AI Gateway 端点创建一个 Cloudflare Access 应用程序,并根据您的 IdP 组配置策略。当开发人员或代理发出请求时,他们通过 OAuth 进行身份验证,使用典型的 CLI 设备代码流程。AI Gateway 验证令牌并提取身份。您无需编写自定义 Worker、自行解析 JWT,或依赖基于信誉系统的元数据标头。
我们最近撰写了关于 我们如何构建内部 AI 工程栈 的文章。这就是我们今天提供的功能——因此您也可以使用它,而无需自行构建。
如果您希望访问封闭测试版,请 在此注册。
下一步:从成本控制到成本优化
设定预算很有必要。但一旦有了预算,如何充分利用它?
现实情况是,并非每个请求都需要前沿模型:摘要任务可以在更小、更便宜的模型上运行,而不会造成明显的质量损失,而大规模代码重构可能需要最先进的模型。但如果没有控制,人们几乎总是会选择最先进的模型。
接下来将推出一个解决方案:我们正在 AI Gateway 中构建智能的、基于任务的路由。对于每个请求,我们可以分析并自动将其路由到能够以最低成本提供最佳结果的模型。这正在积极开发中,请关注我们的 开发者文档 和 变更日志。
AI Gateway 可以免费开始使用。所有用户现在都可以使用支出限制。
如果您还没有,请 创建一个网关 并将您的应用程序指向它。然后,在仪表板中或通过 API 设置支出限制。在开始强制执行之前,先在监控模式下设置一个高限制,以了解您当前的使用模式。
如果您希望进行按用户归属和基于团队的策略,请 注册 身份驱动预算封闭测试版,我们将为您设置 Access 集成。
我们想听听您目前如何管理 AI 成本。加入 Cloudflare 社区 的讨论,或 联系我们 讨论您更广泛的 AI 安全策略。
