返回 文章 apply CMS 文章

利用用户洞察识别 AI 模型过度使用

AI Gateway 用户洞察新增任务、模型、轮次和用户分类,帮助团队识别模型过度使用并优化模型选择。

AI Gateway用户洞察模型过度使用成本优化
成长分 / 100 72 综合收获、行动、留存与影响

利用用户洞察识别 AI 模型过度使用
为什么值得读了解如何通过任务、模型、轮次和用户分类识别 AI 模型过度使用,优化成本与性能。

学习如何将使用洞察转化为自动路由决策,提升 AI 工作流效率。

关键洞察
  1. 用户洞察新增任务、模型、轮次和用户分类,提供 AI 使用上下文,帮助识别模型过度使用。
  2. 模型过度使用视图显示所选模型可能比任务所需更强大的对话,帮助团队调查并做出针对性改变。
  3. 任务分析按工作类型分组对话,初始类别包括编码、研究、写作、摘要和数据分析。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:13087

利用用户洞察识别 AI 模型过度使用

上个月我们推出用户洞察时,旨在帮助团队回答一个基本问题:人们实际上在用 AI 做什么?用户洞察让团队更清晰地了解其 AI 使用情况,展示哪些用户、应用程序、任务和模型在驱动流量。它还突出显示用户和代理异常,帮助团队在意外或失控的支出和使用变成更大问题之前识别它们。

我们的最新更新增加了用户一直要求的功能:上下文。

自推出以来,我们听到用户反馈,模型名称和请求计数只能说明部分情况。它们显示了流量去向,但很少揭示背后的工作:那个请求是代码审查、研究任务,还是代理为完成工作而进行的多次调用?相同的令牌数可能代表非常不同的工作类型,如果不了解任务,就无法评估模型选择。

用户洞察现在可以显示模型何时可能比任务所需更强大,哪些用户和代理在驱动这种使用,以及任务、模型、成本和对话模式之间的关系。团队可以利用这些洞察在组织内进行调查并做出有针对性的改变。这些功能对 AI Gateway 用户免费提供。

为什么 AI 使用难以理解

考虑一个团队将其内部 AI 流量通过 AI Gateway 路由。几周后,支出增加,一些请求感觉比预期慢,这是组织大规模采用 AI 时的常见挑战。

可能有几种解释。开发人员可能正在使用 AI 进行越来越复杂的编码工作。代理可能为了完成任务而进行了过多的后续调用。或者一小部分用户或代理可能对组织的使用量负有不成比例的责任。

仅凭令牌和请求计数无法显示是哪种模式驱动了增长。团队需要了解流量代表什么,然后才能决定是否应更改模型、工作流或路由规则。

帮助团队发现 AI 模型过度使用的地方

模型过度使用视图帮助团队识别所选模型似乎比任务所需更强大的对话。例如,团队可能发现用户或代理正在向高能力推理模型发送简单的格式化或摘要请求。

这为组织提供了一个起点。他们可以看到哪些用户、代理或应用程序与这种模式相关,然后调查其背后的任务。团队可能会发现,使用某个模型是因为它是默认值,因为用户不确定选择哪个模型,或者因为代理被配置为每个步骤都使用相同的模型。

BLOG-3566 2.png

过度使用视图不是排行榜,也不会自动推荐替代模型。它帮助团队提出更好的问题:

  • 这个模型适合这个任务吗?
  • 额外的能力是否改善了结果?
  • 更快或更便宜的模型能否产生等效的结果?
  • 问题是否仅限于一个工作流、用户或代理?

在此基础上,团队可以比较成本、延迟、token 用量和对话轮次,然后再决定要更改什么。

这些洞察同时支撑着新的“潜在节省”视图和 Auto Router,后者随本次发布一同进入公开测试阶段。“潜在节省”视图帮助团队识别那些可能由更快或更便宜的模型处理、且不会损害输出质量的请求。Auto Router 会自动应用这些任务与模型匹配信号,帮助降低成本,而无需为每个工作负载单独配置路由规则。

BLOG-3566 3.png

“过度配置”视图是评估模型匹配度的起点。团队可以比较同一类型任务的延迟、输入和输出 token、对话轮次以及总成本。困难的编码或研究任务可能需要一个能力强的推理模型,而简短的摘要或简单的分类任务则未必需要。目标并不是把每个请求都转移到最便宜的模型上,而是了解所选模型是否适合这项工作。

BLOG-3566-replace-image.png

了解人们正在用 AI 做什么

任务分析会按对话所代表的工作类型对其进行分组。初始类别包括编码、研究、写作、摘要和数据分析。

这提供了仅凭模型名称列表无法提供的背景信息。一个工程团队可能主要将 AI 用于编码和调试,而另一个团队可能将其用于研究和摘要。团队还可能发现,相当一部分流量来自简单任务,尽管这些任务被发送到了高能力模型。

答案会因团队而异。类别数据提供了一种方式,可以利用已经通过 AI Gateway 的流量来调查这些差异。团队可以确定某个模型是否被用于最适合它处理的工作,或者某个默认模型是否被应用得过于宽泛。

BLOG-3566 5.png

了解一项任务的完整成本

有些任务一次交互就能完成。另一些则需要几轮提问、纠正和追问。轮次分析显示了不同任务需要多少来回交互。长对话不一定是坏事,尤其是对于复杂工作而言。但如果一个简单任务持续需要好几轮,那么可能值得检查一下提示词、模型或工作流。

第一个请求只是成本的一部分。团队还应该关注任务完成之前所花费的时间、token 和金钱。比较这些数字可以显示工作流在哪些地方耗时更长或成本高于预期。

BLOG-3566 6.png

将洞察转化为自动路由

一旦团队识别出过度配置模式,并通过任务、成本、延迟和轮次数据加以确认,就可以将这一洞察转化为自动路由决策。

例如,任务视图可能显示团队的 AI 使用大部分是摘要和格式化。模型视图可能显示这些请求被发送到大型推理模型,而轮次视图显示大多数对话在单轮内完成。这些信号共同为团队提供了一个具体的工作负载供其评估。

除了我们对 User Insights 的更新外,Auto Router 现已开放封闭测试。Auto Router 利用对话轨迹、任务类别、任务复杂度和模型匹配信号,在考虑成本的同时自动将请求路由到合适的模型。

封闭测试中的客户无需为每个工作负载创建单独的路由规则,而是可以让 Auto Router 在其应用程序可用的模型中进行选择。路由器并非简单地将每个请求发送到最便宜的模型,而是为当前任务选择合适的模型。复杂的编码或研究工作可能仍需要能力更强的模型,而较简单的任务则可以由更快或更便宜的选项来处理。

要了解有关 Auto Router 的更多信息并报名参加封闭测试,请在此处阅读博客文章。

Auto Router 使用与 User Insights 相同的任务和对话信号。下面一节解释了这些信号是如何产生的。

User Insights 如何对流量进行分类

每个对话都会收到一个分析信号,可在 User Insights 中分组。该信号用于报告和路由分析,并非旨在替换或暴露原始请求。

分类引擎是一个专用的 Cloudflare Worker,用于处理符合条件的 AI Gateway 日志。它检查对话轨迹,包括用户请求、助手响应、工具调用和工具结果,并识别正在执行的工作类型,例如编码、调试、研究或摘要。它还返回置信度分数,并评估任务复杂度、意图模糊性、利害关系和上下文依赖性等维度。

该 Worker 返回一个类别,可与仪表板使用的日志元数据连接。这些信号还可用于通过比较候选模型对任务的适合程度与其成本来评估模型匹配度。当前实现侧重于少量易于理解的类别,而不是试图推断用户工作的每一个细节。

该流水线遵循现有的 AI Gateway 日志架构。元数据与日志正文分开存储,当前实现使用 Durable Objects 存储元数据,使用 R2 存储日志正文。User Insights 展示派生类别和聚合视图。它不会将仪表板变成原始提示浏览器。底层日志正文的保留继续遵循所配置的 AI Gateway 日志记录行为,因此团队在决定通过分类器发送哪些内容时应审查这些设置。

分类是异步的,这意味着它发生在 AI Gateway 处理请求之后,而不是在用户等待响应时。AI Gateway 首先将日志写入现有存储路径,分类 Worker 随后处理它。这使分类远离请求路径,不会给用户的响应增加延迟。

权衡之处在于,User Insights 并非实时视图。新收到的对话可能不会立即出现在仪表板中,并且由于日志需要经过处理和聚合,分析结果可能会比传入流量滞后大约一天。团队应使用 User Insights 来识别一段时间内的使用模式,而不是监控实时请求活动。

流程如下所示:

BLOG-3566 7.png

BLOG-3566 8.png

将使用情况关联到用户、团队和工具

当任务类别可以按用户、团队或应用程序查看时,它们会变得更有用。AI Gateway 具备身份感知能力,无需团队构建单独的报表管道即可提供这种上下文。

这不仅适用于团队自行构建的应用程序,也适用于开发者工具和智能体框架,例如 Claude Code、Codex 和 OpenCode。通过将 AI Gateway 置于 Cloudflare Access 之后,团队可以将经过身份验证的用户和会话与其 AI 流量关联起来,使 User Insights 能够将活动与正确的人员和对话关联。

对于自定义应用程序,请求必须同时包含稳定的 user_id 和 session_id,才能进行 User Insights 分析。确切的身份配置和字段名称取决于应用程序或工具的设置方式。重要的是提供稳定、非敏感的用户和会话标识符,以便在不将身份数据放入提示本身的情况下对使用情况进行分组。

对于自定义应用程序,请求元数据可能如下所示:

POST https://gateway.ai.cloudflare.com/v1/$ACCOUNT_ID/$GATEWAY_ID/openai/chat/completions
Content-Type: application/json
Authorization: Bearer $OPENAI_API_KEY
cf-aig-metadata: { user_id: \"user-123\", session_id: \"session-456\", idp_group: \"engineering\", application: \"code-review\" }

请求正文包含对话的模型和消息。

在 AI Gateway 前方配置 Access 后,Claude Code、Codex 和 OpenCode 等工具可以自动继承此身份上下文。Cloudflare Access 对最多 50 名用户的团队免费提供,因此是一种易于上手的方式。

AI Gateway User Insights 入门

AI 的使用正在快速变化。模型在变,团队会开发新的工作流,对某个团队来说正确的选择对另一个团队来说可能是错误的选择。

User Insights 让团队能够通过识别某些模型可能在哪些地方过度使用,从而开始做出更明智的选择。随后,他们可以查看是哪些用户和代理在推动这种使用,了解其背后的任务,并比较完成这项工作的成本。

通过 AI Gateway User Insights 文档了解更多。在

中打开 AI Gateway,并利用你了解到的信息做出更有针对性的模型和路由决策。

Cloudflare 仪表板