返回 文章 apply CMS 文章

Cloudflare 推出 AI 训练重定向:用 301 强制爬虫访问规范内容

Cloudflare 推出 AI 训练重定向,用 301 强制 AI 爬虫访问 canonical 内容,无需修改源站。

CloudflareAI 训练重定向canonical 标签爬虫管理
成长分 / 100 81 综合收获、行动、留存与影响

Cloudflare 推出 AI 训练重定向:用 301 强制爬虫访问规范内容
为什么值得读了解 AI 爬虫如何忽略 noindex 等软信号,持续爬取弃用内容,导致 AI 模型学习过时信息。

掌握 Cloudflare 如何利用现有 canonical 标签实现零配置的爬虫重定向,且不影响人类和搜索引擎流量。

关键洞察
  1. Cloudflare 的 AI 爬虫控制数据显示,过去 30 天内 AI 爬虫访问了 480 万次,弃用内容与当前内容被爬取频率相同。
  2. AI 训练重定向基于 cf.verified_bot_category 和 HTML 中的 <link rel="canonical"> 标签,对已验证 AI 爬虫返回 301 重定向。
  3. 在 Cloudflare 文档站点启用后,100% 的 AI 训练爬虫对带非自引用 canonical 标签的页面请求被重定向,未提供弃用内容。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:10601

Cloudflare 的 Wrangler CLI 在过去六年中发布了多个主要版本,每个版本至少包含一些对命令、配置或开发者与平台交互方式的重大更改。与任何积极维护的开源项目一样,我们保留了旧版本的文档。v1 文档 带有弃用横幅、noindex 元标签 以及指向当前文档的规范标签。每个建议信号都传达相同的信息:此内容已过时,请查阅其他内容。AI 训练爬虫并未可靠地遵循这些信号。

我们在 developers.cloudflare.com 上使用 AI 爬虫控制,因此我们知道 AI 爬虫类别 中的机器人在过去 30 天内访问了 480 万次,并且它们消耗弃用内容的频率与当前内容相同。建议信号没有产生可衡量的差异。这种影响是累积的,因为 AI 代理并不总是实时获取内容;它们依赖于训练好的模型。当爬虫摄取弃用的文档时,代理会继承过时的基础。

今天,我们推出 AI 训练重定向,让您可以强制已验证的 AI 训练爬虫重定向到最新内容。您现有的规范标签将成为 HTTP 301 重定向,用于已验证的 AI 训练爬虫,只需一个开关,即可在所有付费 Cloudflare 计划上自动生效。

此外,由于状态码最终是网络向爬虫传达策略的方式,Radar 的 AI 洞察 页面现在包含 响应状态码分析,显示 AI 爬虫在 Cloudflare 所有流量中接收到的各种类型(成功 (2xx)、重定向 (3xx)、客户端错误 (4xx) 和 服务器错误 (5xx))的状态码,以展示当前网络如何响应 AI 爬虫。

AI 训练爬虫如今面临死胡同

对于搜索引擎来说,noindex 作为一个丰富的信号系统,但页面上没有等效的内联指令可以说“不要在此训练”。保留带有警告横幅的弃用页面可能对人类有效,他们会阅读通知并继续导航,但 AI 训练爬虫会摄取全文,并可能将横幅视为又一个段落,即使在警告可见后仍会返回数千次。

阻止会产生自身的问题:它会产生一个空白,没有关于爬虫应该学习什么内容的信号。robots.txt 提供了有限的保护,但随着自动化流量的增长,维护每个爬虫、每个路径、每个内容更新的指令需要大量的人工维护。爬虫需要的是具体的指示:“当前内容在这里。”

<link rel="canonical"> 标签是一个在 RFC 6596 中定义的 HTML 元素,它告诉搜索引擎和自动化系统哪个 URL 代表页面的权威版本。它已经存在于 65-69% 的网页 上,并由 EmDash、WordPress 和 Contentful 等平台自动生成。该基础设施声明了您内容的当前版本是什么,而 AI 训练重定向则强制执行它。

AI 训练重定向基于两个输入:Cloudflare 的 cf.verified_bot_category 字段和 HTML 中已有的 <link rel="canonical"> 标签。AI 爬虫类别 涵盖为 AI 模型训练而爬取的机器人,包括 GPTBot、ClaudeBot 和 Bytespider,并且与涵盖 AI 代理的 AI 助手AI 搜索 类别不同。

当来自已验证的 AI 爬虫的请求到达时,Cloudflare 会读取响应 HTML。如果存在非自引用的 canonical 标签,Cloudflare 会在返回响应之前向 canonical URL 发出 301 Moved Permanently。人类流量、搜索引擎索引和其他自动化流量不受影响。

以下是 GPTBot 请求已弃用路径时的交互示例:

GET /durable-objects/api/legacy-kv-storage-api/
Host: developers.cloudflare.com
User-Agent: Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)
HTTP/1.1 301 Moved Permanently
Location: https://developers.cloudflare.com/durable-objects/api/sqlite-storage-api/

它不会追溯性地修正已摄入的训练数据,也不会覆盖 AI Crawler 机器人类别之外的未验证爬虫。访问已弃用页面的人类和 AI 代理不会被重定向。我们还特意排除了跨域规范标签(指向不同域上首选 URL 的标签),因为它们通常用于域名整合而非内容更新。为避免循环,自引用规范标签(页面上指向自身 URL 的标签)也不会触发重定向。

为什么不直接使用重定向规则?

单条重定向规则 可以通过用户代理字符串定位 AI 爬虫,如果站点只有少量已知的弃用路径,这种方式可行。但它无法扩展:每个新的弃用路径都需要修改规则,用户代理必须手动跟踪,并且会消耗__计划限制__,而这些限制本可用于营销活动 URL 或域名迁移。重定向规则还会手动重新编码规范标签已声明的内容,并随着内容变化而失去同步。

我们在自己的文档站点上的发现

我们自身的经验表明这个问题是真实存在的。我们在 developers.cloudflare.com 上使用与所有 Cloudflare 客户相同的仪表板运行 AI 爬虫控制。2026 年 3 月,旧版 Workers 文档被 OpenAI 爬取了约 46,000 次,被 Anthropic 爬取了 3,600 次,被 Meta 爬取了 1,700 次。

对弃用页面的爬取可能解释了为什么当我们在 2026 年 4 月询问领先的 AI 助手“如何使用 Wrangler CLI 写入 KV 值?”时,它给出了过时的答案:“通过 Wrangler CLI 使用 kv:key put 命令写入 Cloudflare KV。”

实际上,正确的语法(截至 2026 年 4 月)是 wrangler kv key put

;冒号语法(kv:key put

)在 Wrangler 3.60.0 中已被弃用。我们的文档__带有内联弃用通知__,但尚不清楚训练管道如何解释它们。

因此,我们在 developers.cloudflare.com 上启用了 AI 训练重定向并测量了响应。在头七天内,100% 的 AI 训练爬虫对带有非自引用规范标签的页面的请求被重定向,并且没有提供弃用内容。

我们预计将爬虫重定向到当前内容最终会改善 AI 生成的关于旧版工具的答案。鉴于训练管道的封闭性和重新爬取时间的变化性,这是一个我们将继续验证的假设。但爬虫在访问点接收到的内容已经立即得到了改善。

如果你的站点有规范标签,你现在可以对已验证的 AI 训练爬虫强制执行现有的内容层级。Cloudflare 的 已验证机器人分类 自动处理爬虫识别。

在仪表板中: 在任何域上,转到 AI 爬虫控制 > 快速操作 > AI 训练重定向 > 开启。

有关通过配置规则和 Cloudflare for SaaS 进行路径特定控制的信息,请参阅 完整文档

网络如何响应 AI 爬虫

AI 训练重定向将一种状态码 301 Moved Permanently

转化为内容策略的执行机制。但 301

是源站与爬虫之间更广泛对话中的一个信号。200 OK

表示内容已提供。403 Forbidden

表示访问被阻止。402 Payment Required

告知客户端需要付费才能访问。综合来看,AI 爬虫流量中状态码的分布揭示了网络实际上如何大规模响应爬虫。

Radar 的 AI Insights 页面 现在包含一个 响应状态码分析 图表,展示了 AI 爬虫流量的主要响应状态码或响应状态码 分组(可通过下拉菜单选择)的分布。数据可按行业集过滤;在 Data Explorer 中也可应用爬取目的过滤器。过滤后的分析提供了关于某些类型爬虫行为是否不同,或请求模式和分布是否因行业而异的视角。

在下面的一般示例中,我们可以看到,在图表覆盖的时间段内,略超过 70% 的请求被成功处理(200

),而 10.1% 的请求被重定向(301

302

)到另一个 URL,3.7% 的请求针对未找到的文件(404

)。8.3% 的请求被阻止访问,收到 403

响应状态码。分组后,我们发现近 74% 的请求收到了 成功响应2xx

),13.7% 收到了 客户端错误响应4xx

),11.3% 收到了 重定向消息3xx

),1.2% 收到了 服务器错误响应5xx

)。

此分析也已添加到 单个机器人页面,以提供对爬虫行为这一方面的洞察。在下面的 GPTBot 示例中,我们可以看到,在图表覆盖的时间段内,略超过 80% 的请求被成功处理(200

),而 4.7% 的请求被重定向(301

302

)到另一个 URL,仅 2.7% 的请求针对未找到的文件(404

)。近 6% 的请求被阻止,Cloudflare 返回 403

响应状态码。分组后,我们发现 83% 的请求收到了 成功响应(2xx),近 10% 收到了 客户端错误响应4xx

),5.1% 收到了 重定向消息3xx

),其余 2.2% 收到了 服务器错误响应5xx

)。

如上所述,Radar 的 Data Explorer 使用户能够通过应用额外过滤器进一步深入分析数据。例如,我们可以查看 哪些爬虫 请求了最多不存在的內容(导致 404

响应状态码),以及该请求流量随时间的变化趋势,或者 哪些行业训练 爬虫发送了最多的 重定向3xx

)响应状态码,以及该活动随时间的变化趋势。

响应状态码数据,无论是汇总数据还是按机器人细分的数据,也可通过 Cloudflare Radar API 获取。

AI 训练重定向 让您可以控制爬虫从您的源站获取的内容;Radar 的状态码分析让您了解其他网站是如何进行相同操作的。在 AI 爬虫控制 > 概览 > 快速操作 中启用 AI 训练重定向,立即开始在您的网站上用强制执行的结果取代建议信号。

有问题或想分享您的发现?加入 Cloudflare 社区 的讨论,或在 Discord 上找到我们。