Cloudflare 的 Wrangler CLI 在过去六年中发布了多个主要版本,每个版本至少包含一些对命令、配置或开发者与平台交互方式的重大更改。与任何积极维护的开源项目一样,我们保留了旧版本的文档。v1 文档 带有弃用横幅、noindex 元标签 以及指向当前文档的规范标签。每个建议信号都传达相同的信息:此内容已过时,请查阅其他内容。AI 训练爬虫并未可靠地遵循这些信号。
我们在 developers.cloudflare.com 上使用 AI 爬虫控制,因此我们知道 AI 爬虫类别 中的机器人在过去 30 天内访问了 480 万次,并且它们消耗弃用内容的频率与当前内容相同。建议信号没有产生可衡量的差异。这种影响是累积的,因为 AI 代理并不总是实时获取内容;它们依赖于训练好的模型。当爬虫摄取弃用的文档时,代理会继承过时的基础。
今天,我们推出 AI 训练重定向,让您可以强制已验证的 AI 训练爬虫重定向到最新内容。您现有的规范标签将成为 HTTP 301 重定向,用于已验证的 AI 训练爬虫,只需一个开关,即可在所有付费 Cloudflare 计划上自动生效。
此外,由于状态码最终是网络向爬虫传达策略的方式,Radar 的 AI 洞察 页面现在包含 响应状态码分析,显示 AI 爬虫在 Cloudflare 所有流量中接收到的各种类型(成功 (2xx)、重定向 (3xx)、客户端错误 (4xx) 和 服务器错误 (5xx))的状态码,以展示当前网络如何响应 AI 爬虫。
AI 训练爬虫如今面临死胡同
对于搜索引擎来说,noindex 作为一个丰富的信号系统,但页面上没有等效的内联指令可以说“不要在此训练”。保留带有警告横幅的弃用页面可能对人类有效,他们会阅读通知并继续导航,但 AI 训练爬虫会摄取全文,并可能将横幅视为又一个段落,即使在警告可见后仍会返回数千次。
阻止会产生自身的问题:它会产生一个空白,没有关于爬虫应该学习什么内容的信号。robots.txt 提供了有限的保护,但随着自动化流量的增长,维护每个爬虫、每个路径、每个内容更新的指令需要大量的人工维护。爬虫需要的是具体的指示:“当前内容在这里。”
<link rel="canonical"> 标签是一个在 RFC 6596 中定义的 HTML 元素,它告诉搜索引擎和自动化系统哪个 URL 代表页面的权威版本。它已经存在于 65-69% 的网页 上,并由 EmDash、WordPress 和 Contentful 等平台自动生成。该基础设施声明了您内容的当前版本是什么,而 AI 训练重定向则强制执行它。
AI 训练重定向基于两个输入:Cloudflare 的 cf.verified_bot_category 字段和 HTML 中已有的 <link rel="canonical"> 标签。AI 爬虫类别 涵盖为 AI 模型训练而爬取的机器人,包括 GPTBot、ClaudeBot 和 Bytespider,并且与涵盖 AI 代理的 AI 助手 和 AI 搜索 类别不同。
当来自已验证的 AI 爬虫的请求到达时,Cloudflare 会读取响应 HTML。如果存在非自引用的 canonical 标签,Cloudflare 会在返回响应之前向 canonical URL 发出 301 Moved Permanently。人类流量、搜索引擎索引和其他自动化流量不受影响。
以下是 GPTBot 请求已弃用路径时的交互示例:
GET /durable-objects/api/legacy-kv-storage-api/
Host: developers.cloudflare.com
User-Agent: Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)
HTTP/1.1 301 Moved Permanently
Location: https://developers.cloudflare.com/durable-objects/api/sqlite-storage-api/
它不会追溯性地修正已摄入的训练数据,也不会覆盖 AI Crawler 机器人类别之外的未验证爬虫。访问已弃用页面的人类和 AI 代理不会被重定向。我们还特意排除了跨域规范标签(指向不同域上首选 URL 的标签),因为它们通常用于域名整合而非内容更新。为避免循环,自引用规范标签(页面上指向自身 URL 的标签)也不会触发重定向。
为什么不直接使用重定向规则?
单条重定向规则 可以通过用户代理字符串定位 AI 爬虫,如果站点只有少量已知的弃用路径,这种方式可行。但它无法扩展:每个新的弃用路径都需要修改规则,用户代理必须手动跟踪,并且会消耗__计划限制__,而这些限制本可用于营销活动 URL 或域名迁移。重定向规则还会手动重新编码规范标签已声明的内容,并随着内容变化而失去同步。
我们在自己的文档站点上的发现
我们自身的经验表明这个问题是真实存在的。我们在 developers.cloudflare.com 上使用与所有 Cloudflare 客户相同的仪表板运行 AI 爬虫控制。2026 年 3 月,旧版 Workers 文档被 OpenAI 爬取了约 46,000 次,被 Anthropic 爬取了 3,600 次,被 Meta 爬取了 1,700 次。
对弃用页面的爬取可能解释了为什么当我们在 2026 年 4 月询问领先的 AI 助手“如何使用 Wrangler CLI 写入 KV 值?”时,它给出了过时的答案:“通过 Wrangler CLI 使用 kv:key put 命令写入 Cloudflare KV。”
实际上,正确的语法(截至 2026 年 4 月)是 wrangler kv key put
;冒号语法(kv:key put
)在 Wrangler 3.60.0 中已被弃用。我们的文档__带有内联弃用通知__,但尚不清楚训练管道如何解释它们。
因此,我们在 developers.cloudflare.com 上启用了 AI 训练重定向并测量了响应。在头七天内,100% 的 AI 训练爬虫对带有非自引用规范标签的页面的请求被重定向,并且没有提供弃用内容。
我们预计将爬虫重定向到当前内容最终会改善 AI 生成的关于旧版工具的答案。鉴于训练管道的封闭性和重新爬取时间的变化性,这是一个我们将继续验证的假设。但爬虫在访问点接收到的内容已经立即得到了改善。
如果你的站点有规范标签,你现在可以对已验证的 AI 训练爬虫强制执行现有的内容层级。Cloudflare 的 已验证机器人分类 自动处理爬虫识别。
在仪表板中: 在任何域上,转到 AI 爬虫控制 > 快速操作 > AI 训练重定向 > 开启。
有关通过配置规则和 Cloudflare for SaaS 进行路径特定控制的信息,请参阅 完整文档。
网络如何响应 AI 爬虫
AI 训练重定向将一种状态码 301 Moved Permanently
转化为内容策略的执行机制。但 301
是源站与爬虫之间更广泛对话中的一个信号。200 OK
表示内容已提供。403 Forbidden
表示访问被阻止。402 Payment Required
告知客户端需要付费才能访问。综合来看,AI 爬虫流量中状态码的分布揭示了网络实际上如何大规模响应爬虫。
Radar 的 AI Insights 页面 现在包含一个 响应状态码分析 图表,展示了 AI 爬虫流量的主要响应状态码或响应状态码 分组(可通过下拉菜单选择)的分布。数据可按行业集过滤;在 Data Explorer 中也可应用爬取目的过滤器。过滤后的分析提供了关于某些类型爬虫行为是否不同,或请求模式和分布是否因行业而异的视角。
在下面的一般示例中,我们可以看到,在图表覆盖的时间段内,略超过 70% 的请求被成功处理(200
),而 10.1% 的请求被重定向(301
、302
)到另一个 URL,3.7% 的请求针对未找到的文件(404
)。8.3% 的请求被阻止访问,收到 403
响应状态码。分组后,我们发现近 74% 的请求收到了 成功响应(2xx
),13.7% 收到了 客户端错误响应(4xx
),11.3% 收到了 重定向消息(3xx
),1.2% 收到了 服务器错误响应(5xx
)。
此分析也已添加到 单个机器人页面,以提供对爬虫行为这一方面的洞察。在下面的 GPTBot 示例中,我们可以看到,在图表覆盖的时间段内,略超过 80% 的请求被成功处理(200
),而 4.7% 的请求被重定向(301
、302
)到另一个 URL,仅 2.7% 的请求针对未找到的文件(404
)。近 6% 的请求被阻止,Cloudflare 返回 403
响应状态码。分组后,我们发现 83% 的请求收到了 成功响应(2xx),近 10% 收到了 客户端错误响应(4xx
),5.1% 收到了 重定向消息(3xx
),其余 2.2% 收到了 服务器错误响应(5xx
)。
如上所述,Radar 的 Data Explorer 使用户能够通过应用额外过滤器进一步深入分析数据。例如,我们可以查看 哪些爬虫 请求了最多不存在的內容(导致 404
响应状态码),以及该请求流量随时间的变化趋势,或者 哪些行业 向 训练 爬虫发送了最多的 重定向(3xx
)响应状态码,以及该活动随时间的变化趋势。
响应状态码数据,无论是汇总数据还是按机器人细分的数据,也可通过 Cloudflare Radar API 获取。
AI 训练重定向 让您可以控制爬虫从您的源站获取的内容;Radar 的状态码分析让您了解其他网站是如何进行相同操作的。在 AI 爬虫控制 > 概览 > 快速操作 中启用 AI 训练重定向,立即开始在您的网站上用强制执行的结果取代建议信号。
有问题或想分享您的发现?加入 Cloudflare 社区 的讨论,或在 Discord 上找到我们。
