一年前,我们宣布了第一个__内容独立日__,并赋予了网站所有者夺回内容控制权的手段。持续了30年的爬虫与网站所有者之间的协议——我们爬取你的内容,你获得推荐流量——已不再成立。AI正在攫取一切,却不回馈任何东西,这对网站所有者构成了生存威胁。因此,我们推出了“一键屏蔽AI机器人”选项,以及一个__按爬取付费的市场__。
一年间,情况发生了很大变化。去年七月,围绕“AI机器人”的讨论主要集中在未经补偿地阻止AI训练,指出这是一种赢-输交易:内容被用于模型训练,却没有为网站所有者带来任何价值。但如今,人们渴望更细致的处理方式:内容所有者仍然希望能够保护自己的内容,并且他们应该为自己努力创作、策划和分享的原创内容获得补偿。我们也知道,封锁内容并非一刀切的解决方案;网站所有者希望有更多选择,而不仅仅是“每次都阻止所有自动化”。
如果你运营一个小型网站,问题不仅仅在于有人可能用你的内容训练模型——更根本的问题是,别人根本找不到你。因此,你不得不做出浮士德式的交易:要么出现在搜索结果中并让AI训练你的内容,要么冒着失去可发现性的风险。如果现有的搜索提供商将同一机器人同时用于搜索和训练,这会不公平地使他们受益;而这种不公平优势会激励新进入者采取规避手段,试图缩小竞争差距。
如今,AI可以存在于任何事物中。谷歌搜索已从由AI排序转变为__完整的答案引擎__,直接在结果页面上回答你的问题。而谷歌并非唯一如此——这是“搜索”发展的方向。
我们可以争论今天什么才算“AI”的界限,但标准明天可能就会改变。因此,我们不再主要根据是否为“AI”来定义机器人,而是采用更新的分类方法,对机器人或代理的行为提出更深入的问题:它们在我的网站上做什么?它们存储了什么?它们将如何重新分享我的内容?
为了解决这些问题,我们需要更细致的视角——一种实用的分类法,与我们客户关心的AI用例保持一致。因此,我们将讨论范围扩大到AI训练之外,聚焦于我们希望所有客户都能管理的三个AI用例:
搜索: 任何收集或索引你内容的行为,以便日后回答相关问题。关键在于,搜索是主动构建你网站的数据库,以便后续响应查询。网站所有者应期望因此获得推荐流量或其他公平补偿。
代理: 代表个人实时执行操作的自动化行为,以立即完成某项任务。这包括聊天获取机器人(例如ChatGPT-User)和浏览器使用代理(例如驱动Chrome的Gemini或Claude)。关键在于,它访问你的网络应用是为了完成一项工作,并且通常另一端有人在等待。
训练: 爬虫获取你的内容以训练或微调模型。关键在于,你的数据被永久吸收到AI的基础架构中,以提升其能力。
网络上的许多流行爬虫属于上述分类之一;有些则属于多个分类。除了上述三种行为外,我们还对许多其他行为进行了分类——包括广告验证、Feed 获取和代理交易(下文将详细介绍)。但我们认为,所有网站所有者都应该能够轻松管理这三种以 AI 为中心的使用场景的访问权限。我们认为,机器人运营者应该将其爬虫分开,因为这能为网站所有者带来更多透明度:让他们更好地理解特定爬虫为何访问,以及更好地管理授予该爬虫的访问权限。如果一家公司运行的自动化程序既构建搜索索引,又充当代理,还收集数据以训练其模型,那么我们强烈建议该公司将自动化程序拆分为三个独立的爬虫。
我们希望建立一个可扩展且能代表自动化流量世界演变的分类系统。追踪机器人的目的并非新鲜事,但我们的新分类法包含了一些更新,以更好地反映当今机器人流量的状况。最值得注意的是,我们希望认识到,具有多种目的的机器人应被记录所有目的,而不仅仅是其中之一。
管理 AI 流量的新选项
我们希望为管理不同类型的 AI 流量提供更多选项,面向 Cloudflare 网络上的所有网站所有者。
我们之前宣布的“阻止 AI 机器人”管理预设包括用于模型训练的单用途爬虫,如下所示:
2025 年 7 月 1 日管理 AI 机器人流量的现有设置截图。
但并非所有 AI 用途都相同,我们希望客户拥有所需的控制权。因此,我们推出了基于三种主要用例:搜索、代理和训练爬虫来管理 AI 流量的能力。通过这些新选项,我们的客户可以更精细地调整他们管理 AI 机器人流量的方式——包括我们免费套餐的客户。
2026 年 7 月 1 日管理 AI 机器人流量的新选项截图。
2026 年 9 月 15 日,我们将为这三个分类设置新的默认值。 对于所有新接入 Cloudflare 的域名,训练和代理类别将在显示广告的页面上默认被阻止,而搜索则默认保持允许。
广告是网站所有者希望有人访问并看到它的信号——这是可货币化并推动业务的东西。因此,在这些页面上,我们将人类注意力视为最终目标,并阻止可能妨碍这种注意力的机器人(即训练和代理机器人)。另一方面,搜索是最自然地将访问者引流回来的行为,我们认为允许这种行为符合大多数网站所有者的利益。
另一个将于 9 月 15 日生效的变更是,多用途爬虫(特别是那些将搜索与训练结合的爬虫)将根据其所有行为被允许/阻止,这与我们对网站所有者透明度的呼吁一致。由于默认值将由最严格的适用规则强制执行,因此像 Googlebot、Applebot 和 BingBot 这样的多用途爬虫将被那些选择阻止训练(通过新的 管理 AI 流量 选项,或通过旧的阻止 AI 机器人服务)的客户阻止。
当然,客户的选择至关重要:如果网站所有者希望退出这些新的默认配置,他们可以在9月15日之前的任何时间__在安全设置中轻松标记__,这将确认他们希望不改变同时用于搜索目的的训练爬虫。我们还会在9月15日临近时继续通知客户即将发生的默认设置变更,以确保希望选择与默认设置不同配置的客户有机会这样做。
BotBase:面向企业客户的新可见性平面
我们还很高兴地推出了一项重大的可见性更新,作为企业版机器人管理的新功能。随着Cloudflare跟踪的机器人目录不断增长,以合理的分组管理这些机器人并了解特定机器人的更多细节的需求也随之增加。
隆重推出__BotBase__。BotBase是我们新的数据库,跟踪所有已知的机器人,包括已验证的机器人和代理。该数据库在Cloudflare仪表板上直接提供了我们整个机器人目录的全面、可搜索视图。我们首先解决可见性问题,但今年晚些时候,我们将扩展BotBase,为网站上的已知自动化内容提供直接控制中心。
借助这一新视图,企业版机器人管理客户可以查看所有已验证机器人/代理的完整目录及其在此更新分类中的位置——这是我们以前从未在Cloudflare仪表板上动态展示过的视图。希望精确定位特定机器人的客户还可以轻松过滤来自该机器人的所有流量,并复制检测ID以在安全规则中使用。所有这些现在都已在一个专用页面上线,可通过__机器人管理配置卡__访问。
在构建BotBase时,我们希望考虑所有信息片段,以便能够从机器人到机器人构建可扩展、强大的洞察。其中一个片段是我们更新分类的基石,基于机器人在您网站上的可能行为——其行为。 我们将这些分类如下所示,每个机器人被归类为一种或多种行为。
机器人分类 | 行为与用途
搜索 | 爬取以扫描您的网站,帮助其在搜索引擎结果中出现
代理 | 代表人类访问页面的用户导向代理
训练 | 爬取以训练或微调模型
交易 | 代表用户执行结账操作 |
数据收集 | 包括价格抓取、竞争情报收集和第三方分析 |
安全测试 | 包括漏洞扫描和渗透测试 |
SEO | SEO爬取、网站审计、可访问性检查 |
广告验证 | 广告投放验证、广告欺诈检测 |
社交/链接预览 | 社交平台和消息应用的链接预览 |
订阅源获取 | 包括RSS阅读器、播客聚合器和新闻订阅机器人 |
监控与运维 | 包括正常运行时间监控、Webhook和健康检查 |
粗斜体行表示所有客户均可使用的新可配置选项。
爬虫如何使用我的内容?
我们听到的另一条对客户很重要的信息是机器人的内容使用——机器人在抓取你的内容后可能保留和重新分享的内容。 为了解决这个问题,我们正在为 Bot Management 客户构建基于“内容使用”进行选择和阻止的功能。此设置可以设置为三个级别之一,从最低到最高允许程度:
immediate
— 交互,但不存储和重用任何内容
reference
(默认)— 索引、摘录并链接回
full
— 总结和复制
这些值可以与机器人分类结合,以表达细微的规则,例如“允许所有用于搜索、SEO和广告验证的机器人,但仅限于reference
使用级别。”这允许网站所有者以合理的分组做出决策,而不是逐个管理每个机器人的规则。
为了进一步支持这一点,从今天开始,我们正在测试一个新的信号use
,它扩展了__Content Signals__并存在于你的 robots.txt 中。这为第一版 Content Signals 的三个字段增加了第四个可选字段,表达与上述相同的偏好:
use=immediate
use=reference
use=full
与 robots.txt 文件中列出的所有其他项目一样,内容使用的值表示网站所有者的偏好,而不是直接阻止。我们现在正在添加对此扩展的支持:所有已启用托管 robots.txt 的客户——该功能在 robots.txt 中预先添加了允许抓取用于搜索但不允许用于训练的偏好——现在将在其 robots.txt 中添加额外的偏好use=reference
。
# 带有原始内容信号的 Cloudflare 托管内容
User-agent: *
Content-Signal: search=yes,ai-train=no
Allow: /
Cloudflare 管理的 robots.txt 内容,包含原始内容信号值。
# 使用新的内容使用信号的 Cloudflare 托管内容
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
添加了参数的 Cloudflare 托管 robots.txt 内容。
我们还开始跟踪 BotBase 中每个机器人的内容使用情况,当我们发现机器人滥用这些信号时,它将失去“已验证”状态,从而不再被允许。目前,完全复制内容的机器人不能拥有已验证状态。
机器人被验证意味着什么?
说到“已验证”,已验证__的定义正在更新,以反映即将对默认允许和阻止基线进行的更改。以前,所有已验证的机器人默认被允许,这反映在我们的基本__机器人战斗模式(用于阻止不需要的自动流量)以及企业机器人管理客户的规则模板中。
从今天开始,我们正在调整这一点以增加细微差别:未验证的机器人仍然默认被阻止,但我们不再将已验证视为“默认允许”。现在,已验证标签使机器人与其相关类别一起被允许,这意味着允许的类别(例如,允许搜索)将决定允许访问网站的内容。
为了平衡这一变化,我们正在开放成为已验证机器人的流程,并使其更加透明。要“验证”机器人,机器人运营商需要展示两件事:你诚实地代表自己,并且你不滥用这种诚实所获得的访问权限。为了让机器人运营商更容易做到这一点,我们目前正在为机器人运营商构建管理工具,以更好地确保他们被 Cloudflare 的分类系统准确表示(将在不久的将来公布)。
即将为已加入或希望加入 BotBase(下一代 Cloudflare 机器人目录)的机器人运营商直接构建的平台的预览截图。
尝试传递信任
还有一点:来到你门口的机器人(或代理)越来越不是由构建它的公司运营的。像 Cloudflare 开发者平台这样的平台同时为成千上万不同的运营商运行自动化,从企业到你从未听说过的开发者。你可能信任 Stripe,但你不一定信任每个将 Stripe 的工具整合到周末项目中的人。
我们将(网站所有者 → 机器人拥有公司 → 最终用户)的情况称为传递信任问题,我们提议利用 RFC 7239 中定义的现有 Forwarded 标头,该标头随请求一起发送,并允许“代理组件披露在代理过程中丢失的信息”。
这类似于 X-Forwarded-For
对 IP 地址的作用,或 X-Forwarded-Host
对保留原始 Host 标头的作用。因此,当网站所有者说“允许此运营商”时,无论运营商是直接访问你还是通过三层受信任的中介,该偏好都将保持。更多细节可以在__我们的文档__中找到,下面有一个简短的示例来展示格式。
Forwarded: for="openai"
添加上面讨论的带有内容使用的扩展后,标头添加将如下所示,指定运营商表示他们将如何使用他们访问的内容:
Forwarded: for="openai";use="reference"
这也符合我们希望培养的激励模式。在超过 20% 的位于 Cloudflare 背后的网站域名中失去受信任状态是一种有力的威慑。信任成为你可以随身携带的东西,也是你可能失去的东西。
然而,随着机器人流量与人类流量相混合,这种传递信任的系统可能无法惠及那些能够承担可识别身份成本的用户。我们今天提出的措施有助于传递信任,但无法永远适用于整个网络。小型流量来源需要隐私,而希望维护自身隐私承诺的公司应能探索面向代理互联网未来的公平构建模块,例如私有速率限制。
这些朝着同一方向的小变革让网站所有者能更好地控制其内容的使用者及使用方式。我们相信,今天讨论并即将实施的新默认设置将鼓励透明度,并更能反映世界的发展趋势。
当然,网络的潮起潮落将继续在我们脚下变化,我们也会随之调整。但方向不会改变,因为这是Cloudflare的初心:构建一个以信任为核心的网络生态系统。在这个系统中,内容的创造者可以决定其使用方式——而诚实的行为将为你赢得更多访问权限,而非更少。
这些管理AI流量的新选项现已上线,所有现有客户可在其区域设置中进行配置。还不是Cloudflare用户?免费开始,立即设置你想要的流量控制。
祝内容独立日快乐。
