两全其美:在搜索中保持可发现性,同时禁止 AI 训练

在没有适当控制的情况下,网站所有者长期以来面临一个艰难的权衡:允许你的内容被用于 AI 训练,或者冒着在搜索中失去可发现性的风险。这种权衡之所以存在,是因为互联网上一些最大的组织使用混合用途爬虫:一个爬虫同时服务于搜索和 AI 训练。拒绝一个,就等于拒绝了另一个。
今天,Cloudflare 宣布了一项新的禁止 AI 训练设置,让你可以轻松地保持搜索索引,同时拒绝让同一个爬虫在你的内容上进行训练。Apple、Google 和 Microsoft 尊重或已承诺(在指定时间范围内)尊重这一设置。
混合用途爬虫是训练问题中的难点。AI 摘要则是下一个。全站范围的“是”或“否”过于生硬:你的内容有多少出现在摘要中,与它是否出现同样重要。对 AI 摘要的选择退出已经是我们为混合用途爬虫运营商设定的要求之一。到明年年初,我们的目标是让你控制你的内容被包含多少——在 Cloudflare 上设置一次,而不是分别与每个运营商设置。
为什么仅仅询问是不够的
大多数网站所有者希望被找到:被人类、代理和(好的)机器人找到。但开放互联网的很大一部分是由广告、订阅或与访客的直接关系资助的,而这些模式只有在有人真正到达时才会付费。
几乎每个网站所有者都认为搜索是有益的:不到 1% 的 Cloudflare 网站选择屏蔽搜索机器人。然而,训练则是另一回事:17% 的网站选择启用某种机制来阻止训练。这正是为什么我们决定网站所有者需要更精细的控制,而不是一刀切的“阻止 AI”。
仅靠 robots.txt 指令无法解决这个问题。任何人都可以发布一个,但它无法识别谁在爬取,无法确定他们为什么爬取,也无法阻止无视它的爬虫。
然而,网络可以解决它:我们发布偏好,识别谁在爬取,分类他们为什么爬取,并阻止那些无视它的——然后在 Radar 上报告每个运营商实际做了什么。
但阻止会移除一个爬虫。它不会改变爬虫的行为方式。更好的结果是运营商根本不让你选择。因此,自 7 月以来,我们一直在直接与他们交谈。回应令人鼓舞:几乎所有人都同意,网站所有者应该对自己的内容如何使用拥有控制权和透明度,并保证他们的选择会得到尊重。为了帮助网站所有者理解这一点,我们创建了一个称号:Accountable。
Accountable 称号既认可当今可用的能力,也认可交付这些能力的具体承诺。要获得资格,机器人运营商必须满足或承诺满足以下要求:
- 一种机制,允许网站所有者通过 robots.txt 或类似标准选择退出 AI 训练。
- 一种机制,允许网站所有者直接与运营商设置选择退出 AI 摘要,明年将通过 Cloudflare 实现(详见下文)。
- URL 级别的可见性,了解哪些页面可用于训练,以及显示内容如何在搜索中出现的指标。
- 保证选择退出 AI 训练不会影响传统搜索结果。
苹果、谷歌和微软均证明它们符合成为 Accountable 的资格。每家公司都将当前可用的能力与对仍在开发中的能力的有时间限制的承诺相结合。以下是这些公司爬虫的详细信息。
新的安全设置选项
Cloudflare 根据行为对机器人进行分类,单个机器人可以表现出多种行为。三种行为可作为控制选项:
搜索 - 爬取以构建搜索索引。训练 - 爬取以训练或微调模型。代理 - 代表人类访问页面的用户导向代理,例如聊天获取机器人和浏览器使用代理。
混合用途爬虫是同时进行搜索和训练的单个爬虫。如果没有控制,这种组合会产生上述权衡:网站所有者无法在不拒绝另一种用途的情况下拒绝一种用途。
为了避免阻止 Accountable 混合用途爬虫——那些不会将这种权衡强加给网站所有者的爬虫——我们引入了一个新设置:禁止 AI 训练。禁止 AI 训练以其在您的 robots.txt 中发布的 Disallow: 指令命名。
“阻止”设置现在含义不同
阻止和“在有广告的页面上阻止”以前不适用于混合用途爬虫,因为阻止它们也可能影响搜索可发现性。现在我们有了新的禁止 AI 训练设置,阻止和“在有广告的页面上阻止”适用于所有训练爬虫,包括混合用途爬虫。
训练、搜索和代理控制在域级别应用。随着禁止 AI 训练的加入,可用的设置包括:
允许:允许所有爬虫,除非被其他设置或 WAF 规则阻止。禁止 AI 训练:机器人偏好同步在 robots.txt 中发布适用的无训练偏好。Accountable 混合用途爬虫仍允许用于搜索。所有其他训练爬虫被阻止,包括亚马逊、Anthropic、Meta 和 OpenAI 运行的仅训练爬虫——阻止这些不会影响搜索。禁止 AI 训练仅作为训练设置可用,不适用于搜索或代理。在有广告的页面上阻止:爬虫,包括混合用途爬虫,仅在检测到投放广告的页面上被阻止。阻止:所有爬虫,包括混合用途爬虫,都被阻止。
禁止 AI 训练通过在 robots.txt 中发布偏好来工作。仅广告偏好无法以这种方式表达:Cloudflare 可以检测哪些页面投放广告,但该列表太大且变化太频繁,无法在 robots.txt 中枚举。这就是为什么没有“在有广告的页面上禁止 AI 训练”。
代理不会像混合用途爬虫那样产生搜索可发现性的权衡,而且互联网尚未有完善的指令来表达对代理的禁止偏好。目前,我们不包括针对代理的禁止设置。随着诸如 ai-prefs 等标准的成熟,我们将重新审视这种方法。
9月15日有哪些变化?
我们正在对机器人管理和AI爬虫控制进行以下更改:
- 屏蔽 和 在含广告的页面上屏蔽 现在适用于混合用途爬虫,包括 Applebot、Bingbot 和 Googlebot,因此任一设置都会同时影响搜索和训练。若要停止训练并保留搜索,请使用 禁止AI训练。 - “屏蔽AI机器人”将被弃用,取而代之的是更细粒度的 搜索、训练 和 代理 控制。
- 托管 Robots.txt 将被弃用,取而代之的是 机器人偏好同步。已启用 托管 Robots.txt 的客户将迁移到新系统。
- 禁止AI训练 将成为某些新域名的推荐配置的一部分。
- 现有客户的偏好将如下所述迁移到新控制项。
您需要做什么
几乎在所有情况下,什么都不用做。您当前的设置会自动延续。
如果您希望完全移除混合用途爬虫,现在必须明确说明。选择 屏蔽。它将阻止 Applebot、Bingbot 和 Googlebot 访问您的网站——包括搜索。
从未使用过 搜索/训练/代理 控制的现有域名
从未配置过更细粒度控制的网站所有者,将根据其旧版 屏蔽AI机器人 设置迁移到新设置:
(旧版)“屏蔽AI”设置 |
(新)搜索设置 |
(新)训练设置 |
| (新)代理设置 |
|---|
| 已禁用(未选择) |
| 屏蔽 |
| 在含广告的页面上屏蔽 |
之前配置过 搜索/训练/代理 控制的现有域名
对于之前配置过细粒度控制的域名,我们将在新定义下保留其选择的实际效果。之前的 训练 选择为 屏蔽 或 在含广告的页面上屏蔽 将迁移为 禁止AI训练。
| 控制 | 旧版设置 | 新设置 |
|---|---|---|
| 搜索 | 允许 | 允许 |
| 屏蔽 | 屏蔽 | |
| 在含广告的页面上屏蔽 | 在含广告的页面上屏蔽 | |
| 训练 | 允许 | 允许 |
| 屏蔽 | 禁止AI训练 | |
| 在含广告的页面上屏蔽 | 禁止AI训练 | |
| 代理 | 允许 | 允许 |
| 屏蔽 | 屏蔽 | |
| 在含广告的页面上屏蔽 | 在含广告的页面上屏蔽 |
对新域名的建议
从9月15日开始,正在接入新域名的客户将获得两种预设配置之一,具体取决于该网站是否通过广告赚钱。广告收入取决于真人实际看到页面。训练会用答案取代该访问;代理会抓取页面,但没有人看到广告。因此,面向广告支持型网站的预设更为严格。您可以在接入过程中或之后的任何时间更改这些设置中的任何一项。
| 设置 | 网站不通过广告变现 | 网站通过广告变现 |
|---|---|---|
| 偏好同步 | 已启用 | 已启用 |
| 搜索 | 允许 | 允许 |
| 训练 | 允许 | 禁止AI训练 |
| 代理 | 允许 | 在含广告的页面上屏蔽 |
新域名的推荐设置

这对特定的混合用途爬虫意味着什么?
Applebot、Bingbot 和 Googlebot 是 负责任的。Apple、Google 和 Microsoft 承诺遵循相同的发布者选择与透明度原则。在 禁止AI训练 下,它们可以继续为搜索抓取您的网站。选择 屏蔽 会完全阻止它们。
我们还将来自 Amazon、Anthropic、Meta 和 OpenAI 的相关爬虫归类为“可问责”(Accountable)。这些组织将其搜索爬虫与训练爬虫分开,因此 Cloudflare 可以在不影响搜索的情况下屏蔽训练爬虫。
Applebot
Applebot 允许网站所有者通过在 robots.txt 中为“Applebot-Extended”添加 Disallow 规则来选择退出训练。网站所有者目前还可以通过页面 HTML 中的 nosnippet 指令来表达对 AI 摘要的偏好。内容也可以被标记为
以将其排除在生成式输出之外。Applebot 尚未提供 URL 级检查工具。不过,我们已与其团队会面,他们分享了明年即将推出的解决方案的细节。Apple 还表示,禁止训练
付费墙内容。
不会影响搜索排名### Googlebot
Googlebot 允许网站所有者通过在 robots.txt 中为“Google-Extended”添加 Disallow 规则来选择退出训练,并且他们在其网站管理员门户中提供了一个开关,可将网站内容排除在生成式搜索结果之外。Googlebot 还为网站所有者提供有关搜索结果和 AI 摘要结果的指标和报告。Google 分享了有关其现有和最近推出的控制措施的信息,以及他们已经在着手开发的内容的信息,包括针对 Google-Extended 为网站所有者提供的额外 URL 级透明度工具,他们预计将在未来几周内推出。Google 还表示,禁止 Google-Extended 不会影响搜索排名。
Bingbot
Bingbot 在其网站管理员工具中提供了精细的控制和透明度。网站所有者目前可以通过 Bing 的
NOARCHIVE
元标签NOARCHIVE
标签外,网站所有者还可以使用。Microsoft 还表示,使用
阻止 URL 或内容移除工具NOARCHIVE
不会影响搜索排名 在该支持功能推出之前,选择“禁止 AI 训练”不会通过 robots.txt 自动向 Bing 传达不用于训练的偏好。这与之前的“训练阻止”设置的实际行为相同,该设置不适用于 Bingbot 等混合用途爬虫。
持续进展
随着这些能力不断发展,我们将继续联系并接触所有 AI 爬虫的运营方。Cloudflare Radar 公开追踪由“负责任”爬虫运营方提供的控制、透明度和报告。
让互联网变得更好需要双方都拥有自主权:爬虫需要访问开放网络,而创建这个网络的人们需要对其作品的使用方式拥有有意义的控制权。今天的公告代表着朝着这种平衡迈出的切实进展。
进展需要基础设施提供商、内容创作者、科技公司以及互联网工程任务组(IETF)等标准组织共同努力,将这些原则转化为开放、可互操作的标准。
下一步:AI 摘要
训练和 AI 摘要给网站所有者带来了不同的问题。训练涉及内容能否被用于构建 AI 模型。摘要则影响人们如何发现、评估并最终访问一家企业。两者都很重要,但它们以不同方式影响企业。
选择退出 AI 摘要的控制是第一步。被认定为“负责任”的运营方要么已经提供该能力,要么正在完成相关工作以提供该能力,从而确立了一个重要基线:网站所有者可以说“不”。
但在允许和禁止摘要之间进行全站选择仍然是一种粗放的工具。正确的决定取决于网站、内容以及业务结果。对于发布者而言,训练引发了关于控制、补偿以及原创内容可持续性的根本性问题。摘要则带来了另一个且往往更直接的传播问题:用户是访问发布者的网站,还是在搜索或 AI 体验中直接消费答案?对于许多其他企业而言,AI 摘要日益位于潜在客户与网站之间。它们可能回答问题、比较替代方案、推荐产品,或帮助某人决定是否访问。
数据呈现出复杂的影响。 超过一半 的消费者会阅读搜索结果顶部的摘要,而这些消费者
超过 40% 的可能性在阅读一条后。这可能会减少网站收到的访问量。但由 AI 搜索引荐的消费者转化率介于
结束他们的搜索并且
三倍传统搜索引荐的比率。AI 可能产生更少的访问量,但带来意图更强的客户。
__超过五倍__这本身并无好坏之分。靠广告资助的发布商可能会优化受众数量。零售商可能更喜欢更少但更可能购买的访客。Cloudflare 的角色不是替他们做选择,而是提供做出明智决策所需的可见性和控制。
摘要退出是一个强有力的开始,但并非最终状态。我们的下一个重点是帮助网站所有者了解摘要如何影响他们的业务,并让他们更好地控制其内容可以被使用多少。诸如 ai-prefs 这样的开放标准将是实现这一目标的重要部分。
如果您想在这场对话中发声,或提供反馈,请联系 crawlercontrols@cloudflare.com。
这些新控制对所有客户、所有计划均可用,并可在域(区域) 安全设置中进行配置。尚未使用 Cloudflare?
免费开始
