Cloudflare 推出“禁止 AI 训练”选项:保持网站可搜索 同时阻止 AI 模型训练
Cloudflare 现在提供“禁止 AI 训练”功能,让站点仍能被搜索引擎收录,却拒绝同一爬虫用于 AI 模型训练,回应了对混合用途机器人日益增长的担忧。

背景介绍
2026年9月15日,Cloudflare 在官方博客上发布了一篇题为《同时保持可搜索性并拒绝 AI 训练》的文章,正式推出了名为“禁止 AI 训练”的新配置选项。该功能的核心目标是让站点所有者在不牺牲搜索引擎收录的前提下,向使用相同爬虫的 AI 模型训练明确发出拒绝信号。
该配置的推出正值全球对网络爬虫多用途行为的争议升温之际。传统的搜索爬虫与用于大规模机器学习的数据抓取爬虫往往共用同一 IP 段和用户代理字符串,使得内容提供者难以对二者进行精细区分。Cloudflare 的新选项旨在在技术层面实现这一区分,从而回应日益增长的伦理和商业担忧。
为何需要区分搜索与训练
根据 Cloudflare 内部的统计数据,受其防护的站点数量已超过数百万,其中仅有不足1%的站点完全阻止了搜索机器人访问。相比之下,大约17%的站点已经部署了至少一种阻止 AI 训练的机制,这一比例表明站点运营者对细粒度控制的需求正在快速上升。
传统的 robots.txt 文件只能表达“请勿抓取”之类的偏好,却无法验证爬虫的真实身份,也无法确认其具体用途。于是,即便站点在 robots.txt 中声明不允许抓取,某些爬虫仍可在技术或法律层面无障碍地获取内容并用于模型训练,这让内容所有者感到无力。
Cloudflare 方案的工作原理
Cloudflare 表示会将站点的“禁止 AI 训练”偏好写入元数据层,并在其全球网络中对每一次经过的爬虫请求进行实时识别和分类。对标记为训练类爬虫且未遵守该标记的请求将被拦截,其拦截日志会同步到 Cloudflare Radar,以提升透明度并为站点所有者提供可审计的证据。
平台为符合“Accountable”标准的爬虫定义了一套负责任的抓取要求,包括明确拒绝用于模型训练的机制、未来可选的拒绝 AI 生成摘要的功能、按 URL 可视化的拒绝状态展示,以及保证这些限制不影响普通搜索引擎的索引效果。
- Apple、Google 与 Microsoft 已经或承诺在规定时间内满足 Accountable 标准。
- Amazon、Anthropic、Meta 与 OpenAI 已根据 Cloudflare 的分类法分离搜索和训练机器人。
- Cloudflare 的控制将机器人分为三类:搜索、训练和代理。
- 新的“禁止 AI 训练”设置仅适用于训练类机器人,尚未扩展至用户指定的代理。
搜索与训练的区分至关重要,因为它保留了网络可发现性的核心价值。站点在开启该选项后仍然可以出现在 Google、Bing 等主流搜索引擎的结果页中,同时向 AI 提供者发出技术层面的明确拒绝信号,防止其内容被用于大规模模型的训练。
未来路线图
Cloudflare 在同篇博客中透露,下一阶段的研发重点将转向对页面内容在 AI 生成摘要中的呈现比例进行控制。该功能独立于训练拒绝机制,旨在解决内容在对话式代理中被直接展示或引用时可能产生的版权和隐私风险。
为了实现这一目标,Cloudflare 计划在 Radar 中加入更细粒度的可视化工具,帮助站点运营者实时监测其内容被 AI 摘要系统引用的频次和范围,并提供可选的“摘要拒绝”开关,以进一步细化数据使用政策的执行力度。
对中国企业的意义
对于在中国境内运营的企业而言,启用“禁止 AI 训练”选项同样具备直接而显著的影响。通过该设置,企业能够在保持搜索引擎优化(SEO)表现的同时,向国内外的 AI 模型提供者发送明确的技术信号,表明其网页内容不应被用于训练。Radar 提供的可视化日志还能帮助法务和合规部门在监管审查中展示对新兴数据使用政策的遵循情况。
信息来源
- Have it both ways: stay discoverable in search while disallowing AI trainingCloudflare · 2026年9月15日
- Cloudflare ermöglicht Trennung von KI- und SuchbotsGolem.de · 2026年9月18日



