Cloudflare 推出「禁止 AI 訓練」設定,讓網站仍可被搜尋,同時阻止 AI 模型訓練
Cloudflare 現在提供「禁止 AI 訓練」選項,讓網站在搜尋引擎仍可被索引,同時拒絕使用相同的爬蟲進行人工智慧模型訓練,回應混合用途機器人日益受到關注的議題。

在 2026 年 9 月 15 日的部落格貼文中,Cloudflare 宣佈推出一項全新設定,稱為「禁止 AI 訓練」。此設定讓網站所有者在仍能被傳統搜尋引擎索引的同時,明確拒絕相同的爬蟲將其內容用於人工智慧模型的訓練,回應混合用途機器人日益受到關注的議題。
此舉的核心對象是同時執行搜尋索引與機器學習資料收集的混合用途機器人。這類機器人一次請求即可服務兩種截然不同的商業與倫理目標,因而成為業界與學界討論的焦點。
為何區分很重要
根據 Cloudflare 內部測量,受其保護的數百萬網站中,阻止搜尋機器人的比例總共不到百分之一。相較之下,已有 17 % 的網站啟用了至少一項阻止 AI 訓練的機制,顯示對細緻控制的明顯需求。
傳統的 robots.txt 檔案只能表達偏好,卻無法驗證爬蟲的身分或其使用目的。因此,即使營運者在檔案中標明禁止,仍有可能在缺乏技術或法律阻礙的情況下被抓取。
Cloudflare 解決方案的運作方式
Cloudflare 表示會將站點的偏好寫入其元資料,然後在其全球網路上辨識並分類所有通過的機器人。任何忽視「禁止 AI 訓練」旗標的機器人將被阻擋,其活動會記錄於 Cloudflare Radar,以確保透明度與可追溯性。
其「Accountable」標籤定義了一套負責任爬取的要求,包括拒絕訓練的機制、未來拒絕 AI 生成摘要的能力、每個 URL 的拒絕可視化,以及保證此拒絕不會影響一般搜尋索引的正常運作。
- Apple、Google 與 Microsoft 已符合或承諾在規定期限內符合 Accountable 標準。
- Amazon、Anthropic、Meta 與 OpenAI 已依照 Cloudflare 的分類法分離搜尋與訓練機器人。
- Cloudflare 的控制分為三類:搜尋、訓練與代理。
- 新的「禁止 AI 訓練」設定僅適用於訓練類別,尚未延伸至使用者指定的代理。
搜尋與訓練之間的區別至關重要,因為它保留了網站可被發現的核心價值。網站仍可出現在 Google、Bing 或其他搜尋結果中,同時明確表明其內容不應被大規模模型訓練重新利用。
未來路線圖
Cloudflare 表示下一階段將聚焦於控制頁面內容在 AI 生成摘要中的呈現比例。此功能將獨立於訓練拒絕機制,回應關於內容在對話式代理中曝光的顧慮。
對於使用中文的企業而言,影響即時且明顯。啟用「禁止 AI 訓練」選項後,企業可維持 SEO 效能,同時向 AI 供應商發出明確的技術訊號,表示其頁面不可用於訓練。
Radar 所提供的可見性亦可作為審計痕跡,協助法務與合規團隊證明遵循新興的資料使用政策,減少因未授權資料抓取而產生的法律風險。
此外,Cloudflare 正在與主要搜尋引擎合作,確保「禁止 AI 訓練」旗標不會被誤判為阻止索引的指令,避免網站因設定失誤而失去自然流量。
業界回應與挑戰
多家大型科技公司已公開表示支持 Cloudflare 的分離策略,認為這有助於建立更透明的資料生態系統,同時減少爭議性的資料使用情形。
然而,也有部分開源社群質疑僅靠標記與阻擋機制是否足以防止惡意爬蟲繞過,呼籲進一步的技術驗證與法律框架。
在亞洲市場,特別是中文網站,對於內容所有權的保護意識日益提升,許多企業已將「禁止 AI 訓練」列為網站治理的重要項目之一。
最後,Cloudflare 預計在 2027 年上半年推出更細緻的代理控制功能,讓站長可以自行指定哪些第三方代理可存取內容,進一步完善資料使用的授權管理。
資料來源
- Have it both ways: stay discoverable in search while disallowing AI trainingCloudflare · 2026年9月15日
- Cloudflare ermöglicht Trennung von KI- und SuchbotsGolem.de · 2026年9月18日



