TECHNICAL NOTE · 2026-08-27
AI 爬蟲不是同一回事:
Search、Agent、Training 怎樣分開管理?
「封鎖所有 AI bot」聽起來簡單,實際可能關錯門
同一個「AI 爬蟲」標籤下面,可能是幫搜尋產品建立索引的 crawler、代表使用者即時讀取網頁的 agent,也可能是收集內容作模型訓練的 bot。把三者一刀切,管理上很方便,業務上卻未必合理。
Cloudflare 最新的分類把用途拆成三類:Search 用於建立索引及日後回答問題;Agent 代表使用者即時執行任務,例如 chat fetch 或 browser-use;Training 用於訓練或微調模型,亦包括同時兼作搜尋及訓練的 mixed-purpose crawler。這個分類的價值,不是多一組技術名詞,而是讓網站可以按用途作選擇。
robots.txt 是表態,真正阻擋是另一層
robots.txt 可以說明網站希望 crawler 怎樣使用內容,但 Cloudflare 的文件講得很清楚:遵守與否屬自願,檔案本身不是技術封鎖。若要實際阻擋,需使用 AI Crawl Control 或相應 WAF 規則。
Cloudflare 的 Content Signals 進一步把用途寫成 search、ai-input 和 ai-train;另有仍在測試的 content-use,用來表達內容可否只作即時互動、作索引與引用,或被更完整地摘要及重用。這些訊號適合用來建立政策紀錄,但不應被宣傳成所有 AI 平台已共同接受的行業標準。
企業需要的是一張政策表,不是一個總開關
可以先用一句話定義每類流量的立場:搜尋用途是否有助內容被發現;即時 agent 是否符合使用者服務場景;訓練用途是否符合版權、商業與資料政策。答案可以是允許、觀察後再定,或封鎖,但每項都要有負責人與覆核日期。
Cloudflare 已預告,2026-09-15 起新加入的網域會採用更新後的預設:在顯示廣告的頁面,Training 與 Agent 類別會被封鎖,Search 維持允許;mixed-purpose crawler 亦會納入訓練封鎖。這是新網域的預設變更,不代表所有現有網站會在當日自動採用同一政策。
看到 crawler,不等於已被 AI 推薦
AI Crawl Control 可以顯示 crawler 請求、狀態碼、熱門路徑與 robots.txt 違規情況。免費方案主要依 user-agent 辨識已知、自我標示的 crawler,詳細指標只保留 24 小時;更深入的辨識需要 Bot Management。
這些資料回答的是「誰來過網站」,不是「哪個 AI 回答提到品牌」。crawler request、AI 平台引薦流量、搜尋結果中的支援連結,以及受控問題測試,仍然要分開量度。流量增加也不能單獨證明內容會被引用或推薦。
PRIMARY SOURCES · OFFICIAL DOCUMENTS
主要官方來源
REVISION RECORD
修訂紀錄
v1.0 · 2026-08-27:依 Cloudflare 於 2026 年 7 至 8 月更新的官方文件,整理 AI bot 用途分類、robots.txt 與執行層的差異,以及量度限制。
限制及更正說明:本文只整理 Cloudflare 公開的一手文件與 CLEARCRAFT 的工作判讀,不代表 Cloudflare 或任何 AI 平台背書,也不構成法律意見、授權條款或可見度保證。正式改動 crawler、WAF 或內容使用政策前,應由網站、內容及合規負責人共同覆核。如有可核實的事實更正,會依 Insights 編輯與更正政策 記錄實質修訂。
