技術指南 · 2026-09-05
公開內容可否被 ChatGPT 找到?
香港企業要分清 OAI-SearchBot、GPTBot 與 noindex
如果香港公司的目標是讓公開服務頁有機會被 ChatGPT 搜尋到,首先要分清三件事:OAI-SearchBot 關乎搜尋發現,GPTBot 關乎潛在訓練排除,而 noindex 是頁面不應出現在索引結果時的訊號。它們不是同一個開關,更不會保證品牌被提及、引用或推薦。
最容易出錯的地方,是把「不想讓模型訓練」和「不想讓客戶在 ChatGPT 看到這個頁面」混成同一句要求。前者和 GPTBot 有關;後者要看頁面是否公開、是否設 noindex、crawler 能否讀到指示,以及網站邊界是否由登入或存取控制保護。
一個公開頁,先問三條問題
先不要急著改 robots。對每一個網址,先用同一張表記錄以下三項意圖:
| 要決定的事 | 應問的問題 | 不能假定的事 |
|---|---|---|
| 搜尋發現 | 這個公開頁是否應容許 ChatGPT 搜尋 crawler 讀取? | 容許讀取不等於一定出現在答案或得到連結。 |
| 訓練用途 | 公司是否願意讓該頁用於潛在模型訓練? | 封鎖訓練 crawler 不等於同時退出搜尋。 |
| 不公開程度 | 這個頁面是否根本不應被搜尋結果顯示? | 只封鎖 crawler 不必然阻止標題或連結從其他來源被看見。 |
這個「頁面意圖 × crawler 用途 × 曝光訊號」表是 CLEARCRAFT 的內部整理框架,不是任何平台的官方評分或保證。
OAI-SearchBot:處理「可否被搜尋發現」
OpenAI 最新的 Publisher FAQ 指出,若希望內容可用於 ChatGPT 的摘要與片段,網站不應封鎖 OAI-SearchBot。這是公開內容能否被讀取的其中一個條件,不是收錄、摘要、引用或流量承諾。
因此,一間提供美容、牙科或工程服務的香港公司,如決定讓公開服務說明、地區資訊和可核對資料參與搜尋,應把「OAI-SearchBot 是否可讀」列為逐頁政策,而不是在沒有分頁意圖的情況下,一次過封鎖全部 AI crawler。
GPTBot:處理「是否容許潛在訓練」
OpenAI 把 GPTBot 用於另一路徑:網站可用它表達不希望內容用於潛在訓練的選擇。這不等同於 OAI-SearchBot 的搜尋用途。
最實用的做法不是預設「全開」或「全關」,而是由內容責任人先確認哪些頁是公開服務資料、哪些是只供客戶或內部使用、哪些內容需要另外處理。若一個頁面不適合公開,最穩妥的起點通常是不要把它當作公開可索引頁,而不是期待一條 crawler 規則代替存取控制。
noindex:處理「不希望連標題和連結也出現」
OpenAI 也提醒:即使 crawler 被封鎖,系統仍可能從第三方搜尋供應商或其他頁面得知 URL,並在相關情況下只顯示標題和連結。文件建議對不希望出現這種結果的頁使用 noindex;同時,crawler 必須可讀取頁面,才看得到這個訊號。
這帶來一個很重要的實務檢查:若公司同時說「不要這頁出現在結果」和「不要任何 crawler 讀取這頁」,兩個設定可能互相抵觸。應先釐清頁面是否真的需要公開存在;涉及客戶、登入、報價草稿或內部文件的內容,應由合適的存取控制保護,而不是把它當成普通公開頁處理。
香港雙語網站,政策也要雙語對齊
香港網站常有繁中與英文頁。Google 的多語網站文件建議各語言版本使用不同 URL、適當的 hreflang 與可見語言內容,避免按訪客語言自動轉址,以免使用者和 crawler 看不到所有版本。
放到公開內容政策上,意思很簡單:若繁中服務頁可公開搜尋、英文版卻意外加了 noindex,或兩者連到不同版本的資料,不能期待平台自動替你修正。每對語言頁都應核對同一組項目:公開意圖、canonical、hreflang、可見正文、robots/頁面指示與內鏈。
發布前的最小核對清單
- 為每個重要網址標示:公開搜尋、訓練、代理存取與私有內容的預期狀態。
- 分開檢視
OAI-SearchBot、GPTBot與其他 crawler 的規則;不要以「AI bot」作單一決定。 - 核對
robots.txt、頁面 meta/HTTPX-Robots-Tag、實際存取控制及 WAF/bot 規則有沒有矛盾。 - 對繁中和英文相對頁逐一比對公開意圖與技術標記。
- 把 crawler request、AI referral、答案中的連結與實際查詢/成交分開記錄。
這些檢查能減少設定互相打架,卻不能取代平台的展示決定。平台會按查詢、時間、地區、語言、可用來源與其他訊號決定答案;網站只可以把公開資料與限制說清楚。
下一步
若你正在整理公開服務頁,先建立一份「網址—公開意圖—搜尋 crawler—訓練 crawler—頁面指示—責任人」清單,再檢查每一項是否一致。需要進一步理解 AI crawler 的 Search、Agent、Training 分工,可閱讀 AI 爬蟲不是同一回事:Search、Agent、Training 怎樣分開管理?。來源核對流程可參考 AI 搜尋答案的來源,香港企業如何核對?。
官方來源與適用範圍
官方來源與適用範圍
- OpenAI:Publishers and Developers - FAQ(本草稿於 2026-09-01 核對;頁面當時顯示 3 days ago 更新):
OAI-SearchBot、GPTBot、noindex與 ChatGPT Atlas 的說明。 - Cloudflare:Bots(2026-07-01 更新):Search、Agent、Training 的行為分類。
- Cloudflare:Bot reference(2026-04-23 更新):
OAI-SearchBot、GPTBot的分類參考。 - Google Search Central:Managing Multi-Regional and Multilingual Sites(2026-09-01 核對):多語網址、
hreflang、可見語言及避免自動轉址的說明。
更正政策:本文沿用正式網站的 Insights 編輯與更正政策。本文說明公開內容控制與 crawler 用途,不代表任何平台背書,也不保證收錄、摘要、引用、推薦、流量或商業結果。
