AI 爬蟲完整指南,從 GPTBot、ClaudeBot 到 PerplexityBot 的可見度監測與 robots.txt 策略
3 種 AI 爬蟲角色解析與 11 個 User-Agent 阻擋規則。針對 GPTBot 與 ClaudeBot 制定精準 robots.txt 策略,攔截無流量回饋的模型訓練抓取,並放行 OAI-SearchBot 等搜尋索引爬蟲,確保網站在 AI 搜尋引擎中維持高曝光與引用連結。
本文重點
- AI 爬蟲分為訓練、RAG 與搜尋索引 3 種角色,僅後兩者會為網站提供實質流量回饋與明確的來源引用。
- GPTBot 與 CCBot 等純訓練爬蟲會無償消耗資源,應透過 robots.txt 攔截以保護內容智財權。
- 放行 OAI-SearchBot 等搜尋與 RAG 爬蟲,是確保網站在 AI 搜尋引擎獲得曝光與流量的關鍵。
- 傳統放行策略已失效,應依據用途分流原則,精準控管 11 種主流 AI 爬蟲的抓取權限以保護網站流量。
隨著生成式 AI 搜尋引擎崛起,網站管理者必須重新檢視對待 AI 爬蟲 的技術策略。這篇文章將帶你深度解析 GPTBot、ClaudeBot、PerplexityBot 等主流爬蟲的運作機制,並透過 robots.txt 與 Cloudflare 實作精準的 AI 可見度監測與攔截設定,確保網站能在保護智財權的同時最大化 AI 搜尋曝光。
一、AI 爬蟲與傳統搜尋爬蟲的根本差異
AI 爬蟲與傳統搜尋引擎爬蟲的最大差異,在於資料抓取後的「用途」與「流量回饋機制」。傳統爬蟲抓取網頁是為了建立索引並將流量導回原站,而部分 AI 爬蟲抓取內容則是為了訓練大型語言模型(LLM),這通常不會為網站帶來任何實質的點擊回饋。
(一)訓練爬蟲、RAG 爬蟲與 AI 搜尋索引爬蟲的三種角色
要制定正確的防禦與放行策略,必須先釐清目前在網路上運作的 AI 爬蟲主要分為三種截然不同的角色:
- 訓練爬蟲(Training Bots):專門抓取全網資料來訓練下一代基礎模型。這類爬蟲會將你的文章拆解成 Token 餵給神經網路,無法提供來源連結,對網站來說屬於「純消耗」流量。
- RAG 爬蟲(Retrieval-Augmented Generation Bots):當使用者在 ChatGPT 或 Claude 介面中輸入包含 URL 的指令,或觸發即時聯網功能時,這類爬蟲會即時出動去抓取特定網頁內容來回答問題。
- AI 搜尋索引爬蟲(AI Search Index Bots):類似傳統搜尋引擎,為了建立 AI 搜尋(如 SearchGPT、Perplexity)的底層索引而運作,抓取後會在介面中提供明確的引用連結(Citations)與流量回饋。
(二)為什麼不能像對待 Googlebot 一樣對待 AI 爬蟲
根據 Google Crawlers Overview 的定義,Googlebot 的核心任務是建立 Google 搜尋索引。你放行 Googlebot,換取的是 SERP 上的排名與自然流量。然而,如果你一視同仁地放行所有 AI 爬蟲,等同於免費將網站心血送給科技巨頭進行模型訓練,不僅佔用伺服器頻寬,還可能培養出直接回答用戶問題而不再點擊進入你網站的競爭對手。因此,現代 SEO 策略必須將 AI 爬蟲進行精細的「用途分流」。
二、目前主流 AI 爬蟲完整清單與 User-Agent 對照
各大 AI 廠商通常會將訓練用與搜尋用的爬蟲拆分為不同的 User-Agent,精準識別這些 User-Agent 是進行 robots.txt AI 爬蟲管理的第一步。
(一)OpenAI 旗下的 GPTBot 與 OAI-SearchBot 解析
根據 OpenAI Bots 官方文件,OpenAI 目前將旗下爬蟲分為三個主要 User-Agent,明確區分了訓練與搜尋用途:
- GPTBot:專門用於抓取資料以訓練未來的 OpenAI 模型。這是不會帶來回饋流量的訓練爬蟲。
- OAI-SearchBot:專門為 SearchGPT 建立搜尋索引的爬蟲。放行這隻爬蟲才能確保你的網站在 OpenAI 的搜尋產品中獲得曝光與引用連結。
- ChatGPT-User:屬於 RAG 爬蟲。當 ChatGPT 用戶在對話框貼上你的網站連結並要求 AI 總結時,就是由這隻爬蟲出動抓取單一網頁。
(二)Anthropic 旗下的 ClaudeBot 與搜尋爬蟲
Anthropic 同樣具備抓取網頁的能力,根據 Anthropic Crawler 文件,其主要爬蟲配置如下:
- ClaudeBot:主要用於抓取公開網頁資料,為 Claude 模型的訓練提供語料。
- Claude-SearchBot / Claude-User:目前 Anthropic 在聯網搜尋與用戶觸發的即時抓取上,也逐漸細分出專屬的 User-Agent 來處理 RAG 任務,確保用戶貼上連結時能順利讀取內容。
(三)PerplexityBot 與 Perplexity-User 的差異
Perplexity 作為原生 AI 搜尋引擎,其爬蟲機制更偏向即時檢索與索引建立。根據 Perplexity Bots 文件,其爬蟲主要分為:
- PerplexityBot:負責廣泛抓取網頁以建立 Perplexity 的內部索引庫,確保 AI 搜尋結果的時效性。
- Perplexity-User:當用戶提出具體問題,Perplexity 判斷需要即時造訪特定來源以核實資訊時觸發的 RAG 爬蟲。
(四)其他需要注意的 CCBot 與科技巨頭 AI 爬蟲
除了上述三家,還有許多對 AI 生態系至關重要的爬蟲在默默消耗網站資源:
- CCBot:根據 Common Crawl CCBot 說明,這是 Common Crawl 計畫的爬蟲。雖然它本身是開源非營利專案,但其資料集是目前全球幾乎所有開源與商用 LLM(包含 Llama、GPT 系列早期版本)最重要的訓練語料庫。
- Google-Extended:Google 專門用來控制是否允許內容被用於訓練 Bard/Gemini 基礎模型的 User-Agent。
- Bytespider:字節跳動(ByteDance)旗下用來訓練豆包等 AI 模型的爬蟲,經常被觀測到具備極高的抓取頻率。
- Applebot-Extended:Apple 用於訓練其 Apple Intelligence 基礎模型的爬蟲。
- Amazonbot:Amazon 旗下用於訓練與改進其 AI 產品的網路爬蟲。
三、robots.txt 對 AI 爬蟲的精準管理策略
了解各家爬蟲的 User-Agent 後,我們就能透過 robots.txt 實作「阻擋訓練、放行搜尋」的最佳化策略。這能確保網站不會成為免費的 AI 訓練素材,同時依然能在 AI 搜尋引擎中保有極高的能見度。
(一)只擋訓練爬蟲並放行 RAG 與搜尋索引爬蟲的設定範本
如果你希望網站內容出現在 SearchGPT 和 Perplexity 的引用連結中,但不想被拿去當作底層模型訓練,可以使用以下 robots.txt 範本:
## 阻擋 OpenAI 訓練爬蟲
User-agent: GPTBot
Disallow: /
## 阻擋 Google 模型訓練爬蟲(不影響一般 Googlebot 搜尋排名)
User-agent: Google-Extended
Disallow: /
## 阻擋 Anthropic 訓練爬蟲
User-agent: ClaudeBot
Disallow: /
## 阻擋 Common Crawl(切斷多數開源模型的語料來源)
User-agent: CCBot
Disallow: /
## 阻擋其他常見訓練爬蟲
User-agent: Bytespider
Disallow: /
User-agent: Applebot-Extended
Disallow: /
## 明確放行 OpenAI 搜尋與 RAG 爬蟲
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
## 明確放行 Perplexity 爬蟲
User-agent: PerplexityBot
Allow: /
User-agent: Perplexity-User
Allow: /
(二)Wildcard 設定的陷阱與 Crawl-delay 對 AI 爬蟲是否有效
在設定 robots.txt 時,許多人會誤以為使用 Crawl-delay: 10 可以限制 AI 爬蟲的抓取頻率。根據 Google robots.txt 介紹 與業界實測,包含 Googlebot 與多數現代 AI 爬蟲根本不支援 Crawl-delay 指令。
此外,使用 Wildcard(如 User-agent: *)時要特別小心。AI 爬蟲的 User-Agent 匹配規則通常遵循最長前綴匹配,如果你只設定了 User-agent: * 的規則,而沒有特別針對 GPTBot 寫出 Disallow: /,GPTBot 就會預設自己被允許抓取全站。
(三)擋了訓練爬蟲會不會影響 AI Overview 與 LLM 引用
這是不斷被討論的 SEO 議題。阻擋 GPTBot 或 Google-Extended 絕對不會影響你在 Google AI Overviews 或是 SearchGPT 裡面的曝光。因為這些 AI 搜尋功能的資料來源是基於傳統搜尋索引(Googlebot)或是專屬的搜尋爬蟲(OAI-SearchBot)。想進一步了解 AI 搜尋的運作機制,可以參考 GEO 是什麼 與 llms.txt 完整指南 的深度解析。
四、Cloudflare WAF 與 Bot Management 對 AI 爬蟲的進階管控
robots.txt 充其量只是一份「君子協定」,對於完全無視 robots.txt 規範的惡意 AI 爬蟲或偽裝成一般瀏覽器的 Scraper,我們必須依賴伺服器端的防火牆(WAF)來進行實質攔截。
(一)運用 Cloudflare AI Audit 與一鍵阻擋功能
Cloudflare 近期推出了專門針對 AI 爬蟲的防護機制。根據 Cloudflare AI Audit 的介紹,這項工具能在儀表板中清晰呈現哪些 AI 模型正在抓取你的網站,並提供詳細的 Request 數據分析。
更強大的是,根據 Cloudflare Block AI Bots 說明,網站管理員現在可以直接在 Cloudflare Security 介面中啟用一鍵阻擋功能(Block AI Bots)。這個按鈕會自動套用 Cloudflare 持續更新的 AI 爬蟲特徵庫,直接在邊緣節點(Edge)將這些爬蟲的 Request 阻擋下來(回傳 403 Forbidden),徹底節省原站的伺服器資源。
(二)用 Bot Management 規則辨識假冒 AI 爬蟲的流量
有些開發者為了繞過防護,會將自己寫的 Python 爬蟲 User-Agent 偽裝成 Mozilla/5.0 (Windows NT 10.0; Win64; x64)...。如果你使用的是 Cloudflare Pro 以上方案,可以透過 Bot Management 搭配 WAF 自訂規則,檢查 cf.bot_management.score。通常 AI 爬蟲與自動化腳本的 Bot Score 會低於 30,你可以設定當分數過低且未通過 Verified Bot 驗證時,觸發 Managed Challenge(圖形驗證碼),從而精準攔截假冒為一般用戶的惡意抓取。
五、AI 爬蟲可見度監測的三層做法
要確認防禦策略是否生效,或是評估網站受 AI 爬蟲青睞的程度,需要建立完善的 AI 可見度監測機制。由於傳統的網站分析工具(如 Google Analytics)大多依賴 JavaScript 執行,而多數 AI 爬蟲不會執行 JS,因此必須從伺服器端著手。
(一)Server Log 過濾 AI User-Agent 的正則表達式範本
最準確的數據來源永遠是伺服器的 Access Log(如 Nginx 或 Apache 的日誌)。你可以使用以下正則表達式(Regex)範本,在日誌分析工具(如 ELK Stack 或 Datadog)中過濾出主流 AI 爬蟲的造訪紀錄:
(?i)(GPTBot|OAI-SearchBot|ChatGPT-User|ClaudeBot|Claude-SearchBot|PerplexityBot|CCBot|Bytespider|Applebot-Extended|Amazonbot|Google-Extended|Meta-ExternalAgent)
透過分析這些 Log,你可以清楚知道哪些 URL 最常被 AI 搜尋引擎抓取,進而推測哪些內容在 AI 檢索中具有較高的權重。
(二)在 Cloudflare Analytics 中追蹤 AI 爬蟲的 Request 數
如果你沒有自建 Log 分析系統,Cloudflare Analytics 是最方便的替代方案。進入 Cloudflare 的 Web Analytics 或 Security Events,你可以將過濾條件設定為 User Agent contains GPTBot 或直接使用前述提到的 AI Audit 面板,觀察特定時間區間內 AI 爬蟲造成的 Request 數量與頻寬消耗。這對於評估是否需要升級伺服器規格非常有幫助。
(三)GSC 與 AI 爬蟲交叉驗證的盲點
許多 SEO 從業人員習慣依賴 Google Search Console(GSC)的抓取統計資料(Crawl Stats),但這存在嚴重的盲點。GSC 只會顯示 Googlebot 系列(包含一般 Googlebot 與 Google-Extended)的抓取紀錄。如果你想知道 PerplexityBot 或 OAI-SearchBot 有沒有來抓你的 Sitemap,GSC 完全幫不上忙。要全面掌握爬蟲動態,必須結合 Server Log 與 Sitemap 實作與 GSC 提交 中提到的 Sitemap 存取日誌進行交叉比對。
六、AI 爬蟲擋與不擋的策略決策樹
到底該不該全面封殺 AI 爬蟲?這沒有標準答案,完全取決於你的網站商業模式與內容資產的性質。
(一)內容站與 SaaS 等四種角色的建議設定
不同類型的網站,面對 AI 爬蟲時應採取截然不同的策略:
- 內容農場與資訊站:強烈建議阻擋訓練爬蟲(GPTBot、CCBot),但全面放行搜尋爬蟲(OAI-SearchBot、PerplexityBot)。這能確保你的內容不會被白白吃掉,同時爭取在 AI 搜尋結果中成為引用來源。
- SaaS 官方文件與部落格:建議全面放行。SaaS 公司的核心利益是讓 AI 準確理解你的產品並推薦給使用者。讓 LLM 學習你的 API 文件與使用教學,有助於 ChatGPT 在回答開發者問題時直接生成包含你產品的程式碼。
- 電商網站:建議阻擋訓練爬蟲,放行搜尋爬蟲。你絕對不希望競爭對手透過開源資料集輕易獲取你全站的商品定價與規格資料,但你會希望消費者在使用 AI 購物助理時能搜尋到你的商品。
- 付費牆媒體(Paywall Media):必須全面阻擋所有非授權的 AI 爬蟲,並在 WAF 層級實作嚴格的 Bot 防護,避免付費內容被 RAG 爬蟲繞過付費牆直接抓取給免費用戶看。
(二)智財權與品牌曝光的三方權衡
在制定策略時,SEO 團隊需要與法務及行銷部門共同權衡。阻擋訓練爬蟲能保護智財權(IP)不被未經授權的科技巨頭濫用;阻擋特定爬蟲能防止競爭情報外洩;而放行搜尋爬蟲則是為了順應 SEO 基礎策略 的未來趨勢,確保品牌在下一代對話式搜尋介面中維持極高的曝光度。
七、FAQ
(一)Q1: 阻擋 AI 爬蟲會影響傳統 SEO 排名嗎?
完全不會。只要你的 robots.txt 中沒有不小心阻擋到 Googlebot,單純針對 GPTBot、ClaudeBot 或 Google-Extended 設置 Disallow,對你在 Google 傳統搜尋引擎的 SERP 排名與自然流量沒有任何負面影響。
(二)Q2: 設定 robots.txt 後為何仍有 AI 爬蟲抓取紀錄?
這有三種可能原因:第一,爬蟲快取了你舊版的 robots.txt,通常需要等待 24 到 48 小時才會更新規則;第二,部分惡意或不守規矩的 AI 爬蟲本來就無視 robots.txt 規範;第三,有開發者偽造了該 AI 爬蟲的 User-Agent 進行抓取。遇到後兩種情況,必須改用 Cloudflare WAF 進行伺服器層級的攔截。
(三)Q3: OAI-SearchBot 與 GPTBot 應該如何取捨?
這是現代 AI SEO 最核心的決策。GPTBot 是為了訓練未來的 ChatGPT 底層模型,不會給你帶來流量;OAI-SearchBot 則是為了建立 SearchGPT 的搜尋索引,會在使用者的搜尋結果中提供明確的來源連結。因此,最佳實務是「阻擋 GPTBot,放行 OAI-SearchBot」,以確保網站資源不被白嫖,同時最大化 AI 搜尋曝光。
張家偉 Albert Chang
行銷領域工作五年,其中四年幾乎每天都在想 SEO 的事。這裡寫我的筆記——不追流量、不堆關鍵字,只寫自己想讀的文章。
- JUL 20, 2026
AEO 是什麼?一張表分清 AEO、GEO、LLMO 與 AI SEO 的差異和 KPI
一張總表對照 4 個 AI 搜尋優化名詞的優化對象與核心 KPI。AEO 針對答案引擎、GEO 針對生成式引擎、LLMO 針對語言模型本身,三者的量測層次完全不同。拆解每個名詞的來源、適用場景與衡量指標,下次看到代理商報價單或職缺名稱時,你能立刻判斷對方在賣什麼、該追什麼數據。
- JUL 20, 2026
AI 搜尋原理完整拆解,RAG、查詢扇出與引用歸屬一次搞懂
把 AI 搜尋拆成兩期五環節:索引期的爬取與切塊,查詢期的扇出、檢索、重排序與接地生成,每個環節對應一個 SEO 可以施力的槓桿。搞懂 RAG 為什麼以段落為單位、引用為什麼會浮動,你就不再需要背誦零散的 GEO 技巧——所有優化建議都能從原理推導出來。
- JUL 20, 2026
ChatGPT SEO 完整指南,讓你的網站成為 ChatGPT Search 的引用來源
從 3 隻爬蟲的分工到 6 步優化清單,完整拆解 ChatGPT SEO 的平台邏輯。ChatGPT Search 的檢索鏈是 Bing 索引加 OAI-SearchBot,跟 Google SEO 的優化入口完全不同。搞懂放行哪些爬蟲、提交哪個站長工具、寫什麼樣的段落,把九億週活用戶的對話式搜尋變成你的導流管道。