🤖 如何用「AI 爬蟲健檢器」:先確認 AI 進得來,再談內容寫得好不好
很多人以為沒被 ChatGPT 引用是內容不夠好,實際上常常是 robots.txt 把搜尋爬蟲一起擋掉了。這篇教你用 AI 爬蟲健檢器分清楚訓練爬蟲與搜尋爬蟲、看懂不執行 JavaScript 時頁面還剩多少字,以及三種最常見的誤設。
為什麼你需要這個工具
去問 ChatGPT「推薦幾個台灣的某某品牌」,發現競品被列出來、你沒有。多數人第一個反應是內容寫得不夠好,於是開始補文章、補 FAQ。
但在補內容之前,有一件更便宜的事要先確認:AI 爬蟲進不進得來。
這件事常常被跳過,因為它看起來很技術。而實際上最常見的三種狀況都不是內容問題:
- robots.txt 想擋 AI 訓練,結果連負責搜尋索引的那幾隻一起擋掉了
- 網站是純前端渲染,AI 爬蟲不執行 JavaScript,抓到的頁面幾乎是空白
- 根本沒有 robots.txt 也沒有 sitemap,爬蟲只能靠連結慢慢摸
第三種不致命,前兩種是真的會讓你在 AI 搜尋裡完全消失,而且你補再多內容都沒用。
工具運作邏輯
這支工具不問 AI,它直接去抓。
貼上網址之後它做五件事:
1.抓網域根目錄的 robots.txt,照 RFC 9309 的規則解析
2.對十二隻 AI 爬蟲逐一判定放行或封鎖
3.抓 llms.txt 與 llms-full.txt 看存不存在
4.抓 sitemap(優先用 robots.txt 裡宣告的位置),數裡面有幾個網址
5.抓你那一頁的原始 HTML,不執行 JavaScript,算純文字字數、標題層級與 JSON-LD 型別
全部是確定性的抓取與解析,沒有任何一步交給 AI 判斷。所以它不耗 AI 額度,也不會出現「同一個網址問兩次得到不同答案」這種事。
這一點跟 GEO 引用檢查器剛好互補。那一支是請 AI 評估「你的內容被引用的機會有多高」,屬於判斷;這一支是核對事實。先用這支確認技術上進得來,再用那支看內容夠不夠被引用,順序對了才不會白做工。
最關鍵的一件事:訓練爬蟲與搜尋爬蟲是兩回事
這是整份報告最重要的區別,也是最常被搞混的地方。工具把爬蟲分三類顯示,就是為了讓這件事講清楚。
搜尋索引用(OAI-SearchBot、PerplexityBot、Claude-SearchBot)
這幾隻負責把你的頁面放進 AI 搜尋的索引裡。被擋掉就等於你在 ChatGPT 搜尋、Perplexity 的回答與引用來源裡完全不存在。這一組不能擋。
模型訓練用(GPTBot、ClaudeBot、Google-Extended、Applebot-Extended、CCBot、Bytespider)
這幾隻是把內容拿去訓練模型的。擋掉完全不影響你現在會不會被引用,只影響未來的模型是否學到你的內容。很多媒體與品牌刻意擋這一組,那是合理的商業決定。
使用者指定讀取(ChatGPT-User、Claude-User、Perplexity-User)
有人把你的網址貼進 AI 說「幫我看這一頁」的時候走這幾隻。擋掉的話,別人想主動了解你都讀不到。
為什麼要特別講?因為「我不想被 AI 拿去訓練」是很常見的念頭,而最直覺的做法就是在 robots.txt 寫一條 User-agent: * 加 Disallow: /,結果三類一起擋掉。想擋訓練、留搜尋,必須逐隻指定。
另外一個常見誤解:擋掉 Google-Extended 不會影響 Google 搜尋排名,也不決定你是否出現在 AI Overviews。那由一般的 Googlebot 決定,是兩個不同的開關。
第二個殺手:不執行 JavaScript 時你還剩多少字
多數 AI 爬蟲不執行 JavaScript。它們抓到的就是伺服器回傳的那份原始 HTML。
如果你的網站是純前端渲染,那份原始 HTML 裡可能只有一個空的 div 和一堆 script 標籤。robots.txt 開得再大方都沒意義,因為爬蟲進來之後看到的是空白。
工具會把這個數字直接告訴你。少於 500 字會標成紅色,因為那基本上代表內容靠 JS 才出現。
我們實測過幾個站當對照:
- 一個伺服器端渲染的工具站,不執行 JS 看得到 44,175 字
- 另一個同樣架構的站,7,468 字
- 台灣某大型電商平台的首頁,不執行 JS 只剩 41 個字、沒有 h1、沒有任何 JSON-LD
最後那個案例值得想一下:它的 robots.txt 對 AI 爬蟲完全放行,但爬蟲實際上什麼都拿不到。如果只檢查 robots.txt 就會以為一切正常。
這也是為什麼這支工具要同時看這兩件事,只看一件會得到錯誤的安心感。
怎麼讀報告
報告最上面是一句話結論,只講一件事:搜尋用的爬蟲有沒有被擋。那是唯一會立刻造成「在 AI 搜尋裡消失」的狀況。
接下來是逐項發現,分四個等級:
- 🔴 會讓你在 AI 搜尋裡消失的,先修這些
- 🟡 會降低被引用機會的,例如沒有 h1、沒有 JSON-LD、抓不到 sitemap
- ⚪ 參考資訊,例如沒有 llms.txt。那是新興慣例還不是正式標準,各家支援程度不一,但成本很低
- ✅ 已經做對的
每一隻爬蟲旁邊會標它是依哪一組規則判的。看到「依通用規則 *」表示你沒有為它單獨設定;看到「依 OAI-SearchBot / disallow: /」就是你明確擋了它。
工具也會把真正生效的那一條規則寫出來。這在規則互相覆蓋的時候特別有用,因為 robots.txt 不是「寫在前面的贏」,而是「路徑最長的贏」,長度相同時 Allow 贏。這條規則寫錯的人很多。
還有一條更容易錯的:Disallow: 後面留空是整站放行,不是整站封鎖。如果判斷邏輯弄反,結論會完全相反。
檢查完之後做什麼
如果搜尋用的爬蟲被擋了,那是唯一需要立刻處理的。改 robots.txt,把三類分開寫,例如留下搜尋與使用者讀取、只擋訓練。
如果不執行 JS 只剩幾十個字,那是架構問題不是設定問題,需要伺服器端渲染或預渲染,比改一行 robots.txt 工程大得多,但也是回報最大的一項。
如果技術上都通了,接下來才輪到內容。這時候用 GEO 引用檢查器看單篇文章的引用機會,用 AI 能見度檢測包產出該去問 AI 哪些問題、怎麼判分。
順序很重要:技術可及性是門票,內容品質是入場之後的競爭。門票沒拿到就去優化內容,等於在沒有人看得到的地方努力。
檢查完會知道什麼
跑完一次,你會確定下面這幾件事,而且是事實不是推測:
- 哪幾隻 AI 爬蟲被你擋住了,以及被擋的是訓練用還是搜尋用
- 真正生效的是 robots.txt 裡哪一條規則(不用自己推最長匹配)
- 不執行 JavaScript 時你的頁面還剩多少字,純前端站的致命問題會現形
- llms.txt、sitemap 網址數、JSON-LD 型別、h1 層級一次看完
整輪兩到六秒,零 AI、不耗額度、不用登入。每小時 20 次,夠你把客戶的站一次掃完。
三個實際情境
明明有寫文章卻沒被 ChatGPT 引用
持續產出內容半年,問 ChatGPT 相關問題卻從來不出現。先貼網域進來檢查:如果 OAI-SearchBot 被擋,那跟內容無關,改 robots.txt 即可;如果放行但不執行 JS 只剩幾十個字,問題在渲染方式。兩個都正常,才需要回頭檢討內容。
想擋 AI 訓練但不想影響 AI 搜尋
檢查後照三類分開設定:擋 GPTBot、ClaudeBot、Google-Extended、CCBot,保留 OAI-SearchBot、PerplexityBot、Claude-SearchBot 與三隻使用者讀取用的。改完再檢查一次確認沒有誤擋。
接客戶案子前的技術盤點
要接 SEO 或 GEO 的案子,貼客戶網址,兩到六秒拿到一份可以直接放進提案的現況表:哪幾隻爬蟲被擋、不執行 JS 剩多少字、有沒有 sitemap 與結構化資料。這些通常是對方自己不知道的事。