搜霸 SEOBARSEO / GEO 技術專欄AI 爬蟲實測:sitemap.xml 的爬取有近八成來自 AI 而非搜尋引擎

AI 爬蟲實測:sitemap.xml 的爬取有近八成來自 AI 而非搜尋引擎

2026年9月17日技術 SEO· 王豪勳
淺色底橫條圖:sitemap.xml 的長條有 89.1% 為深綠色(AI 爬蟲),robots.txt 的長條只有 53.9% 為深綠色,其餘為灰色(搜尋引擎)

TL;DR

  • 三個網站近 30 天的紀錄裡,sitemap.xml 的爬取有 78% 到 89% 來自 AI 爬蟲;同一批資料中,robots.txt 的 AI 與搜尋引擎幾乎各佔一半
  • 只有 15 頁的新站,一半的爬取次數落在 robots.txt 與 sitemap.xml 這兩個檔案上,沒有讀到任何內容;頁數較多的兩站是 17% 與 19%
  • 單篇文章 30 天被爬 8 到 14 次,首頁被爬的次數是它的數倍到數十倍
  • Google 官方文件寫明小型且內鏈完整的網站可以不用 sitemap,這個判準在 AI 爬蟲身上看不到對應的行為
  • 多發一篇文章的作用,是在一份被反覆讀取的清單上多一行,不是讓既有文章被讀得更深

目錄

實測環境:三個網站的 30 天爬蟲紀錄
robots.txt 與 sitemap.xml 佔總爬取次數的比例
sitemap.xml 上 AI 爬蟲與搜尋引擎的組成
單篇文章分到的爬取次數
文章數量在爬取端的作用
本次觀測的限制

引言

網站上線之後最難確認的一件事,是 AI 到底有沒有讀到你。Search Console 只回答 Google 那一側,伺服器層的請求紀錄多數站長看不到,於是「要不要為了 AI 做什麼」這個問題往往只能憑感覺回答。

這裡有三個網站同一天取出的近 30 天爬蟲紀錄。原本要查的是哪幾篇文章被抓得最頻繁,最明顯的分布卻不在文章,在 sitemap.xml。

實測環境:三個網站的 30 天爬蟲紀錄

三個網站共用同一套紀錄機制,逐次記下爬蟲請求的來源與路徑。爬蟲身份不只認 User-Agent 字串,另有一層來源驗證,偽造 UA 的請求不列入統計。真人訪客不記錄。

網站 已被爬到的頁數 30 天總爬取次數
本站 seobar.dev(2026-08-27 上線,11 篇文章) 15 844
B 站(經營中的平台型網站) 62 8,006
C 站(經營約三年的公司網站) 116 10,086

爬蟲分成三類計算:即時檢索(回答問題時抓取當下的頁面,例如 OAI-SearchBot)、訓練抓取(取內容作為語料,例如 GPTBot、ClaudeBot)、傳統搜尋引擎(Googlebot、Bingbot)。本文提到的「AI 爬蟲」是前兩類的合計。

robots.txt 與 sitemap.xml 佔總爬取次數的比例

先看這兩個檔案佔掉多少爬取次數。兩者都不含內容,一個宣告規則,一個列出網址清單。

網站 robots.txt sitemap.xml 合計 佔總爬取次數
seobar.dev(15 頁) 284 138 422 50.0%
B 站(62 頁) 1,082 442 1,524 19.0%
C 站(116 頁) 1,264 436 1,700 16.9%

新站有一半的爬取次數沒有讀到任何內容,都在反覆確認「這個站有哪些頁、哪些可以抓」。

sitemap.xml 的絕對次數在三站相當接近(138、442、436),robots.txt 則隨站台規模上升。清單被重讀的頻率與站有多少頁,關聯並不明顯。

sitemap.xml 上 AI 爬蟲與搜尋引擎的組成

把這兩個檔案的爬取次數拆成 AI 與搜尋引擎,兩者的落差是這次資料裡最大的一處。

網站 sitemap.xml(AI/搜尋) AI 佔比 robots.txt(AI/搜尋) AI 佔比
seobar.dev 123 / 15 89.1% 153 / 131 53.9%
B 站 366 / 76 82.8% 597 / 485 55.2%
C 站 341 / 95 78.2% 762 / 502 60.3%

robots.txt 在這裡的角色是對照組:同一個網站、同一段時間、同樣是只有爬蟲會讀的檔案。三站的 robots.txt 都接近一比一,sitemap.xml 卻是 3.6 比 1 到 8.2 比 1。

這排除了「AI 爬蟲總量本來就比較多」這個解釋。以 seobar.dev 為例,全站的 AI 與搜尋引擎比例是 503 比 341,約 1.5 比 1;sitemap.xml 上的 8.2 比 1 遠高於這條基準線。

Google 的官方文件寫明,約 500 頁以下、內部連結完整的網站「可能不需要 sitemap」,因為 Googlebot 跟著連結就找得到。三個網站都在這個門檻內,Googlebot 的行為也與文件一致,它對 sitemap 的取用頻率明顯低於 robots.txt。

AI 爬蟲沒有表現出同一套判準。一個比較合理的解釋是它們缺少 Google 累積二十年的連結圖,發現新網址時能依靠的就是網站自己提供的清單;不過這是推測,這份資料只能證明行為差異存在,證不到原因。sitemap 的產生、提交與 Google 實際會讀的欄位robots.txt 的語法與常見錯誤,各有一篇完整說明。

單篇文章分到的爬取次數

剩下的爬取次數分配到內容頁時,頁與頁之間的差距相當大。

seobar.dev 的 11 篇文章,30 天各被爬 8 到 14 次。同一段時間首頁 86 次、關於頁 73 次、文章列表 62 次。B 站首頁一頁就 1,342 次,進入前 50 名排行的 18 篇文章加起來 748 次。C 站首頁 803 次,進榜的 29 篇文章合計 1,601 次。

首頁與列表頁被爬的次數,是單篇文章的數倍到數十倍。首頁是每一輪重新探索的起點,列表頁是新內容出現的位置,兩者的變動頻率都高於單篇文章。

文章數量在爬取端的作用

本站先前量過另一組資料:前 10% 的文章拿走近八成點擊,篇數與流量不成正比。那一組看的是搜尋結果那一端,這一組看的是爬取那一端。

爬蟲每天回來重讀的是清單,不是文章。多發一篇的直接效果,是那份清單上多一行、多一個可能被挑中的入口;它不會讓既有文章被讀得更深,也不會讓整站的爬取次數等比例上升。三站的 sitemap.xml 爬取次數落在 138 到 442 之間,頁數卻相差七倍以上。

至於長尾文章能不能透過內部連結把權重與讀者導向支柱文章,爬蟲紀錄回答不了。它看得到的是入口數量,看不到單篇之間的相互作用,那需要另一組資料。

實務上可以先確認的是清單本身:sitemap.xml 有沒有漏頁、lastmod 有沒有跟著內容更新、robots.txt 有沒有擋掉不該擋的路徑。這三件事的成本遠低於再寫一篇文章,而它們影響的是每一篇。

本次觀測的限制

熱門頁面的統計只取前 50 名路徑,站越大截斷越多。B 站與 C 站的「每篇平均被爬幾次」因此是高估值,只有進榜的文章被算進去;跨站比較只能比比例與排序,不宜比絕對值。

三個網站由同一人維護,用同一套技術架構與同一份 sitemap 產生邏輯,這會讓行為趨同。三個樣本不足以推論到所有網站,特別是 sitemap 產生方式不同、或內鏈結構差異大的站。

被爬取代表 AI 有抓到內容,不代表它在回答時會引用你。這兩件事之間還有好幾道判定,這份資料只涵蓋最前面那一道。

爬蟲的行為會隨各家策略調整而變動,上述比例是一次觀測的結果,不是穩定常數。

AI 爬蟲sitemaprobots.txt技術 SEO實測

常見問題

Q

AI 爬蟲會讀 sitemap.xml 嗎?

會,而且比例遠高於搜尋引擎。三個網站近 30 天的紀錄中,sitemap.xml 的爬取有 78.2% 到 89.1% 來自 AI 爬蟲;同一批資料裡,robots.txt 的 AI 佔比只有 53.9% 到 60.3%。robots.txt 是同站、同時段、同樣只有爬蟲會讀的對照組,這排除了「AI 爬蟲總量本來就比較多」的解釋。

Q

小型網站需要 sitemap.xml 嗎?

Google 官方文件說約 500 頁以下、內部連結完整的網站可能不需要,實測中 Googlebot 的行為也與這個說法一致。但 AI 爬蟲沒有表現出同一套判準:本站只有 15 頁,sitemap.xml 上 AI 與搜尋引擎的比例仍是 8.2 比 1。若希望 AI 讀得到內容,sitemap 的作用高於那份文件所描述的情況。

Q

一篇文章 30 天大概會被爬幾次?

本站 11 篇文章 30 天各被爬 8 到 14 次,同期首頁 86 次、文章列表 62 次。規模較大的兩個網站,首頁分別是 1,342 次與 803 次。這些數字會隨站台規模、更新頻率與各家爬蟲策略變動,不宜當成基準值。

Q

多寫文章可以增加被 AI 爬取的次數嗎?

可以增加入口數量,但不是等比例。三個網站的頁數從 15 到 116 相差七倍以上,sitemap.xml 的爬取次數卻都落在 138 到 442 之間。新增一篇的直接效果是在被反覆讀取的清單上多一行,不會讓既有文章被讀得更深。

Q

被 AI 爬取代表會被 AI 引用嗎?

不代表。被爬取只證明內容有被抓到,之後還有能否被檢索、能否被選為答案來源等判定。本站另一篇實測記錄了新網域從上線到 ChatGPT 能正常讀取所需的時間,那是引用之前的第一道門。

免費初步診斷

網站一直搜不到,想知道卡在哪一關?

抓取、索引、排名、AI 引用是四道不同的關卡,卡在哪一關決定要做什麼。把網址給我,我用實際量測看一遍再跟你說。

聊聊你的網站關於搜霸

技術 SEO 分類其他文章

繼續閱讀同主題的延伸內容

AI SEO/GEO 實測:ChatGPT 與 Gemini 引用來源重疊 17.8%
216 次實測:ChatGPT 與 Gemini 的引用來源重疊率只有 17.8%。問操作與觀念時,ChatGPT 有 96% 不引用任何外部網頁,Gemini 則有三分之二會列出來源。
SEO 文章要寫幾篇才有效?兩個網站的曝光集中度實測
SEO 服務多半按篇計價,但文章累積與流量成長並不成正比。兩個網站的實測顯示前 10% 的文章拿走近八成點擊,本文說明這個分布怎麼形成、為什麼合約長成按篇計價,以及判斷要不要再寫一篇的三個問題。
已檢索 - 目前尚未建立索引:狀態定義與排查順序
Google 官方明寫這不是錯誤、不必重新送交檢索。本文說明兩種未建立索引狀態的差別、被收錄卻搜不到的原因,以及為什麼同一頁在 AI 搜尋的處境未必相同。
AI SEO 實測:ChatGPT 開始讀取新網域花了 7 天
上線第 5 天,ChatGPT 對這個新網域回「URL is not safe to open」;第 12 天回測已能正常讀取並正確摘出站台資訊。被 AI 引用之前還有一道抓取准入的門,這是它打開所需…

留言討論

只有會員能留言(防止垃圾訊息),留言顯示於此頁。

載入中...
← 返回SEO / GEO 技術專欄