Sitemap 產生器

sitemap.xml 產生器

輸入 URL 列表,統一設定更新頻率、優先權與最後修改時間,一鍵產生符合 sitemap.org 標準的 XML 網站地圖。

輸入與參數
XML 輸出
共 3 個有效 URL,檔案大小 483 位元組

線上產生符合 sitemap.org 0.9 開放協定標準的 Sitemap XML 網站地圖檔案,支援 changefreq 七種更新頻率、priority 0.0-1.0 相對優先度、lastmod 日期選擇器完整設定,自動XML實體跳脫、無效URL即時偵測、結構化XML即時預覽、一鍵下載與複製功能,助力 Google/Bing 主流搜尋引擎快速發現並高效收錄網站全部重要頁面。

相關推薦

適用場景

  • 新網站上線後批次產生核心頁面 Sitemap,提交至 Google Search Console 和 Bing Webmaster Tools 加速搜尋引擎發現與收錄
  • 網站欄目改版或URL結構調整後重新產生站台地圖,更新搜尋引擎索引避免死鏈殘留影響SEO表現
  • 電商網站批次匯入商品列表URL,按商品分類、上架時間設定不同的 changefreq 和 priority 值
  • 大型入口或資訊站點超過50000條URL時,按頻道拆分產生多個Sitemap並製作Sitemap Index索引檔案
  • 部落格網站為文章頁、標籤頁、分類頁、歸檔頁分別設定合理的更新頻率和優先度參數
  • 企業官網整理產品頁、新聞頁、關於頁、聯絡頁等不同類型URL,設定差異化lastmod和priority
  • 網站遷移完成後(HTTP升級HTTPS、網域更換)重新產生Sitemap並提交,引導爬蟲快速抓取新位址
  • 配合Yoast SEO等外掛產生的Sitemap進行手動補充,新增外掛未涵蓋的特殊頁面URL
  • SEO診斷最佳化後重新產生Sitemap,確保重要頁面 priority 設定合理,提升高價值頁面抓取權重
  • 透過robots.txt宣告Sitemap位置前,先用本工具驗證XML格式正確性,避免爬蟲解析失敗

使用方法

  1. 在URL輸入區域貼上需要收錄的頁面位址列表,每行一個完整URL(需包含http://或https://協定標頭)
  2. 在changefreq下拉選單中選擇頁面更新頻率:首頁選daily或hourly,文章頁選weekly,靜態頁選yearly或monthly
  3. 拖動priority滑桿或輸入0.0-1.0之間的數值設定優先度:核心首頁設為1.0,重要欄目頁0.8,普通文章頁0.5,歸檔頁0.3
  4. 點擊lastmod日期選擇器,選擇網站內容最後修改日期,或留空不包含lastmod欄位
  5. 查看右側即時預覽區域,檢查產生的XML結構是否正確,無效URL會被紅色標註提示修正
  6. 確認無誤後點擊「下載sitemap.xml」按鈕儲存檔案,或點擊「複製」按鈕將XML內容複製到剪貼簿
  7. 將sitemap.xml上傳至網站根目錄,在robots.txt中新增Sitemap宣告,或直接提交到Google Search Console/Bing Webmaster

功能特點

  • 批次 URL 輸入支援:每行一個 URL,自動過濾空行與重複連結,快速處理大量頁面位址
  • XML 實體自動跳脫:URL 中的 &、<、>、"、' 等特殊字元自動跳脫為 &amp;、&lt;、&gt;、&quot;、&apos;,徹底避免 XML 解析錯誤
  • 7種 changefreq 更新頻率選項:always、hourly、daily、weekly、monthly、yearly、never,涵蓋所有頁面類型場景
  • priority 優先度精細設定:支援 0.0 到 1.0 區間內任意數值,支援小數點後一位精度,區分頁面重要程度
  • lastmod 最後修改時間日期選擇器:視覺化日曆選擇器,自動格式化為 W3C Datetime 標準格式(YYYY-MM-DD)
  • 無效 URL 即時偵測:自動識別格式錯誤的 URL(缺少協定、非法字元等),標註問題行號便於修正
  • 即時預覽產生:修改 URL 列表或設定參數後 XML 內容即時更新,無需手動點擊產生按鈕
  • 一鍵下載 sitemap.xml:產生結果直接下載為標準 XML 檔案,儲存後可立即上傳至網站伺服器
  • URL 數量超限警告:當輸入 URL 達到 50000 條時自動提示需要使用 Sitemap Index 拆分方案
  • 複製到剪貼簿:一鍵複製完整 XML 內容到剪貼簿,方便直接貼上到伺服器檔案或線上提交
  • 位元組大小統計:即時顯示產生的 Sitemap XML 檔案位元組數,評估檔案大小是否符合搜尋引擎限制
  • 標準 urlset 根元素輸出:嚴格遵循 http://www.sitemaps.org/schemas/sitemap/0.9 協定規範,包含正確的 xmlns 命名空間宣告
  • UTF-8 編碼宣告:自動新增 XML 編碼宣告,確保中文等多語言 URL 正確解析不出現亂碼

常見問題

Sitemap一定要提交嗎?不提交網站就不會被收錄嗎?

不提交Sitemap網站也可能被收錄——搜尋引擎可以透過其他網站的外鏈、內鏈跟蹤發現你的頁面。但提交Sitemap可以大幅加快發現速度,特別是新站、大型網站、內鏈不完善的網站。Google官方建議所有網站都提交Sitemap,這是成本極低收益很高的SEO基礎工作。

Sitemap中的URL必須是絕對路徑嗎?可以寫相對路徑嗎?

必須是完整的絕對URL,包含協定標頭(http://或https://)和完整網域,不能寫相對路徑(如/page1.html)或省略協定的寫法。搜尋引擎解析Sitemap時需要完整URL才能正確抓取,相對路徑會導致解析錯誤。

changefreq和priority設定真的有用嗎?搜尋引擎會遵守嗎?

這兩個欄位都是「提示」不是「指令」,搜尋引擎不一定會100%遵守,但準確設定依然有參考價值。相比之下lastmod(最後修改時間)是三個欄位中搜尋引擎最重視的,因為它可以直接告訴爬蟲頁面有沒有新內容。不要弄虛作假把所有頁面都設為最高優先度或always,這會讓搜尋引擎不再信任這些後設資料。

Sitemap檔案必須放在網站根目錄嗎?

不一定,Sitemap可以放在網站任意路徑下,只要URL能正常造訪即可。但robots.txt必須放在根目錄。如果你用Sitemap Index拆分了多個Sitemap,子Sitemap的路徑沒有限制。不過習慣上放在根目錄最方便管理,也方便爬蟲發現。

網站URL不到50000條,但檔案大小超過50MB怎麼辦?

需要拆分Sitemap。50000條和50MB是兩個並列限制,滿足任意一個超限條件就需要拆分。你可以按內容類型拆分,或者精簡Sitemap(比如去掉不必要的空格、縮排,使用gzip壓縮),但如果壓縮後還是超過50MB就必須拆分。

Sitemap中可以包含noindex頁面或者被robots.txt禁止的URL嗎?

不建議。Sitemap中應該只包含你希望搜尋引擎抓取和收錄的頁面。noindex頁面、Disallow禁止的頁面、登入後才能造訪的頁面、404錯誤頁面都不應該出現在Sitemap中,這會降低搜尋引擎對Sitemap的信任度,也浪費抓取預算。

更新內容後需要重新提交Sitemap嗎?多久更新一次Sitemap合適?

只要Sitemap檔案URL不變,搜尋引擎會定期重新抓取,不需要每次更新內容都手動重新提交。更新頻率取決於你網站內容更新頻率:新聞類網站可以每天甚至每小時更新Sitemap(自動產生),企業網站每週或每月更新一次即可。可以設定伺服器端指令碼自動更新Sitemap檔案。

Sitemap支援哪些語言的URL?中文URL需要編碼嗎?

Sitemap支援任意語言的URL,但非ASCII字元(如中文)的URL需要進行URL編碼(也叫百分號編碼,percent-encoding)。比如「中文頁面」要編碼成%E4%B8%AD%E6%96%87%E9%A0%81%E9%9D%A2這種形式。大部分瀏覽器和工具會自動處理,但你需要確保產生的Sitemap中URL是正確編碼的。

可以同時提交多個Sitemap嗎?比如同時有文章Sitemap和商品Sitemap?

可以,有兩種方式:①使用Sitemap Index索引檔案統一管理所有子Sitemap,這是推薦方式,只需要提交索引檔案URL;②在站長平台逐個提交每個子Sitemap的URL,這種方式也可以但管理起來麻煩。兩種方式都有效,搜尋引擎都會抓取。

Sitemap產生後需要gzip壓縮嗎?壓縮有什麼好處?

不強制要求壓縮,但強烈推薦。gzip壓縮通常能把Sitemap體積減小70%-80%,節省頻寬和爬蟲抓取時間,特別是大型網站效果明顯。搜尋引擎完全支援sitemap.xml.gz這種壓縮格式,會自動解壓。只要壓縮後不超過50MB就沒問題。

HTTP和HTTPS兩個版本的網站都需要提交Sitemap嗎?

你應該只提交你希望被收錄的首選版本。如果已經全站HTTPS並做了HTTP→HTTPS 301重新導向,只需要提交HTTPS版本的Sitemap。不要同時提交HTTP和HTTPS兩個版本,這會導致重複內容問題。同樣,www和非www也要確定首選網域,只提交首選網域的Sitemap。

WordPress用Yoast SEO產生了Sitemap,還需要用這個工具嗎?

Yoast SEO可以自動產生大部分頁面的Sitemap,但可能漏掉一些頁面——比如你手動建立的單頁、自訂post type沒設定好、特殊落地頁、站外匯入的頁面等。可以用本工具補充這些Yoast沒涵蓋的URL,產生單獨的補充Sitemap,或者對比檢查Yoast產生的Sitemap是否完整正確。

Sitemap中URL的順序重要嗎?把重要頁面放前面有用嗎?

Sitemap協定中URL順序沒有任何官方權重,搜尋引擎不會因為URL排在前面就優先抓取。但部分SEO從業者觀察到有輕微的順序偏好效果,所以把重要URL放前面也沒有壞處,但不要指望這能帶來明顯效果,還是應該透過priority欄位正確標識優先度。

分頁頁面(如/list?page=2、/page/3)需要放進Sitemap嗎?

這取決於分頁內容的價值。如果分頁是「查看更多」性質的重複列表(如文章列表第2頁、第3頁),通常不建議放入Sitemap,因為這些頁面內容重複且價值低,應該把重點放在列表首頁和具體文章頁。但如果分頁是獨特內容(如分類瀏覽、分頁有獨立價值)可以考慮包含,設定較低的priority。

怎麼驗證Sitemap是否正確有效?

有幾種驗證方式:①用本工具產生後先在本機預覽XML結構是否正確,檢查標籤閉合、命名空間、跳脫字元是否正常;②使用sitemap-inspector工具線上驗證格式和URL可造訪性,批量檢查所有URL的HTTP狀態碼;③上傳後用瀏覽器直接造訪Sitemap URL看是否能正常顯示沒有XML解析錯誤;④提交到Google Search Console/Bing Webmaster Tools後檢視狀態報告,看有沒有格式錯誤、URL無法造訪、超出限制等錯誤提示,這是最權威的驗證方式;⑤也可以用線上XML驗證工具檢查XML語法正確性。

故障排查

產生的Sitemap XML在瀏覽器打開顯示解析錯誤,提示格式不正確

URL中包含&、<、>等XML特殊字元沒有跳脫:手動貼上時工具已自動跳脫,但如果你手動編輯過檔案可能漏掉跳脫 XML宣告或urlset命名空間寫錯:檢查首行xmlns值是否完全匹配http://www.sitemaps.org/schemas/sitemap/0.9,沒有多餘斜線 標籤沒有正確閉合:所有開始標籤如<url>、<loc>必須有對應的閉合標籤</url>、</loc>,自閉合標籤寫法不要錯 檔案編碼不是UTF-8無BOM:Windows記事本可能儲存為UTF-8 BOM或Big5編碼導致解析錯誤,需儲存為無BOM的UTF-8 URL中包含非法字元:中文URL需要進行URL編碼(percent-encoding),特殊字元未編碼會導致XML解析失敗 XML版本宣告錯誤:首行必須是<?xml version="1.0" encoding="UTF-8"?>,不要寫成1.1或其他版本 標籤巢狀順序錯誤:子標籤必須完全包含在父標籤內,不能交叉巢狀,如<url><loc></url></loc>這種順序錯誤

Google Search Console提交Sitemap後顯示「無法讀取Sitemap」或「格式錯誤」

Sitemap檔案URL無法造訪:檢查瀏覽器直接造訪Sitemap URL是否回傳200狀態碼,沒有403/404/500錯誤 伺服器回傳了錯誤的Content-Type:應該回傳application/xml或text/xml,如果回傳text/html會導致識別失敗 Sitemap中包含了被robots.txt禁止抓取的URL:GSC偵測到Sitemap中有Disallow路徑會報錯 URL重新導向問題:Sitemap的URL如果301/302跳轉到其他位址會導致錯誤,確保URL直接可造訪不跳轉 HTTP/HTTPS或www/非www不匹配:提交的Sitemap網域與GSC中驗證的網域不一致(如驗證的是www.example.com但Sitemap用了example.com) Sitemap檔案太大超出50MB限制或URL超過50000條:GSC會直接拒絕處理超限檔案 使用了HTML實體而不是XML實體:空格的&nbsp;是HTML實體不是XML實體,XML中不能使用

提交Sitemap很久了,很多URL還是沒有被Google收錄

頁面品質問題:收錄不是提交就一定有的,內容原創性差、重複內容、內容價值低的頁面Google可能選擇不收錄 新站審核期(沙盒效應):新網站提交Sitemap後可能需要幾周到幾個月的觀察期才會批量收錄 頁面是noindex:URL回傳的頁面中有noindex meta標籤或X-Robots-Tag: noindex回應標頭,Google會主動排除 網站抓取預算不足:網站權重低、伺服器回應慢、內鏈結構差,Google爬蟲分配的抓取頻率低,需要更多時間 Sitemap中包含了大量低品質URL:如果Sitemap中很多是404、5xx錯誤、重複內容、低價值頁面,Google會降低對整個Sitemap的信任 網域被懲罰:網站存在違反Google品質指南的問題(如作弊、垃圾內容、惡意軟體)導致收錄受阻 頁面是孤立頁面:頁面雖然在Sitemap中,但網站內鏈沒有任何入口,爬蟲可能認為不重要而不收錄

Sitemap中顯示已發現URL,但實際索引數量很少

這是正常現象:「已發現」只是表示Google造訪過Sitemap看到了URL,不代表會全部收錄,索引率取決於頁面品質 重複內容問題:多個URL內容高度相似(如帶不同參數的同一頁面、列印版本、分頁),Google會選一個規範版本收錄 規範化標籤(canonical)指向其他頁面:頁面設定了<link rel="canonical" href="其他URL">,Google會收錄canonical指向的位址 頁面內容太單薄:內容字數太少、沒有實質價值、採集內容,Google認為不值得收錄 頁面載入速度過慢:伺服器回應逾時、頁面載入太慢,爬蟲抓取失敗多次後會降低抓取優先度 HTTPS憑證問題:SSL憑證無效、混合內容錯誤、HTTP/HTTPS版本同時存在導致規範化問題 行動裝置適配問題:行動裝置友善性差、行動適配錯誤,在行動優先索引環境下影響收錄

Bing能正常抓取Sitemap但Google完全不抓取

Google Search Console驗證問題:確認網域所有權驗證有效,驗證的網域(www/非www、http/https)和實際造訪版本一致 伺服器防火牆或CDN攔截了Googlebot:檢查伺服器造訪日誌看Googlebot(user-agent包含Googlebot)的請求是否被攔截或回傳403 DNS解析問題:Google的DNS解析到的IP位址和Bing不同,確保所有地區都能正常解析到你的伺服器 robots.txt對Googlebot有特殊限制:檢查User-agent: Googlebot下是否有特殊的Disallow規則 網站之前有過作弊歷史被Google降權:曾被手動處罰的網域需要先申請重新審核 Sitemap URL中包含了Google認為不安全的內容:如被標記為惡意軟體、釣魚內容的網域 CDN的WAF規則誤攔截:某些安全規則可能誤判Googlebot爬蟲行為,需要檢查CDN安全日誌

產生的Sitemap在本機測試正常,上傳到伺服器後造訪回傳404錯誤

檔案路徑不對:sitemap.xml沒有上傳到正確的目錄,確認上傳到了你在robots.txt和提交給搜尋引擎的URL對應位置 檔名大小寫問題:Linux/Unix伺服器區分大小寫,Sitemap.xml和sitemap.xml是不同檔案,確保檔名全小寫 Nginx/Apache設定禁止造訪xml檔案:檢查伺服器設定是否有location規則拒絕了.xml後綴檔案造訪或回傳了錯誤的try_files規則 檔案權限問題:伺服器上檔案權限設定不正確(如600權限),Web伺服器使用者沒有讀取權限,通常需要644權限,目錄需要755權限 CDN快取了舊的404回應:剛上傳的檔案CDN可能還快取著之前的404,需要重新整理CDN快取或等待CDN自動回源更新 WordPress等CMS的固定連結規則衝突:CMS的重寫規則把sitemap.xml攔截了,需要設定排除規則讓伺服器直接造訪靜態檔案 伺服器設定了防盜鏈或造訪控制:.htaccess或Nginx設定中的referer檢查、IP白名單等規則可能攔截了爬蟲造訪

術語表

Sitemap(站台地圖)
向搜尋引擎告知網站上所有可供抓取頁面的XML協定標準檔案,包含完整URL列表及每個URL的後設資料資訊,幫助Googlebot、Bingbot等爬蟲更智慧高效地發現、理解和抓取網站內容,由sitemaps.org組織維護統一的開放協定標準(目前版本0.9)。
urlset
標準Sitemap XML檔案的根元素,必須包含正確的xmlns命名空間宣告,內部巢狀所有<url>子元素條目,是Sitemap有效性的核心標識,缺少正確urlset結構的Sitemap會被搜尋引擎直接拒絕解析。
Sitemap Index
站台地圖索引檔案,當網站URL數量超過50000條或單個Sitemap檔案大小超過50MB時必須使用,根元素為<sitemapindex>,用於統一列出和管理多個子Sitemap檔案位址,支援大型網站拆分Sitemap的標準方案。
changefreq
Sitemap中可選後設資料元素,用於指定頁面內容大概的更新頻率,共有always、hourly、daily、weekly、monthly、yearly、never七種合法取值,供搜尋引擎爬蟲參考安排回訪抓取頻率,合理設定可最佳化抓取預算分配。
priority
Sitemap中可選後設資料元素,用於指定該URL相對於網站內其他頁面的重要程度優先度,取值範圍為0.0到1.0之間的小數,預設值為0.5,priority僅影響站內頁面相對抓取優先度,不影響搜尋結果排名。
lastmod
Sitemap中可選後設資料元素,記錄頁面最後一次實質性內容修改的日期和時間,格式必須遵循W3C Datetime規範,是三個可選後設資料欄位中搜尋引擎最重視的欄位,因為它直接指示頁面是否有新內容需要重新抓取。
loc
<url>元素下的必填子元素,用於指定頁面的完整絕對URL位址,必須以http://或https://協定開頭,包含完整網域,URL總長度不能超過2048個字元,不允許使用相對路徑。
XML 命名空間(xmlns)
urlset根元素必須宣告的XML命名空間屬性,屬性值必須精確匹配http://www.sitemaps.org/schemas/sitemap/0.9,用於標識Sitemap使用的協定版本,缺少或寫錯命名空間會導致Sitemap解析失敗。
W3C Datetime
W3C(全球資訊網聯盟)規定的日期和時間表示格式,Sitemap中的lastmod欄位必須遵循此格式,常用YYYY-MM-DD簡化日期格式(相容性最好),也支援包含時分秒和時區資訊的完整日期時間格式。
XML 實體跳脫
XML語法中特殊字元必須跳脫為對應的實體參考才能正確解析:&跳脫為&amp;、<跳脫為&lt;、>跳脫為&gt;、"跳脫為&quot;、'跳脫為&apos;,URL中包含這些字元時必須跳脫,否則會導致XML解析錯誤。
Google Search Console (GSC)
Google官方提供的站長平台工具,用於提交Sitemap、檢視網站索引狀態、搜尋流量資料分析、抓取錯誤報告、安全問題通知、手動操作處罰通知等,是Google搜尋引擎最佳化(SEO)的必備工具。
Bing Webmaster Tools
微軟Bing搜尋引擎官方站長平台,功能與Google Search Console類似,支援Sitemap提交、索引覆蓋率統計、SEO診斷分析、關鍵字研究、反向連結查詢等,覆蓋Bing和Yahoo兩大搜尋引擎的搜尋流量。
robots.txt
存放在網站根目錄下的純文字檔案,透過User-agent、Disallow、Allow等指令告知搜尋引擎爬蟲哪些路徑允許抓取、哪些路徑禁止抓取,同時也可以在檔案中宣告Sitemap檔案的位置供爬蟲自動發現。
爬蟲(Crawler/Spider/Bot)
搜尋引擎開發的自動抓取網頁內容的程式,如Googlebot(Google爬蟲)、Bingbot(Bing爬蟲)、Baiduspider(百度爬蟲),透過跟蹤頁面連結和讀取Sitemap檔案發現新頁面,下載頁面內容後存入搜尋引擎索引庫。
抓取預算(Crawl Budget)
搜尋引擎在一定時間週期內分配給某個網站的總抓取資源量,由網站網域權重、伺服器回應速度、頁面內容品質、歷史抓取效果等多種因素共同決定,正確設定Sitemap可以幫助最佳化抓取預算的使用效率。
UTF-8 編碼
Sitemap XML檔案強制要求使用的字元編碼,UTF-8支援包括中文在內的所有Unicode字元,在XML宣告中透過encoding="UTF-8"屬性指定,使用其他編碼(如Big5、GB2312)可能導致中文URL亂碼和解析失敗。
gzip 壓縮
Sitemap協定支援使用gzip演算法壓縮傳輸(檔案後綴為.xml.gz),可將Sitemap檔案體積減小70%-80%,大幅節省伺服器頻寬和爬蟲抓取時間,主流搜尋引擎都能自動解壓處理gzip壓縮的Sitemap檔案,壓縮後仍需遵守50MB大小限制。
Yoast SEO
WordPress、Shopify等CMS平台上廣泛使用的SEO外掛,可自動產生Sitemap、meta標籤、麵包屑導航、XML站台地圖、RSS最佳化、社群媒體後設資料等SEO相關功能,是內容型網站常用的SEO解決方案。
索引覆蓋率(Index Coverage)
Google Search Console中的核心報告之一,詳細顯示網站中頁面被Google收錄、排除、出現錯誤、存在警告的具體數量和原因明細,可用來驗證Sitemap提交效果和診斷頁面收錄問題。
URL 編碼(Percent-Encoding)
也叫百分號編碼,用於在URL中表示非ASCII字元(如中文、特殊符號)的編碼方式,中文字元會被編碼為%XX%XX%XX形式(如"中文"編碼為%E4%B8%AD%E6%96%87),Sitemap中的中文URL必須正確編碼才能被解析。

changefreq 更新頻率場景對照表

changefreq取值更新頻率典型適用頁面類型注意事項
always每次造訪都可能變化即時資料頁、搜尋入口、動態聚合頁不是說爬蟲每次都來,只是變化頻率極高;不要濫用,普通頁面不要設為always
hourly每小時更新新聞首頁、社群媒體動態、即時行情頁適合每小時有新內容產出的頁面,非高頻更新站點不要設為hourly
daily每天更新網站首頁、部落格列表頁、資訊頻道頁、商品分類頁最常用的值之一,大部分站點首頁和欄目頁適用
weekly每週更新普通文章詳情頁、產品詳情頁、部落格正文頁大部分內容型網站的正文頁用這個比較合適
monthly每月更新分類目錄頁、歸檔頁、FAQ頁、使用指南頁內容更新不頻繁但偶爾調整的輔助頁面
yearly每年更新公司介紹頁、聯絡方式頁、服務條款、隱私政策幾乎不會變動的靜態資訊頁面
never永不更新歷史文章存檔、過期活動頁、歸檔舊內容確認不再修改的頁面設為never,若有更新記得及時改回

priority 優先度設定參考表

priority值優先度層級適用頁面類型建議頁面數量占比
1.0最高網站首頁、核心落地頁、最重要的頻道入口整個網站僅1-3個頁面
0.8-0.9很高主要欄目頁、熱門分類頁、核心產品頁、重點專題約占總頁面數的5-10%
0.6-0.7較高次要欄目頁、子分類頁、熱門文章、重要產品詳情約占總頁面數的10-20%
0.4-0.5普通普通文章詳情頁、一般產品頁、常規內容頁面約占總頁面數的40-60%(預設值)
0.2-0.3較低標籤頁、歸檔分頁、舊文章存檔、輔助頁面約占總頁面數的15-25%
0.0-0.1最低低價值頁面、重複內容頁、不希望重點抓取的頁面約占總頁面數的5%以內,0不代表禁止收錄

Sitemap 協定規範限制表

限制項上限值說明超限處理方案
單個Sitemap包含URL數量50,000條sitemap.org 0.9協定硬性規定使用Sitemap Index拆分為多個子Sitemap
單個Sitemap未壓縮檔案大小50MB(52428800位元組)包含所有標籤和空格的原始檔案大小使用gzip壓縮、拆分Sitemap、精簡註解
Sitemap Index可包含子Sitemap數量50,000個索引檔案本身的URL條目限制理論支援25億URL,一般網站用不到
單個URL長度2,048字元包含協定、網域、路徑、所有查詢參數URL過長需精簡參數或進行URL重寫
Sitemap支援的編碼格式UTF-8協定強制要求,其他編碼可能導致解析失敗儲存檔案時確保使用UTF-8編碼
Sitemap支援的協定http:// 或 https://URL必須包含完整協定標頭不支援ftp://等其他協定
提交後爬蟲回應時間幾小時到幾天取決於網站權重和Sitemap複雜度不需要重複提交,耐心等待處理即可
gzip壓縮後檔案大小50MB壓縮後的檔案同樣不能超過50MB限制壓縮超限仍需拆分Sitemap