Sitemap 生成器

sitemap.xml 生成器

输入 URL 列表,统一设置更新频率、优先级和最后修改时间,一键生成符合 sitemap.org 标准的 XML 站点地图。

输入与参数
XML 输出
共 3 个有效 URL,文件大小 483 字节

在线生成符合 sitemap.org 0.9 开放协议标准的 Sitemap XML 网站地图文件,支持 changefreq 七种更新频率、priority 0.0-1.0 相对优先级、lastmod 日期选择器完整配置,自动XML实体转义、无效URL实时检测、结构化XML实时预览、一键下载与复制功能,助力 Google/Bing 主流搜索引擎快速发现并高效收录网站全部重要页面。

相关推荐

适用场景

  • 新网站上线后批量生成核心页面 Sitemap,提交至 Google Search Console 和 Bing Webmaster Tools 加速搜索引擎发现与收录
  • 网站栏目改版或URL结构调整后重新生成站点地图,更新搜索引擎索引避免死链残留影响SEO表现
  • 电商网站批量导入商品列表URL,按商品分类、上架时间设置不同的 changefreq 和 priority 值
  • 大型门户或资讯站点超过50000条URL时,按频道拆分生成多个Sitemap并制作Sitemap Index索引文件
  • 博客网站为文章页、标签页、分类页、归档页分别配置合理的更新频率和优先级参数
  • 企业官网整理产品页、新闻页、关于页、联系页等不同类型URL,设置差异化lastmod和priority
  • 网站迁移完成后(HTTP升级HTTPS、域名更换)重新生成Sitemap并提交,引导爬虫快速抓取新地址
  • 配合Yoast SEO等插件生成的Sitemap进行手动补充,添加插件未覆盖的特殊页面URL
  • SEO诊断优化后重新生成Sitemap,确保重要页面 priority 设置合理,提升高价值页面抓取权重
  • 通过robots.txt声明Sitemap位置前,先用本工具验证XML格式正确性,避免爬虫解析失败

使用方法

  1. 在URL输入区域粘贴需要收录的页面地址列表,每行一个完整URL(需包含http://或https://协议头)
  2. 在changefreq下拉菜单中选择页面更新频率:首页选daily或hourly,文章页选weekly,静态页选yearly或monthly
  3. 拖动priority滑块或输入0.0-1.0之间的数值设置优先级:核心首页设为1.0,重要栏目页0.8,普通文章页0.5,归档页0.3
  4. 点击lastmod日期选择器,选择网站内容最后修改日期,或留空不包含lastmod字段
  5. 查看右侧实时预览区域,检查生成的XML结构是否正确,无效URL会被红色标注提示修正
  6. 确认无误后点击「下载sitemap.xml」按钮保存文件,或点击「复制」按钮将XML内容复制到剪贴板
  7. 将sitemap.xml上传至网站根目录,在robots.txt中添加Sitemap声明,或直接提交到Google Search Console/Bing Webmaster

功能特点

  • 批量 URL 输入支持:每行一个 URL,自动过滤空行与重复链接,快速处理大批量页面地址
  • XML 实体自动转义:URL 中的 &、<、>、"、' 等特殊字符自动转义为 &amp;、&lt;、&gt;、&quot;、&apos;,彻底避免 XML 解析错误
  • 7种 changefreq 更新频率选项:always、hourly、daily、weekly、monthly、yearly、never,覆盖所有页面类型场景
  • priority 优先级精细设置:支持 0.0 到 1.0 区间内任意数值,支持小数点后一位精度,区分页面重要程度
  • lastmod 最后修改时间日期选择器:可视化日历选择器,自动格式化为 W3C Datetime 标准格式(YYYY-MM-DD)
  • 无效 URL 实时检测:自动识别格式错误的 URL(缺少协议、非法字符等),标注问题行号便于修正
  • 实时预览生成:修改 URL 列表或配置参数后 XML 内容即时更新,无需手动点击生成按钮
  • 一键下载 sitemap.xml:生成结果直接下载为标准 XML 文件,保存后可立即上传至网站服务器
  • URL 数量超限警告:当输入 URL 达到 50000 条时自动提示需要使用 Sitemap Index 拆分方案
  • 复制到剪贴板:一键复制完整 XML 内容到剪贴板,方便直接粘贴到服务器文件或在线提交
  • 字节大小统计:实时显示生成的 Sitemap XML 文件字节数,评估文件大小是否符合搜索引擎限制
  • 标准 urlset 根元素输出:严格遵循 http://www.sitemaps.org/schemas/sitemap/0.9 协议规范,包含正确的 xmlns 命名空间声明
  • UTF-8 编码声明:自动添加 XML 编码声明,确保中文等多语言 URL 正确解析不出现乱码

常见问题

Sitemap一定要提交吗?不提交网站就不会被收录吗?

不提交Sitemap网站也可能被收录——搜索引擎可以通过其他网站的外链、内链跟踪发现你的页面。但提交Sitemap可以大幅加快发现速度,特别是新站、大型网站、内链不完善的网站。Google官方建议所有网站都提交Sitemap,这是成本极低收益很高的SEO基础工作。

Sitemap中的URL必须是绝对路径吗?可以写相对路径吗?

必须是完整的绝对URL,包含协议头(http://或https://)和完整域名,不能写相对路径(如/page1.html)或省略协议的写法。搜索引擎解析Sitemap时需要完整URL才能正确抓取,相对路径会导致解析错误。

changefreq和priority设置真的有用吗?搜索引擎会遵守吗?

这两个字段都是「提示」不是「指令」,搜索引擎不一定会100%遵守,但准确设置依然有参考价值。相比之下lastmod(最后修改时间)是三个字段中搜索引擎最重视的,因为它可以直接告诉爬虫页面有没有新内容。不要弄虚作假把所有页面都设为最高优先级或always,这会让搜索引擎不再信任这些元数据。

Sitemap文件必须放在网站根目录吗?

不一定,Sitemap可以放在网站任意路径下,只要URL能正常访问即可。但robots.txt必须放在根目录。如果你用Sitemap Index拆分了多个Sitemap,子Sitemap的路径没有限制。不过习惯上放在根目录最方便管理,也方便爬虫发现。

网站URL不到50000条,但文件大小超过50MB怎么办?

需要拆分Sitemap。50000条和50MB是两个并列限制,满足任意一个超限条件就需要拆分。你可以按内容类型拆分,或者精简Sitemap(比如去掉不必要的空格、缩进,使用gzip压缩),但如果压缩后还是超过50MB就必须拆分。

Sitemap中可以包含noindex页面或者被robots.txt禁止的URL吗?

不建议。Sitemap中应该只包含你希望搜索引擎抓取和收录的页面。noindex页面、Disallow禁止的页面、登录后才能访问的页面、404错误页面都不应该出现在Sitemap中,这会降低搜索引擎对Sitemap的信任度,也浪费抓取预算。

更新内容后需要重新提交Sitemap吗?多久更新一次Sitemap合适?

只要Sitemap文件URL不变,搜索引擎会定期重新抓取,不需要每次更新内容都手动重新提交。更新频率取决于你网站内容更新频率:新闻类网站可以每天甚至每小时更新Sitemap(自动生成),企业网站每周或每月更新一次即可。可以设置服务器端脚本自动更新Sitemap文件。

Sitemap支持哪些语言的URL?中文URL需要编码吗?

Sitemap支持任意语言的URL,但非ASCII字符(如中文)的URL需要进行URL编码(也叫百分号编码,percent-encoding)。比如「中文页面」要编码成%E4%B8%AD%E6%96%87%E9%A1%B5%E9%9D%A2这种形式。大部分浏览器和工具会自动处理,但你需要确保生成的Sitemap中URL是正确编码的。

可以同时提交多个Sitemap吗?比如同时有文章Sitemap和商品Sitemap?

可以,有两种方式:①使用Sitemap Index索引文件统一管理所有子Sitemap,这是推荐方式,只需要提交索引文件URL;②在站长平台逐个提交每个子Sitemap的URL,这种方式也可以但管理起来麻烦。两种方式都有效,搜索引擎都会抓取。

Sitemap生成后需要gzip压缩吗?压缩有什么好处?

不强制要求压缩,但强烈推荐。gzip压缩通常能把Sitemap体积减小70%-80%,节省带宽和爬虫抓取时间,特别是大型网站效果明显。搜索引擎完全支持sitemap.xml.gz这种压缩格式,会自动解压。只要压缩后不超过50MB就没问题。

HTTP和HTTPS两个版本的网站都需要提交Sitemap吗?

你应该只提交你希望被收录的首选版本。如果已经全站HTTPS并做了HTTP→HTTPS 301跳转,只需要提交HTTPS版本的Sitemap。不要同时提交HTTP和HTTPS两个版本,这会导致重复内容问题。同样,www和非www也要确定首选域,只提交首选域的Sitemap。

WordPress用Yoast SEO生成了Sitemap,还需要用这个工具吗?

Yoast SEO可以自动生成大部分页面的Sitemap,但可能漏掉一些页面——比如你手动创建的单页、自定义post type没配置好、特殊落地页、站外导入的页面等。可以用本工具补充这些Yoast没覆盖的URL,生成单独的补充Sitemap,或者对比检查Yoast生成的Sitemap是否完整正确。

Sitemap中URL的顺序重要吗?把重要页面放前面有用吗?

Sitemap协议中URL顺序没有任何官方权重,搜索引擎不会因为URL排在前面就优先抓取。但部分SEO从业者观察到有轻微的顺序偏好效果,所以把重要URL放前面也没有坏处,但不要指望这能带来明显效果,还是应该通过priority字段正确标识优先级。

分页页面(如/list?page=2、/page/3)需要放进Sitemap吗?

这取决于分页内容的价值。如果分页是「查看更多」性质的重复列表(如文章列表第2页、第3页),通常不建议放入Sitemap,因为这些页面内容重复且价值低,应该把重点放在列表首页和具体文章页。但如果分页是独特内容(如分类浏览、分页有独立价值)可以考虑包含,设置较低的priority。

怎么验证Sitemap是否正确有效?

有几种验证方式:①用本工具生成后先在本地预览XML结构是否正确,检查标签闭合、命名空间、转义字符是否正常;②使用sitemap-inspector工具在线验证格式和URL可访问性,批量检查所有URL的HTTP状态码;③上传后用浏览器直接访问Sitemap URL看是否能正常显示没有XML解析错误;④提交到Google Search Console/Bing Webmaster Tools后查看状态报告,看有没有格式错误、URL无法访问、超出限制等错误提示,这是最权威的验证方式;⑤也可以用在线XML验证工具检查XML语法正确性。

故障排查

生成的Sitemap XML在浏览器打开显示解析错误,提示格式不正确

URL中包含&、<、>等XML特殊字符没有转义:手动粘贴时工具已自动转义,但如果你手动编辑过文件可能漏掉转义 XML声明或urlset命名空间写错:检查首行xmlns值是否完全匹配http://www.sitemaps.org/schemas/sitemap/0.9,没有多余斜杠 标签没有正确闭合:所有开始标签如<url>、<loc>必须有对应的闭合标签</url>、</loc>,自闭合标签写法不要错 文件编码不是UTF-8带BOM:Windows记事本可能保存为UTF-8 BOM或GBK编码导致解析错误,需保存为无BOM的UTF-8 URL中包含非法字符:中文URL需要进行URL编码(percent-encoding),特殊字符未编码会导致XML解析失败 XML版本声明错误:首行必须是<?xml version="1.0" encoding="UTF-8"?>,不要写成1.1或其他版本 标签嵌套顺序错误:子标签必须完全包含在父标签内,不能交叉嵌套,如<url><loc></url></loc>这种顺序错误

Google Search Console提交Sitemap后显示「无法读取Sitemap」或「格式错误」

Sitemap文件URL无法访问:检查浏览器直接访问Sitemap URL是否返回200状态码,没有403/404/500错误 服务器返回了错误的Content-Type:应该返回application/xml或text/xml,如果返回text/html会导致识别失败 Sitemap中包含了被robots.txt禁止抓取的URL:GSC检测到Sitemap中有Disallow路径会报错 URL重定向问题:Sitemap的URL如果301/302跳转到其他地址会导致错误,确保URL直接可访问不跳转 HTTP/HTTPS或www/非www不匹配:提交的Sitemap域名与GSC中验证的域名不一致(如验证的是www.example.com但Sitemap用了example.com) Sitemap文件太大超出50MB限制或URL超过50000条:GSC会直接拒绝处理超限文件 使用了HTML实体而不是XML实体:空格的&nbsp;是HTML实体不是XML实体,XML中不能使用

提交Sitemap很久了,很多URL还是没有被Google收录

页面质量问题:收录不是提交就一定有的,内容原创性差、重复内容、内容价值低的页面Google可能选择不收录 新站审核期(沙盒效应):新网站提交Sitemap后可能需要几周到几个月的观察期才会批量收录 页面是noindex:URL返回的页面中有noindex meta标签或X-Robots-Tag: noindex响应头,Google会主动排除 网站抓取预算不足:网站权重低、服务器响应慢、内链结构差,Google爬虫分配的抓取频率低,需要更多时间 Sitemap中包含了大量低质量URL:如果Sitemap中很多是404、5xx错误、重复内容、低价值页面,Google会降低对整个Sitemap的信任 域名被惩罚:网站存在违反Google质量指南的问题(如作弊、垃圾内容、恶意软件)导致收录受阻 页面是孤立页面:页面虽然在Sitemap中,但网站内链没有任何入口,爬虫可能认为不重要而不收录

Sitemap中显示已发现URL,但实际索引数量很少

这是正常现象:「已发现」只是表示Google访问过Sitemap看到了URL,不代表会全部收录,索引率取决于页面质量 重复内容问题:多个URL内容高度相似(如带不同参数的同一页面、打印版本、分页),Google会选一个规范版本收录 规范化标签(canonical)指向其他页面:页面设置了<link rel="canonical" href="其他URL">,Google会收录canonical指向的地址 页面内容太单薄:内容字数太少、没有实质价值、采集内容,Google认为不值得收录 页面加载速度过慢:服务器响应超时、页面加载太慢,爬虫抓取失败多次后会降低抓取优先级 HTTPS证书问题:SSL证书无效、混合内容错误、HTTP/HTTPS版本同时存在导致规范化问题 移动端适配问题:移动端友好性差、移动适配错误,在移动优先索引环境下影响收录

Bing能正常抓取Sitemap但Google完全不抓取

Google Search Console验证问题:确认域名所有权验证有效,验证的域名(www/非www、http/https)和实际访问版本一致 服务器防火墙或CDN拦截了Googlebot:检查服务器访问日志看Googlebot(user-agent包含Googlebot)的请求是否被拦截或返回403 DNS解析问题:Google的DNS解析到的IP地址和Bing不同,确保所有地区都能正常解析到你的服务器 robots.txt对Googlebot有特殊限制:检查User-agent: Googlebot下是否有特殊的Disallow规则 网站之前有过作弊历史被Google降权:曾被手动处罚的域名需要先申请重新审核 Sitemap URL中包含了Google认为不安全的内容:如被标记为恶意软件、钓鱼内容的域名 CDN的WAF规则误拦截:某些安全规则可能误判Googlebot爬虫行为,需要检查CDN安全日志

生成的Sitemap在本地测试正常,上传到服务器后访问返回404错误

文件路径不对:sitemap.xml没有上传到正确的目录,确认上传到了你在robots.txt和提交给搜索引擎的URL对应位置 文件名大小写问题:Linux/Unix服务器区分大小写,Sitemap.xml和sitemap.xml是不同文件,确保文件名全小写 Nginx/Apache配置禁止访问xml文件:检查服务器配置是否有location规则拒绝了.xml后缀文件访问或返回了错误的try_files规则 文件权限问题:服务器上文件权限设置不正确(如600权限),Web服务器用户没有读取权限,通常需要644权限,目录需要755权限 CDN缓存了旧的404响应:刚上传的文件CDN可能还缓存着之前的404,需要刷新CDN缓存或等待CDN自动回源更新 WordPress等CMS的固定链接规则冲突:CMS的重写规则把sitemap.xml拦截了,需要配置排除规则让服务器直接访问静态文件 服务器配置了防盗链或访问控制:.htaccess或Nginx配置中的referer检查、IP白名单等规则可能拦截了爬虫访问

术语表

Sitemap(站点地图)
向搜索引擎告知网站上所有可供抓取页面的XML协议标准文件,包含完整URL列表及每个URL的元数据信息,帮助Googlebot、Bingbot等爬虫更智能高效地发现、理解和抓取网站内容,由sitemaps.org组织维护统一的开放协议标准(当前版本0.9)。
urlset
标准Sitemap XML文件的根元素,必须包含正确的xmlns命名空间声明,内部嵌套所有<url>子元素条目,是Sitemap有效性的核心标识,缺少正确urlset结构的Sitemap会被搜索引擎直接拒绝解析。
Sitemap Index
站点地图索引文件,当网站URL数量超过50000条或单个Sitemap文件大小超过50MB时必须使用,根元素为<sitemapindex>,用于统一列出和管理多个子Sitemap文件地址,支持大型网站拆分Sitemap的标准方案。
changefreq
Sitemap中可选元数据元素,用于指定页面内容大概的更新频率,共有always、hourly、daily、weekly、monthly、yearly、never七种合法取值,供搜索引擎爬虫参考安排回访抓取频率,合理设置可优化抓取预算分配。
priority
Sitemap中可选元数据元素,用于指定该URL相对于网站内其他页面的重要程度优先级,取值范围为0.0到1.0之间的小数,默认值为0.5,priority仅影响站内页面相对抓取优先级,不影响搜索结果排名。
lastmod
Sitemap中可选元数据元素,记录页面最后一次实质性内容修改的日期和时间,格式必须遵循W3C Datetime规范,是三个可选元数据字段中搜索引擎最重视的字段,因为它直接指示页面是否有新内容需要重新抓取。
loc
<url>元素下的必填子元素,用于指定页面的完整绝对URL地址,必须以http://或https://协议开头,包含完整域名,URL总长度不能超过2048个字符,不允许使用相对路径。
XML 命名空间(xmlns)
urlset根元素必须声明的XML命名空间属性,属性值必须精确匹配http://www.sitemaps.org/schemas/sitemap/0.9,用于标识Sitemap使用的协议版本,缺少或写错命名空间会导致Sitemap解析失败。
W3C Datetime
W3C(万维网联盟)规定的日期和时间表示格式,Sitemap中的lastmod字段必须遵循此格式,常用YYYY-MM-DD简化日期格式(兼容性最好),也支持包含时分秒和时区信息的完整日期时间格式。
XML 实体转义
XML语法中特殊字符必须转义为对应的实体引用才能正确解析:&转义为&amp;、<转义为&lt;、>转义为&gt;、"转义为&quot;、'转义为&apos;,URL中包含这些字符时必须转义,否则会导致XML解析错误。
Google Search Console (GSC)
Google官方提供的站长平台工具,用于提交Sitemap、查看网站索引状态、搜索流量数据分析、抓取错误报告、安全问题通知、手动操作处罚通知等,是Google搜索引擎优化(SEO)的必备工具。
Bing Webmaster Tools
微软Bing搜索引擎官方站长平台,功能与Google Search Console类似,支持Sitemap提交、索引覆盖率统计、SEO诊断分析、关键词研究、反向链接查询等,覆盖Bing和Yahoo两大搜索引擎的搜索流量。
robots.txt
存放在网站根目录下的纯文本文件,通过User-agent、Disallow、Allow等指令告知搜索引擎爬虫哪些路径允许抓取、哪些路径禁止抓取,同时也可以在文件中声明Sitemap文件的位置供爬虫自动发现。
爬虫(Crawler/Spider/Bot)
搜索引擎开发的自动抓取网页内容的程序,如Googlebot(Google爬虫)、Bingbot(Bing爬虫)、Baiduspider(百度爬虫),通过跟踪页面链接和读取Sitemap文件发现新页面,下载页面内容后存入搜索引擎索引库。
抓取预算(Crawl Budget)
搜索引擎在一定时间周期内分配给某个网站的总抓取资源量,由网站域名权重、服务器响应速度、页面内容质量、历史抓取效果等多种因素共同决定,正确配置Sitemap可以帮助优化抓取预算的使用效率。
UTF-8 编码
Sitemap XML文件强制要求使用的字符编码,UTF-8支持包括中文在内的所有Unicode字符,在XML声明中通过encoding="UTF-8"属性指定,使用其他编码(如GBK、GB2312)可能导致中文URL乱码和解析失败。
gzip 压缩
Sitemap协议支持使用gzip算法压缩传输(文件后缀为.xml.gz),可将Sitemap文件体积减小70%-80%,大幅节省服务器带宽和爬虫抓取时间,主流搜索引擎都能自动解压处理gzip压缩的Sitemap文件,压缩后仍需遵守50MB大小限制。
Yoast SEO
WordPress、Shopify等CMS平台上广泛使用的SEO插件,可自动生成Sitemap、meta标签、面包屑导航、XML站点地图、RSS优化、社交媒体元数据等SEO相关功能,是内容型网站常用的SEO解决方案。
索引覆盖率(Index Coverage)
Google Search Console中的核心报告之一,详细显示网站中页面被Google收录、排除、出现错误、存在警告的具体数量和原因明细,可用来验证Sitemap提交效果和诊断页面收录问题。
URL 编码(Percent-Encoding)
也叫百分号编码,用于在URL中表示非ASCII字符(如中文、特殊符号)的编码方式,中文字符会被编码为%XX%XX%XX形式(如"中文"编码为%E4%B8%AD%E6%96%87),Sitemap中的中文URL必须正确编码才能被解析。

changefreq 更新频率场景对照表

changefreq取值更新频率典型适用页面类型注意事项
always每次访问都可能变化实时数据页、搜索入口、动态聚合页不是说爬虫每次都来,只是变化频率极高;不要滥用,普通页面不要设为always
hourly每小时更新新闻首页、社交媒体动态、实时行情页适合每小时有新内容产出的页面,非高频更新站点不要设为hourly
daily每天更新网站首页、博客列表页、资讯频道页、商品分类页最常用的值之一,大部分站点首页和栏目页适用
weekly每周更新普通文章详情页、产品详情页、博客正文页大部分内容型网站的正文页用这个比较合适
monthly每月更新分类目录页、归档页、FAQ页、使用指南页内容更新不频繁但偶尔调整的辅助页面
yearly每年更新公司介绍页、联系方式页、服务条款、隐私政策几乎不会变动的静态信息页面
never永不更新历史文章存档、过期活动页、归档旧内容确认不再修改的页面设为never,若有更新记得及时改回

priority 优先级设置参考表

priority值优先级层级适用页面类型建议页面数量占比
1.0最高网站首页、核心落地页、最重要的频道入口整个网站仅1-3个页面
0.8-0.9很高主要栏目页、热门分类页、核心产品页、重点专题约占总页面数的5-10%
0.6-0.7较高次要栏目页、子分类页、热门文章、重要产品详情约占总页面数的10-20%
0.4-0.5普通普通文章详情页、一般产品页、常规内容页面约占总页面数的40-60%(默认值)
0.2-0.3较低标签页、归档分页、旧文章存档、辅助页面约占总页面数的15-25%
0.0-0.1最低低价值页面、重复内容页、不希望重点抓取的页面约占总页面数的5%以内,0不代表禁止收录

Sitemap 协议规范限制表

限制项上限值说明超限处理方案
单个Sitemap包含URL数量50,000条sitemap.org 0.9协议硬性规定使用Sitemap Index拆分为多个子Sitemap
单个Sitemap未压缩文件大小50MB(52428800字节)包含所有标签和空格的原始文件大小使用gzip压缩、拆分Sitemap、精简注释
Sitemap Index可包含子Sitemap数量50,000个索引文件本身的URL条目限制理论支持25亿URL,一般网站用不到
单个URL长度2,048字符包含协议、域名、路径、所有查询参数URL过长需精简参数或进行URL重写
Sitemap支持的编码格式UTF-8协议强制要求,其他编码可能导致解析失败保存文件时确保使用UTF-8编码
Sitemap支持的协议http:// 或 https://URL必须包含完整协议头不支持ftp://等其他协议
提交后爬虫响应时间几小时到几天取决于网站权重和Sitemap复杂度不需要重复提交,耐心等待处理即可
gzip压缩后文件大小50MB压缩后的文件同样不能超过50MB限制压缩超限仍需拆分Sitemap