Gerador de Sitemap

Gerador de sitemap.xml

Insira uma lista de URLs, defina changefreq, priority e lastmod globalmente, gere sitemaps XML compatíveis com sitemap.org em um clique.

Entrada e parâmetros
Saída XML
3 URLs válidas, 483 bytes

Gere online arquivos de mapa do site Sitemap XML em conformidade com o padrão do protocolo aberto sitemap.org 0.9. Suporta configuração completa de sete frequências de atualização changefreq, prioridade relativa priority de 0.0-1.0, seletor de data lastmod, escape automático de entidades XML, detecção em tempo real de URLs inválidas, pré-visualização estruturada de XML em tempo real, download e cópia com um clique, ajudando os principais motores de busca como Google e Bing a descobrir rapidamente e indexar eficientemente todas as páginas importantes do site.

Sugestões Relacionadas

Casos de uso

  • Após o lançamento de um site novo, gere Sitemaps de páginas principais em massa e envie para Google Search Console e Bing Webmaster Tools para acelerar a descoberta e indexação pelos motores de busca
  • Regenere o mapa do site após redesenhar seções do site ou ajustar a estrutura de URL, atualizando o índice dos motores de busca para evitar links mortos que afetem o desempenho SEO
  • Importe em massa URLs de listas de produtos em sites de e-commerce, configurando diferentes valores de changefreq e priority de acordo com a categoria do produto e data de publicação
  • Para portais grandes ou sites de notícias com mais de 50000 URLs, divida por canais para gerar múltiplos Sitemaps e crie um arquivo de índice Sitemap Index
  • Para sites de blog, configure parâmetros razoáveis de frequência de atualização e prioridade para páginas de artigos, páginas de tags, páginas de categorias e páginas de arquivo
  • Organize diferentes tipos de URL como páginas de produtos, páginas de notícias, páginas Sobre, páginas de contato em sites corporativos, configurando lastmod e priority diferenciados
  • Após concluir a migração do site (atualização HTTP para HTTPS, mudança de domínio), regenere o Sitemap e envie para guiar os crawlers a rastrear rapidamente os novos endereços
  • Complemente manualmente os Sitemaps gerados por plugins como Yoast SEO, adicionando URLs de páginas especiais não cobertas pelo plugin
  • Regenere o Sitemap após o diagnóstico e otimização SEO, garantindo que a configuração de priority das páginas importantes seja razoável e melhorando o peso de rastreamento de páginas de alto valor
  • Antes de declarar a localização do Sitemap no robots.txt, use esta ferramenta para verificar a correção do formato XML e evitar falhas de análise do crawler

Como Usar

  1. Cole a lista de endereços de páginas que deseja indexar na área de entrada de URL, uma URL completa por linha (deve incluir o cabeçalho de protocolo http:// ou https://)
  2. Selecione a frequência de atualização da página no menu suspenso changefreq: escolha daily ou hourly para a página inicial, weekly para páginas de artigos, yearly ou monthly para páginas estáticas
  3. Arraste o controle deslizante de priority ou insira um valor entre 0.0 e 1.0 para definir a prioridade: página inicial principal em 1.0, páginas de seções importantes em 0.8, páginas de artigos normais em 0.5, páginas de arquivo em 0.3
  4. Clique no seletor de data lastmod para selecionar a data da última modificação do conteúdo do site, ou deixe em branco para não incluir o campo lastmod
  5. Verifique a área de pré-visualização em tempo real à direita, confira se a estrutura XML gerada está correta; URLs inválidas serão marcadas em vermelho para correção
  6. Após confirmar que tudo está correto, clique no botão «Baixar sitemap.xml» para salvar o arquivo, ou clique no botão «Copiar» para copiar o conteúdo XML para a área de transferência
  7. Envie sitemap.xml para o diretório raiz do seu site, adicione a declaração Sitemap no robots.txt, ou envie diretamente para Google Search Console/Bing Webmaster

Recursos

  • Entrada em massa de URL: uma URL por linha, filtra automaticamente linhas vazias e links duplicados, processa rapidamente grandes lotes de endereços de páginas
  • Escape automático de entidades XML: caracteres especiais em URLs como &, <, >, ", ' são escapados automaticamente para &amp;, &lt;, &gt;, &quot;, &apos;, evitando completamente erros de análise XML
  • 7 opções de frequência de atualização changefreq: always, hourly, daily, weekly, monthly, yearly, never, cobrindo todos os cenários de tipos de páginas
  • Configuração precisa de prioridade priority: suporta qualquer valor entre 0.0 e 1.0 com precisão de uma casa decimal, distinguindo o nível de importância das páginas
  • Seletor de data lastmod: seletor de calendário visual que formata automaticamente para o padrão W3C Datetime (YYYY-MM-DD)
  • Detecção em tempo real de URLs inválidas: identifica automaticamente URLs com formato incorreto (falta de protocolo, caracteres ilegais, etc.) e marca o número da linha problemática para facilitar a correção
  • Pré-visualização em tempo real: o conteúdo XML é atualizado instantaneamente ao modificar a lista de URLs ou parâmetros de configuração, sem necessidade de clicar manualmente em um botão de geração
  • Download de sitemap.xml com um clique: o resultado gerado é baixado diretamente como um arquivo XML padrão, pronto para ser enviado ao servidor web imediatamente após salvar
  • Aviso de limite de URL: ao atingir 50000 URLs, um aviso é exibido automaticamente indicando a necessidade de usar o esquema de divisão Sitemap Index
  • Cópia para a área de transferência: copia o conteúdo XML completo para a área de transferência com um clique, facilitando colar diretamente em arquivos do servidor ou envios online
  • Estatísticas de tamanho em bytes: exibe em tempo real o tamanho em bytes do arquivo Sitemap XML gerado, avaliando se o tamanho do arquivo atende aos limites dos motores de busca
  • Saída do elemento raiz urlset padrão: segue rigorosamente a especificação do protocolo http://www.sitemaps.org/schemas/sitemap/0.9, incluindo a declaração correta do namespace xmlns
  • Declaração de codificação UTF-8: adiciona automaticamente a declaração de codificação XML, garantindo a interpretação correta de URLs multilíngues sem caracteres corrompidos

Perguntas frequentes

É obrigatório enviar um Sitemap? Se eu não enviar, meu site não será indexado?

Sem enviar um Sitemap, um site também pode ser indexado — os motores de busca podem descobrir suas páginas através de links externos de outros sites e rastreamento de links internos. Mas enviar um Sitemap pode acelerar significativamente a velocidade de descoberta, especialmente para sites novos, sites grandes e sites com links internos deficientes. O Google recomenda oficialmente que todos os sites enviem Sitemap; é um trabalho SEO básico de custo muito baixo e alto benefício.

As URLs no Sitemap devem ser caminhos absolutos? Podem ser escritos caminhos relativos?

Devem ser URLs absolutas completas, incluindo o cabeçalho de protocolo (http:// ou https://) e o domínio completo; não podem ser escritos caminhos relativos (como /page1.html) nem omitir o protocolo. Os motores de busca precisam de URLs completas para rastrear corretamente ao analisar o Sitemap; caminhos relativos causarão erros de análise.

As configurações de changefreq e priority são realmente úteis? Os motores de busca as respeitarão?

Ambos os campos são «sugestões», não «instruções»; os motores de busca não necessariamente as respeitarão 100%, mas uma configuração precisa ainda tem valor de referência. Em comparação, lastmod (hora da última modificação) é o mais valorizado pelos motores de busca entre os três campos, porque pode indicar diretamente ao crawler se a página tem conteúdo novo. Não estabeleça falsamente todas as páginas na prioridade mais alta ou always, isso fará com que os motores de busca deixem de confiar nesses metadados.

O arquivo Sitemap deve ser colocado obrigatoriamente no diretório raiz do site?

Não necessariamente; o Sitemap pode ser colocado em qualquer caminho do site, desde que a URL seja acessível normalmente. Mas robots.txt deve estar no diretório raiz. Se você dividiu múltiplos Sitemaps usando Sitemap Index, os caminhos dos Sitemaps secundários não têm restrições. Porém, por costume colocá-lo no diretório raiz é mais conveniente para a gestão e para que os crawlers o descubram.

Meu site tem menos de 50000 URLs, mas o tamanho do arquivo excede 50 MB, o que devo fazer?

Precisa dividir o Sitemap. 50000 URLs e 50 MB são dois limites paralelos; quando se cumpre qualquer uma das condições de superação de limite, é necessária a divisão. Você pode dividir por tipo de conteúdo, ou simplificar o Sitemap (como eliminar espaços e indentações desnecessárias, usar compressão gzip), mas se após comprimir ainda exceder os 50 MB deve dividi-lo obrigatoriamente.

Podem ser incluídas páginas noindex ou URLs proibidas pelo robots.txt no Sitemap?

Não é recomendado. O Sitemap deve conter apenas páginas que você deseja que os motores de busca rastreiem e indexem. Páginas noindex, páginas proibidas por Disallow, páginas que requerem login para acessar, páginas de erro 404 não devem aparecer no Sitemap; isso reduzirá a confiança dos motores de busca no Sitemap e também desperdiçará orçamento de rastreamento.

Após atualizar conteúdo preciso reenviar o Sitemap? Com que frequência é adequado atualizar o Sitemap?

Desde que a URL do arquivo Sitemap não mude, os motores de busca o voltarão a rastrear periodicamente; você não precisa reenviá-lo manualmente toda vez que atualizar conteúdo. A frequência de atualização depende da frequência de atualização do conteúdo do seu site: sites de notícias podem atualizar o Sitemap diariamente ou mesmo a cada hora (geração automática); sites corporativos podem atualizá-lo semanal ou mensalmente. Você pode configurar scripts do lado do servidor para atualizar automaticamente o arquivo Sitemap.

Quais idiomas de URL o Sitemap suporta? URLs chinesas precisam de codificação?

O Sitemap suporta URLs de qualquer idioma, mas URLs com caracteres não ASCII (como chinês) requerem codificação URL (também chamada de codificação percentual, percent-encoding). Por exemplo, «中文页面» deve ser codificada como %E4%B8%AD%E6%96%87%E9%A1%B5%E9%9D%A2 neste formato. A maioria dos navegadores e ferramentas o processa automaticamente, mas você deve garantir que as URLs no Sitemap gerado estejam corretamente codificadas.

Podem ser enviados múltiplos Sitemaps simultaneamente? Por exemplo, ter Sitemap de artigos e Sitemap de produtos ao mesmo tempo

Sim, há duas formas: ①Usar um arquivo de índice Sitemap Index para gerenciar unificadamente todos os Sitemaps secundários; esta é a forma recomendada, só precisa enviar a URL do arquivo de índice; ②Enviar individualmente a URL de cada Sitemap secundário na plataforma de webmasters; esta forma também é válida mas é mais complicada de gerenciar. Ambas as formas são efetivas e os motores de busca as rastrearão.

Após gerar o Sitemap precisa de compressão gzip? Quais benefícios tem a compressão?

Não é obrigatório comprimir, mas é altamente recomendado. A compressão gzip geralmente pode reduzir o volume do Sitemap em 70%-80%, economizando largura de banda e tempo de rastreamento do crawler; o efeito é especialmente notável em sites grandes. Os motores de busca suportam completamente o formato comprimido sitemap.xml.gz e o descomprimirão automaticamente. Desde que após comprimir não exceda os 50 MB não haverá problemas.

Preciso enviar Sitemap para as duas versões HTTP e HTTPS do site?

Você deve enviar apenas a versão preferida que deseja que seja indexada. Se já tem todo o site em HTTPS e realizou redirecionamento 301 HTTP→HTTPS, só precisa enviar o Sitemap da versão HTTPS. Não envie as duas versões HTTP e HTTPS simultaneamente; isso causará problemas de conteúdo duplicado. Da mesma forma, deve determinar o domínio preferido com www ou sem www e enviar apenas o Sitemap do domínio preferido.

O WordPress usa Yoast SEO para gerar Sitemap, ainda preciso desta ferramenta?

O Yoast SEO pode gerar automaticamente Sitemaps para a maioria das páginas, mas pode omitir algumas páginas — como páginas individuais criadas manualmente, tipos de post personalizados não configurados corretamente, páginas de destino especiais, páginas importadas de fontes externas, etc. Você pode usar esta ferramenta para complementar essas URLs não cobertas pelo Yoast, gerando um Sitemap complementar separado, ou verificar comparativamente se o Sitemap gerado pelo Yoast está completo e correto.

A ordem das URLs no Sitemap é importante? Colocar as páginas importantes no início é útil?

No protocolo Sitemap a ordem das URLs não tem nenhum peso oficial; os motores de busca não priorizarão o rastreamento porque uma URL está no início. Mas alguns profissionais de SEO observaram um leve efeito de preferência de ordem, então colocar as URLs importantes no início não tem nenhum inconveniente, mas não espere que isso traga efeitos evidentes; deve identificar corretamente a prioridade através do campo priority.

Páginas paginadas (como /list?page=2, /page/3) devem ser incluídas no Sitemap?

Isso depende do valor do conteúdo paginado. Se a paginação é listas repetidas de tipo «ver mais» (como a página 2, página 3 de listas de artigos), geralmente não é recomendado incluí-las no Sitemap, porque essas páginas têm conteúdo duplicado e baixo valor; deve focar na página inicial da lista e páginas de artigos específicos. Mas se a paginação é conteúdo único (como navegação por categorias, páginas paginadas com valor independente) pode considerar incluí-las com uma priority mais baixa.

Como posso verificar se o Sitemap está correto e válido?

Há várias formas de verificação: ①Após gerar com esta ferramenta, pré-visualize primeiro localmente se a estrutura XML está correta, verifique se o fechamento de tags, namespaces, caracteres de escape estão normais; ②Use a ferramenta sitemap-inspector para verificar online o formato e acessibilidade de URL, verificando em lote os códigos de status HTTP de todas as URLs; ③Após enviar, acesse diretamente a URL do Sitemap no navegador para ver se é exibida normalmente sem erros de análise XML; ④Após enviar para Google Search Console/Bing Webmaster Tools consulte o relatório de estado para ver se há erros de formato, URLs inacessíveis, limites excedidos e outros avisos de erro; esta é a forma de verificação mais autorizada; ⑤Também pode usar ferramentas de verificação XML online para verificar a correção da sintaxe XML.

Solução de Problemas

O Sitemap XML gerado mostra erros de análise ao abri-lo no navegador, indicando formato incorreto

As URLs contêm caracteres especiais XML como &, <, > que não foram escapados: a ferramenta já escapa automaticamente ao colar, mas se você editou o arquivo manualmente pode ter omitido o escape Erro na declaração XML ou no namespace urlset: verifique se o valor xmlns da primeira linha coincide exatamente com http://www.sitemaps.org/schemas/sitemap/0.9, sem barras adicionais As tags não estão fechadas corretamente: todas as tags de abertura como <url>, <loc> devem ter suas tags de fechamento correspondentes </url>, </loc>; tags de auto-fechamento não devem ser escritas incorretamente A codificação do arquivo não é UTF-8 sem BOM: o Bloco de Notas do Windows pode salvar como UTF-8 BOM ou codificação GBK causando erros de análise; deve salvar como UTF-8 sem BOM As URLs contêm caracteres ilegais: URLs chinesas requerem codificação URL (percent-encoding); caracteres especiais não codificados causam falhas de análise XML Erro na declaração de versão XML: a primeira linha deve ser <?xml version="1.0" encoding="UTF-8"?>, não escreva 1.1 ou outras versões Erro na ordem de aninhamento de tags: as tags filhas devem estar completamente contidas dentro das tags pais, não é permitido aninhamento cruzado como <url><loc></url></loc>

Após enviar o Sitemap no Google Search Console, mostra «Não foi possível ler o Sitemap» ou «Erro de formato»

A URL do arquivo Sitemap não é acessível: verifique se acessando diretamente a URL do Sitemap no navegador retorna código de status 200, sem erros 403/404/500 O servidor retornou um Content-Type incorreto: deve retornar application/xml ou text/xml; se retornar text/html causará falhas de reconhecimento O Sitemap contém URLs proibidas pelo robots.txt: o GSC informará erros se detectar rotas Disallow no Sitemap Problemas de redirecionamento de URL: se as URLs do Sitemap redirecionam 301/302 para outros endereços causará erros; certifique-se de que as URLs são diretamente acessíveis sem redirecionamentos Discrepância HTTP/HTTPS ou www/sem www: o domínio do Sitemap enviado não coincide com o domínio verificado no GSC (por exemplo, verificou www.example.com mas o Sitemap usa example.com) O arquivo Sitemap é muito grande excedendo o limite de 50 MB ou as URLs excedem 50000: o GSC rejeitará diretamente processar arquivos que excedam os limites Foram utilizadas entidades HTML em vez de entidades XML: &nbsp; para espaços é uma entidade HTML, não uma entidade XML; não pode ser utilizada em XML

Já passou muito tempo desde que enviei o Sitemap, mas muitas URLs ainda não foram indexadas pelo Google

Problemas de qualidade de página: a indexação não é garantida apenas por enviar; o Google pode optar por não indexar páginas com conteúdo original deficiente, conteúdo duplicado ou conteúdo de baixo valor Período de revisão para sites novos (efeito sandbox): sites novos podem exigir um período de observação de várias semanas a vários meses após enviar o Sitemap antes da indexação em massa A página tem noindex: as páginas retornadas por URL têm tag meta noindex ou cabeçalho de resposta X-Robots-Tag: noindex; o Google as excluirá ativamente Orçamento de rastreamento do site insuficiente: baixa autoridade do site, resposta lenta do servidor, estrutura deficiente de links internos; o Googlebot aloca uma frequência de rastreamento baixa, o que requer mais tempo O Sitemap contém uma grande quantidade de URLs de baixa qualidade: se muitas URLs no Sitemap são erros 404, 5xx, conteúdo duplicado ou páginas de baixo valor, o Google reduzirá a confiança em todo o Sitemap Domínio penalizado: o site tem problemas que violam as diretrizes de qualidade do Google (como truques, conteúdo spam, malware) que bloqueiam a indexação A página é uma página órfã: embora a página esteja no Sitemap, não tem nenhuma entrada através de links internos do site; o crawler pode considerá-la pouco importante e não indexá-la

O Sitemap mostra URLs descobertas, mas a quantidade de índices reais é muito baixa

Isso é normal: «Descobertas» apenas significa que o Google acessou o Sitemap e viu as URLs, não garante que todas sejam indexadas; a taxa de indexação depende da qualidade da página Problemas de conteúdo duplicado: múltiplas URLs com conteúdo muito semelhante (como a mesma página com diferentes parâmetros, versões de impressão, paginação); o Google escolherá uma versão canônica para indexar A tag de canonicalização (canonical) aponta para outra página: a página tem configurado <link rel="canonical" href="outra URL">, o Google indexará o endereço para o qual aponta canonical O conteúdo da página é muito escasso: muito poucas palavras de conteúdo, sem valor substancial, conteúdo coletado; o Google considera que não vale a pena indexar Velocidade de carregamento da página muito lenta: tempo de espera de resposta do servidor, carregamento de página muito lento; após várias falhas de rastreamento, o crawler reduzirá a prioridade de rastreamento Problemas de certificado HTTPS: certificado SSL inválido, erros de conteúdo misto, coexistência de versões HTTP/HTTPS causando problemas de canonicalização Problemas de adaptação móvel: má experiência móvel, erros de adaptação móvel que afetam a indexação no ambiente de indexação móvel primeiro

O Bing pode rastrear o Sitemap normalmente mas o Google não o rastreia de forma alguma

Problemas de verificação no Google Search Console: confirme que a verificação de propriedade do domínio é válida; o domínio verificado (www/sem www, http/https) coincide com a versão de acesso real O firewall do servidor ou CDN está bloqueando o Googlebot: verifique os registros de acesso do servidor para ver se as solicitações do Googlebot (user-agent que contém Googlebot) são bloqueadas ou retornam 403 Problemas de resolução DNS: o IP para o qual o DNS do Google resolve é diferente daquele do Bing; certifique-se de que todas as regiões podem resolver normalmente para seu servidor O robots.txt tem restrições especiais para o Googlebot: verifique se há regras Disallow especiais sob User-agent: Googlebot O site tem histórico de truques e foi penalizado pelo Google: domínios que foram sancionados manualmente devem solicitar primeiro uma nova revisão A URL do Sitemap contém conteúdo que o Google considera inseguro: como domínios marcados como malware ou conteúdo de phishing Regras WAF do CDN bloqueiam por engano: algumas regras de segurança podem julgar erroneamente o comportamento do crawler Googlebot; precisa revisar os registros de segurança do CDN

O Sitemap gerado funciona corretamente em testes locais, mas após enviá-lo ao servidor o acesso retorna erro 404

Caminho de arquivo incorreto: sitemap.xml não foi enviado para o diretório correto; confirme que está enviado para o local correspondente à URL que você declarou no robots.txt e enviou aos motores de busca Problema de maiúsculas/minúsculas no nome do arquivo: servidores Linux/Unix diferenciam maiúsculas de minúsculas; Sitemap.xml e sitemap.xml são arquivos diferentes; certifique-se de que o nome do arquivo está completamente em minúsculas A configuração do Nginx/Apache proíbe acesso a arquivos xml: verifique se a configuração do servidor tem regras location que neguem acesso a arquivos com sufixo .xml ou retornam regras try_files incorretas Problemas de permissões de arquivos: as permissões de arquivos no servidor estão configuradas incorretamente (como permissões 600); o usuário do servidor web não tem permissões de leitura; geralmente são necessárias permissões 644 para arquivos e 755 para diretórios O CDN tem em cache uma resposta 404 anterior: o CDN de arquivos recém-enviados pode ainda ter em cache o 404 anterior; precisa atualizar o cache do CDN ou aguardar que o CDN atualize automaticamente a partir da origem Conflito com regras de links permanentes de CMS como WordPress: as regras de reescrita do CMS interceptam sitemap.xml; precisa configurar regras de exclusão para que o servidor acesse diretamente arquivos estáticos O servidor tem configurado anti-hotlinking ou controle de acesso: regras de verificação de referer, listas brancas de IP no .htaccess ou configuração Nginx podem bloquear o acesso de crawlers

Glossário

Sitemap (mapa do site)
Arquivo de padrão de protocolo XML que informa aos motores de busca sobre todas as páginas do site disponíveis para rastreamento, que contém uma lista completa de URLs e informação de metadados para cada URL, ajudando crawlers como Googlebot e Bingbot a descobrir, compreender e rastrear o conteúdo do site de forma mais inteligente e eficiente; o padrão de protocolo aberto unificado é mantido pela organização sitemaps.org (versão atual 0.9).
urlset
Elemento raiz do arquivo Sitemap XML padrão, que deve conter a declaração correta do namespace xmlns, com todos os elementos filhos <url> aninhados em seu interior; é o identificador central de validade do Sitemap; Sitemaps que carecem de uma estrutura urlset correta são rejeitados diretamente pelos motores de busca para análise.
Sitemap Index
Arquivo de índice de mapa do site, que deve ser utilizado quando a quantidade de URLs do site excede 50000 ou o tamanho de um único arquivo Sitemap excede 50 MB; seu elemento raiz é <sitemapindex>, utilizado para listar e gerenciar de forma unificada os endereços de múltiplos arquivos Sitemap secundários; é o esquema padrão para dividir Sitemaps em sites grandes.
changefreq
Elemento de metadados opcional no Sitemap, utilizado para especificar a frequência de atualização aproximada do conteúdo da página; tem sete valores válidos: always, hourly, daily, weekly, monthly, yearly, never, como referência para que os crawlers de motores de busca programem a frequência de rastreamento de revisita; uma configuração razoável pode otimizar a alocação do orçamento de rastreamento.
priority
Elemento de metadados opcional no Sitemap, utilizado para especificar o nível de importância desta URL em relação a outras páginas do site; o intervalo de valores é um decimal entre 0.0 e 1.0, com valor padrão de 0.5; priority afeta apenas a prioridade relativa de rastreamento entre páginas do site e não afeta a classificação nos resultados de busca.
lastmod
Elemento de metadados opcional no Sitemap, que registra a data e hora da última modificação substancial do conteúdo da página; o formato deve seguir a especificação W3C Datetime; é o campo mais valorizado pelos motores de busca entre os três campos de metadados opcionais, porque indica diretamente se a página tem conteúdo novo que precisa ser rerastreado.
loc
Elemento filho obrigatório sob o elemento <url>, utilizado para especificar o endereço URL absoluto completo da página; deve começar com o protocolo http:// ou https://, incluir o domínio completo, o comprimento total da URL não deve exceder 2048 caracteres, não são permitidos caminhos relativos.
Namespace XML (xmlns)
Atributo de namespace XML que o elemento raiz urlset deve declarar; o valor do atributo deve coincidir exatamente com http://www.sitemaps.org/schemas/sitemap/0.9, utilizado para identificar a versão do protocolo utilizada pelo Sitemap; a falta ou digitação incorreta do namespace causará falhas de análise do Sitemap.
W3C Datetime
Formato de representação de data e hora especificado pelo W3C (World Wide Web Consortium); o campo lastmod no Sitemap deve seguir este formato; é comumente utilizado o formato de data simplificado YYYY-MM-DD (melhor compatibilidade), e também suporta o formato completo de data e hora que inclui horas, minutos, segundos e informação de fuso horário.
Escape de entidades XML
Na sintaxe XML, caracteres especiais devem ser escapados para suas referências de entidade correspondentes para serem analisados corretamente: & é escapado para &amp;, < para &lt;, > para &gt;, " para &quot;, ' para &apos;; esses caracteres nas URLs devem ser escapados, caso contrário causarão erros de análise XML.
Google Search Console (GSC)
Ferramenta de plataforma de webmasters fornecida oficialmente pelo Google, utilizada para enviar Sitemaps, ver o estado de indexação do site, análise de dados de tráfego de busca, relatórios de erros de rastreamento, notificações de problemas de segurança, notificações de sanções por ações manuais, etc.; é a ferramenta essencial para a otimização de motores de busca (SEO) do Google.
Bing Webmaster Tools
Plataforma oficial de webmasters do motor de busca Bing da Microsoft, com funções semelhantes ao Google Search Console; suporta envio de Sitemaps, estatísticas de cobertura de índice, análise de diagnóstico SEO, pesquisa de palavras-chave, consulta de links reversos, etc., cobrindo o tráfego de busca dos dois motores de busca Bing e Yahoo.
robots.txt
Arquivo de texto simples localizado no diretório raiz do site web, que indica aos crawlers de motores de busca quais rotas são permitidas para rastreamento e quais rotas têm proibido o acesso através de diretivas como User-agent, Disallow, Allow; também pode declarar a localização do arquivo Sitemap no arquivo para que os crawlers o descubram automaticamente.
Crawler (Spider/Bot)
Programa desenvolvido por motores de busca para rastrear automaticamente conteúdo web, como Googlebot (crawler do Google), Bingbot (crawler do Bing), Baiduspider (crawler do Baidu); descobre novas páginas seguindo links de páginas e lendo arquivos Sitemap, e armazena o conteúdo das páginas baixadas no índice do motor de busca.
Orçamento de rastreamento (Crawl Budget)
Quantidade total de recursos de rastreamento que os motores de busca alocam para um site web em um determinado período de tempo, determinada conjuntamente por múltiplos fatores como autoridade do domínio, velocidade de resposta do servidor, qualidade do conteúdo da página, histórico de efeitos de rastreamento, etc.; configurar corretamente o Sitemap pode ajudar a otimizar a eficiência de uso do orçamento de rastreamento.
Codificação UTF-8
Codificação de caracteres obrigatória para arquivos Sitemap XML; UTF-8 suporta todos os caracteres Unicode, incluindo caracteres chineses; é especificada na declaração XML através do atributo encoding="UTF-8"; o uso de outras codificações (como GBK, GB2312) pode causar caracteres corrompidos em URLs chinesas e falhas de análise.
Compressão gzip
O protocolo Sitemap suporta o uso do algoritmo gzip para transmissão comprimida (extensão de arquivo .xml.gz), que pode reduzir o tamanho do arquivo Sitemap em 70%-80%, economizando significativamente largura de banda do servidor e tempo de rastreamento do crawler; os principais motores de busca podem descomprimir e processar automaticamente arquivos Sitemap comprimidos com gzip; após a compressão, ainda deve atender ao limite de tamanho de 50 MB.
Yoast SEO
Plugin SEO amplamente utilizado em plataformas CMS como WordPress e Shopify, que pode gerar automaticamente Sitemaps, meta tags, navegação de breadcrumbs, mapas do site XML, otimização RSS, metadados de redes sociais e outras funções relacionadas a SEO; é uma solução SEO comumente utilizada para sites de conteúdo.
Cobertura de índice (Index Coverage)
Um dos relatórios centrais no Google Search Console, que mostra detalhadamente a quantidade específica e os motivos detalhados de páginas do site que foram indexadas, excluídas, com erros ou com advertências pelo Google; pode ser utilizado para verificar o efeito do envio de Sitemap e diagnosticar problemas de indexação de páginas.
Codificação URL (Percent-Encoding)
Também chamada de codificação percentual, é um método de codificação utilizado para representar caracteres não ASCII (como chinês, símbolos especiais) em URLs; caracteres chineses são codificados no formato %XX%XX%XX (por exemplo, «中文» é codificado como %E4%B8%AD%E6%96%87); URLs chinesas no Sitemap devem estar corretamente codificadas para serem analisadas.

Tabela de referência de cenários de frequência de atualização changefreq

Valor changefreqFrequência de atualizaçãoTipos de páginas típicas aplicáveisObservações importantes
alwaysPode mudar a cada acessoPáginas de dados em tempo real, entradas de busca, páginas de agregação dinâmicaNão significa que o crawler virá todas as vezes, apenas que a frequência de mudança é extremamente alta; não use indevidamente, páginas normais não configurem always
hourlyAtualização a cada horaPáginas iniciais de notícias, atividade de redes sociais, páginas de cotações em tempo realAdequado para páginas que produzem conteúdo novo a cada hora; sites sem atualizações de alta frequência não configurem hourly
dailyAtualização diáriaPágina inicial do site, páginas de lista de blogs, páginas de canais de notícias, páginas de categorias de produtosUm dos valores mais utilizados, aplicável a páginas iniciais e seções da maioria dos sites
weeklyAtualização semanalPáginas de detalhes de artigos normais, páginas de detalhes de produtos, páginas de conteúdo de blogsAdequado para páginas de conteúdo da maioria dos sites de conteúdo
monthlyAtualização mensalPáginas de diretório de categorias, páginas de arquivo, páginas FAQ, páginas de guias de usoPáginas auxiliares com atualizações pouco frequentes mas ajustes ocasionais
yearlyAtualização anualPáginas de apresentação da empresa, páginas de contato, termos de serviço, política de privacidadePáginas de informação estática que quase nunca mudam
neverNunca é atualizadaArquivo de artigos históricos, páginas de eventos expirados, conteúdo antigo arquivadoConfigure como never páginas que definitivamente não serão mais modificadas; se houver atualizações lembre-se de alterar oportunamente

Tabela de referência de configuração de prioridade priority

Valor priorityNível de prioridadeTipos de páginas aplicáveisProporção recomendada de páginas
1.0MáximaPágina inicial do site, páginas de destino principais, entradas de canais mais importantesApenas 1-3 páginas em todo o site
0.8-0.9Muito altaPáginas de seções principais, páginas de categorias populares, produtos principais, tópicos especiais destacadosAproximadamente 5-10% do total de páginas
0.6-0.7AltaPáginas de seções secundárias, subcategorias, artigos populares, detalhes de produtos importantesAproximadamente 10-20% do total de páginas
0.4-0.5NormalPáginas de detalhes de artigos normais, produtos gerais, conteúdo convencionalAproximadamente 40-60% do total de páginas (valor padrão)
0.2-0.3BaixaPáginas de tags, paginação de arquivos, artigos antigos, páginas auxiliaresAproximadamente 15-25% do total de páginas
0.0-0.1MínimaPáginas de baixo valor, conteúdo duplicado, páginas que não deseja rastrear prioritariamenteDentro de 5% do total de páginas; 0 não significa proibir indexação

Tabela de limites da especificação do protocolo Sitemap

Item de limiteValor limiteDescriçãoEsquema de tratamento ao exceder limite
Quantidade de URLs por Sitemap individual50,000Requisito obrigatório do protocolo sitemap.org 0.9Usar Sitemap Index para dividir em múltiplos Sitemaps secundários
Tamanho de arquivo descomprimido por Sitemap50 MB (52428800 bytes)Tamanho de arquivo original incluindo todas as tags e espaçosUsar compressão gzip, dividir Sitemap, simplificar comentários
Quantidade de Sitemaps secundários por Sitemap Index50,000Limite de entradas URL do arquivo de índiceTeoricamente suporta 2,5 bilhões de URLs, geralmente não necessário para sites comuns
Comprimento de URL individual2,048 caracteresIncluindo protocolo, domínio, rota, todos os parâmetros de consultaURLs muito longas exigem simplificar parâmetros ou reescrita de URL
Codificação suportada pelo SitemapUTF-8Requisito obrigatório do protocolo; outras codificações podem causar falhas de análiseCertifique-se de usar codificação UTF-8 ao salvar arquivos
Protocolos suportados pelo Sitemaphttp:// ou https://As URLs devem incluir cabeçalho de protocolo completoNão suporta outros protocolos como ftp://
Tempo de resposta do crawler após o envioDe algumas horas a vários diasDepende da autoridade do site e complexidade do SitemapNão precisa enviar repetidamente, aguarde pacientemente o processamento
Tamanho de arquivo após compressão gzip50 MBO arquivo comprimido também não deve exceder o limite de 50 MBSe ainda exceder o limite após comprimir, deve dividir o Sitemap