Generador de Sitemap

Generador de sitemap.xml

Introdueix una llista d'URLs, estableix changefreq, priority i lastmod globalment, genera sitemaps XML conformes a sitemap.org amb un clic.

Entrada i paràmetres
Sortida XML
3 URLs vàlides, 483 bytes

Genera en línia fitxers Sitemap XML de mapa web que compleixen l'estàndard del protocol obert sitemap.org 0.9, admet configuració completa de set freqüències d'actualització changefreq, prioritat relativa priority de 0.0 a 1.0, selector de dates lastmod, escapament automàtic d'entitats XML, detecció en temps real d'URL no vàlides, previsualització en temps real d'XML estructurat, funcions de descàrrega i còpia amb un sol clic, ajudant els motors de cerca principals com Google/Bing a descobrir ràpidament i indexar eficientment totes les pàgines importants del lloc web.

Relacionats

Casos d'ús

  • Després del llançament d'un lloc web nou, genera Sitemap massivament per a les pàgines principals, envia'ls a Google Search Console i Bing Webmaster Tools per accelerar el descobriment i la indexació dels motors de cerca
  • Després d'un redisseny de seccions del lloc o ajustos en l'estructura d'URL, regenera el mapa del lloc, actualitza l'índex dels motors de cerca per evitar que enllaços morts residuals afectin el rendiment SEO
  • Els llocs web de comerç electrònic importen massivament URL de llistes de productes, establint diferents valors de changefreq i priority segons la categoria de producte i la data de publicació
  • Quan portals grans o llocs de notícies superen les 50.000 URL, genera diversos Sitemaps per canal i crea un fitxer d'índex Sitemap Index
  • Els blocs configuren paràmetres raonables de freqüència d'actualització i prioritat per a pàgines d'articles, pàgines d'etiquetes, pàgines de categories i pàgines d'arxiu
  • Els llocs web corporatius organitzen diferents tipus d'URL com pàgines de productes, pàgines de notícies, pàgines sobre nosaltres i pàgines de contacte, establint lastmod i priority diferenciats
  • Després de completar la migració del lloc web (actualització d'HTTP a HTTPS, canvi de domini), regenera el Sitemap i envia'l, guiant el crawler a rastrejar ràpidament les noves adreces
  • Complementa manualment els Sitemaps generats per connectors com Yoast SEO, afegint URL de pàgines especials que el connector no cobreix
  • Després de l'optimització de diagnòstic SEO, regenera el Sitemap per garantir que la configuració priority de les pàgines importants sigui raonable, augmentant el pes de rastreig de les pàgines d'alt valor
  • Abans de declarar la ubicació del Sitemap mitjançant robots.txt, utilitza aquesta eina per verificar la correcció del format XML, evitant errors d'anàlisi del crawler

Com usar-ho

  1. Enganxa la llista d'adreces de pàgines que cal indexar a l'àrea d'entrada d'URL, una URL completa per línia (cal incloure el capçal de protocol http:// o https://)
  2. Al menú desplegable changefreq selecciona la freqüència d'actualització de la pàgina: la pàgina principal tria daily o hourly, les pàgines d'articles trien weekly, les pàgines estàtiques trien yearly o monthly
  3. Arrossega el control lliscant priority o introdueix un valor entre 0.0 i 1.0 per establir la prioritat: la pàgina principal principal estableix 1.0, les pàgines de seccions importants 0.8, les pàgines d'articles habituals 0.5, les pàgines d'arxiu 0.3
  4. Fes clic al selector de dates lastmod, selecciona la data de l'última modificació del contingut del lloc web, o deixa-ho en blanc per no incloure el camp lastmod
  5. Consulta l'àrea de previsualització en temps real a la dreta, comprova si l'estructura XML generada és correcta, les URL no vàlides es marcaran en vermell per recordar-te la correcció
  6. Després de confirmar que no hi ha errors, fes clic al botó「Descarrega sitemap.xml」per desar el fitxer, o fes clic al botó「Copia」per copiar el contingut XML al porta-retalls
  7. Puja sitemap.xml al directori arrel del lloc web, afegeix la declaració Sitemap a robots.txt, o envia'l directament a Google Search Console/Bing Webmaster

Característiques

  • Suport d'entrada massiva d'URL: Una URL per línia, filtra automàticament les línies buides i els enllaços duplicats, processa ràpidament grans volums d'adreces de pàgina
  • Escapament automàtic d'entitats XML: Els caràcters especials com ara &, <, >, ", ' a les URL s'escapen automàticament a &amp;, &lt;, &gt;, &quot;, &apos;, evitant completament errors d'anàlisi XML
  • 7 opcions de freqüència d'actualització changefreq: always, hourly, daily, weekly, monthly, yearly, never, cobrint tots els escenaris de tipus de pàgina
  • Configuració precisa de la prioritat priority: Admet qualsevol valor dins de l'interval de 0.0 a 1.0, admet precisió d'un decimal, distingeix el grau d'importància de la pàgina
  • Selector de data de l'última modificació lastmod: Selector de calendari visual, formatat automàticament segons l'estàndard W3C Datetime (YYYY-MM-DD)
  • Detecció en temps real d'URL no vàlides: Reconeix automàticament URL amb format incorrecte (manca de protocol, caràcters il·legals, etc.), marca el número de línia problemàtic per facilitar la correcció
  • Previsualització de generació en temps real: El contingut XML s'actualitza instantàniament després de modificar la llista d'URL o els paràmetres de configuració, sense necessitat de fer clic manualment al botó de generació
  • Descàrrega de sitemap.xml amb un sol clic: El resultat generat es descarrega directament com a fitxer XML estàndard, després de desar-lo es pot penjar immediatament al servidor web
  • Avís de límit de nombre d'URL: Quan el nombre d'URL introduïdes arriba a les 50.000, avisa automàticament que cal utilitzar l'esquema de divisió Sitemap Index
  • Còpia al porta-retalls: Copia tot el contingut XML al porta-retalls amb un sol clic, facilitant l'enganxament directe a fitxers del servidor o l'enviament en línia
  • Estadístiques de mida de bytes: Mostra en temps real el nombre de bytes del fitxer Sitemap XML generat, avaluant si la mida del fitxer compleix les limitacions dels motors de cerca
  • Sortida de l'element arrel urlset estàndard: Compleix estrictament l'especificació del protocol http://www.sitemaps.org/schemas/sitemap/0.9, incloent la declaració de l'espai de noms xmlns correcta
  • Declaració de codificació UTF-8: Afegeix automàticament la declaració de codificació XML, garantint que les URL multilingües com les en xinès s'analitzin correctament sense caràcters corruptes

Preguntes freqients

Cal enviar obligatòriament el Sitemap? Si no l'envio el lloc no serà indexat?

Sense enviar el Sitemap el lloc també pot ser indexat — els motors de cerca poden descobrir les vostres pàgines mitjançant enllaços externs d'altres llocs o seguint enllaços interns. Però enviar el Sitemap pot accelerar significativament la velocitat de descobriment, especialment per a llocs nous, llocs grans i llocs amb enllaços interns imperfectes. Google recomana oficialment que tots els llocs enviïn un Sitemap; és una tasca bàsica de SEO amb cost molt baix i benefici molt alt.

Les URL del Sitemap han de ser camins absoluts? Es poden escriure camins relatius?

Han de ser URL absolutes completes, amb capçalera de protocol (http:// o https://) i domini complet; no es poden escriure camins relatius (com /page1.html) ni formes que ometin el protocol. Quan els motors de cerca analitzen el Sitemap necessiten l'URL completa per rastrejar correctament; els camins relatius provocaran errors d'anàlisi.

La configuració de changefreq i priority és realment útil? Els motors de cerca la compleixen?

Aquests dos camps són「suggeriments」no pas「ordres」; els motors de cerca no els compleixen obligatòriament al 100%, però una configuració correcta encara té valor de referència. En comparació, el lastmod (última modificació) és el camp més valorat pels motors de cerca entre els tres, perquè pot indicar directament al crawler si una pàgina té contingut nou. No enganyeu posant totes les pàgines amb la prioritat més alta o always; això farà que els motors de cerca deixin de confiar en aquestes metadades.

El fitxer Sitemap s'ha de col·locar obligatòriament al directori arrel del lloc?

No és obligatori; el Sitemap es pot col·locar a qualsevol camí sota el lloc web, sempre que l'URL sigui accessible normalment. Però robots.txt s'ha de col·locar al directori arrel. Si utilitzeu Sitemap Index per dividir diversos Sitemaps, el camí dels Sitemaps fills no té limitacions. Tanmateix, per costum col·locar-lo a l'arrel és el més còmode per gestionar i també facilita que el crawler el descobreixi.

El lloc no arriba a les 50.000 URL, però la mida del fitxer supera els 50MB. Què cal fer?

Cal dividir el Sitemap. 50.000 URL i 50MB són dos límits paral·lels; si es compleix qualsevol condició de superació cal dividir. Podeu dividir per tipus de contingut o simplificar el Sitemap (per exemple eliminant espais i indentacions innecessaris, utilitzant compressió gzip); però si després de comprimir encara supera els 50MB cal dividir-lo.

Es poden incloure pàgines noindex o URL prohibides per robots.txt al Sitemap?

No és recomanable. Al Sitemap només hauríeu d'incloure les pàgines que voleu que els motors de cerca rastregin i indexin. Les pàgines noindex, les pàgines prohibides per Disallow, les pàgines que requereixen inici de sessió i les pàgines d'error 404 no haurien d'aparèixer al Sitemap; això reduirà la confiança dels motors de cerca en el Sitemap i també malbaratarà el pressupost de rastreig.

Després d'actualitzar contingut cal tornar a enviar el Sitemap? Amb quina freqüència s'ha d'actualitzar?

Mentre l'URL del fitxer Sitemap no canviï, els motors de cerca el tornaran a rastrejar periòdicament; no cal tornar-lo a enviar manualment cada vegada que actualitzeu contingut. La freqüència d'actualització depèn de la freqüència amb què s'actualitza el contingut del lloc: els llocs de notícies poden actualitzar el Sitemap diàriament o fins i tot cada hora (generació automàtica); els llocs empresarials amb actualització setmanal o mensual n'hi ha prou. Podeu configurar un script del costat del servidor per actualitzar automàticament el fitxer Sitemap.

Quins idiomes d'URL admet el Sitemap? Les URL en xinès cal codificar-les?

El Sitemap admet URL de qualsevol idioma, però les URL amb caràcters no ASCII (com el xinès) requereixen codificació d'URL (també anomenada codificació de percentatge, percent-encoding). Per exemple「中文页面」s'ha de codificar com a %E4%B8%AD%E6%96%87%E9%A1%B5%E9%9D%A2. La majoria de navegadors i eines ho processen automàticament, però heu d'assegurar-vos que les URL del Sitemap generat estiguin correctament codificades.

Es poden enviar diversos Sitemaps alhora? Per exemple tenir alhora un Sitemap d'articles i un de productes?

Sí, hi ha dues maneres:①Utilitzar un fitxer d'índex Sitemap Index per gestionar de manera unificada tots els Sitemaps fills; aquesta és la manera recomanada, només cal enviar l'URL del fitxer d'índex;②A la plataforma de webmasters enviar una per una les URL de cada Sitemap fill; aquesta manera també funciona però la gestió és més complicada. Ambdues maneres són efectives i els motors de cerca les rastrejaran.

Després de crear el Sitemap cal comprimir-lo amb gzip? Quins beneficis té la compressió?

No és obligatori comprimir, però és molt recomanable. La compressió gzip normalment pot reduir la mida del Sitemap en un 70%-80%, estalviant amplada de banda i temps de rastreig del crawler, especialment en llocs grans on l'efecte és notable. Els motors de cerca donen suport totalment al format comprimit sitemap.xml.gz i el descomprimiran automàticament. Mentre després de comprimir no superi els 50MB no hi ha problema.

Cal enviar el Sitemap tant per a la versió HTTP com HTTPS del lloc?

Només hauríeu d'enviar la versió preferida que voleu que sigui indexada. Si ja teniu tot el lloc en HTTPS i heu fet una redirecció 301 HTTP→HTTPS, només cal enviar el Sitemap de la versió HTTPS. No envieu alhora les dues versions HTTP i HTTPS; això provocaria problemes de contingut duplicat. De la mateixa manera, per a www i non-www també heu de determinar el domini preferit i només enviar el Sitemap del domini preferit.

WordPress ja utilitza Yoast SEO per generar el Sitemap. Encara cal utilitzar aquesta eina?

Yoast SEO pot generar automàticament el Sitemap de la majoria de pàgines, però potser es deixa algunes pàgines — com ara pàgines simples creades manualment, tipus de publicació personalitzats mal configurats, pàgines de destinació especials, pàgines importades de fora del lloc, etc. Podeu utilitzar aquesta eina per complementar les URL que Yoast no cobreix, crear un Sitemap addicional independent o comprovar si el Sitemap generat per Yoast és complet i correcte.

L'ordre de les URL al Sitemap és important? Posar les pàgines importants al principi serveix d'alguna cosa?

En el protocol Sitemap l'ordre de les URL no té cap pes oficial; els motors de cerca no donaran prioritat de rastreig només perquè una URL estigui al principi. Però alguns professionals de SEO han observat un lleuger efecte de preferència d'ordre, així que posar les URL importants al principi no fa mal; però no espereu que això aporti un efecte notable; encara heu d'identificar correctament la prioritat mitjançant el camp priority.

Les pàgines amb paginació (com /list?page=2, /page/3) cal incloure-les al Sitemap?

Això depèn del valor del contingut de la paginació. Si la paginació és una llista repetitiva de tipus「veure més」(com la segona o tercera pàgina d'una llista d'articles), normalment no es recomana incloure-les al Sitemap, perquè aquestes pàgines tenen contingut repetitiu i poc valor; us hauríeu de centrar en la primera pàgina de la llista i les pàgines d'articles específiques. Però si la paginació és contingut únic (com navegació per categories, paginació amb valor independent) es pot considerar incloure-la, amb una priority més baixa.

Com es pot verificar que el Sitemap és correcte i efectiu?

Hi ha diverses maneres de verificació:①Després de generar-lo amb aquesta eina, previsualitzeu primer l'estructura XML en local per veure si és correcta; comproveu que les etiquetes es tanquen, els espais de noms i els caràcters escapçats són normals;②Utilitzeu l'eina sitemap-inspector per verificar en línia el format i l'accessibilitat de les URL, comprovant massivament els codis d'estat HTTP de totes les URL;③Després de pujar-lo, utilitzeu el navegador per accedir directament a l'URL del Sitemap i veure si es mostra normalment sense errors d'anàlisi XML;④Després d'enviar-lo a Google Search Console/Bing Webmaster Tools consulteu l'informe d'estat per veure si hi ha errors de format, URL inaccessibles, superació de límits, etc. avisos d'error; aquesta és la manera de verificació més autoritària;⑤També podeu utilitzar eines de verificació XML en línia per comprovar la correcció de la sintaxi XML.

Solució de problemes

El Sitemap XML generat en obrir-lo al navegador mostra errors d'anàlisi i indica que el format no és correcte

La URL conté caràcters especials XML com &, <, > que no han estat escapats: en enganxar manualment l'eina ja els ha escaphat automàticament, però si heu editat el fitxer manualment potser us heu deixat algun escapat La declaració XML o l'espai de noms urlset és incorrecte: comproveu que el valor xmlns de la primera línia coincideix exactament amb http://www.sitemaps.org/schemas/sitemap/0.9 i que no hi ha barres inclinades sobrants Les etiquetes no estan tancades correctament: totes les etiquetes d'obertura com <url>, <loc> han de tenir les etiquetes de tancament corresponents </url>, </loc>; la sintaxi d'etiquetes autotancades no ha de ser incorrecta La codificació del fitxer no és UTF-8 sense BOM: el Bloc de notes de Windows pot desar-lo com a UTF-8 amb BOM o GBK, cosa que causa errors d'anàlisi; cal desar-lo com a UTF-8 sense BOM La URL conté caràcters il·legals: les URL en xinès requereixen codificació d'URL (percent-encoding); els caràcters especials sense codificar provocaran errors d'anàlisi XML Error en la declaració de versió XML: la primera línia ha de ser <?xml version="1.0" encoding="UTF-8"?>, no l'escrigueu com a 1.1 o altres versions Error en l'ordre d'imbricació d'etiquetes: les etiquetes filles han d'estar completament contingudes dins de les etiquetes pares, no hi pot haver imbricacions creuades, com per exemple <url><loc></url></loc>, que és un error d'ordre

Després d'enviar el Sitemap a Google Search Console es mostra「No es pot llegir el Sitemap」o「Error de format」

L'URL del fitxer Sitemap no és accessible: comproveu que en accedir directament a l'URL del Sitemap des del navegador retorni un codi d'estat 200, sense errors 403/404/500 El servidor retorna un Content-Type incorrecte: ha de retornar application/xml o text/xml; si retorna text/hml provocarà fallades d'identificació El Sitemap conté URL que el robots.txt prohibeix rastrejar: si GSC detecta camins Disallow dins el Sitemap mostrarà un error Problema de redirecció d'URL: si l'URL del Sitemap fa una redirecció 301/302 a una altra adreça provocarà errors; assegureu-vos que l'URL sigui accessible directament sense redireccions HTTP/HTTPS o www/non-www no coincideixen: el domini del Sitemap enviat no coincideix amb el domini verificat a GSC (per exemple, el verificat és www.example.com però el Sitemap utilitza example.com) El fitxer Sitemap és massa gran i supera el límit de 50MB o les 50.000 URL: GSC rebutjarà directament processar fitxers que superin els límits S'han utilitzat entitats HTML en lloc d'entitats XML: l'&nbsp; de l'espai és una entitat HTML, no pas una entitat XML, i no es pot utilitzar en XML

Fa molt de temps que he enviat el Sitemap i moltes URL encara no han estat indexades per Google

Problema de qualitat de la pàgina: la indexació no és garantida només per enviar; les pàgines amb poca originalitat, contingut duplicat o poc valor Google pot optar per no indexar-les Període de revisió de lloc nou (efecte sandbox): els llocs nous després d'enviar el Sitemap poden necessitar de setmanes a mesos de període d'observació abans de ser indexats massivament La pàgina és noindex: a la pàgina retornada per la URL hi ha una metaetiqueta noindex o la capçalera de resposta X-Robots-Tag: noindex; Google l'exclourà activament El pressupost de rastreig del lloc és insuficient: lloc amb poc pes, servidor que respon lentament, estructura d'enllaços interns deficient, la freqüència de rastreig assignada per Googlebot és baixa; cal més temps El Sitemap conté un gran nombre d'URL de baixa qualitat: si moltes URL del Sitemap són errors 404, 5xx, contingut duplicat o pàgines de poc valor, Google reduirà la confiança en tot el Sitemap El domini ha estat penalitzat: el lloc té problemes que infringeixen les directrius de qualitat de Google (com trampa, contingut brossa, programari maliciós), cosa que dificulta la indexació La pàgina és una pàgina aïllada: tot i estar al Sitemap, no hi ha cap punt d'entrada des dels enllaços interns del lloc; el crawler pot considerar que no és important i no indexar-la

El Sitemap mostra que s'han descobert URL, però la quantitat d'índexs reals és molt baixa

Això és un fenomen normal:「Descobert」només indica que Google ha accedit al Sitemap i ha vist les URL, no vol dir que les indexarà totes; la taxa d'indexació depèn de la qualitat de la pàgina Problema de contingut duplicat: diverses URL amb contingut molt similar (com la mateixa pàgina amb paràmetres diferents, versió d'impressió, paginació); Google en triarà una versió canònica per indexar L'etiqueta de canonicalització (canonical) apunta a una altra pàgina: la pàgina té establert <link rel="canonical" href="una altra URL">; Google indexarà l'adreça a la qual apunta el canonical El contingut de la pàgina és massa prim: el contingut té poques paraules, sense valor substancial, o és contingut recopilat; Google considera que no val la pena indexar-lo La velocitat de càrrega de la pàgina és massa lenta: el servidor respon amb temps d'espera esgotat, la pàgina carrega massa lentament; després de diversos intents fallits de rastreig el crawler reduirà la prioritat de rastreig Problemes amb el certificat HTTPS: certificat SSL no vàlid, errors de contingut mixt, versions HTTP/HTTPS coexistint, cosa que provoca problemes de canonicalització Problemes d'adaptació mòbil: poca adaptabilitat a mòbils, errors d'adaptació mòbil; en un entorn d'indexació mobile-first això afecta la indexació

Bing pot rastrejar el Sitemap amb normalitat però Google no el rastreja gens

Problema de verificació a Google Search Console: assegureu-vos que la verificació de propietat del domini és vigent i que el domini verificat (www/non-www, http/https) coincideix amb la versió d'accés real El tallafoc del servidor o el CDN ha bloquejat Googlebot: comproveu els registres d'accés del servidor per veure si les sol·licituds de Googlebot (l'user-agent conté Googlebot) són bloquejades o retornen 403 Problema de resolució DNS: la IP a la qual resol el DNS de Google és diferent de la de Bing; assegureu-vos que totes les regions poden resoldre correctament al vostre servidor El robots.txt té restriccions especials per a Googlebot: comproveu si sota User-agent: Googlebot hi ha regles Disallow especials El lloc web té un historial de trampes i ha estat rebaixat de rang per Google: els dominis que han estat sancionats manualment han de sol·licitar una revisió primer L'URL del Sitemap conté contingut que Google considera insegur: com ara dominis marcats com a programari maliciós o contingut de phishing Les regles WAF del CDN bloquegen per error: algunes regles de seguretat poden jutjar erròniament el comportament del crawler Googlebot; cal comprovar els registres de seguretat del CDN

El Sitemap generat es comprova correctament en local, però després de pujar-lo al servidor l'accés retorna un error 404

El camí del fitxer és incorrecte: sitemap.xml no s'ha pujat al directori correcte; assegureu-vos que l'heu pujat a la ubicació corresponent a l'URL que heu declarat a robots.txt i enviat als motors de cerca Problema de majúscules i minúscules del nom de fitxer: els servidors Linux/Unix distingeixen majúscules i minúscules; Sitemap.xml i sitemap.xml són fitxers diferents; assegureu-vos que el nom del fitxer sigui tot en minúscules La configuració de Nginx/Apache prohibeix l'accés a fitxers xml: comproveu la configuració del servidor per veure si hi ha regles location que rebutgen l'accés a fitxers amb sufix .xml o que retornen regles try_files incorrectes Problema de permisos de fitxer: els permisos del fitxer al servidor estan configurats incorrectament (com ara permís 600); l'usuari del servidor Web no té permís de lectura; normalment cal permís 644, els directoris necessiten permís 755 El CDN ha guardat a la memòria cau una resposta 404 antiga: el fitxer que acabeu de pujar potser el CDN encara té a la memòria cau el 404 anterior; cal refrescar la memòria cau del CDN o esperar que el CDN actualitzi automàticament des de l'origen Conflicte de regles d'enllaços permanents de CMS com WordPress: les regles de reescriptura del CMS han interceptat sitemap.xml; cal configurar regles d'exclusió perquè el servidor accedeixi directament al fitxer estàtic El servidor ha configurat anti-hotlink o control d'accés: regles de comprovació de referer, llistes blanques d'IP, etc. a la configuració de .htaccess o Nginx poden bloquejar l'accés del crawler

Glossari

Sitemap (Mapa web)
Fitxer estàndard de protocol XML que informa els motors de cerca sobre totes les pàgines del lloc web disponibles per al rastreig, inclou una llista completa d'URL i informació de metadades de cada URL, ajudant crawlers com Googlebot i Bingbot a descobrir, comprendre i rastrejar el contingut del lloc de manera més intel·ligent i eficient; és mantingut per l'organització sitemaps.org amb un estàndard de protocol obert unificat (versió actual 0.9).
urlset
Element arrel d'un fitxer Sitemap XML estàndard; ha d'incloure la declaració correcta de l'espai de noms xmlns, i dins seu s'aniden totes les entrades d'elements fills <url>; és la identificació central de la validesa del Sitemap; un Sitemap sense una estructura urlset correcta serà rebutjat directament pels motors de cerca.
Sitemap Index
Fitxer d'índex de mapa web; s'ha d'utilitzar quan el nombre d'URL del lloc supera les 50.000 o la mida d'un sol fitxer Sitemap supera els 50MB; l'element arrel és <sitemapindex>, s'utilitza per llistar i gestionar de manera unificada les adreces de diversos fitxers Sitemap fills; és l'esquema estàndard que permet als llocs grans dividir els Sitemaps.
changefreq
Element de metadades opcional del Sitemap, s'utilitza per especificar la freqüència d'actualització aproximada del contingut de la pàgina; hi ha set valors vàlids: always, hourly, daily, weekly, monthly, yearly, never; serveix de referència perquè el crawler dels motors de cerca programi la freqüència de rastreig de revisita; una configuració raonable pot optimitzar l'assignació del pressupost de rastreig.
priority
Element de metadades opcional del Sitemap, s'utilitza per especificar el grau de prioritat d'importància d'aquesta URL respecte a altres pàgines del lloc; el rang de valors és un decimal entre 0.0 i 1.0, el valor per defecte és 0.5; la priority només afecta la prioritat de rastreig relativa de les pàgines dins del lloc, no afecta el rànquing dels resultats de cerca.
lastmod
Element de metadades opcional del Sitemap, registra la data i l'hora de la darrera modificació substancial del contingut de la pàgina; el format ha de complir l'especificació W3C Datetime; és el camp més valorat pels motors de cerca entre els tres camps de metadades opcionals, perquè indica directament si la pàgina té contingut nou que cal tornar a rastrejar.
loc
Element fill obligatori sota l'element <url>, s'utilitza per especificar l'adreça URL absoluta completa de la pàgina; ha de començar amb el protocol http:// o https://, incloure el domini complet, la longitud total de l'URL no pot superar els 2048 caràcters; no es permeten camins relatius.
Espai de noms XML (xmlns)
Atribut d'espai de noms XML que ha de ser declarat per l'element arrel urlset; el valor de l'atribut ha de coincidir exactament amb http://www.sitemaps.org/schemas/sitemap/0.9; s'utilitza per identificar la versió del protocol utilitzat pel Sitemap; la manca o escriptura incorrecta de l'espai de noms provocarà errors d'anàlisi del Sitemap.
W3C Datetime
Format de representació de dates i hores establert pel W3C (World Wide Web Consortium); el camp lastmod dels Sitemaps ha de complir aquest format; generalment s'utilitza el format de data simplificat YYYY-MM-DD (millor compatibilitat), també admet el format complet de data i hora amb informació d'hores, minuts, segons i zona horària.
Escapament d'entitats XML
En la sintaxi XML, els caràcters especials han de ser escapats a les referències d'entitat corresponents per ser analitzats correctament: & s'escapa a &amp;, < a &lt;, > a &gt;, " a &quot;, ' a &apos;; quan les URL contenen aquests caràcters cal escapçar-los, en cas contrari provocaran errors d'anàlisi XML.
Google Search Console (GSC)
Eina oficial de plataforma de webmasters proporcionada per Google; s'utilitza per enviar Sitemaps, veure l'estat d'indexació del lloc, analitzar dades de tràfic de cerca, informes d'errors de rastreig, notificacions de problemes de seguretat, notificacions de sancions per accions manuals, etc.; és una eina indispensable per a l'optimització de motors de cerca (SEO) de Google.
Bing Webmaster Tools
Plataforma oficial de webmasters del motor de cerca Microsoft Bing; la seva funcionalitat és similar a Google Search Console; admet enviament de Sitemaps, estadístiques de cobertura d'índex, anàlisi de diagnòstic SEO, recerca de paraules clau, consultes d'enllaços entrants, etc.; cobreix el tràfic de cerca dels dos grans motors de cerca Bing i Yahoo.
robots.txt
Fitxer de text pla emmagatzemat al directori arrel del lloc web; mitjançant ordres com User-agent, Disallow i Allow informa el crawler dels motors de cerca sobre quins camins es permet rastrejar i quins es prohibeix; alhora també pot declarar la ubicació del fitxer Sitemap dins del fitxer perquè el crawler el descobreixi automàticament.
Crawler (Aranya/Bot)
Programa automàtic desenvolupat pels motors de cerca per rastrejar contingut de pàgines web, com ara Googlebot (crawler de Google), Bingbot (crawler de Bing), Baiduspider (crawler de Baidu); descobreix pàgines noves seguint enllaços de pàgines i llegint fitxers Sitemap; després de descarregar el contingut de la pàgina l'emmagatzema a la base de dades d'índex dels motors de cerca.
Pressupost de rastreig (Crawl Budget)
Total de recursos de rastreig que els motors de cerca assignen a un lloc web en un cicle de temps determinat; està determinat conjuntament per diversos factors com el pes del domini, la velocitat de resposta del servidor, la qualitat del contingut de la pàgina, l'eficàcia històrica de rastreig, etc.; una configuració correcta del Sitemap pot ajudar a optimitzar l'eficiència en l'ús del pressupost de rastreig.
Codificació UTF-8
Codificació de caràcters obligatòria per als fitxers Sitemap XML; UTF-8 admet tots els caràcters Unicode, inclòs el xinès; s'especifica mitjançant l'atribut encoding="UTF-8" a la declaració XML; l'ús d'altres codificacions (com GBK, GB2312) pot provocar caràcters corruptes en URL xineses i errors d'anàlisi.
Compressió gzip
El protocol Sitemap admet l'ús de l'algorisme gzip per a la transmissió comprimida (l'extensió de fitxer és .xml.gz); pot reduir la mida del fitxer Sitemap en un 70%-80%, estalviant significativament amplada de banda del servidor i temps de rastreig del crawler; els motors de cerca principals poden descomprimir i processar automàticament fitxers Sitemap comprimits amb gzip; després de la compressió encara cal complir el límit de mida de 50MB.
Yoast SEO
Connector SEO àmpliament utilitzat en plataformes CMS com WordPress i Shopify; pot generar automàticament Sitemaps, metaetiquetes, navegació d'engrunes, mapes web XML, optimització RSS, metadades de xarxes socials, etc. funcions relacionades amb SEO; és una solució SEO habitual per a llocs web de tipus contingut.
Cobertura de l'índex (Index Coverage)
Un dels informes centrals de Google Search Console; mostra detalladament el nombre específic i els detalls de les causes de les pàgines del lloc web que són indexades, excloses, amb errors o amb advertències per Google; es pot utilitzar per verificar l'eficàcia de l'enviament del Sitemap i diagnosticar problemes d'indexació de pàgines.
Codificació d'URL (Percent-Encoding)
També anomenada codificació de percentatge; és un mètode de codificació utilitzat per representar caràcters no ASCII (com el xinès o símbols especials) a les URL; els caràcters xinesos es codifiquen en forma %XX%XX%XX (per exemple「中文」es codifica com a %E4%B8%AD%E6%96%87); les URL en xinès dels Sitemaps han d'estar correctament codificades per poder ser analitzades.

Taula de comparació d'escenaris de freqüència d'actualització changefreq

Valor changefreqFreqüència d'actualitzacióTipus de pàgina d'aplicació típicaNotes
alwaysPot canviar en cada accésPàgines de dades en temps real, entrada de cerca, pàgines d'agregació dinàmicaNo vol dir que el crawler hi vingui cada cop, només que la freqüència de canvi és molt alta; no abogueu, les pàgines habituals no configureu com a always
hourlyS'actualitza cada horaPortada de notícies, dinàmiques de xarxes socials, pàgines de preus en temps realApte per a pàgines amb contingut nou cada hora; llocs amb actualitzacions poc freqüents no configureu com a hourly
dailyS'actualitza diàriamentPàgina principal, llistes de blocs, canals de notícies, categories de productesUn dels valors més utilitzats; vàlid per a la portada i pàgines de seccions de la majoria de llocs
weeklyS'actualitza setmanalmentPàgines de detall d'articles habituals, detalls de productes, contingut de blocsApte per a la majoria de pàgines de contingut principal de llocs de tipus contingut
monthlyS'actualitza mensualmentDirectoris de categories, arxius, pàgines de FAQ, guies d'úsPàgines auxiliars amb actualitzacions de contingut poc freqüents però amb ajustos ocasionals
yearlyS'actualitza anualmentPàgines de presentació d'empresa, contacte, termes de servei, polítiques de privacitatPàgines d'informació estàtica que gairebé no canvien
neverNo s'actualitza maiArxius d'articles històrics, pàgines d'esdeveniments caducats, contingut antic arxivatConfigureu com a never les pàgines que segurament no es modificaran més; si hi ha actualitzacions recordeu canviar-ho oportunament

Taula de referència de configuració de prioritat priority

Valor priorityNivell de prioritatTipus de pàgina d'aplicacióPercentatge recomanat de nombre de pàgines
1.0MàximaPàgina principal, pàgines de destinació principals, entrada de canals més importantsNomés 1-3 pàgines a tot el lloc
0.8-0.9Molt altaSeccions principals, categories populars, productes principals, temes especials importantsAproximadament el 5-10% del total de pàgines
0.6-0.7AltaSeccions secundàries, subcategories, articles populars, detalls de productes importantsAproximadament el 10-20% del total de pàgines
0.4-0.5NormalPàgines de detall d'articles habituals, productes generals, contingut rutinariAproximadament el 40-60% del total de pàgines (valor per defecte)
0.2-0.3BaixaPàgines d'etiquetes, paginació d'arxius, arxius d'articles antics, pàgines auxiliarsAproximadament el 15-25% del total de pàgines
0.0-0.1MínimaPàgines de baix valor, contingut duplicat, pàgines que no es volen rastrejar amb focusDins del 5% del total de pàgines; 0 no vol dir prohibir indexació

Taula de límits de l'especificació del protocol Sitemap

Element de límitValor límit superiorDescripcióEsquema de gestió en superar el límit
Nombre d'URL en un sol Sitemap50.000 URLRequisit estricte del protocol sitemap.org 0.9Utilitzeu Sitemap Index per dividir en diversos Sitemaps fills
Mida de fitxer Sitemap sense comprimir50MB (52428800 bytes)Mida del fitxer original amb totes les etiquetes i espaisUtilitzeu compressió gzip, dividiu Sitemaps, simplifiqueu comentaris
Nombre de Sitemaps fills que pot contenir Sitemap Index50.000Límit d'entrades URL del propi fitxer d'índexTeòricament admet 2,5 milers de milions d'URL; els llocs habituals no ho necessiten
Longitud d'una URL2.048 caràctersInclosos protocol, domini, camí i tots els paràmetres de consultaURL massa llargues cal simplificar paràmetres o fer reescriptura d'URL
Format de codificació admèsUTF-8Requisit obligatori del protocol; altres codificacions poden causar errors d'anàlisiAssegureu-vos d'utilitzar codificació UTF-8 en desar el fitxer
Protocols admesoshttp:// o https://Les URL han de tenir el capçal de protocol completNo s'admeten altres protocols com ftp://
Temps de resposta del crawler després de l'enviamentAlgunes hores a uns quants diesDepèn del pes del lloc i la complexitat del SitemapNo cal enviar repetidament; espereu el processament amb paciència
Mida de fitxer després de compressió gzip50MBEl fitxer comprimit tampoc no pot superar el límit de 50MBSi supera el límit després de comprimir cal dividir el Sitemap