Generador de Sitemap
Generador de sitemap.xml
Introduce una lista de URLs, establece changefreq, priority y lastmod globalmente, genera sitemaps XML conformes a sitemap.org con un clic.
Genere en línea archivos de mapa del sitio Sitemap XML que cumplan con el estándar del protocolo abierto sitemap.org 0.9. Admite configuración completa de siete frecuencias de actualización changefreq, prioridad relativa priority de 0.0-1.0, selector de fecha lastmod, escape automático de entidades XML, detección en tiempo real de URL no válidas, previsualización estructurada de XML en tiempo real, descarga y copia con un clic, ayudando a los principales motores de búsqueda como Google y Bing a descubrir rápidamente e indexar eficientemente todas las páginas importantes del sitio.
Relacionado
Casos de uso
- Después del lanzamiento de un sitio nuevo, genere Sitemaps de páginas principales de forma masiva y envíelos a Google Search Console y Bing Webmaster Tools para acelerar el descubrimiento e indexación por parte de los motores de búsqueda
- Regenere el mapa del sitio después de rediseñar secciones del sitio o ajustar la estructura de URL, actualizando el índice de los motores de búsqueda para evitar enlaces muertos que afecten el rendimiento SEO
- Importe masivamente URL de listas de productos en sitios de comercio electrónico, configurando diferentes valores de changefreq y priority según la categoría del producto y la fecha de publicación
- Para portales grandes o sitios de noticias con más de 50000 URL, divida por canales para generar múltiples Sitemaps y cree un archivo de índice Sitemap Index
- Para sitios de blogs, configure parámetros razonables de frecuencia de actualización y prioridad para páginas de artículos, páginas de etiquetas, páginas de categorías y páginas de archivo
- Organice diferentes tipos de URL como páginas de productos, páginas de noticias, páginas Acerca de, páginas de contacto en sitios corporativos, configurando lastmod y priority diferenciados
- Después de completar la migración del sitio (actualización HTTP a HTTPS, cambio de dominio), regenere el Sitemap y envíelo para guiar a los crawlers a rastrear rápidamente las nuevas direcciones
- Complemente manualmente los Sitemaps generados por complementos como Yoast SEO, agregando URL de páginas especiales no cubiertas por el complemento
- Regenere el Sitemap después del diagnóstico y optimización SEO, asegurando que la configuración de priority de las páginas importantes sea razonable y mejorando el peso de rastreo de páginas de alto valor
- Antes de declarar la ubicación del Sitemap en robots.txt, utilice esta herramienta para verificar la corrección del formato XML y evitar fallos de análisis del crawler
Cómo Usar
- Pegue la lista de direcciones de páginas que desea indexar en el área de entrada de URL, una URL completa por línea (debe incluir el encabezado de protocolo http:// o https://)
- Seleccione la frecuencia de actualización de la página en el menú desplegable changefreq: elija daily o hourly para la página de inicio, weekly para páginas de artículos, yearly o monthly para páginas estáticas
- Arrastre el control deslizante de priority o ingrese un valor entre 0.0 y 1.0 para establecer la prioridad: página de inicio principal en 1.0, páginas de secciones importantes en 0.8, páginas de artículos normales en 0.5, páginas de archivo en 0.3
- Haga clic en el selector de fecha lastmod para seleccionar la fecha de última modificación del contenido del sitio, o déjelo vacío para no incluir el campo lastmod
- Revise el área de previsualización en tiempo real a la derecha, verifique que la estructura XML generada sea correcta; las URL no válidas se marcarán en rojo para su corrección
- Después de confirmar que todo es correcto, haga clic en el botón «Descargar sitemap.xml» para guardar el archivo, o haga clic en el botón «Copiar» para copiar el contenido XML al portapapeles
- Suba sitemap.xml al directorio raíz de su sitio web, agregue la declaración Sitemap en robots.txt, o envíelo directamente a Google Search Console/Bing Webmaster
Características
- Entrada masiva de URL: una URL por línea, filtra automáticamente líneas vacías y enlaces duplicados, procesa rápidamente grandes lotes de direcciones de páginas
- Escape automático de entidades XML: los caracteres especiales en URL como &, <, >, ", ' se escapan automáticamente a &, <, >, ", ', evitando por completo errores de análisis XML
- 7 opciones de frecuencia de actualización changefreq: always, hourly, daily, weekly, monthly, yearly, never, cubriendo todos los escenarios de tipos de páginas
- Configuración precisa de prioridad priority: admite cualquier valor entre 0.0 y 1.0 con precisión de un decimal, distinguiendo el nivel de importancia de las páginas
- Selector de fecha lastmod: selector de calendario visual que formatea automáticamente al estándar W3C Datetime (YYYY-MM-DD)
- Detección en tiempo real de URL no válidas: identifica automáticamente URL con formato incorrecto (falta de protocolo, caracteres ilegales, etc.) y marca el número de línea problemático para facilitar la corrección
- Previsualización en tiempo real: el contenido XML se actualiza instantáneamente al modificar la lista de URL o parámetros de configuración, sin necesidad de hacer clic manualmente en un botón de generación
- Descarga de sitemap.xml con un clic: el resultado generado se descarga directamente como un archivo XML estándar, listo para subir al servidor web inmediatamente después de guardar
- Advertencia de límite de URL: al alcanzar las 50000 URL, se muestra automáticamente un aviso indicando que es necesario usar el esquema de división Sitemap Index
- Copia al portapapeles: copia el contenido XML completo al portapapeles con un clic, facilitando pegarlo directamente en archivos del servidor o envíos en línea
- Estadísticas de tamaño en bytes: muestra en tiempo real el tamaño en bytes del archivo Sitemap XML generado, evaluando si el tamaño del archivo cumple con los límites de los motores de búsqueda
- Salida del elemento raíz urlset estándar: sigue estrictamente la especificación del protocolo http://www.sitemaps.org/schemas/sitemap/0.9, incluyendo la declaración correcta del espacio de nombres xmlns
- Declaración de codificación UTF-8: agrega automáticamente la declaración de codificación XML, garantizando la interpretación correcta de URL multilingües sin caracteres corruptos
Preguntas Frecuentes
¿Es obligatorio enviar un Sitemap? ¿Si no lo envío, mi sitio no será indexado?
Sin enviar un Sitemap, un sitio también puede ser indexado — los motores de búsqueda pueden descubrir sus páginas a través de enlaces externos de otros sitios y seguimiento de enlaces internos. Pero enviar un Sitemap puede acelerar significativamente la velocidad de descubrimiento, especialmente para sitios nuevos, sitios grandes y sitios con enlaces internos deficientes. Google recomienda oficialmente que todos los sitios envíen Sitemap; es un trabajo SEO básico de costo muy bajo y alto beneficio.
¿Las URL en el Sitemap deben ser rutas absolutas? ¿Se pueden escribir rutas relativas?
Deben ser URL absolutas completas, incluyendo el encabezado de protocolo (http:// o https://) y el dominio completo; no se pueden escribir rutas relativas (como /page1.html) ni omitir el protocolo. Los motores de búsqueda necesitan URL completas para rastrear correctamente al analizar el Sitemap; las rutas relativas provocarán errores de análisis.
¿Realmente son útiles las configuraciones de changefreq y priority? ¿Los motores de búsqueda las respetarán?
Ambos campos son «sugerencias», no «instrucciones»; los motores de búsqueda no necesariamente las respetarán al 100%, pero una configuración precisa aún tiene valor de referencia. En comparación, lastmod (hora de última modificación) es el más valorado por los motores de búsqueda entre los tres campos, porque puede indicar directamente al crawler si la página tiene contenido nuevo. No establezca falsamente todas las páginas en la prioridad más alta o always, esto hará que los motores de búsqueda dejen de confiar en estos metadatos.
¿El archivo Sitemap debe colocarse obligatoriamente en el directorio raíz del sitio?
No necesariamente; el Sitemap se puede colocar en cualquier ruta del sitio, siempre que la URL sea accesible normalmente. Pero robots.txt debe estar en el directorio raíz. Si ha dividido múltiples Sitemaps usando Sitemap Index, las rutas de los Sitemaps secundarios no tienen restricciones. Sin embargo, por costumbre colocarlo en el directorio raíz es más conveniente para la gestión y para que los crawlers lo descubran.
Mi sitio tiene menos de 50000 URL, pero el tamaño del archivo supera los 50 MB, ¿qué debo hacer?
Necesita dividir el Sitemap. 50000 URL y 50 MB son dos límites paralelos; cuando se cumple cualquiera de las condiciones de superación de límite, se requiere división. Puede dividir por tipo de contenido, o simplificar el Sitemap (como eliminar espacios y sangrías innecesarios, usar compresión gzip), pero si después de comprimir aún supera los 50 MB debe dividirlo obligatoriamente.
¿Se pueden incluir páginas noindex o URL prohibidas por robots.txt en el Sitemap?
No se recomienda. El Sitemap solo debe contener páginas que desea que los motores de búsqueda rastreen e indexen. Las páginas noindex, páginas prohibidas por Disallow, páginas que requieren inicio de sesión para acceder, páginas de error 404 no deben aparecer en el Sitemap; esto reducirá la confianza de los motores de búsqueda en el Sitemap y también desperdiciará presupuesto de rastreo.
¿Después de actualizar contenido necesito volver a enviar el Sitemap? ¿Con qué frecuencia es adecuado actualizar el Sitemap?
Siempre que la URL del archivo Sitemap no cambie, los motores de búsqueda lo volverán a rastrear periódicamente; no necesita volver a enviarlo manualmente cada vez que actualice contenido. La frecuencia de actualización depende de la frecuencia de actualización del contenido de su sitio: sitios de noticias pueden actualizar el Sitemap diariamente o incluso cada hora (generación automática); sitios corporativos pueden actualizarlo semanal o mensualmente. Puede configurar scripts del lado del servidor para actualizar automáticamente el archivo Sitemap.
¿Qué idiomas de URL admite Sitemap? ¿Las URL chinas necesitan codificación?
Sitemap admite URL de cualquier idioma, pero las URL con caracteres no ASCII (como chino) requieren codificación URL (también llamada codificación porcentual, percent-encoding). Por ejemplo, «中文页面» debe codificarse como %E4%B8%AD%E6%96%87%E9%A1%B5%E9%9D%A2 en este formato. La mayoría de navegadores y herramientas lo procesan automáticamente, pero debe asegurarse de que las URL en el Sitemap generado estén correctamente codificadas.
¿Se pueden enviar múltiples Sitemaps simultáneamente? Por ejemplo, tener Sitemap de artículos y Sitemap de productos al mismo tiempo
Sí, hay dos formas: ①Usar un archivo de índice Sitemap Index para gestionar unificadamente todos los Sitemaps secundarios; esta es la forma recomendada, solo necesita enviar la URL del archivo de índice; ②Enviar individualmente la URL de cada Sitemap secundario en la plataforma de webmasters; esta forma también es válida pero es más complicada de gestionar. Ambas formas son efectivas y los motores de búsqueda las rastrearán.
¿Después de generar el Sitemap necesita compresión gzip? ¿Qué beneficios tiene la compresión?
No es obligatorio comprimir, pero se recomienda encarecidamente. La compresión gzip generalmente puede reducir el volumen del Sitemap en un 70%-80%, ahorrando ancho de banda y tiempo de rastreo del crawler; el efecto es especialmente notable en sitios grandes. Los motores de búsqueda admiten completamente el formato comprimido sitemap.xml.gz y lo descomprimirán automáticamente. Siempre que después de comprimir no supere los 50 MB no habrá problemas.
¿Necesito enviar Sitemap para las dos versiones HTTP y HTTPS del sitio?
Solo debe enviar la versión preferida que desea que se indexe. Si ya tiene todo el sitio en HTTPS y ha realizado redirección 301 HTTP→HTTPS, solo necesita enviar el Sitemap de la versión HTTPS. No envíe las dos versiones HTTP y HTTPS simultáneamente; esto provocará problemas de contenido duplicado. Asimismo, debe determinar el dominio preferido con www o sin www y enviar solo el Sitemap del dominio preferido.
WordPress usa Yoast SEO para generar Sitemap, ¿aún necesito esta herramienta?
Yoast SEO puede generar automáticamente Sitemaps para la mayoría de páginas, pero puede omitir algunas páginas — como páginas individuales creadas manualmente, tipos de entrada personalizados no configurados correctamente, páginas de destino especiales, páginas importadas de fuentes externas, etc. Puede usar esta herramienta para complementar estas URL no cubiertas por Yoast, generando un Sitemap complementario separado, o verificar comparativamente si el Sitemap generado por Yoast es completo y correcto.
¿Es importante el orden de las URL en el Sitemap? ¿Es útil poner las páginas importantes al principio?
En el protocolo Sitemap el orden de las URL no tiene ningún peso oficial; los motores de búsqueda no priorizarán el rastreo porque una URL esté al principio. Pero algunos profesionales de SEO han observado un ligero efecto de preferencia de orden, así que poner las URL importantes al principio no tiene ningún inconveniente, pero no espere que esto traiga efectos evidentes; debe identificar correctamente la prioridad a través del campo priority.
¿Las páginas paginadas (como /list?page=2, /page/3) deben incluirse en el Sitemap?
Esto depende del valor del contenido paginado. Si la paginación es listas repetidas de tipo «ver más» (como la página 2, página 3 de listas de artículos), generalmente no se recomienda incluirlas en el Sitemap, porque estas páginas tienen contenido duplicado y bajo valor; debe enfocarse en la página de inicio de la lista y páginas de artículos específicos. Pero si la paginación es contenido único (como navegación por categorías, páginas paginadas con valor independiente) puede considerar incluirlas con una priority más baja.
¿Cómo puedo verificar si el Sitemap es correcto y válido?
Hay varias formas de verificación: ①Después de generar con esta herramienta, previsualice primero localmente si la estructura XML es correcta, verifique que el cierre de etiquetas, espacios de nombres, caracteres de escape sean normales; ②Use la herramienta sitemap-inspector para verificar en línea el formato y accesibilidad de URL, comprobando por lotes los códigos de estado HTTP de todas las URL; ③Después de subir, acceda directamente a la URL del Sitemap en el navegador para ver si se muestra normalmente sin errores de análisis XML; ④Después de enviar a Google Search Console/Bing Webmaster Tools consulte el informe de estado para ver si hay errores de formato, URL inaccesibles, límites excedidos y otros avisos de error; esta es la forma de verificación más autorizada; ⑤También puede usar herramientas de verificación XML en línea para comprobar la corrección de la sintaxis XML.
Solución de problemas
El Sitemap XML generado muestra errores de análisis al abrirlo en el navegador, indicando formato incorrecto
Las URL contienen caracteres especiales XML como &, <, > que no han sido escapados: la herramienta ya escapa automáticamente al pegar, pero si ha editado el archivo manualmente puede haber omitido el escape Error en la declaración XML o el espacio de nombres urlset: verifique que el valor xmlns de la primera línea coincida exactamente con http://www.sitemaps.org/schemas/sitemap/0.9, sin barras diagonales adicionales Las etiquetas no están cerradas correctamente: todas las etiquetas de apertura como <url>, <loc> deben tener sus etiquetas de cierre correspondientes </url>, </loc>; las etiquetas de autocierre no deben escribirse incorrectamente La codificación del archivo no es UTF-8 sin BOM: el Bloc de notas de Windows puede guardar como UTF-8 BOM o codificación GBK provocando errores de análisis; debe guardar como UTF-8 sin BOM Las URL contienen caracteres ilegales: las URL chinas requieren codificación URL (percent-encoding); caracteres especiales sin codificar provocan fallos de análisis XML Error en la declaración de versión XML: la primera línea debe ser <?xml version="1.0" encoding="UTF-8"?>, no escriba 1.1 u otras versiones Error en el orden de anidamiento de etiquetas: las etiquetas secundarias deben estar completamente contenidas dentro de las etiquetas principales, no se permite anidamiento cruzado como <url><loc></url></loc>
Después de enviar el Sitemap en Google Search Console, muestra «No se puede leer el Sitemap» o «Error de formato»
La URL del archivo Sitemap no es accesible: verifique que accediendo directamente a la URL del Sitemap en el navegador devuelva código de estado 200, sin errores 403/404/500 El servidor devolvió un Content-Type incorrecto: debe devolver application/xml o text/xml; si devuelve text/html provocará fallos de reconocimiento El Sitemap contiene URL prohibidas por robots.txt: GSC informará errores si detecta rutas Disallow en el Sitemap Problemas de redireccionamiento de URL: si las URL del Sitemap redireccionan 301/302 a otras direcciones provocará errores; asegúrese de que las URL sean directamente accesibles sin redirecciones Discrepancia HTTP/HTTPS o www/sin www: el dominio del Sitemap enviado no coincide con el dominio verificado en GSC (por ejemplo, verificó www.example.com pero el Sitemap usa example.com) El archivo Sitemap es demasiado grande superando el límite de 50 MB o las URL superan las 50000: GSC rechazará directamente procesar archivos que excedan los límites Se han utilizado entidades HTML en lugar de entidades XML: para espacios es una entidad HTML, no una entidad XML; no se puede utilizar en XML
Ha pasado mucho tiempo desde que envié el Sitemap, pero muchas URL aún no han sido indexadas por Google
Problemas de calidad de página: la indexación no está garantizada solo por enviar; Google puede optar por no indexar páginas con contenido original deficiente, contenido duplicado o contenido de bajo valor Período de revisión para sitios nuevos (efecto sandbox): los sitios nuevos pueden requerir un período de observación de varias semanas a varios meses después de enviar el Sitemap antes de la indexación masiva La página tiene noindex: las páginas devueltas por URL tienen etiqueta meta noindex o encabezado de respuesta X-Robots-Tag: noindex; Google las excluirá activamente Presupuesto de rastreo del sitio insuficiente: baja autoridad del sitio, respuesta lenta del servidor, estructura deficiente de enlaces internos; Googlebot asigna una frecuencia de rastreo baja, lo que requiere más tiempo El Sitemap contiene una gran cantidad de URL de baja calidad: si muchas URL en el Sitemap son errores 404, 5xx, contenido duplicado o páginas de bajo valor, Google reducirá la confianza en todo el Sitemap Dominio penalizado: el sitio tiene problemas que violan las directrices de calidad de Google (como trucos, contenido spam, malware) que bloquean la indexación La página es una página huérfana: aunque la página está en el Sitemap, no tiene ninguna entrada a través de enlaces internos del sitio; el crawler puede considerarla poco importante y no indexarla
El Sitemap muestra URL descubiertas, pero la cantidad de índices reales es muy baja
Esto es normal: «Descubiertas» solo significa que Google accedió al Sitemap y vio las URL, no garantiza que todas sean indexadas; la tasa de indexación depende de la calidad de la página Problemas de contenido duplicado: múltiples URL con contenido muy similar (como la misma página con diferentes parámetros, versiones de impresión, paginación); Google elegirá una versión canónica para indexar La etiqueta de canonicalización (canonical) apunta a otra página: la página tiene configurado <link rel="canonical" href="otra URL">, Google indexará la dirección a la que apunta canonical El contenido de la página es demasiado escaso: muy pocas palabras de contenido, sin valor sustancial, contenido recolectado; Google considera que no vale la pena indexar Velocidad de carga de la página demasiado lenta: tiempo de espera de respuesta del servidor, carga de página demasiado lenta; después de varios fallos de rastreo, el crawler reducirá la prioridad de rastreo Problemas de certificado HTTPS: certificado SSL no válido, errores de contenido mixto, coexistencia de versiones HTTP/HTTPS provocando problemas de canonicalización Problemas de adaptación móvil: mala experiencia móvil, errores de adaptación móvil que afectan la indexación en el entorno de indexación móvil primero
Bing puede rastrear el Sitemap normalmente pero Google no lo rastrea en absoluto
Problemas de verificación en Google Search Console: confirme que la verificación de propiedad del dominio es válida; el dominio verificado (www/sin www, http/https) coincide con la versión de acceso real El firewall del servidor o CDN está bloqueando a Googlebot: verifique los registros de acceso del servidor para ver si las solicitudes de Googlebot (user-agent que contiene Googlebot) son bloqueadas o devuelven 403 Problemas de resolución DNS: la IP a la que resuelve el DNS de Google es diferente a la de Bing; asegúrese de que todas las regiones puedan resolver normalmente a su servidor robots.txt tiene restricciones especiales para Googlebot: verifique si hay reglas Disallow especiales bajo User-agent: Googlebot El sitio tiene historial de trucos y ha sido penalizado por Google: los dominios que han sido sancionados manualmente deben solicitar primero una revisión nueva La URL del Sitemap contiene contenido que Google considera inseguro: como dominios marcados como malware o contenido de phishing Reglas WAF del CDN bloquean por error: algunas reglas de seguridad pueden juzgar erróneamente el comportamiento del crawler Googlebot; necesita revisar los registros de seguridad del CDN
El Sitemap generado funciona correctamente en pruebas locales, pero después de subirlo al servidor el acceso devuelve error 404
Ruta de archivo incorrecta: sitemap.xml no ha sido subido al directorio correcto; confirme que está subido a la ubicación correspondiente a la URL que declaró en robots.txt y envió a los motores de búsqueda Problema de mayúsculas/minúsculas en el nombre de archivo: los servidores Linux/Unix distinguen mayúsculas y minúsculas; Sitemap.xml y sitemap.xml son archivos diferentes; asegúrese de que el nombre del archivo esté completamente en minúsculas La configuración de Nginx/Apache prohíbe el acceso a archivos xml: verifique si la configuración del servidor tiene reglas location que nieguen acceso a archivos con sufijo .xml o devuelven reglas try_files incorrectas Problemas de permisos de archivos: los permisos de archivos en el servidor están configurados incorrectamente (como permisos 600); el usuario del servidor web no tiene permisos de lectura; generalmente se necesitan permisos 644 para archivos y 755 para directorios El CDN tiene en caché una respuesta 404 anterior: el CDN de archivos recién subidos puede aún tener en caché el 404 anterior; necesita actualizar la caché del CDN o esperar a que el CDN actualice automáticamente desde el origen Conflicto con reglas de enlaces permanentes de CMS como WordPress: las reglas de reescritura del CMS interceptan sitemap.xml; necesita configurar reglas de exclusión para que el servidor acceda directamente a archivos estáticos El servidor tiene configurado antirrobo de enlaces o control de acceso: reglas de verificación de referer, listas blancas de IP en .htaccess o configuración Nginx pueden bloquear el acceso de crawlers
Glosario
- Sitemap (mapa del sitio)
- Archivo de estándar de protocolo XML que informa a los motores de búsqueda sobre todas las páginas del sitio disponibles para rastreo, que contiene una lista completa de URL e información de metadatos para cada URL, ayudando a crawlers como Googlebot y Bingbot a descubrir, comprender y rastrear el contenido del sitio de manera más inteligente y eficiente; el estándar de protocolo abierto unificado es mantenido por la organización sitemaps.org (versión actual 0.9).
- urlset
- Elemento raíz del archivo Sitemap XML estándar, que debe contener la declaración correcta del espacio de nombres xmlns, con todos los elementos secundarios <url> anidados en su interior; es el identificador central de validez del Sitemap; los Sitemaps que carecen de una estructura urlset correcta son rechazados directamente por los motores de búsqueda para su análisis.
- Sitemap Index
- Archivo de índice de mapa del sitio, que debe utilizarse cuando la cantidad de URL del sitio supera las 50000 o el tamaño de un solo archivo Sitemap supera los 50 MB; su elemento raíz es <sitemapindex>, utilizado para enumerar y gestionar de forma unificada las direcciones de múltiples archivos Sitemap secundarios; es el esquema estándar para dividir Sitemaps en sitios web grandes.
- changefreq
- Elemento de metadatos opcional en Sitemap, utilizado para especificar la frecuencia de actualización aproximada del contenido de la página; tiene siete valores válidos: always, hourly, daily, weekly, monthly, yearly, never, como referencia para que los crawlers de motores de búsqueda programen la frecuencia de rastreo de revisita; una configuración razonable puede optimizar la asignación del presupuesto de rastreo.
- priority
- Elemento de metadatos opcional en Sitemap, utilizado para especificar el nivel de importancia de esta URL en relación con otras páginas del sitio; el rango de valores es un decimal entre 0.0 y 1.0, con valor predeterminado de 0.5; priority solo afecta la prioridad relativa de rastreo entre páginas del sitio y no afecta la clasificación en los resultados de búsqueda.
- lastmod
- Elemento de metadatos opcional en Sitemap, que registra la fecha y hora de la última modificación sustancial del contenido de la página; el formato debe seguir la especificación W3C Datetime; es el campo más valorado por los motores de búsqueda entre los tres campos de metadatos opcionales, porque indica directamente si la página tiene contenido nuevo que necesita ser rerastreado.
- loc
- Elemento secundario obligatorio bajo el elemento <url>, utilizado para especificar la dirección URL absoluta completa de la página; debe comenzar con el protocolo http:// o https://, incluir el dominio completo, la longitud total de la URL no debe exceder los 2048 caracteres, no se permiten rutas relativas.
- Espacio de nombres XML (xmlns)
- Atributo de espacio de nombres XML que debe declarar el elemento raíz urlset; el valor del atributo debe coincidir exactamente con http://www.sitemaps.org/schemas/sitemap/0.9, utilizado para identificar la versión del protocolo utilizada por el Sitemap; la falta o escritura incorrecta del espacio de nombres provocará fallos de análisis del Sitemap.
- W3C Datetime
- Formato de representación de fecha y hora especificado por W3C (World Wide Web Consortium); el campo lastmod en Sitemap debe seguir este formato; se utiliza comúnmente el formato de fecha simplificado YYYY-MM-DD (mejor compatibilidad), y también admite el formato completo de fecha y hora que incluye horas, minutos, segundos e información de zona horaria.
- Escape de entidades XML
- En la sintaxis XML, los caracteres especiales deben escaparse a sus referencias de entidad correspondientes para ser analizados correctamente: & se escapa a &, < a <, > a >, " a ", ' a '; estos caracteres en las URL deben escaparse, de lo contrario provocarán errores de análisis XML.
- Google Search Console (GSC)
- Herramienta de plataforma de webmasters proporcionada oficialmente por Google, utilizada para enviar Sitemaps, ver el estado de indexación del sitio, análisis de datos de tráfico de búsqueda, informes de errores de rastreo, notificaciones de problemas de seguridad, notificaciones de sanciones por acciones manuales, etc.; es la herramienta esencial para la optimización de motores de búsqueda (SEO) de Google.
- Bing Webmaster Tools
- Plataforma oficial de webmasters del motor de búsqueda Bing de Microsoft, con funciones similares a Google Search Console; admite envío de Sitemaps, estadísticas de cobertura de índice, análisis de diagnóstico SEO, investigación de palabras clave, consulta de enlaces inversos, etc., cubriendo el tráfico de búsqueda de los dos motores de búsqueda Bing y Yahoo.
- robots.txt
- Archivo de texto sin formato ubicado en el directorio raíz del sitio web, que indica a los crawlers de motores de búsqueda qué rutas están permitidas para rastreo y qué rutas tienen prohibido el acceso mediante directivas como User-agent, Disallow, Allow; también puede declarar la ubicación del archivo Sitemap en el archivo para que los crawlers lo descubran automáticamente.
- Crawler (Spider/Bot)
- Programa desarrollado por motores de búsqueda para rastrear automáticamente contenido web, como Googlebot (crawler de Google), Bingbot (crawler de Bing), Baiduspider (crawler de Baidu); descubre nuevas páginas siguiendo enlaces de páginas y leyendo archivos Sitemap, y almacena el contenido de las páginas descargadas en el índice del motor de búsqueda.
- Presupuesto de rastreo (Crawl Budget)
- Cantidad total de recursos de rastreo que los motores de búsqueda asignan a un sitio web en un período de tiempo determinado, determinada conjuntamente por múltiples factores como la autoridad del dominio, la velocidad de respuesta del servidor, la calidad del contenido de la página, el historial de efectos de rastreo, etc.; configurar correctamente el Sitemap puede ayudar a optimizar la eficiencia de uso del presupuesto de rastreo.
- Codificación UTF-8
- Codificación de caracteres obligatoria para archivos Sitemap XML; UTF-8 admite todos los caracteres Unicode, incluidos los caracteres chinos; se especifica en la declaración XML mediante el atributo encoding="UTF-8"; el uso de otras codificaciones (como GBK, GB2312) puede provocar caracteres corruptos en URL chinas y fallos de análisis.
- Compresión gzip
- El protocolo Sitemap admite el uso del algoritmo gzip para transmisión comprimida (extensión de archivo .xml.gz), que puede reducir el tamaño del archivo Sitemap en un 70%-80%, ahorrando significativamente ancho de banda del servidor y tiempo de rastreo del crawler; los principales motores de búsqueda pueden descomprimir y procesar automáticamente archivos Sitemap comprimidos con gzip; después de la compresión, aún debe cumplir el límite de tamaño de 50 MB.
- Yoast SEO
- Complemento SEO ampliamente utilizado en plataformas CMS como WordPress y Shopify, que puede generar automáticamente Sitemaps, metaetiquetas, navegación de breadcrumbs, mapas del sitio XML, optimización RSS, metadatos de redes sociales y otras funciones relacionadas con SEO; es una solución SEO comúnmente utilizada para sitios de contenido.
- Cobertura de índice (Index Coverage)
- Uno de los informes centrales en Google Search Console, que muestra detalladamente la cantidad específica y los motivos detallados de páginas del sitio que han sido indexadas, excluidas, con errores o con advertencias por Google; se puede utilizar para verificar el efecto del envío de Sitemap y diagnosticar problemas de indexación de páginas.
- Codificación URL (Percent-Encoding)
- También llamada codificación porcentual, es un método de codificación utilizado para representar caracteres no ASCII (como chino, símbolos especiales) en URL; los caracteres chinos se codifican en formato %XX%XX%XX (por ejemplo, «中文» se codifica como %E4%B8%AD%E6%96%87); las URL chinas en Sitemap deben estar correctamente codificadas para ser analizadas.
Tabla de referencia de escenarios de frecuencia de actualización changefreq
| Valor changefreq | Frecuencia de actualización | Tipos de páginas típicas aplicables | Notas importantes |
|---|---|---|---|
always | Puede cambiar en cada acceso | Páginas de datos en tiempo real, entradas de búsqueda, páginas de agregación dinámica | No significa que el crawler vendrá cada vez, solo que la frecuencia de cambio es extremadamente alta; no lo use indebidamente, páginas normales no configuren always |
hourly | Actualización cada hora | Páginas de inicio de noticias, actividad de redes sociales, páginas de cotizaciones en tiempo real | Adecuado para páginas que producen contenido nuevo cada hora; sitios sin actualizaciones de alta frecuencia no configuren hourly |
daily | Actualización diaria | Página de inicio del sitio, páginas de lista de blogs, páginas de canales de noticias, páginas de categorías de productos | Uno de los valores más utilizados, aplicable a páginas de inicio y secciones de la mayoría de sitios |
weekly | Actualización semanal | Páginas de detalles de artículos normales, páginas de detalles de productos, páginas de contenido de blogs | Adecuado para páginas de contenido de la mayoría de sitios de contenido |
monthly | Actualización mensual | Páginas de directorio de categorías, páginas de archivo, páginas FAQ, páginas de guías de uso | Páginas auxiliares con actualizaciones poco frecuentes pero ajustes ocasionales |
yearly | Actualización anual | Páginas de presentación de empresa, páginas de contacto, términos de servicio, política de privacidad | Páginas de información estática que casi nunca cambian |
never | Nunca se actualiza | Archivo de artículos históricos, páginas de eventos caducados, contenido antiguo archivado | Configure como never páginas que definitivamente no se modificarán más; si hay actualizaciones recuerde cambiarlo oportunamente |
Tabla de referencia de configuración de prioridad priority
| Valor priority | Nivel de prioridad | Tipos de páginas aplicables | Proporción recomendada de páginas |
|---|---|---|---|
1.0 | Máxima | Página de inicio del sitio, páginas de destino principales, entradas de canales más importantes | Solo 1-3 páginas en todo el sitio |
0.8-0.9 | Muy alta | Páginas de secciones principales, páginas de categorías populares, productos principales, temas especiales destacados | Aproximadamente 5-10% del total de páginas |
0.6-0.7 | Alta | Páginas de secciones secundarias, subcategorías, artículos populares, detalles de productos importantes | Aproximadamente 10-20% del total de páginas |
0.4-0.5 | Normal | Páginas de detalles de artículos normales, productos generales, contenido convencional | Aproximadamente 40-60% del total de páginas (valor predeterminado) |
0.2-0.3 | Baja | Páginas de etiquetas, paginación de archivos, artículos antiguos, páginas auxiliares | Aproximadamente 15-25% del total de páginas |
0.0-0.1 | Mínima | Páginas de bajo valor, contenido duplicado, páginas que no desea rastrear prioritariamente | Dentro del 5% del total de páginas; 0 no significa prohibir indexación |
Tabla de límites de la especificación del protocolo Sitemap
| Elemento de límite | Valor límite | Descripción | Esquema de tratamiento al superar límite |
|---|---|---|---|
| Cantidad de URL por Sitemap individual | 50,000 | Requisito obligatorio del protocolo sitemap.org 0.9 | Usar Sitemap Index para dividir en múltiples Sitemaps secundarios |
| Tamaño de archivo sin comprimir por Sitemap | 50 MB (52428800 bytes) | Tamaño de archivo original incluyendo todas las etiquetas y espacios | Usar compresión gzip, dividir Sitemap, simplificar comentarios |
| Cantidad de Sitemaps secundarios por Sitemap Index | 50,000 | Límite de entradas URL del archivo de índice | Teóricamente admite 2.500 millones de URL, generalmente no necesario para sitios comunes |
| Longitud de URL individual | 2,048 caracteres | Incluyendo protocolo, dominio, ruta, todos los parámetros de consulta | URL demasiado largas requieren simplificar parámetros o reescritura de URL |
| Codificación admitida por Sitemap | UTF-8 | Requisito obligatorio del protocolo; otras codificaciones pueden provocar fallos de análisis | Asegúrese de usar codificación UTF-8 al guardar archivos |
| Protocolos admitidos por Sitemap | http:// o https:// | Las URL deben incluir encabezado de protocolo completo | No admite otros protocolos como ftp:// |
| Tiempo de respuesta del crawler después del envío | De unas horas a varios días | Depende de la autoridad del sitio y complejidad del Sitemap | No necesita enviar repetidamente, espere pacientemente el procesamiento |
| Tamaño de archivo después de compresión gzip | 50 MB | El archivo comprimido tampoco debe exceder el límite de 50 MB | Si aún supera el límite después de comprimir, debe dividir el Sitemap |
- Generador de cabecera Authentication
- Analizador de Cache-Control
- Analizador de Content-Disposition
- Generador de cabeceras CORS
- Inspector CORS
- Generador de CSP
- Generador de código cURL
- Verificación de Propagación DNS Global
- Consulta DNS
- Analizador de cabecera Forwarded
- Generador de etiquetas hreflang
- Analizador de HSTS
- Analizador de cookies HTTP
- Comprobador de cabeceras HTTP
- Probador de peticiones HTTP
- Consulta de códigos de estado HTTP
- Búsqueda de IP
- Convertidor IPv4
- Expansor de Rango IPv4
- Caja de Herramientas IPv6
- Analizador de Cabecera Link
- Consulta MX
- Verificador de Puertos
- Constructor de Parámetros URL
- Analizador de Cabeceras de Límite de Tasa
- Comprobador de Cadenas de Redirección
- Generador de Robots.txt
- Verificador de robots.txt
- Verificador de Cabeceras de Seguridad
- Generador de Security.txt
- Analizador Set-Cookie
- Auditoría de Red del Sitio
- Generador de Sitemap
- Inspector de Sitemap
- Comprobador de Certificados SSL
- Calculadora de Subredes
- Analizador de URL
- Analizador User-Agent
- Generador de Enlaces UTM
- Probador de WebSocket
- ¿Cuál es mi IP?
- Consulta WHOIS