Générateur de Sitemap
Générateur sitemap.xml
Saisissez une liste d'URLs, définissez globalement changefreq, priority et lastmod, générez des sitemaps XML conformes à sitemap.org en un clic.
Générez en ligne des fichiers de plan de site Sitemap XML conformes à la norme du protocole ouvert sitemap.org 0.9. Prend en charge la configuration complète de sept fréquences de mise à jour changefreq, de la priorité relative priority de 0.0-1.0, du sélecteur de date lastmod, l'échappement automatique des entités XML, la détection en temps réel des URL invalides, l'aperçu XML structuré en temps réel, le téléchargement et la copie en un clic, aidant les principaux moteurs de recherche tels que Google et Bing à découvrir rapidement et indexer efficacement toutes les pages importantes du site.
Recommandations connexes
Cas d'utilisation
- Après le lancement d'un nouveau site, générez en masse des Sitemaps des pages principales et soumettez-les à Google Search Console et Bing Webmaster Tools pour accélérer la découverte et l'indexation par les moteurs de recherche
- Régénérez le plan de site après avoir redessiné des sections du site ou ajusté la structure d'URL, mettant à jour l'index des moteurs de recherche pour éviter les liens morts qui affectent les performances SEO
- Importez en masse des URL de listes de produits sur des sites e-commerce, en configurant différentes valeurs de changefreq et priority selon la catégorie du produit et la date de publication
- Pour les grands portails ou sites d'actualités avec plus de 50000 URL, divisez par canaux pour générer plusieurs Sitemaps et créez un fichier d'index Sitemap Index
- Pour les sites de blogs, configurez des paramètres raisonnables de fréquence de mise à jour et de priorité pour les pages d'articles, les pages de tags, les pages de catégories et les pages d'archive
- Organisez différents types d'URL telles que pages de produits, pages d'actualités, pages À propos, pages de contact sur des sites d'entreprise, en configurant lastmod et priority différenciés
- Après avoir terminé la migration du site (mise à niveau HTTP vers HTTPS, changement de domaine), régénérez le Sitemap et soumettez-le pour guider les crawlers à explorer rapidement les nouvelles adresses
- Complétez manuellement les Sitemaps générés par des plugins tels que Yoast SEO, en ajoutant des URL de pages spéciales non couvertes par le plugin
- Régénérez le Sitemap après le diagnostic et l'optimisation SEO, garantissant que la configuration de priority des pages importantes est raisonnable et améliorant le poids de crawl des pages à haute valeur
- Avant de déclarer l'emplacement du Sitemap dans robots.txt, utilisez cet outil pour vérifier l'exactitude du format XML et éviter les échecs d'analyse du crawler
Comment utiliser
- Collez la liste des adresses de pages que vous souhaitez indexer dans la zone de saisie d'URL, une URL complète par ligne (doit inclure l'en-tête de protocole http:// ou https://)
- Sélectionnez la fréquence de mise à jour de la page dans le menu déroulant changefreq : choisissez daily ou hourly pour la page d'accueil, weekly pour les pages d'articles, yearly ou monthly pour les pages statiques
- Faites glisser le curseur priority ou saisissez une valeur entre 0.0 et 1.0 pour définir la priorité : page d'accueil principale à 1.0, pages de sections importantes à 0.8, pages d'articles normaux à 0.5, pages d'archive à 0.3
- Cliquez sur le sélecteur de date lastmod pour sélectionner la date de dernière modification du contenu du site, ou laissez-le vide pour ne pas inclure le champ lastmod
- Consultez la zone d'aperçu en temps réel à droite, vérifiez que la structure XML générée est correcte ; les URL invalides seront marquées en rouge pour correction
- Après avoir confirmé que tout est correct, cliquez sur le bouton « Télécharger sitemap.xml » pour enregistrer le fichier, ou cliquez sur le bouton « Copier » pour copier le contenu XML dans le presse-papiers
- Téléversez sitemap.xml dans le répertoire racine de votre site web, ajoutez la déclaration Sitemap dans robots.txt, ou soumettez directement à Google Search Console/Bing Webmaster
Fonctionnalités
- Saisie en masse d'URL : une URL par ligne, filtre automatiquement les lignes vides et les liens dupliqués, traite rapidement de grands lots d'adresses de pages
- Échappement automatique des entités XML : les caractères spéciaux dans les URL tels que &, <, >, ", ' sont automatiquement échappés en &, <, >, ", ', évitant complètement les erreurs d'analyse XML
- 7 options de fréquence de mise à jour changefreq : always, hourly, daily, weekly, monthly, yearly, never, couvrant tous les scénarios de types de pages
- Configuration précise de la priorité priority : prend en charge toute valeur entre 0.0 et 1.0 avec une précision d'une décimale, distinguant le niveau d'importance des pages
- Sélecteur de date lastmod : sélecteur de calendrier visuel qui formate automatiquement au standard W3C Datetime (YYYY-MM-DD)
- Détection en temps réel des URL invalides : identifie automatiquement les URL au format incorrect (protocole manquant, caractères illégaux, etc.) et marque le numéro de ligne problématique pour faciliter la correction
- Aperçu en temps réel : le contenu XML est mis à jour instantanément lors de la modification de la liste d'URL ou des paramètres de configuration, sans avoir à cliquer manuellement sur un bouton de génération
- Téléchargement de sitemap.xml en un clic : le résultat généré est téléchargé directement sous forme de fichier XML standard, prêt à être envoyé au serveur web immédiatement après enregistrement
- Avertissement de limite d'URL : lorsque le nombre d'URL saisies atteint 50000, un avertissement s'affiche automatiquement indiquant la nécessité d'utiliser le schéma de division Sitemap Index
- Copie dans le presse-papiers : copie le contenu XML complet dans le presse-papiers en un clic, facilitant le collage direct dans des fichiers serveur ou des soumissions en ligne
- Statistiques de taille en octets : affiche en temps réel la taille en octets du fichier Sitemap XML généré, évaluant si la taille du fichier respecte les limites des moteurs de recherche
- Sortie de l'élément racine urlset standard : respecte strictement la spécification du protocole http://www.sitemaps.org/schemas/sitemap/0.9, incluant la déclaration correcte de l'espace de noms xmlns
- Déclaration d'encodage UTF-8 : ajoute automatiquement la déclaration d'encodage XML, garantissant l'interprétation correcte des URL multilingues sans caractères corrompus
FAQ
Est-il obligatoire de soumettre un Sitemap ? Si je n'en soumets pas, mon site ne sera pas indexé ?
Sans soumettre de Sitemap, un site peut également être indexé — les moteurs de recherche peuvent découvrir vos pages via des liens externes d'autres sites et le suivi des liens internes. Mais soumettre un Sitemap peut accélérer significativement la vitesse de découverte, en particulier pour les nouveaux sites, les grands sites et les sites avec des liens internes déficients. Google recommande officiellement que tous les sites soumettent un Sitemap ; c'est un travail SEO de base à très faible coût et à haut bénéfice.
Les URL dans le Sitemap doivent-elles être des chemins absolus ? Peut-on écrire des chemins relatifs ?
Ce doivent être des URL absolues complètes, incluant l'en-tête de protocole (http:// ou https://) et le domaine complet ; on ne peut pas écrire de chemins relatifs (comme /page1.html) ni omettre le protocole. Les moteurs de recherche ont besoin d'URL complètes pour crawler correctement lors de l'analyse du Sitemap ; les chemins relatifs entraîneront des erreurs d'analyse.
Les configurations de changefreq et priority sont-elles vraiment utiles ? Les moteurs de recherche les respecteront-ils ?
Ces deux champs sont des « suggestions », pas des « instructions » ; les moteurs de recherche ne les respecteront pas nécessairement à 100%, mais une configuration précise a toujours une valeur de référence. En comparaison, lastmod (heure de dernière modification) est le plus valorisé par les moteurs de recherche parmi les trois champs, car il peut indiquer directement au crawler si la page a du nouveau contenu. Ne définissez pas faussement toutes les pages à la priorité la plus élevée ou sur always, cela fera que les moteurs de recherche cesseront de faire confiance à ces métadonnées.
Le fichier Sitemap doit-il obligatoirement être placé dans le répertoire racine du site ?
Pas nécessairement ; le Sitemap peut être placé dans n'importe quel chemin du site, à condition que l'URL soit accessible normalement. Mais robots.txt doit être dans le répertoire racine. Si vous avez divisé plusieurs Sitemaps avec Sitemap Index, les chemins des Sitemaps secondaires n'ont pas de restrictions. Cependant, par habitude le placer dans le répertoire racine est plus pratique pour la gestion et pour que les crawlers le découvrent.
Mon site a moins de 50000 URL, mais la taille du fichier dépasse 50 MB, que dois-je faire ?
Vous devez diviser le Sitemap. 50000 URL et 50 MB sont deux limites parallèles ; lorsque l'une des conditions de dépassement est remplie, la division est nécessaire. Vous pouvez diviser par type de contenu, ou simplifier le Sitemap (comme éliminer les espaces et indentations inutiles, utiliser la compression gzip), mais si après compression la taille dépasse toujours 50 MB vous devez obligatoirement le diviser.
Peut-on inclure des pages noindex ou des URL interdites par robots.txt dans le Sitemap ?
Ce n'est pas recommandé. Le Sitemap ne doit contenir que les pages que vous souhaitez que les moteurs de recherche crawler et indexent. Les pages noindex, les pages interdites par Disallow, les pages nécessitant une connexion pour y accéder, les pages d'erreur 404 ne doivent pas apparaître dans le Sitemap ; cela réduira la confiance des moteurs de recherche dans le Sitemap et gaspillera également le budget de crawl.
Après mise à jour du contenu dois-je resoumettre le Sitemap ? Quelle fréquence de mise à jour du Sitemap est appropriée ?
Tant que l'URL du fichier Sitemap ne change pas, les moteurs de recherche le recrawleront périodiquement ; vous n'avez pas besoin de le resoumettre manuellement chaque fois que vous mettez à jour du contenu. La fréquence de mise à jour dépend de la fréquence de mise à jour du contenu de votre site : les sites d'actualités peuvent mettre à jour le Sitemap quotidiennement voire toutes les heures (génération automatique) ; les sites d'entreprise peuvent le mettre à jour hebdomadairement ou mensuellement. Vous pouvez configurer des scripts côté serveur pour mettre à jour automatiquement le fichier Sitemap.
Quelles langues d'URL le Sitemap prend-il en charge ? Les URL chinoises nécessitent-elles un encodage ?
Le Sitemap prend en charge les URL de n'importe quelle langue, mais les URL avec des caractères non ASCII (comme le chinois) nécessitent un encodage URL (également appelé encodage en pourcentage, percent-encoding). Par exemple, «中文页面» doit être encodé en %E4%B8%AD%E6%96%87%E9%A1%B5%E9%9D%A2 dans ce format. La plupart des navigateurs et outils le traitent automatiquement, mais vous devez vous assurer que les URL dans le Sitemap généré sont correctement encodées.
Peut-on soumettre plusieurs Sitemaps simultanément ? Par exemple, avoir à la fois un Sitemap d'articles et un Sitemap de produits ?
Oui, il y a deux façons : ①Utiliser un fichier d'index Sitemap Index pour gérer de manière unifiée tous les Sitemaps secondaires ; c'est la façon recommandée, vous n'avez qu'à soumettre l'URL du fichier d'index ; ②Soumettre individuellement l'URL de chaque Sitemap secondaire sur la plateforme de webmasters ; cette façon est également valable mais plus compliquée à gérer. Les deux façons sont effectives et les moteurs de recherche les crawleront.
Après génération du Sitemap faut-il une compression gzip ? Quels sont les avantages de la compression ?
La compression n'est pas obligatoire, mais elle est fortement recommandée. La compression gzip peut généralement réduire le volume du Sitemap de 70%-80%, économisant la bande passante et le temps de crawl du crawler ; l'effet est particulièrement notable sur les grands sites. Les moteurs de recherche prennent entièrement en charge le format compressé sitemap.xml.gz et le décompresseront automatiquement. Tant qu'après compression la taille ne dépasse pas 50 MB il n'y aura pas de problème.
Dois-je soumettre un Sitemap pour les deux versions HTTP et HTTPS du site ?
Vous ne devez soumettre que la version préférée que vous souhaitez voir indexée. Si vous avez déjà tout le site en HTTPS et avez effectué une redirection 301 HTTP→HTTPS, vous n'avez qu'à soumettre le Sitemap de la version HTTPS. Ne soumettez pas les deux versions HTTP et HTTPS simultanément ; cela causera des problèmes de contenu dupliqué. De même, vous devez déterminer le domaine préféré avec ou sans www et ne soumettre que le Sitemap du domaine préféré.
WordPress utilise Yoast SEO pour générer le Sitemap, ai-je encore besoin de cet outil ?
Yoast SEO peut générer automatiquement des Sitemaps pour la plupart des pages, mais il peut en omettre certaines — comme des pages individuelles créées manuellement, des types de publication personnalisés mal configurés, des pages de destination spéciales, des pages importées de sources externes, etc. Vous pouvez utiliser cet outil pour compléter ces URL non couvertes par Yoast, en générant un Sitemap complémentaire séparé, ou pour vérifier comparativement si le Sitemap généré par Yoast est complet et correct.
L'ordre des URL dans le Sitemap est-il important ? Mettre les pages importantes au début est-il utile ?
Dans le protocole Sitemap l'ordre des URL n'a aucun poids officiel ; les moteurs de recherche ne prioriseront pas le crawl parce qu'une URL est au début. Mais certains professionnels du SEO ont observé un léger effet de préférence d'ordre, donc mettre les URL importantes au début n'a aucun inconvénient, mais ne vous attendez pas à ce que cela apporte des effets évidents ; vous devez identifier correctement la priorité via le champ priority.
Les pages paginées (comme /list?page=2, /page/3) doivent-elles être incluses dans le Sitemap ?
Cela dépend de la valeur du contenu paginé. Si la pagination est des listes répétées de type « voir plus » (comme la page 2, page 3 de listes d'articles), il n'est généralement pas recommandé de les inclure dans le Sitemap, car ces pages ont un contenu dupliqué et une faible valeur ; vous devez vous concentrer sur la page d'accueil de la liste et les pages d'articles spécifiques. Mais si la pagination est un contenu unique (comme la navigation par catégories, des pages paginées avec une valeur indépendante) vous pouvez envisager de les inclure avec une priority plus faible.
Comment puis-je vérifier si le Sitemap est correct et valide ?
Il y a plusieurs façons de vérification : ①Après génération avec cet outil, prévisualisez d'abord localement si la structure XML est correcte, vérifiez que la fermeture des balises, les espaces de noms, les caractères d'échappement sont normaux ; ②Utilisez l'outil sitemap-inspector pour vérifier en ligne le format et l'accessibilité des URL, en vérifiant par lots les codes de statut HTTP de toutes les URL ; ③Après téléversement, accédez directement à l'URL du Sitemap dans le navigateur pour voir s'il s'affiche normalement sans erreurs d'analyse XML ; ④Après soumission à Google Search Console/Bing Webmaster Tools consultez le rapport d'état pour voir s'il y a des erreurs de format, des URL inaccessibles, des limites dépassées et autres avertissements d'erreur ; c'est la méthode de vérification la plus autorisée ; ⑤Vous pouvez également utiliser des outils de vérification XML en ligne pour vérifier l'exactitude de la syntaxe XML.
Dépannage
Le Sitemap XML généré affiche des erreurs d'analyse à l'ouverture dans le navigateur, indiquant un format incorrect
Les URL contiennent des caractères spéciaux XML comme &, <, > qui n'ont pas été échappés : l'outil échappe automatiquement lors du collage, mais si vous avez édité le fichier manuellement vous avez pu omettre l'échappement Erreur dans la déclaration XML ou l'espace de noms urlset : vérifiez que la valeur xmlns de la première ligne correspond exactement à http://www.sitemaps.org/schemas/sitemap/0.9, sans barres obliques supplémentaires Les balises ne sont pas correctement fermées : toutes les balises d'ouverture comme <url>, <loc> doivent avoir leurs balises de fermeture correspondantes </url>, </loc> ; les balises auto-fermantes ne doivent pas être mal écrites L'encodage du fichier n'est pas UTF-8 sans BOM : le Bloc-notes Windows peut enregistrer en UTF-8 BOM ou encodage GBK provoquant des erreurs d'analyse ; vous devez enregistrer en UTF-8 sans BOM Les URL contiennent des caractères illégaux : les URL chinoises nécessitent un encodage URL (percent-encoding) ; les caractères spéciaux non encodés provoquent des échecs d'analyse XML Erreur de déclaration de version XML : la première ligne doit être <?xml version="1.0" encoding="UTF-8"?>, n'écrivez pas 1.1 ou d'autres versions Erreur dans l'ordre d'imbrication des balises : les balises enfants doivent être complètement contenues dans les balises parentes, l'imbrication croisée comme <url><loc></url></loc> n'est pas autorisée
Après avoir soumis le Sitemap sur Google Search Console, affiche « Impossible de lire le Sitemap » ou « Erreur de format »
L'URL du fichier Sitemap n'est pas accessible : vérifiez qu'en accédant directement à l'URL du Sitemap dans le navigateur, elle retourne un code de statut 200, sans erreurs 403/404/500 Le serveur a retourné un Content-Type incorrect : doit retourner application/xml ou text/xml ; s'il retourne text/html cela provoquera des échecs de reconnaissance Le Sitemap contient des URL interdites par robots.txt : GSC signalera des erreurs s'il détecte des routes Disallow dans le Sitemap Problèmes de redirection d'URL : si les URL du Sitemap redirigent 301/302 vers d'autres adresses cela provoquera des erreurs ; assurez-vous que les URL sont directement accessibles sans redirections Divergence HTTP/HTTPS ou www/sans www : le domaine du Sitemap soumis ne correspond pas au domaine vérifié dans GSC (par exemple, vous avez vérifié www.example.com mais le Sitemap utilise example.com) Le fichier Sitemap est trop grand dépassant la limite de 50 MB ou les URL dépassent 50000 : GSC rejettera directement le traitement des fichiers dépassant les limites Des entités HTML ont été utilisées au lieu d'entités XML : pour les espaces est une entité HTML, pas une entité XML ; elle ne peut pas être utilisée en XML
Cela fait longtemps que j'ai soumis le Sitemap, mais de nombreuses URL n'ont toujours pas été indexées par Google
Problèmes de qualité de page : l'indexation n'est pas garantie simplement par soumission ; Google peut choisir de ne pas indexer les pages avec un contenu original déficient, du contenu dupliqué ou du contenu de faible valeur Période de révision pour les nouveaux sites (effet sandbox) : les nouveaux sites peuvent nécessiter une période d'observation de plusieurs semaines à plusieurs mois après soumission du Sitemap avant l'indexation en masse La page a noindex : les pages retournées par l'URL ont une balise meta noindex ou un en-tête de réponse X-Robots-Tag: noindex ; Google les exclura activement Budget de crawl du site insuffisant : faible autorité du site, réponse lente du serveur, structure déficiente des liens internes ; Googlebot alloue une faible fréquence de crawl, ce qui nécessite plus de temps Le Sitemap contient une grande quantité d'URL de faible qualité : si de nombreuses URL dans le Sitemap sont des erreurs 404, 5xx, du contenu dupliqué ou des pages de faible valeur, Google réduira la confiance dans l'ensemble du Sitemap Domaine pénalisé : le site a des problèmes qui violent les consignes de qualité de Google (tels que tricheries, contenu spam, logiciels malveillants) qui bloquent l'indexation La page est une page orpheline : bien que la page soit dans le Sitemap, elle n'a aucune entrée via les liens internes du site ; le crawler peut la considérer comme peu importante et ne pas l'indexer
Le Sitemap affiche des URL découvertes, mais le nombre d'index réels est très faible
C'est normal : « Découvertes » signifie simplement que Google a accédé au Sitemap et a vu les URL, cela ne garantit pas que toutes seront indexées ; le taux d'indexation dépend de la qualité de la page Problèmes de contenu dupliqué : plusieurs URL avec un contenu très similaire (comme la même page avec différents paramètres, versions imprimables, pagination) ; Google choisira une version canonique à indexer La balise de canonisation (canonical) pointe vers une autre page : la page a configuré <link rel="canonical" href="autre URL">, Google indexera l'adresse pointée par canonical Le contenu de la page est trop pauvre : trop peu de mots dans le contenu, sans valeur substantielle, contenu collecté ; Google estime que cela ne vaut pas la peine d'être indexé Vitesse de chargement de la page trop lente : délai d'attente de réponse du serveur, chargement de page trop lent ; après plusieurs échecs de crawl, le crawler réduira la priorité de crawl Problèmes de certificat HTTPS : certificat SSL invalide, erreurs de contenu mixte, coexistence de versions HTTP/HTTPS provoquant des problèmes de canonisation Problèmes d'adaptation mobile : mauvaise expérience mobile, erreurs d'adaptation mobile affectant l'indexation dans un environnement d'indexation mobile-first
Bing peut crawler le Sitemap normalement mais Google ne le crawle pas du tout
Problèmes de vérification sur Google Search Console : confirmez que la vérification de la propriété du domaine est valide ; le domaine vérifié (www/sans www, http/https) correspond à la version d'accès réelle Le pare-feu du serveur ou le CDN bloque Googlebot : vérifiez les journaux d'accès du serveur pour voir si les requêtes de Googlebot (user-agent contenant Googlebot) sont bloquées ou retournent 403 Problèmes de résolution DNS : l'IP vers laquelle le DNS de Google résout est différente de celle de Bing ; assurez-vous que toutes les régions peuvent résoudre normalement vers votre serveur robots.txt a des restrictions spéciales pour Googlebot : vérifiez s'il y a des règles Disallow spéciales sous User-agent: Googlebot Le site a un historique de tricheries et a été pénalisé par Google : les domaines ayant fait l'objet de sanctions manuelles doivent d'abord demander un nouvel examen L'URL du Sitemap contient du contenu que Google considère comme dangereux : comme des domaines marqués comme logiciels malveillants ou contenu de phishing Les règles WAF du CDN bloquent par erreur : certaines règles de sécurité peuvent juger à tort le comportement du crawler Googlebot ; vous devez consulter les journaux de sécurité du CDN
Le Sitemap généré fonctionne correctement en tests locaux, mais après téléversement sur le serveur l'accès retourne une erreur 404
Chemin de fichier incorrect : sitemap.xml n'a pas été téléversé dans le bon répertoire ; confirmez qu'il est téléversé à l'emplacement correspondant à l'URL que vous avez déclarée dans robots.txt et soumise aux moteurs de recherche Problème de casse du nom de fichier : les serveurs Linux/Unix sont sensibles à la casse ; Sitemap.xml et sitemap.xml sont des fichiers différents ; assurez-vous que le nom de fichier est entièrement en minuscules La configuration Nginx/Apache interdit l'accès aux fichiers xml : vérifiez si la configuration du serveur a des règles location qui refusent l'accès aux fichiers avec suffixe .xml ou retournent des règles try_files incorrectes Problèmes de permissions de fichiers : les permissions de fichiers sur le serveur sont mal configurées (comme des permissions 600) ; l'utilisateur du serveur web n'a pas les droits de lecture ; généralement des permissions 644 sont nécessaires pour les fichiers et 755 pour les répertoires Le CDN a en cache une réponse 404 antérieure : le CDN des fichiers nouvellement téléversés peut encore avoir en cache le 404 précédent ; vous devez actualiser le cache du CDN ou attendre que le CDN mette à jour automatiquement depuis l'origine Conflit avec les règles de permaliens de CMS comme WordPress : les règles de réécriture du CMS interceptent sitemap.xml ; vous devez configurer des règles d'exclusion pour que le serveur accède directement aux fichiers statiques Le serveur a configuré l'anti-hotlinking ou un contrôle d'accès : des règles de vérification de referer, des listes blanches d'IP dans .htaccess ou la configuration Nginx peuvent bloquer l'accès des crawlers
Glossaire
- Sitemap (plan de site)
- Fichier de norme de protocole XML qui informe les moteurs de recherche de toutes les pages du site disponibles pour le crawl, contenant une liste complète d'URL et des informations de métadonnées pour chaque URL, aidant les crawlers comme Googlebot et Bingbot à découvrir, comprendre et explorer le contenu du site de manière plus intelligente et efficace ; la norme de protocole ouvert unifiée est maintenue par l'organisation sitemaps.org (version actuelle 0.9).
- urlset
- Élément racine du fichier Sitemap XML standard, qui doit contenir la déclaration correcte de l'espace de noms xmlns, avec tous les éléments enfants <url> imbriqués à l'intérieur ; c'est l'identifiant central de validité du Sitemap ; les Sitemaps dépourvus d'une structure urlset correcte sont rejetés directement par les moteurs de recherche pour l'analyse.
- Sitemap Index
- Fichier d'index de plan de site, qui doit être utilisé lorsque le nombre d'URL du site dépasse 50000 ou que la taille d'un seul fichier Sitemap dépasse 50 MB ; son élément racine est <sitemapindex>, utilisé pour répertorier et gérer de manière unifiée les adresses de plusieurs fichiers Sitemap secondaires ; c'est le schéma standard pour diviser les Sitemaps sur les grands sites.
- changefreq
- Élément de métadonnées optionnel dans Sitemap, utilisé pour spécifier la fréquence de mise à jour approximative du contenu de la page ; il comporte sept valeurs valides : always, hourly, daily, weekly, monthly, yearly, never, comme référence pour que les crawlers des moteurs de recherche programment la fréquence de crawl de revisite ; une configuration raisonnable peut optimiser l'allocation du budget de crawl.
- priority
- Élément de métadonnées optionnel dans Sitemap, utilisé pour spécifier le niveau d'importance de cette URL par rapport aux autres pages du site ; la plage de valeurs est un nombre décimal entre 0.0 et 1.0, avec une valeur par défaut de 0.5 ; priority n'affecte que la priorité relative de crawl entre les pages du site et n'affecte pas le classement dans les résultats de recherche.
- lastmod
- Élément de métadonnées optionnel dans Sitemap, qui enregistre la date et l'heure de la dernière modification substantielle du contenu de la page ; le format doit respecter la spécification W3C Datetime ; c'est le champ le plus valorisé par les moteurs de recherche parmi les trois champs de métadonnées optionnels, car il indique directement si la page a du nouveau contenu nécessitant un recrawl.
- loc
- Élément enfant obligatoire sous l'élément <url>, utilisé pour spécifier l'adresse URL absolue complète de la page ; doit commencer par le protocole http:// ou https://, inclure le domaine complet, la longueur totale de l'URL ne doit pas dépasser 2048 caractères, les chemins relatifs ne sont pas autorisés.
- Espace de noms XML (xmlns)
- Attribut d'espace de noms XML que l'élément racine urlset doit déclarer ; la valeur de l'attribut doit correspondre exactement à http://www.sitemaps.org/schemas/sitemap/0.9, utilisé pour identifier la version du protocole utilisée par le Sitemap ; l'absence ou une erreur de saisie de l'espace de noms entraînera des échecs d'analyse du Sitemap.
- W3C Datetime
- Format de représentation de date et d'heure spécifié par le W3C (World Wide Web Consortium) ; le champ lastmod dans Sitemap doit respecter ce format ; le format de date simplifié YYYY-MM-DD est couramment utilisé (meilleure compatibilité), et il prend également en charge le format date-heure complet incluant les heures, minutes, secondes et informations de fuseau horaire.
- Échappement des entités XML
- Dans la syntaxe XML, les caractères spéciaux doivent être échappés en leurs références d'entité correspondantes pour être analysés correctement : & est échappé en &, < en <, > en >, " en ", ' en ' ; ces caractères dans les URL doivent être échappés, sinon ils entraîneront des erreurs d'analyse XML.
- Google Search Console (GSC)
- Outil de plateforme de webmasters fourni officiellement par Google, utilisé pour soumettre des Sitemaps, voir l'état d'indexation du site, l'analyse des données de trafic de recherche, les rapports d'erreurs de crawl, les notifications de problèmes de sécurité, les notifications de sanctions par actions manuelles, etc. ; c'est l'outil essentiel pour l'optimisation des moteurs de recherche (SEO) Google.
- Bing Webmaster Tools
- Plateforme officielle de webmasters du moteur de recherche Bing de Microsoft, avec des fonctions similaires à Google Search Console ; prend en charge la soumission de Sitemaps, les statistiques de couverture d'index, l'analyse de diagnostic SEO, la recherche de mots-clés, la requête de liens inverses, etc., couvrant le trafic de recherche des deux moteurs de recherche Bing et Yahoo.
- robots.txt
- Fichier texte brut situé dans le répertoire racine du site web, qui indique aux crawlers des moteurs de recherche quelles routes sont autorisées pour le crawl et quelles routes sont interdites d'accès via des directives telles que User-agent, Disallow, Allow ; il peut également déclarer l'emplacement du fichier Sitemap dans le fichier pour que les crawlers le découvrent automatiquement.
- Crawler (Spider/Bot)
- Programme développé par les moteurs de recherche pour explorer automatiquement le contenu web, tel que Googlebot (crawler de Google), Bingbot (crawler de Bing), Baiduspider (crawler de Baidu) ; découvre de nouvelles pages en suivant les liens de pages et en lisant les fichiers Sitemap, et stocke le contenu des pages téléchargées dans l'index du moteur de recherche.
- Budget de crawl (Crawl Budget)
- Quantité totale de ressources de crawl que les moteurs de recherche allouent à un site web sur une période donnée, déterminée conjointement par de multiples facteurs tels que l'autorité du domaine, la vitesse de réponse du serveur, la qualité du contenu de la page, l'historique des effets de crawl, etc. ; configurer correctement le Sitemap peut aider à optimiser l'efficacité d'utilisation du budget de crawl.
- Encodage UTF-8
- Encodage de caractères obligatoire pour les fichiers Sitemap XML ; UTF-8 prend en charge tous les caractères Unicode, y compris les caractères chinois ; il est spécifié dans la déclaration XML via l'attribut encoding="UTF-8" ; l'utilisation d'autres encodages (comme GBK, GB2312) peut entraîner des caractères corrompus dans les URL chinoises et des échecs d'analyse.
- Compression gzip
- Le protocole Sitemap prend en charge l'utilisation de l'algorithme gzip pour la transmission compressée (extension de fichier .xml.gz), qui peut réduire la taille du fichier Sitemap de 70%-80%, économisant considérablement la bande passante du serveur et le temps de crawl du crawler ; les principaux moteurs de recherche peuvent décompresser et traiter automatiquement les fichiers Sitemap compressés en gzip ; après compression, la taille doit toujours respecter la limite de 50 MB.
- Yoast SEO
- Plugin SEO largement utilisé sur les plateformes CMS telles que WordPress et Shopify, qui peut générer automatiquement des Sitemaps, des balises meta, la navigation par fil d'Ariane, des plans de site XML, l'optimisation RSS, des métadonnées de réseaux sociaux et d'autres fonctions liées au SEO ; c'est une solution SEO couramment utilisée pour les sites de contenu.
- Couverture d'index (Index Coverage)
- L'un des rapports centraux de Google Search Console, qui affiche en détail la quantité spécifique et les raisons détaillées des pages du site qui ont été indexées, exclues, avec des erreurs ou des avertissements par Google ; il peut être utilisé pour vérifier l'effet de la soumission du Sitemap et diagnostiquer les problèmes d'indexation de pages.
- Encodage URL (Percent-Encoding)
- Également appelé encodage en pourcentage, c'est une méthode d'encodage utilisée pour représenter des caractères non ASCII (tels que le chinois, des symboles spéciaux) dans les URL ; les caractères chinois sont encodés au format %XX%XX%XX (par exemple, «中文» est encodé en %E4%B8%AD%E6%96%87) ; les URL chinoises dans le Sitemap doivent être correctement encodées pour être analysées.
Tableau de référence des scénarios de fréquence de mise à jour changefreq
| Valeur changefreq | Fréquence de mise à jour | Types de pages typiques applicables | Remarques importantes |
|---|---|---|---|
always | Peut changer à chaque accès | Pages de données en temps réel, entrées de recherche, pages d'agrégation dynamique | Ne signifie pas que le crawler viendra à chaque fois, seulement que la fréquence de changement est extrêmement élevée ; ne pas utiliser abusivement, les pages normales ne doivent pas être configurées sur always |
hourly | Mise à jour toutes les heures | Pages d'accueil d'actualités, activité de réseaux sociaux, pages de cotations en temps réel | Adapté aux pages produisant du nouveau contenu toutes les heures ; les sites sans mises à jour à haute fréquence ne doivent pas être configurés sur hourly |
daily | Mise à jour quotidienne | Page d'accueil du site, pages de liste de blogs, pages de canaux d'actualités, pages de catégories de produits | L'une des valeurs les plus utilisées, applicable aux pages d'accueil et sections de la plupart des sites |
weekly | Mise à jour hebdomadaire | Pages de détails d'articles normaux, pages de détails de produits, pages de contenu de blogs | Adapté aux pages de contenu de la plupart des sites de contenu |
monthly | Mise à jour mensuelle | Pages de répertoire de catégories, pages d'archive, pages FAQ, pages de guides d'utilisation | Pages auxiliaires avec mises à jour peu fréquentes mais ajustements occasionnels |
yearly | Mise à jour annuelle | Pages de présentation d'entreprise, pages de contact, conditions de service, politique de confidentialité | Pages d'informations statiques qui ne changent presque jamais |
never | Jamais mise à jour | Archive d'articles historiques, pages d'événements expirés, ancien contenu archivé | Configurez sur never les pages qui ne seront définitivement plus modifiées ; en cas de mises à jour pensez à modifier rapidement |
Tableau de référence de configuration de la priorité priority
| Valeur priority | Niveau de priorité | Types de pages applicables | Proportion recommandée de pages |
|---|---|---|---|
1.0 | Maximale | Page d'accueil du site, pages de destination principales, entrées des canaux les plus importants | Seulement 1-3 pages sur l'ensemble du site |
0.8-0.9 | Très élevée | Pages de sections principales, pages de catégories populaires, produits principaux, sujets spéciaux en vedette | Environ 5-10% du nombre total de pages |
0.6-0.7 | Élevée | Pages de sections secondaires, sous-catégories, articles populaires, détails de produits importants | Environ 10-20% du nombre total de pages |
0.4-0.5 | Normale | Pages de détails d'articles normaux, produits généraux, contenu conventionnel | Environ 40-60% du nombre total de pages (valeur par défaut) |
0.2-0.3 | Basse | Pages de tags, pagination d'archives, articles anciens, pages auxiliaires | Environ 15-25% du nombre total de pages |
0.0-0.1 | Minimale | Pages de faible valeur, contenu dupliqué, pages à ne pas crawler prioritairement | Dans les 5% du nombre total de pages ; 0 ne signifie pas interdire l'indexation |
Tableau des limites de la spécification du protocole Sitemap
| Élément de limite | Valeur limite | Description | Schéma de traitement en cas de dépassement |
|---|---|---|---|
| Nombre d'URL par Sitemap individuel | 50,000 | Exigence obligatoire du protocole sitemap.org 0.9 | Utiliser Sitemap Index pour diviser en plusieurs Sitemaps secondaires |
| Taille de fichier non compressé par Sitemap | 50 MB (52428800 octets) | Taille du fichier original incluant toutes les balises et espaces | Utiliser la compression gzip, diviser le Sitemap, simplifier les commentaires |
| Nombre de Sitemaps secondaires par Sitemap Index | 50,000 | Limite des entrées URL du fichier d'index | Théoriquement prend en charge 2,5 milliards d'URL, généralement pas nécessaire pour les sites courants |
| Longueur d'URL individuelle | 2,048 caractères | Incluant le protocole, le domaine, le chemin, tous les paramètres de requête | Les URL trop longues nécessitent de simplifier les paramètres ou une réécriture d'URL |
| Encodage pris en charge par le Sitemap | UTF-8 | Exigence obligatoire du protocole ; d'autres encodages peuvent causer des échecs d'analyse | Assurez-vous d'utiliser l'encodage UTF-8 lors de l'enregistrement des fichiers |
| Protocoles pris en charge par le Sitemap | http:// ou https:// | Les URL doivent inclure l'en-tête de protocole complet | Ne prend pas en charge d'autres protocoles comme ftp:// |
| Temps de réponse du crawler après soumission | De quelques heures à plusieurs jours | Dépend de l'autorité du site et de la complexité du Sitemap | Pas besoin de soumettre à plusieurs reprises, attendez patiemment le traitement |
| Taille de fichier après compression gzip | 50 MB | Le fichier compressé ne doit pas non plus dépasser la limite de 50 MB | Si la taille dépasse toujours après compression, divisez le Sitemap |
- Générateur d'en-tête Auth
- Analyseur Cache-Control
- Analyseur Content-Disposition
- Générateur d'en-têtes CORS
- Inspecteur CORS
- Générateur CSP
- Générateur de code cURL
- Vérification de la Propagation DNS Globale
- Recherche DNS
- Analyseur d'en-tête Forwarded
- Générateur de Balises Hreflang
- Analyseur HSTS
- Analyseur de cookies HTTP
- Vérificateur d'en-têtes HTTP
- Testeur de requêtes HTTP
- Recherche de codes de statut HTTP
- Recherche d'adresse IP
- Convertisseur IPv4
- Étendeur de Plage IPv4
- Boîte à outils IPv6
- Analyseur d'en-tête Link
- Recherche MX
- Vérificateur de ports
- Générateur de paramètres URL
- Analyseur d'en-têtes RateLimit
- Vérificateur de chaîne de redirections
- Générateur Robots.txt
- Inspecteur de robots.txt
- Vérificateur d'en-têtes de sécurité
- Générateur Security.txt
- Analyseur Set-Cookie
- Audit réseau de site
- Générateur de Sitemap
- Inspecteur de Sitemap
- Vérificateur de Certificats SSL
- Calculateur de Sous-réseaux
- Analyseur d'URL
- Analyseur User-Agent
- Générateur de liens UTM
- Test WebSocket
- Quelle est mon IP ?
- Recherche WHOIS