Générateur Robots.txt
Générateur de règles robots.txt
Prend en charge les lignes multiples Allow / Disallow / Sitemap, assemble automatiquement le format standard.
Le générateur Robots.txt en ligne de GeekFormat vous permet de configurer les règles User-agent, Allow/Disallow, les déclarations Sitemap et les directives Host via un formulaire visuel, générant en temps réel des fichiers robots.txt conformes au protocole Robots Exclusion Protocol. La page s'ouvre avec des valeurs d'exemple par défaut – modifiez n'importe quel champ pour prévisualiser les résultats instantanément, puis copiez-les en un clic pour les déployer dans le répertoire racine de votre site web. Fonctionne entièrement localement dans votre navigateur ; aucune donnée de configuration n'est téléversée sur un serveur.
Recommandations connexes
À propos de Robots.txt et du protocole d'exclusion des robots
robots.txt est l'un des moyens les plus basiques par lesquels les sites web communiquent avec les crawlers de moteurs de recherche, de nom complet Robots Exclusion Protocol (protocole d'exclusion des robots, abrégé REP). C'est un fichier texte brut placé dans le répertoire racine d'un site web qui utilise des directives simples pour indiquer aux crawlers de moteurs de recherche conformes quelles parties du site web peuvent être explorées et quelles parties ne sont pas souhaitées à l'exploration. robots.txt a été proposé pour la première fois par Martijn Koster en 1994 ; après près de 30 ans de développement, il a été formellement normalisé par l'IETF en tant que RFC 9309 en 2022.
La structure de base de robots.txt se compose d'un ou plusieurs groupes de règles. Chaque groupe de règles commence par une ou plusieurs lignes User-agent spécifiant les crawlers auxquels les règles s'appliquent (* signifie tous les crawlers) ; suivies de plusieurs lignes Allow et Disallow, spécifiant respectivement les préfixes de chemin autorisés et interdits à l'exploration ; des directives non-niveau-groupe telles que Sitemap et Host peuvent être ajoutées à la fin du fichier. Chaque groupe de règles est séparé par des lignes vides. Un robots.txt typique contient : Déclaration User-agent → Règles de chemin Allow/Disallow → (facultatif) groupes User-agent supplémentaires → Déclaration Sitemap → Directive Host.
Le champ User-agent spécifie le nom du crawler auquel les règles s'appliquent. Les noms de crawlers de moteurs de recherche courants incluent : Googlebot (recherche Google), Bingbot (recherche Bing), Baiduspider (recherche Baidu), YandexBot (recherche Yandex), DuckDuckBot (recherche DuckDuckGo), Twitterbot (récupération de cartes Twitter/X), facebookexternalhit (aperçu de lien Facebook), GPTBot (crawler OpenAI GPT), Bytespider (recherche ByteDance/Toutiao), etc. Utilisez User-agent: * comme caractère générique pour correspondre à tous les crawlers non correspondus séparément.
Les directives Allow et Disallow utilisent le principe de correspondance de préfixe (Prefix Matching) : tant qu'un chemin URL commence par la valeur spécifiée, la règle correspond. Par exemple, Disallow: /admin bloque tous les chemins commençant par /admin tels que /admin, /admin/, /admin/login.html, /administrator, etc. Si vous ne voulez correspondre exactement qu'au répertoire /admin/, écrivez Disallow: /admin/ (barre oblique finale ajoutée). Selon les normes RFC 9309, lorsque Allow et Disallow correspondent tous les deux, la règle avec le chemin le plus long gagne ; lorsque les longueurs sont égales, Allow a la priorité. Cela signifie que les règles plus spécifiques ont une priorité plus élevée.
La directive Sitemap informe les moteurs de recherche de l'emplacement des sitemaps, aidant les crawlers à découvrir et indexer les pages du site web plus efficacement. Les lignes Sitemap doivent être placées après tous les groupes de règles (ou à la fin du fichier), et les URL doivent être des adresses absolues complètes (incluant http:// ou https://). Plusieurs Sitemaps peuvent être déclarés dans un robots.txt, chacun sur sa propre ligne. Les grands sites se divisent généralement en plusieurs Sitemaps (catégorisés par type de contenu, fréquence de mise à jour), gérés de manière unifiée via un fichier d'index Sitemap.
La directive Host est une directive non standard mais largement utilisée proposée par Yandex, utilisée pour spécifier le domaine préféré (miroir principal) d'un site. Par exemple, lorsque example.com et www.example.com existent tous les deux, Host: example.com indique aux moteurs de recherche de préférer example.com. Note : Google a déclaré ne pas utiliser la directive Host ; les domaines préférés doivent être définis via la Google Search Console ; Bing ne l'a pas non plus explicitement prise en charge. La directive Host doit être placée après Sitemap et ne peut apparaître qu'une seule fois.
La configuration correcte de robots.txt a une importance significative pour le SEO : premièrement, elle empêche les crawlers de gaspiller le budget d'exploration sur des pages sans signification (telles que les pages de résultats de recherche, les pages filtrées, les pages de contenu dupliqué), permettant aux crawlers d'explorer le contenu de valeur plus efficacement ; deuxièmement, elle empêche les pages privées ou de faible valeur (telles que les backends, les pages de test, les pages d'impression) d'être indexées ; troisièmement, elle guide proactivement les crawlers vers de nouvelles pages via les Sitemaps. Mais notez : robots.txt est un accord entre gentlemen et ne peut pas remplacer de véritables mesures de sécurité ; les URL Disallow peuvent toujours afficher des URL dans les résultats de recherche si des liens externes pointent vers elles (le contenu ne sera simplement pas exploré) ; interdire complètement l'exploration peut en fait affecter l'évaluation globale du poids du site.
Les erreurs courantes de robots.txt incluent : ① Erreurs de saisie de chemin (telles que Disallow: admin manquant la barre oblique initiale, devrait être /admin) ; ② Utilisation d'expressions régulières (le REP standard ne prend pas en charge les regex, seul Googlebot prend en charge les caractères génériques limités * et $) ; ③ Interdire l'exploration des fichiers JS/CSS (ce qui empêche Google de rendre les pages) ; ④ Disallow: / (interdire l'ensemble du site, une erreur fatale qui empêche le site d'être indexé du tout) ; ⑤ Problèmes d'encodage de fichier (doit être en encodage UTF-8) ; ⑥ Placé dans un sous-répertoire au lieu du répertoire racine ; ⑦ Accès impossible en raison des permissions de fichier (doit renvoyer le code d'état 200 OK). Il est recommandé de vérifier après génération à l'aide de l'outil de test robots.txt de la Google Search Console ou de l'outil d'inspection robots.txt de cette plateforme.
Cas d'utilisation
- Configurer un robots.txt de base avant le lancement d'un nouveau site pour définir clairement les chemins autorisés et interdits à l'exploration, guidant les moteurs de recherche à explorer correctement
- Mettre à jour les règles Disallow après une refonte de site pour empêcher les anciens répertoires d'être explorés continuellement, ce qui pourrait affecter la distribution du poids SEO
- Ajouter plusieurs déclarations d'adresses Sitemap pour aider les moteurs de recherche à découvrir plus rapidement la structure complète des pages du site, améliorant l'efficacité de l'indexation
- Bloquer les répertoires d'administration backend (/admin), les environnements de test et les répertoires privés pour qu'ils ne soient pas indexés par les crawlers, réduisant les risques de sécurité
- Définir la directive Host pour spécifier le domaine préféré de votre site (avec ou sans www), réduisant les problèmes de contenu dupliqué
- Configurer des règles d'exploration indépendantes pour différents crawlers de moteurs de recherche (Googlebot, Bingbot, Baiduspider, etc.)
- Bloquer temporairement les crawlers d'accéder aux répertoires en maintenance, rouvrant l'accès d'exploration une fois les mises à jour du site terminées
- Générer des fichiers robots.txt correctement formatés pour éviter les échecs d'analyse des moteurs de recherche dus à des erreurs de formatage manuscrites
- Configurer plusieurs Sitemaps (par ex. sitemap d'articles, sitemap de produits, sitemap d'images) pour couvrir tous les types de contenu du site
- Démonstration de développement front-end de la configuration de règles robots.txt, présentation pédagogique du format standard du protocole de crawler
- Utiliser avec un outil d'inspection robots.txt pour vérifier que les règles générées correspondent aux attentes, évitant de bloquer accidentellement des pages importantes
- Créer rapidement un modèle robots.txt, le télécharger, l'ajuster à la situation réelle de votre site puis le déployer
Comment utiliser
- Spécifiez le crawler cible dans la zone de saisie User-agent (par défaut * représente tous les crawlers de moteurs de recherche)
- Remplissez dans la zone Allow les chemins autorisés à l'exploration, une règle par ligne (par ex. /, /blog/)
- Remplissez dans la zone Disallow les chemins interdits à l'exploration, une règle par ligne (par ex. /admin, /private)
- Ajoutez les adresses de sitemap XML dans la zone Sitemap (multiligne pris en charge) et remplissez votre domaine préféré dans la zone Host
- La zone de prévisualisation de droite affiche le contenu robots.txt généré en temps réel ; une fois confirmé correct, cliquez sur le bouton de copie pour déployer
Fonctionnalités
- Configuration indépendante de plusieurs règles : Des zones de saisie séparées pour User-agent, Allow, Disallow, Sitemap et Host maintiennent les règles clairement catégorisées au lieu d'être mélangées
- Génération avec prévisualisation en temps réel : Le contenu robots.txt est mis à jour instantanément lorsque vous modifiez une règle – pas besoin de cliquer manuellement sur un bouton de génération, ce que vous voyez est ce que vous obtenez
- Règle de secours par défaut : Génère automatiquement Allow: / lorsque Allow et Disallow sont tous deux vides, empêchant les fichiers vides qui entraînent un comportement indéfini du crawler
- Prise en charge de plusieurs Sitemaps : La zone Sitemap prend en charge la saisie multiligne, chaque URL étant affichée comme une ligne de déclaration Sitemap indépendante – parfait pour les sites avec plusieurs Sitemaps
- Copie en un clic pour le déploiement : Les résultats peuvent être copiés dans le presse-papiers en un clic, prêts à être collés directement dans le répertoire racine de votre site web pour le déploiement
- Exemple par défaut pré-rempli : La page s'ouvre avec une configuration d'exemple par défaut (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host) que les débutants peuvent référencer et modifier directement
- Sortie au format standard : Suit strictement les spécifications du protocole Robots Exclusion Protocol – lignes User-agent en premier, lignes de règles ensuite, Sitemap/Host à la fin – compatible avec tous les moteurs de recherche
- Traitement intelligent des chemins : Supprime automatiquement les espaces blancs en début/fin de chaque ligne et filtre les lignes vides, empêchant l'échec des règles dû à des espaces supplémentaires
- Mise en page responsive à panneaux séparés : Panneaux séparés gauche-droite (configuration/prévisualisation) sur ordinateur, empilés haut-bas sur mobile – fonctionne parfaitement sur ordinateur comme sur smartphone
- Prévisualisation en police à chasse fixe : La zone de prévisualisation utilise une police à chasse fixe pour afficher les résultats générés, maintenant le formatage robots.txt propre et clair
- Prise en charge de la directive Host : Configurez votre domaine Host préféré (pris en charge par Yandex et d'autres moteurs de recherche) pour réduire les problèmes de contenu dupliqué entre domaines
- Fonctionne entièrement localement dans le navigateur : Toutes les opérations de configuration et de génération sont effectuées dans le JavaScript local du navigateur – aucune donnée n'est envoyée à un serveur
- Utilisation instantanée sans dépendance : Prêt à l'emploi dès l'ouverture de la page – aucune inscription, connexion ou installation de logiciel requise
- Lié à l'outil d'inspection : Les liens connexes mènent directement à l'outil d'inspection robots.txt, vous permettant de vérifier les règles immédiatement après génération
FAQ
À quoi sert robots.txt ? Pourquoi un site web a-t-il besoin de ce fichier ?
robots.txt est un fichier texte brut placé dans le répertoire racine d'un site web, utilisé pour indiquer aux crawlers de moteurs de recherche (tels que Googlebot, Bingbot, Baiduspider, etc.) quels chemins peuvent être explorés et lesquels sont interdits d'accès. C'est la mise en œuvre du protocole Robots Exclusion Protocol (protocole d'exclusion des robots), le fichier central pour la gestion de l'exploration du site et la configuration SEO de base. Bien que non strictement obligatoire, presque tous les sites web légitimes configurent robots.txt pour guider le comportement des crawlers.
Où le fichier robots.txt doit-il être placé ?
robots.txt doit être placé dans le répertoire racine du site web et être accessible directement à l'adresse http://votredomaine/robots.txt, par exemple https://example.com/robots.txt. Notez que le placer dans un sous-répertoire (tel que /blog/robots.txt) est invalide – les crawlers ne cherchent ce fichier que dans le répertoire racine. Le nom de fichier doit être entièrement en minuscules : robots.txt, et non Robots.txt ou ROBOTS.TXT.
Quel contenu est généré lorsque Allow et Disallow sont tous deux vides ?
Lorsque ni Allow ni Disallow ne sont remplis, le générateur génère automatiquement Allow: / comme règle de secours, signifiant que l'exploration de l'ensemble du site est autorisée. Cela empêche la génération de fichiers vides ou de fichiers robots.txt incomplets avec uniquement des lignes User-agent, évitant un comportement indéfini du crawler dû à des règles peu claires.
Puis-je configurer plusieurs adresses Sitemap ?
Oui. La zone Sitemap prend en charge la saisie multiligne, et chaque URL sera affichée comme une ligne de déclaration Sitemap indépendante. Par exemple, les grands sites ont généralement plusieurs fichiers sitemap (sitemap d'articles, sitemap de produits, sitemap d'images, etc.) – vous pouvez remplir une URL Sitemap complète par ligne (doit être un chemin absolu complet incluant http:// ou https://).
Quel est le rôle de la directive Host ? Tous les moteurs de recherche la prennent-ils en charge ?
La directive Host spécifie le domaine préféré d'un site (tel que example.com ou www.example.com), aidant les moteurs de recherche à identifier le domaine principal et à réduire les problèmes de contenu dupliqué entre les versions www et non-www. Actuellement, la directive Host est principalement prise en charge par des moteurs de recherche comme Yandex ; Google n'utilise pas directement la directive Host, mais définit les domaines préférés via la Google Search Console. Il est recommandé de la configurer mais de ne pas s'y fier exclusivement.
Que signifie User-agent: * ? Comment configurer des règles pour des crawlers spécifiques ?
User-agent: * signifie que les règles s'appliquent à tous les crawlers (l'astérisque est un caractère générique). Si vous devez configurer des règles indépendantes pour des moteurs de recherche spécifiques, vous pouvez définir User-agent sur un nom de crawler spécifique, tel que Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X), etc. Vous pouvez configurer plusieurs groupes User-agent, séparés par des lignes vides entre chaque groupe.
robots.txt peut-il vraiment protéger les répertoires sensibles contre l'accès ?
Non. robots.txt n'est qu'un accord entre gentlemen – les crawlers de moteurs de recherche conformes respectent les règles, mais les crawlers malveillants et les scanneurs de pirates peuvent l'ignorer complètement. Ne vous fiez pas à robots.txt pour protéger du contenu vraiment sensible (tel que les mots de passe backend, les données de confidentialité des utilisateurs) ; les répertoires sensibles doivent utiliser de véritables mesures de sécurité telles que l'authentification côté serveur (protection par mot de passe, liste blanche d'IP). Le but de robots.txt est de guider les crawlers conformes, pas de fournir une protection de sécurité.
Quelle est la règle de correspondance de chemin pour Disallow ?
Les règles Disallow utilisent la correspondance de préfixe : Disallow: /admin correspond à tous les chemins commençant par /admin, tels que /admin, /admin/, /admin/login.html, /administrator, etc. Si vous ne voulez correspondre qu'au contenu sous le répertoire /admin/, écrivez Disallow: /admin/ (avec barre oblique finale). Disallow: (valeur vide) signifie qu'aucun chemin n'est interdit (c'est-à-dire que tous sont autorisés). Notez que les règles sont sensibles à la casse.
Comment déployer le robots.txt généré sur mon site web ?
Cliquez sur le bouton de copie pour copier le contenu généré dans votre presse-papiers, puis créez un fichier texte brut nommé robots.txt sur votre serveur, collez le contenu et téléversez le fichier dans le répertoire racine de votre site web (généralement le répertoire web root, public_html, www ou dist). Après déploiement, vérifiez que cela fonctionne en accédant à https://votredomaine/robots.txt ; vous pouvez également utiliser l'outil de test robots.txt de la Google Search Console pour vérifier les règles.
Combien de temps faut-il pour que les modifications de robots.txt prennent effet ?
Les crawlers de moteurs de recherche récupèreront à nouveau le fichier robots.txt lors de leur prochaine visite sur votre site, prenant généralement effet dans les heures à jours qui suivent. Si vous souhaitez que les moteurs de recherche découvrent la mise à jour le plus tôt possible, vous pouvez soumettre une demande de mise à jour robots.txt dans la Google Search Console ou Bing Webmaster Tools. Note : Les pages déjà indexées peuvent rester dans les résultats de recherche pendant un certain temps même après avoir été Disallow ; une suppression complète nécessite l'utilisation de la balise noindex ou de l'outil de suppression d'URL.
Lequel a la priorité lorsque Allow et Disallow entrent en conflit ?
Selon la RFC 9309 (la norme formelle du protocole Robots Exclusion Protocol), lorsque les règles Allow et Disallow ont la même longueur de chemin, Allow a la priorité sur Disallow ; lorsque les longueurs de chemin diffèrent, la règle correspondant au chemin le plus long a la priorité. Par exemple, lorsque Allow: /blog entre en conflit avec Disallow: /blog/, l'accès à /blog/post.html correspond à Disallow (chemin plus long /blog/ > /blog), tandis que l'accès à /blog lui-même correspond à Allow. En termes simples, les règles plus spécifiques ont une priorité plus élevée.
Puis-je ajouter des commentaires dans robots.txt ?
Oui, les lignes commençant par # sont des lignes de commentaire, et les crawlers ignorent le contenu après #. Les commentaires peuvent être sur leur propre ligne ou à la fin d'une ligne de règle (après #). Par exemple : # Block admin area ou Disallow: /admin # admin panel. L'ajout de commentaires appropriés vous aide, vous et les membres de l'équipe, à comprendre ce que fait chaque règle.
Les URL Sitemap doivent-elles être des chemins absolus ?
Oui, les directives Sitemap doivent utiliser des URL absolues complètes (incluant le protocole et le domaine), telles que Sitemap: https://example.com/sitemap.xml. Les chemins relatifs (tels que /sitemap.xml) ne peuvent pas être utilisés car les crawlers peuvent accéder à votre site à partir de différents domaines (tels que example.com et www.example.com), et les chemins relatifs empêcheraient les crawlers de déterminer l'adresse correcte.
Les données de configuration sont-elles téléversées sur le serveur ?
Pas du tout. Toutes les opérations de configuration et de génération de robots.txt sont effectuées localement dans votre navigateur via JavaScript – les données de configuration telles que les chemins et domaines saisis ne sont envoyées à aucun serveur externe. La page peut être utilisée hors ligne (fonctionnalités de base) une fois chargée ; les données sont automatiquement effacées lorsque vous fermez la page, ne laissant aucun enregistrement.
Le robots.txt généré peut-il être utilisé sur n'importe quel site web ?
Oui, le générateur produit un fichier texte brut au format standard Robots Exclusion Protocol, adapté à tout serveur web (Nginx, Apache, IIS, Caddy, etc.) et toute plateforme de création de sites (WordPress, Shopify, Next.js, Django, Rails, etc.). Il suffit de le déployer dans le répertoire racine de votre site web et de vous assurer qu'il est accessible publiquement.
Dépannage
L'accès au fichier généré renvoie une erreur 404 ?
Vérifiez que le fichier robots.txt a été téléversé dans le répertoire racine du site web (pas dans un sous-répertoire), que le nom de fichier est entièrement en minuscules robots.txt et que les permissions de fichier sont définies en lecture publique (généralement les permissions 644 sont suffisantes). Après téléversement, accédez directement dans un navigateur à https://votredomaine/robots.txt pour confirmer que vous pouvez voir le contenu. Les emplacements des répertoires racines varient selon le serveur : Nginx/Apache est généralement /var/www/html/ ou /usr/share/nginx/html/, Vercel/Netlify est généralement le répertoire public/.
Les règles Disallow ne fonctionnent pas, les pages sont toujours indexées ?
Causes possibles : ① Les crawlers n'ont pas encore récupéré à nouveau robots.txt (attendez quelques jours ou soumettez une mise à jour dans la Search Console) ; ② Correspondance de préfixe de chemin incorrecte (par ex. Disallow: admin manquant /, devrait être Disallow: /admin/) ; ③ Les pages étaient déjà indexées avant l'ajout de Disallow (les pages déjà indexées ne sont pas automatiquement supprimées) ; ④ Les crawlers malveillants ne respectent pas robots.txt ; ⑤ Conflit de règle Allow écrase Disallow (Allow a la priorité lorsque le chemin est plus long). Pour supprimer complètement de l'index, utilisez la balise noindex.
La Google Search Console signale que robots.txt bloque des pages ?
Cela signifie généralement que des pages importantes ont été accidentellement Disallow. Vérifiez robots.txt pour des règles Disallow trop larges (telles que Disallow: / ou Disallow: /*?) et assurez-vous que les fichiers CSS/JS ne sont pas bloqués (Google doit récupérer ces fichiers pour rendre les pages). Utilisez l'outil de test robots.txt de la Search Console pour saisir des URL spécifiques et tester quelle règle les bloque.
Vous avez accidentellement défini Disallow: /, entraînant l'interdiction d'exploration de l'ensemble du site ?
Supprimez ou modifiez immédiatement cette règle, changez robots.txt en Allow: / ou supprimez la ligne Disallow: /, et téléversez le fichier mis à jour sur le serveur. Soumettez ensuite une demande de mise à jour robots.txt dans la Google Search Console, et soumettez un sitemap pour accélérer la ré-exploration. Les pages déjà supprimées de l'index peuvent prendre des jours à des semaines pour être réindexées.
Glossaire
- robots.txt
- Un fichier texte brut placé dans le répertoire racine du site web, suivant le protocole Robots Exclusion Protocol, utilisé pour indiquer aux crawlers de moteurs de recherche conformes quels chemins sont autorisés/interdits à l'exploration.
- Robots Exclusion Protocol (REP)
- Le protocole d'exclusion des robots, proposé en 1994 et normalisé en RFC 9309 en 2022, est la norme de facto pour la communication des règles d'exploration entre les sites web et les crawlers.
- User-agent
- Le champ de début d'un groupe de règles, spécifiant le nom du crawler auquel les règles Allow/Disallow suivantes s'appliquent ; le caractère générique * correspond à tous les crawlers.
- Disallow
- Directive d'interdiction d'exploration, spécifiant les préfixes de chemin auxquels vous ne souhaitez pas que les crawlers accèdent. Par exemple, Disallow: /admin interdit l'exploration de tous les chemins commençant par /admin.
- Allow
- Directive d'autorisation d'exploration, spécifiant les chemins pour lesquels l'accès du crawler est explicitement autorisé. Utilisée pour ouvrir des sous-chemins spécifiques sous un chemin parent Disallow.
- Sitemap
- Directive de déclaration Sitemap, indiquant aux moteurs de recherche l'URL complète du sitemap XML du site web, aidant les crawlers à découvrir et indexer efficacement toutes les pages du site.
- Host
- Directive de domaine préféré, spécifiant le domaine principal du site (tel que example.com vs www.example.com) ; prise en charge par Yandex, Google utilise la Search Console pour les paramètres.
- Crawler/Bot/Spider
- Programmes automatisés utilisés par les moteurs de recherche pour accéder automatiquement aux pages web et collecter du contenu, tels que Googlebot, Bingbot, Baiduspider, etc.
- Googlebot
- Le crawler web du moteur de recherche Google, responsable de la récupération du contenu web pour l'indexation et le classement Google, l'un des crawlers de moteurs de recherche les plus courants.
- Crawl Budget
- Budget/quota d'exploration, la fréquence d'exploration et la limite de nombre de pages allouées par les moteurs de recherche à chaque site web. Une configuration correcte de robots.txt peut éviter le gaspillage du quota d'exploration.
- Prefix Matching
- Règle de correspondance de préfixe, la méthode de correspondance de chemin de robots.txt. Une correspondance réussit si le chemin URL commence par la valeur de règle ; les règles plus longues ont une priorité plus élevée.
- noindex
- Balise meta HTML ou directive d'en-tête HTTP (X-Robots-Tag: noindex), indiquant aux moteurs de recherche de ne pas inclure la page dans l'index de recherche. Contrairement à Disallow de robots.txt, noindex est une méthode plus fiable pour supprimer de l'index.
Noms User-agent courants des crawlers de moteurs de recherche
Noms User-agent à utiliser lors de la configuration de règles pour des crawlers spécifiques :
| Nom du crawler | Moteur de recherche propriétaire | Objectif |
|---|---|---|
* | Tous les crawlers | Caractère générique, correspond à tous les crawlers non configurés séparément |
Googlebot | Crawler d'exploration web de la recherche Google | |
Bingbot | Bing/Microsoft | Crawler d'exploration web de la recherche Bing |
Baiduspider | Baidu | Crawler d'exploration web de la recherche Baidu |
YandexBot | Yandex | Crawler d'exploration web de la recherche Yandex |
GPTBot | OpenAI | Crawler d'exploration de données d'entraînement ChatGPT |
Twitterbot | X/Twitter | Crawler d'aperçu de carte de lien de la plateforme X |
facebookexternalhit | Crawler d'aperçu de lien Facebook |
Exemples de règles robots.txt couramment utilisés
Configurations de règles courantes pour différents scénarios de site :
| Règle | Effet |
|---|---|
Disallow: /admin/ | Interdire l'exploration de tout le contenu sous le répertoire /admin/ |
Disallow: /*? | Interdire l'exploration des URL avec paramètres de requête (Googlebot prend en charge le caractère générique *) |
Disallow: /search | Interdire l'exploration des pages de résultats de recherche interne du site |
Allow: /public/ | Autoriser explicitement l'exploration du répertoire /public/ |
Disallow: / | ⚠️ Interdire l'exploration de l'ensemble du site (erreur fatale, à utiliser avec prudence !) |
Allow: / | Autoriser l'exploration de tout le contenu de l'ensemble du site |
Référence rapide des directives standard robots.txt
Directives standard et utilisation définies par la RFC 9309 :
| Directive | Portée | Exemple de format | Description |
|---|---|---|---|
User-agent | Début de groupe | User-agent: * | Spécifie le nom du crawler auquel les règles s'appliquent |
Disallow | Dans le groupe | Disallow: /admin | Préfixe de chemin interdit à l'exploration |
Allow | Dans le groupe | Allow: /public | Préfixe de chemin autorisé à l'exploration |
Sitemap | Non-niveau-groupe | Sitemap: https://example.com/sitemap.xml | Déclare l'emplacement du sitemap (URL absolue) |
# | Toute position | # This is a comment | Ligne de commentaire, ignorée par les crawlers |
Privacy & Security
Toutes les opérations de ce générateur Robots.txt sont effectuées entièrement localement dans votre navigateur : User-agent, règles de chemin, Sitemap, Host et autres entrées de configuration sont tous assemblés en temps réel dans la mémoire du navigateur via JavaScript en texte robots.txt, et ne sont pas envoyés sur le réseau à un serveur. Prêt à l'emploi dès le chargement de la page ; n'utilise pas de suivi Cookie, ne collecte aucune donnée utilisateur. Après avoir fermé ou actualisé la page, tout le contenu de configuration est automatiquement effacé et ne sera pas stocké de manière persistante dans le navigateur.
Authoritative References
- Générateur d'en-tête Auth
- Analyseur Cache-Control
- Analyseur Content-Disposition
- Générateur d'en-têtes CORS
- Inspecteur CORS
- Générateur CSP
- Générateur de code cURL
- Vérification de la Propagation DNS Globale
- Recherche DNS
- Analyseur d'en-tête Forwarded
- Générateur de Balises Hreflang
- Analyseur HSTS
- Analyseur de cookies HTTP
- Vérificateur d'en-têtes HTTP
- Testeur de requêtes HTTP
- Recherche de codes de statut HTTP
- Recherche d'adresse IP
- Convertisseur IPv4
- Étendeur de Plage IPv4
- Boîte à outils IPv6
- Analyseur d'en-tête Link
- Recherche MX
- Vérificateur de ports
- Générateur de paramètres URL
- Analyseur d'en-têtes RateLimit
- Vérificateur de chaîne de redirections
- Générateur Robots.txt
- Inspecteur de robots.txt
- Vérificateur d'en-têtes de sécurité
- Générateur Security.txt
- Analyseur Set-Cookie
- Audit réseau de site
- Générateur de Sitemap
- Inspecteur de Sitemap
- Vérificateur de Certificats SSL
- Calculateur de Sous-réseaux
- Analyseur d'URL
- Analyseur User-Agent
- Générateur de liens UTM
- Test WebSocket
- Quelle est mon IP ?
- Recherche WHOIS