Generador de Robots.txt
Generador de regles robots.txt
Admet múltiples línies Allow / Disallow / Sitemap, assembla automàticament el format estàndard.
El generador de Robots.txt en línia de GeekFormat permet configurar mitjançant formularis visuals les regles User-agent, Allow/Disallow, declaracions Sitemap i directives Host, generant en temps real fitxers robots.txt que compleixen l'estàndard Robots Exclusion Protocol. La pàgina s'obre amb valors per defecte d'exemple, en modificar qualsevol camp es previsualitza instantàniament el resultat generat, i es pot copiar amb un sol clic per desplegar al directori arrel del lloc web. Funciona completament al navegador localment, sense pujar dades de configuració a cap servidor.
Relacionats
Sobre Robots.txt i el Protocol d'Exclusió de Rastrejadors
robots.txt és una de les formes més bàsiques de comunicació entre un lloc web i els rastrejadors dels motors de cerca, amb nom complet Robots Exclusion Protocol (Protocol d'Exclusió de Rastrejadors, abreujat REP). És un fitxer de text pla situat al directori arrel del lloc web, que mitjançant instruccions senzilles diu als rastrejadors de motors de cerca que compleixen les normes: quines parts del lloc web es permeten rastrejar i quines parts no es volen rastrejar. robots.txt va ser proposat per primera vegada per Martijn Koster el 1994; després de gairebé 30 anys de desenvolupament, va ser estandarditzat formalment per l'IETF com a RFC 9309 el 2022.
L'estructura bàsica de robots.txt consta d'un o més grups de regles (Group). Cada grup de regles comença amb una o més línies User-agent, que especifiquen el rastrejador al qual s'apliquen les regles (* significa tots els rastrejadors); després hi ha diverses línies Allow i Disallow, que especifiquen respectivament els prefixos de camí permesos i prohibits per al rastreig; al final del fitxer es poden afegir directives no de grup com Sitemap i Host. Cada grup de regles se separa per una línia buida. Un robots.txt típic conté: declaració User-agent → regles de camí Allow/Disallow → (opcional) més grups User-agent → declaració Sitemap → directiva Host.
El camp User-agent especifica el nom del rastrejador al qual s'apliquen les regles. Els noms comuns de rastrejadors de motors de cerca inclouen: Googlebot (cerca Google), Bingbot (cerca Bing), Baiduspider (cerca Baidu), YandexBot (cerca Yandex), DuckDuckBot (cerca DuckDuckGo), Twitterbot (rastreig de targetes Twitter/X), facebookexternalhit (previsualització d'enllaços Facebook), GPTBot (rastrejador OpenAI GPT), Bytespider (cerca ByteDance/Toutiao), etc. Utilitza User-agent: * com a comodí per coincidir amb tots els rastrejadors que no s'han coincidit individualment.
Les directives Allow i Disallow utilitzen el principi de coincidència de prefixos (Prefix Matching): sempre que el camí de l'URL comenci amb el valor especificat, la regla coincideix. Per exemple, Disallow: /admin bloquejarà /admin, /admin/, /admin/login.html, /administrator i tots els camins que comencin per /admin. Si només vols coincidir exactament amb el directori /admin/, has d'escriure Disallow: /admin/ (amb barra al final). Segons l'estàndard RFC 9309, quan Allow i Disallow coincideixen alhora, guanya la regla amb el camí més llarg; quan les longituds són iguals, Allow té prioritat. Això significa que com més específica és la regla, més alta és la seva prioritat.
La directiva Sitemap s'utilitza per informar els motors de cerca de la ubicació del mapa del lloc, ajudant els rastrejadors a descobrir i indexar les pàgines del lloc de manera més eficient. La línia Sitemap s'ha de col·locar després de tots els grups de regles (o al final del fitxer), i l'URL ha de ser una adreça absoluta completa (amb http:// o https://). En un robots.txt es poden declarar diversos Sitemap, cadascun en una línia independent. Els llocs grans solen dividir diversos Sitemap (classificats per tipus de contingut i freqüència d'actualització) i gestionar-los de manera unificada mitjançant un fitxer d'índex Sitemap.
La directiva Host és una directiva no estàndard proposada per Yandex però àmpliament utilitzada, que s'utilitza per especificar el domini preferit del lloc (mirall principal). Per exemple, quan existeixen alhora example.com i www.example.com, Host: example.com diu als motors de cerca que example.com és el preferit. Cal tenir en compte: Google ha declarat que no utilitza la directiva Host, cal configurar el domini preferit mitjançant Google Search Console; Bing tampoc ha donat suport explícit. La directiva Host s'ha de col·locar després de Sitemap i només pot aparèixer una vegada.
Configurar correctament robots.txt té una importància significativa per a SEO: primer, evita que els rastrejadors malgastin la seva quota de rastreig en pàgines sense sentit (com ara pàgines de resultats de cerca, pàgines de filtrat, pàgines de contingut duplicat), permetent que els rastrejadors rastregin contingut valuós de manera més eficient; segon, evita que pàgines privades o de baix valor (com ara administració, pàgines de prova, pàgines d'impressió) siguin indexades; tercer, guia activament els rastrejadors a descobrir pàgines noves mitjançant Sitemap. Però cal tenir en compte: robots.txt és un acord entre cavallers, no pot substituir mesures de seguretat reals; si un URL en Disallow té enllaços externs que apunten cap a ell, encara pot mostrar l'URL als resultats de cerca (però no rastrejarà el contingut); prohibir completament el rastreig pot afectar l'avaluació del pes general del lloc.
Els errors comuns de robots.txt inclouen: ① Camí escrit incorrectament (com ara Disallow: admin que falta la barra inicial, hauria de ser /admin); ② Utilitzar expressions regulars (el REP estàndard no admet expressions regulars, només Googlebot admet comodins limitats * i $); ③ Prohibir el rastreig de fitxers JS/CSS (això farà que Google no pugui renderitzar la pàgina); ④ Disallow: / (prohibir tot el lloc, aquest és un error fatal que farà que el lloc no sigui indexat en absolut); ⑤ Problemes de codificació de fitxers (ha de ser codificació UTF-8); ⑥ Col·locar-lo en un subdirectori en lloc del directori arrel; ⑦ Permisos de fitxer que impedeixen l'accés (ha de retornar codi d'estat 200 OK). Es recomana verificar després de generar utilitzant l'eina de prova de robots.txt de Google Search Console o l'eina de comprovació de robots.txt d'aquesta plataforma.
Casos d'ús
- Configurar un robots.txt bàsic abans del llançament d'un lloc nou, especificant clarament els camins permesos i prohibits per al rastreig, guiant els motors de cerca a rastrejar correctament
- Actualitzar les regles Disallow després d'un redisseny del lloc web per evitar que els directoris antics continuïn sent rastrejats i afectin la distribució del pes SEO
- Afegir múltiples adreces Sitemap per ajudar els motors de cerca a descobrir més ràpidament l'estructura de pàgines de tot el lloc, millorant l'eficiència d'indexació
- Bloquejar directoris d'administració (/admin), entorns de prova i directoris privats per evitar que siguin indexats pels rastrejadors, reduint riscos de seguretat
- Configurar la directiva Host per especificar el domini preferit del lloc (amb www o sense www), reduint problemes de contingut duplicat
- Configurar regles de rastreig independents per a diferents rastrejadors de motors de cerca (Googlebot, Bingbot, Baiduspider, etc.)
- Prohibir temporalment l'accés dels rastrejadors als directoris en manteniment, i obrir el rastreig un cop finalitzada l'actualització del lloc
- Generar fitxers robots.txt amb format estàndard, evitant errors de format manuals que causin fallades en l'anàlisi dels motors de cerca
- Configurar múltiples Sitemap (com ara Sitemap d'articles, Sitemap de productes, Sitemap d'imatges) per cobrir tots els tipus de contingut del lloc
- Desenvolupadors frontend que demostren la configuració de regles robots.txt, ensenyant el format estàndard del protocol de rastrejadors
- Utilitzar juntament amb l'eina de comprovació de robots.txt per verificar si les regles generades compleixen les expectatives, evitant bloquejar pàgines importants per error
- Crear ràpidament una plantilla de robots.txt, descarregar-la i ajustar-la segons la situació real del lloc abans de desplegar
Com usar-ho
- Al camp d'entrada User-agent, especifica el rastrejador objectiu (per defecte * representa tots els rastrejadors de motors de cerca)
- A l'àrea Allow, omple els camins permesos per al rastreig, una regla per línia (com ara /, /blog/)
- A l'àrea Disallow, omple els camins prohibits per al rastreig, una regla per línia (com ara /admin, /private)
- A l'àrea Sitemap, afegeix les adreces del mapa del lloc XML (suporta múltiples línies), i a l'àrea Host omple el domini preferit
- L'àrea de previsualització dreta mostra en temps real el contingut de robots.txt generat, un cop confirmat que és correcte, fes clic al botó de còpia per desplegar
Característiques
- Configuració independent de múltiples regles: àrees d'entrada independents per a User-agent, Allow, Disallow, Sitemap i Host, amb classificació clara de regles sense barrejar-les
- Generació amb previsualització en temps real: el contingut de robots.txt s'actualitza instantàniament en modificar qualsevol regla, sense necessitat de fer clic manualment al botó de generació, el que veus és el que obtens
- Regla de seguretat per defecte: quan Allow i Disallow són tots dos buits, s'emet automàticament Allow: / per evitar generar fitxers en blanc que causin un comportament incert dels rastrejadors
- Suport per a múltiples Sitemap: l'àrea Sitemap admet entrada de múltiples línies, cada URL s'emet com una declaració Sitemap independent per línia, adequat per a llocs amb múltiples Sitemap
- Desplegament amb còpia amb un sol clic: el resultat generat admet la còpia al porta-retalls amb un sol clic, adequat per enganxar directament al directori arrel del lloc web per al desplegament
- Exemple per defecte preomplert: la pàgina s'obre amb una configuració d'exemple per defecte (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), els principiants poden refer-s'hi i modificar-la directament
- Sortida de format estàndard: segueix estrictament l'especificació Robots Exclusion Protocol, amb la línia User-agent al davant, les línies de regles al darrere i Sitemap/Host al final, compatible amb tots els motors de cerca
- Processament intel·ligent de camins: retalla automàticament els espais al principi i al final de cada línia i filtra les línies buides per evitar que els espais sobrants invalidin les regles
- Disseny responsiu de columnes: a PC hi ha columnes esquerra/dreta (configuració/previsualització), a mòbil disposició vertical, funciona bé tant a ordinadors com a telèfons
- Previsualització amb font monoespaiada: l'àrea de previsualització utilitza font monoespaiada per mostrar el resultat generat, amb un format de robots.txt ordenat i clar
- Suport per a la directiva Host: es pot configurar el domini preferit de Host (compatibilitat amb motors de cerca com Yandex), reduint els problemes de contingut duplicat entre dominis
- Funcionament completament local al navegador: totes les operacions de configuració i generació es realitzen al JavaScript local del navegador, sense enviar cap dada al servidor
- Ús instantani amb dependències zero: es pot utilitzar en obrir la pàgina, sense necessitat de registrar-se ni instal·lar cap programari
- Integració amb l'eina de comprovació: els enllaços relacionats porten directament a l'eina de comprovació de robots.txt, per verificar immediatament si les regles són correctes després de generar
Preguntes freqients
Per a què serveix robots.txt? Per què els llocs web necessiten aquest fitxer?
robots.txt és un fitxer de text pla situat al directori arrel del lloc web, que s'utilitza per dir als rastrejadors dels motors de cerca (com ara Googlebot, Bingbot, Baiduspider, etc.) quins camins es poden rastrejar i quins estan prohibits d'accedir. És la implementació del Robots Exclusion Protocol (Protocol d'Exclusió de Rastrejadors) i és el fitxer bàsic per a la gestió del rastreig del lloc i la configuració SEO. Tot i que no és obligatori, gairebé tots els llocs web formals configuren robots.txt per guiar el comportament dels rastrejadors.
On s'ha de col·locar el fitxer robots.txt?
robots.txt s'ha de col·locar obligatòriament al directori arrel del lloc web i ha de ser accessible directament mitjançant http://elteu-domini/robots.txt. Per exemple https://example.com/robots.txt. Tingues en compte que no s'ha de col·locar en subdirectoris (com ara /blog/robots.txt no és vàlid), els rastrejadors només cercaran aquest fitxer al directori arrel. El nom del fitxer ha de ser robots.txt en minúscules, no Robots.txt ni ROBOTS.TXT.
Quin contingut es genera quan Allow i Disallow són tots dos buits?
Quan ni Allow ni Disallow s'han omplert, el generador emet automàticament Allow: / com a regla de seguretat, que permet rastrejar tot el lloc. Això evita generar fitxers en blanc o robots.txt incomplets amb només la línia User-agent, prevenint que els rastrejadors tinguin un comportament incert a causa de regles poc clares.
Es poden configurar múltiples adreces Sitemap?
Sí. L'àrea Sitemap admet entrada de múltiples línies, cada URL s'emetrà com una declaració Sitemap independent per línia. Per exemple, els llocs grans solen tenir diversos fitxers sitemap (sitemap d'articles, sitemap de productes, sitemap d'imatges, etc.), pots omplir una URL Sitemap completa per línia (ha de ser un camí absolut complet, que inclogui http:// o https://).
Quina és la funció de la directiva Host? Tots els motors de cerca la suporten?
La directiva Host s'utilitza per especificar el domini preferit del lloc (com ara example.com o www.example.com), ajudant els motors de cerca a identificar el domini principal i reduint els problemes de contingut duplicat entre les versions www i no www. Actualment la directiva Host és suportada principalment per motors de cerca com Yandex; Google no utilitza directament la directiva Host, sinó que configura el domini preferit mitjançant Google Search Console. Es recomana configurar-la però no dependre completament d'ella.
Què significa User-agent: *? Com es configuren regles per a un rastrejador específic?
User-agent: * significa que les regles s'apliquen a tots els rastrejadors (l'asterisc és un comodí). Si necessites configurar regles independents per a un motor de cerca específic, pots establir User-agent al nom específic del rastrejador, com ara Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X), etc. Pots configurar diversos grups User-agent, separats per una línia buida entre cada grup.
Pot robots.txt protegir realment els directoris sensibles de l'accés?
No. robots.txt és només un acord entre cavallers; els rastrejadors de motors de cerca que compleixen les normes seguiran les regles, però els rastrejadors maliciosos i els escàners de hackers poden ignorar-lo completament. No et refiïs de robots.txt per protegir contingut realment sensible (com ara contrasenyes d'administració, dades de privacitat d'usuaris); els directoris sensibles haurien d'utilitzar mesures de seguretat reals com l'autenticació del costat del servidor (protecció per contrasenya, llistes blanques d'IP). La funció de robots.txt és guiar els rastrejadors que compleixen les normes, no la protecció de seguretat.
Quines són les regles de coincidència de camins de la regla Disallow?
La regla Disallow utilitza coincidència de prefixos: Disallow: /admin coincidirà amb /admin, /admin/, /admin/login.html, /administrator i tots els camins que comencin per /admin. Si només vols coincidir amb el contingut del directori /admin/, has d'escriure Disallow: /admin/ (amb barra al final). Disallow: (valor buit) significa no prohibir cap camí (és a dir, permetre'ls tots). Tingues en compte que les regles distingeixen entre majúscules i minúscules.
Com es desplega el robots.txt generat al lloc web?
Fes clic al botó de còpia per copiar el contingut generat al porta-retalls, després crea un fitxer de text pla anomenat robots.txt al servidor, enganxa el contingut i puja el fitxer al directori arrel del lloc web (normalment el directori web root, public_html, www o dist). Després del desplegament, pots accedir a https://elteu-domini/robots.txt per verificar si funciona, o utilitzar l'eina de prova de robots.txt de Google Search Console per verificar les regles.
Quant de temps triga a funcionar després de modificar robots.txt?
Els rastrejadors dels motors de cerca tornaran a rastrejar el fitxer robots.txt la propera vegada que visitin el teu lloc, normalment funciona en poques hores o dies. Si vols que els motors de cerca descobreixin l'actualització el més aviat possible, pots enviar una sol·licitud d'actualització de robots.txt a Google Search Console o Bing Webmaster Tools. Tingues en compte: les pàgines que ja han estat indexades poden romandre als resultats de cerca durant un temps encara que estiguin en Disallow; per eliminar-les completament cal utilitzar l'etiqueta noindex o l'eina d'eliminació d'URL.
Quin té prioritat quan Allow i Disallow entren en conflicte?
Segons RFC 9309 (estàndard formal del Robots Exclusion Protocol), quan Allow i Disallow tenen la mateixa longitud de camí, Allow té prioritat sobre Disallow; quan les longituds de camí són diferents, la regla amb el camí més llarg coincident té prioritat. Per exemple, quan Allow: /blog i Disallow: /blog/ entren en conflicte, l'accés a /blog/post.html coincidirà amb Disallow (camí més llarg /blog/ > /blog), mentre que l'accés a /blog mateix coincidirà amb Allow. En poques paraules, com més específica és la regla, més alta és la seva prioritat.
Es poden afegir comentaris a robots.txt?
Sí, les línies que comencen amb # són línies de comentari, els rastrejadors ignoraran el contingut després de #. Els comentaris es poden escriure en una línia separada o al final d'una línia de regla (el contingut després de #). Per exemple: # Block admin area o Disallow: /admin # admin panel. Afegir comentaris adequats ajuda a tu i als membres de l'equip a entendre la funció de cada regla.
Cal que l'URL Sitemap sigui un camí absolut?
Sí, la directiva Sitemap ha d'utilitzar una URL absoluta completa (que inclogui protocol i domini), com ara Sitemap: https://example.com/sitemap.xml. No es poden utilitzar camins relatius (com ara /sitemap.xml), perquè els rastrejadors poden accedir al teu lloc des de diferents dominis (com ara example.com i www.example.com), i els camins relatius faran que els rastrejadors no puguin determinar l'adreça correcta.
Les dades de configuració es pugen al servidor?
En absolut. Totes les operacions de configuració i generació de robots.txt es realitzen localment al teu navegador mitjançant JavaScript; les dades de configuració introduïdes com ara camins i dominis no s'enviaran a cap servidor extern. Després de carregar la pàgina es pot utilitzar fora de línia (funcions bàsiques); en tancar la pàgina les dades s'esborren automàticament, sense deixar cap registre.
Es pot utilitzar el robots.txt generat en qualsevol lloc web?
Sí, el generador emet un fitxer de text pla en format estàndard Robots Exclusion Protocol, adequat per a qualsevol servidor web (Nginx, Apache, IIS, Caddy, etc.) i qualsevol plataforma de creació de llocs (WordPress, Shopify, Next.js, Django, Rails, etc.). Només cal desplegar-lo al directori arrel del lloc web i assegurar que sigui accessible públicament.
Solució de problemes
L'accés al fitxer generat retorna error 404?
Confirma que el fitxer robots.txt s'ha pujat al directori arrel del lloc web (no a un subdirectori), que el nom del fitxer és robots.txt en minúscules i que els permisos del fitxer són de lectura pública (normalment els permisos 644 són suficients). Després de pujar, accedeix directament al navegador a https://elteu-domini/robots.txt per confirmar que pots veure el contingut. La ubicació del directori arrel varia segons el servidor: Nginx/Apache normalment és /var/www/html/ o /usr/share/nginx/html/, Vercel/Netlify normalment és el directori public/.
La regla Disallow no funciona, les pàgines continuen sent indexades?
Possibles causes: ① El rastrejador encara no ha tornat a rastrejar robots.txt (espera uns dies o envia l'actualització a Search Console); ② La coincidència del prefix de camí és incorrecta (com ara Disallow: admin que falta /, hauria de ser Disallow: /admin/); ③ La pàgina ja havia estat indexada abans d'afegir Disallow (les pàgines ja indexades no s'eliminen automàticament); ④ Els rastrejadors maliciosos no compleixen robots.txt; ⑤ Hi ha una regla Allow en conflicte que sobreescriu Disallow (Allow té prioritat quan el camí és més llarg). Per eliminar completament de l'índex cal utilitzar l'etiqueta noindex.
Google Search Console informa que robots.txt ha bloquejat pàgines?
Això normalment significa que pàgines importants han estat bloquejades per Disallow accidentalment. Comprova si hi ha regles Disallow massa àmplies a robots.txt (com ara Disallow: / o Disallow: /*?), assegura't que els fitxers CSS/JS no estiguin prohibits (Google necessita rastrejar aquests fitxers per renderitzar les pàgines). Utilitza l'eina de prova de robots.txt de Search Console introduint URL específics per provar quina regla està bloquejant.
Has configurat accidentalment Disallow: / i tot el lloc ha estat prohibit per al rastreig?
Elimina o modifica immediatament aquesta regla, canvia robots.txt a Allow: / o elimina la línia Disallow: /, i puja el fitxer actualitzat al servidor. Després envia una sol·licitud d'actualització de robots.txt a Google Search Console i envia el sitemap per accelerar el rerastreig. Les pàgines que ja han estat eliminades de l'índex poden trigar de diversos dies a setmanes a ser reindexades.
Glossari
- robots.txt
- Fitxer de text pla situat al directori arrel del lloc web, que segueix el Robots Exclusion Protocol, utilitzat per informar els rastrejadors de motors de cerca que compleixen les normes quins camins estan permesos/prohibits per al rastreig.
- Robots Exclusion Protocol (REP)
- Protocol d'exclusió de rastrejadors, proposat el 1994, estandarditzat com a RFC 9309 el 2022, és l'estàndard de fet per a la comunicació de regles de rastreig entre llocs web i rastrejadors.
- User-agent
- Camp inicial d'un grup de regles, que especifica el nom del rastrejador al qual s'apliquen les regles Allow/Disallow posteriors; el comodí * significa coincidir amb tots els rastrejadors.
- Disallow
- Directiva de prohibició de rastreig, que especifica els prefixos de camí als quals no es vol que els rastrejadors accedeixin. Per exemple, Disallow: /admin prohibeix rastrejar tots els camins que comencin per /admin.
- Allow
- Directiva de permís de rastreig, que especifica els camins als quals es permet explícitament l'accés dels rastrejadors. S'utilitza per obrir subcamins específics sota un camí pare Disallow.
- Sitemap
- Directiva de declaració de mapa del lloc, que informa els motors de cerca de l'URL completa del mapa del lloc XML del lloc web, ajudant els rastrejadors a descobrir i indexar eficientment totes les pàgines del lloc.
- Host
- Directiva de domini preferit, que especifica el domini principal del lloc (com ara example.com vs www.example.com), suportada per Yandex; Google ho configura mitjançant Search Console.
- Crawler/Bot/Spider
- Rastrejador/aranya/robot, programa automatitzat dels motors de cerca que accedeix automàticament a les pàgines web i recull contingut, com ara Googlebot, Bingbot, Baiduspider, etc.
- Googlebot
- Rastrejador web del motor de cerca Google, responsable de rastrejar contingut web perquè Google l'indexi i el classifiqui, és un dels rastrejadors de motors de cerca més comuns.
- Crawl Budget
- Pressupost/quota de rastreig, límit de freqüència de rastreig i nombre de pàgines que els motors de cerca assignen a cada lloc web. Configurar correctament robots.txt pot evitar malgastar la quota de rastreig.
- Prefix Matching
- Regla de coincidència de prefixos, mètode de coincidència de camins de robots.txt. El camí de l'URL coincideix si comença amb el valor de la regla; com més llarga és la regla, més alta és la seva prioritat.
- noindex
- Etiqueta meta HTML o directiva de capçalera HTTP (X-Robots-Tag: noindex), que diu als motors de cerca que no indexin aquesta pàgina als resultats de cerca. A diferència de Disallow de robots.txt, noindex és una forma més fiable d'eliminar de l'índex.
Noms User-agent de rastrejadors de motors de cerca comuns
Noms User-agent utilitzats en configurar regles per a rastrejadors específics:
| Nom del rastrejador | Motor de cerca propietari | Propòsit |
|---|---|---|
* | Tots els rastrejadors | Comodí, coincideix amb tots els rastrejadors no configurats individualment |
Googlebot | Rastrejador de rastreig web de la cerca Google | |
Bingbot | Bing/Microsoft | Rastrejador de rastreig web de la cerca Bing |
Baiduspider | Baidu | Rastrejador de rastreig web de la cerca Baidu |
YandexBot | Yandex | Rastrejador de rastreig web de la cerca Yandex |
GPTBot | OpenAI | Rastrejador de recopilació de dades d'entrenament de ChatGPT |
Twitterbot | X/Twitter | Rastrejador de previsualització de targetes d'enllaços de la plataforma X |
facebookexternalhit | Rastrejador de previsualització d'enllaços de Facebook |
Exemples de regles robots.txt d'ús comú
Configuracions de regles habituals per a diferents escenaris de llocs:
| Regla | Efecte |
|---|---|
Disallow: /admin/ | Prohibeix rastrejar tot el contingut del directori /admin/ |
Disallow: /*? | Prohibeix rastrejar URL amb paràmetres de consulta (Googlebot admet el comodí *) |
Disallow: /search | Prohibeix rastrejar pàgines de resultats de cerca interna del lloc |
Allow: /public/ | Permet explícitament rastrejar el directori /public/ |
Disallow: / | ⚠️ Prohibeix rastrejar tot el lloc (error fatal, utilitza amb precaució!) |
Allow: / | Permet rastrejar tot el contingut del lloc |
Taula de referència ràpida de directives estàndard de robots.txt
Directives estàndard i el seu ús definides per RFC 9309:
| Directiva | Àmbit | Exemple de format | Descripció |
|---|---|---|---|
User-agent | Inici de grup | User-agent: * | Especifica el nom del rastrejador al qual s'apliquen les regles |
Disallow | Dins del grup | Disallow: /admin | Prefix de camí prohibit per al rastreig |
Allow | Dins del grup | Allow: /public | Prefix de camí permès per al rastreig |
Sitemap | No de grup | Sitemap: https://example.com/sitemap.xml | Declara la ubicació del mapa del lloc (URL absolut) |
# | Qualsevol posició | # This is a comment | Línia de comentari, ignorada pels rastrejadors |
Privacy & Security
Totes les operacions d'aquest generador de Robots.txt es realitzen completament al teu navegador localment: totes les entrades de configuració com User-agent, regles de camí, Sitemap i Host s'assemblen en temps real mitjançant JavaScript a la memòria del navegador per generar el text de robots.txt, sense enviar-se per xarxa a cap servidor. Es pot utilitzar un cop carregada la pàgina, no utilitza seguiment per Cookie i no recull cap dada d'usuari. En tancar o refrescar la pàgina, tot el contingut de configuració s'esborra automàticament, sense emmagatzematge persistent al navegador.
Authoritative References
- Generador de Capçalera d'Autenticació
- Analitzador de Cache-Control
- Analitzador de Content-Disposition
- Generador de Capçaleres CORS
- Inspeccionador CORS
- Constructor de Polítiques CSP
- Convertidor cURL a codi
- Comprovació de Propagació DNS Global
- Consulta DNS
- Analitzador de Capçalera Forwarded
- Generador d'Etiquetes Hreflang
- Analitzador HSTS
- Analitzador de galetes HTTP
- Verificador de Capçaleres HTTP
- Prover de Sol·licituds HTTP
- Consulta de codis d'estat HTTP
- Cerca d'IP
- Convertidor IPv4
- Expansor de Rang IPv4
- Caixa d'eines IPv6
- Analitzador de Capçalera Link
- Consulta MX
- Verificador de Ports
- Generador de Paràmetres URL
- Analitzador de Capçalera de Límit de Freqüència
- Comprovador de cadena de reorientació
- Generador de Robots.txt
- Inspector de Robots.txt
- Verificador de Capçaleres de Seguretat
- Generador de Security.txt
- Analitzador de Set-Cookie
- Auditoria de Xarxa del Lloc
- Generador de Sitemap
- Inspector de Sitemap
- Verificador de Certificats SSL
- Calculadora de Subxarxes
- Analitzador d'URL
- Analitzador User-Agent
- Generador d'Enllaços UTM
- Prover de WebSocket
- What Is My IP?
- Consulta WHOIS