Generador de Robots.txt
Generador de reglas robots.txt
Soporta múltiples líneas Allow / Disallow / Sitemap, ensambla automáticamente el formato estándar.
El generador de Robots.txt en línea de GeekFormat le permite configurar reglas User-agent, Allow/Disallow, declaraciones Sitemap y directivas Host a través de un formulario visual, generando en tiempo real archivos robots.txt que cumplen con el protocolo Robots Exclusion Protocol. La página se abre con valores de ejemplo predeterminados: modifique cualquier campo para previsualizar los resultados instantáneamente, luego cópielos con un clic para implementarlos en el directorio raíz de su sitio web. Funciona completamente de forma local en su navegador; no se sube ningún dato de configuración a ningún servidor.
Relacionado
Acerca de Robots.txt y el protocolo de exclusión de robots
robots.txt es una de las formas más básicas en que los sitios web se comunican con los crawlers de motores de búsqueda, cuyo nombre completo es Robots Exclusion Protocol (protocolo de exclusión de robots, abreviado REP). Es un archivo de texto sin formato ubicado en el directorio raíz de un sitio web que utiliza directivas simples para indicar a los crawlers de motores de búsqueda conformes qué partes del sitio web se pueden rastrear y qué partes no se desea rastrear. robots.txt fue propuesto por primera vez por Martijn Koster en 1994; después de casi 30 años de desarrollo, fue formalmente estandarizado por la IETF como RFC 9309 en 2022.
La estructura básica de robots.txt consta de uno o más grupos de reglas. Cada grupo de reglas comienza con una o más líneas User-agent que especifican los crawlers a los que se aplican las reglas (* significa todos los crawlers); seguidas de varias líneas Allow y Disallow, que especifican respectivamente los prefijos de ruta permitidos y prohibidos para el rastreo; al final del archivo se pueden agregar directivas de nivel no grupo como Sitemap y Host. Cada grupo de reglas está separado por líneas vacías. Un robots.txt típico contiene: Declaración User-agent → Reglas de ruta Allow/Disallow → (opcional) grupos User-agent adicionales → Declaración Sitemap → Directiva Host.
El campo User-agent especifica el nombre del crawler al que se aplican las reglas. Los nombres de crawlers de motores de búsqueda comunes incluyen: Googlebot (búsqueda Google), Bingbot (búsqueda Bing), Baiduspider (búsqueda Baidu), YandexBot (búsqueda Yandex), DuckDuckBot (búsqueda DuckDuckGo), Twitterbot (recuperación de tarjetas Twitter/X), facebookexternalhit (vista previa de enlace Facebook), GPTBot (crawler OpenAI GPT), Bytespider (búsqueda ByteDance/Toutiao), etc. Utilice User-agent: * como comodín para coincidir con todos los crawlers no coincididos por separado.
Las directivas Allow y Disallow utilizan el principio de coincidencia de prefijo (Prefix Matching): siempre que una ruta URL comience con el valor especificado, la regla coincide. Por ejemplo, Disallow: /admin bloquea todas las rutas que comienzan con /admin, como /admin, /admin/, /admin/login.html, /administrator, etc. Si solo desea coincidir exactamente con el directorio /admin/, escriba Disallow: /admin/ (con barra diagonal final añadida). Según los estándares RFC 9309, cuando tanto Allow como Disallow coinciden, gana la regla con la ruta más larga; cuando las longitudes son iguales, Allow tiene prioridad. Esto significa que las reglas más específicas tienen mayor prioridad.
La directiva Sitemap informa a los motores de búsqueda de la ubicación de los sitemaps, ayudando a los crawlers a descubrir e indexar las páginas del sitio web de manera más eficiente. Las líneas Sitemap deben colocarse después de todos los grupos de reglas (o al final del archivo), y las URL deben ser direcciones absolutas completas (incluyendo http:// o https://). Se pueden declarar múltiples Sitemaps en un robots.txt, cada uno en su propia línea. Los sitios grandes generalmente se dividen en múltiples Sitemaps (categorizados por tipo de contenido, frecuencia de actualización), gestionados de manera unificada a través de un archivo de índice Sitemap.
La directiva Host es una directiva no estándar pero ampliamente utilizada propuesta por Yandex, utilizada para especificar el dominio preferido (espejo principal) de un sitio. Por ejemplo, cuando existen tanto example.com como www.example.com, Host: example.com indica a los motores de búsqueda que prefieran example.com. Nota: Google ha declarado que no utiliza la directiva Host; los dominios preferidos deben establecerse a través de Google Search Console; Bing tampoco la ha admitido explícitamente. La directiva Host debe colocarse después de Sitemap y solo puede aparecer una vez.
Configurar correctamente robots.txt tiene una importancia significativa para el SEO: en primer lugar, evita que los crawlers desperdicien el presupuesto de rastreo en páginas sin sentido (como páginas de resultados de búsqueda, páginas filtradas, páginas de contenido duplicado), permitiendo que los crawlers rastreen contenido de valor de manera más eficiente; en segundo lugar, evita que las páginas privadas o de bajo valor (como backends, páginas de prueba, páginas de impresión) sean indexadas; en tercer lugar, guía proactivamente a los crawlers hacia nuevas páginas a través de los Sitemaps. Pero tenga en cuenta: robots.txt es un acuerdo de caballeros y no puede reemplazar medidas de seguridad reales; las URL Disallow aún pueden mostrar URL en los resultados de búsqueda si hay enlaces externos que apuntan a ellas (el contenido simplemente no se rastreará); prohibir completamente el rastreo puede afectar la evaluación general del peso del sitio.
Los errores comunes de robots.txt incluyen: ① Errores de escritura de ruta (como Disallow: admin sin la barra diagonal inicial, debería ser /admin); ② Uso de expresiones regulares (el REP estándar no admite expresiones regulares, solo Googlebot admite comodines limitados * y $); ③ Prohibir el rastreo de archivos JS/CSS (lo que impide que Google renderice las páginas); ④ Disallow: / (prohibir todo el sitio, un error fatal que hace que el sitio no se indexe en absoluto); ⑤ Problemas de codificación de archivos (debe ser codificación UTF-8); ⑥ Ubicado en un subdirectorio en lugar del directorio raíz; ⑦ Acceso imposible debido a permisos de archivo (debe devolver el código de estado 200 OK). Se recomienda verificar después de la generación utilizando la herramienta de prueba robots.txt de Google Search Console o la herramienta de inspección robots.txt de esta plataforma.
Casos de uso
- Configurar un robots.txt básico antes del lanzamiento de un sitio nuevo para definir claramente las rutas permitidas y prohibidas para el rastreo, guiando a los motores de búsqueda a rastrear correctamente
- Actualizar las reglas Disallow después de un rediseño del sitio para evitar que los directorios antiguos sigan siendo rastreados, lo que podría afectar la distribución del peso SEO
- Agregar múltiples declaraciones de direcciones Sitemap para ayudar a los motores de búsqueda a descubrir más rápidamente la estructura completa de las páginas del sitio, mejorando la eficiencia de indexación
- Bloquear los directorios de administración del backend (/admin), entornos de prueba y directorios privados para que no sean indexados por los crawlers, reduciendo los riesgos de seguridad
- Establecer la directiva Host para especificar el dominio preferido de su sitio (con o sin www), reduciendo problemas de contenido duplicado
- Configurar reglas de rastreo independientes para diferentes crawlers de motores de búsqueda (Googlebot, Bingbot, Baiduspider, etc.)
- Bloquear temporalmente a los crawlers el acceso a directorios en mantenimiento, reabriendo el acceso de rastreo una vez completadas las actualizaciones del sitio
- Generar archivos robots.txt con formato correcto para evitar fallos de análisis de los motores de búsqueda debidos a errores de formato escritos a mano
- Configurar múltiples Sitemaps (por ejemplo, sitemap de artículos, sitemap de productos, sitemap de imágenes) para cubrir todos los tipos de contenido del sitio
- Demostración de desarrollo frontend de la configuración de reglas robots.txt, presentación educativa del formato estándar del protocolo de crawler
- Utilizar junto con una herramienta de inspección de robots.txt para verificar que las reglas generadas coincidan con las expectativas, evitando bloquear accidentalmente páginas importantes
- Crear rápidamente una plantilla robots.txt, descargarla, ajustarla a la situación real de su sitio y luego implementarla
Cómo Usar
- Especifique el crawler objetivo en el cuadro de entrada User-agent (el valor predeterminado * representa todos los crawlers de motores de búsqueda)
- Complete en el área Allow las rutas permitidas para el rastreo, una regla por línea (por ejemplo, /, /blog/)
- Complete en el área Disallow las rutas prohibidas para el rastreo, una regla por línea (por ejemplo, /admin, /private)
- Agregue direcciones de sitemap XML en el área Sitemap (admite multilínea) y complete su dominio preferido en el área Host
- El área de previsualización derecha muestra el contenido de robots.txt generado en tiempo real; una vez confirmado como correcto, haga clic en el botón de copia para implementar
Características
- Configuración independiente de múltiples reglas: Áreas de entrada separadas para User-agent, Allow, Disallow, Sitemap y Host mantienen las reglas claramente categorizadas en lugar de mezcladas
- Generación con previsualización en tiempo real: El contenido de robots.txt se actualiza instantáneamente cuando modifica cualquier regla, sin necesidad de hacer clic manualmente en un botón de generación; lo que ve es lo que obtiene
- Regla de respaldo predeterminada: Genera automáticamente Allow: / cuando tanto Allow como Disallow están vacíos, evitando archivos vacíos que causan un comportamiento indefinido del crawler
- Soporte para múltiples Sitemaps: El área Sitemap admite entrada multilínea, y cada URL se muestra como una línea de declaración Sitemap independiente, perfecta para sitios con múltiples Sitemaps
- Copia con un clic para implementación: Los resultados se pueden copiar al portapapeles con un clic, listos para pegar directamente en el directorio raíz de su sitio web para su implementación
- Ejemplo predeterminado rellenado previamente: La página se abre con una configuración de ejemplo predeterminada (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host) que los principiantes pueden consultar y modificar directamente
- Salida en formato estándar: Sigue estrictamente las especificaciones del protocolo Robots Exclusion Protocol: líneas User-agent primero, líneas de reglas después, Sitemap/Host al final, compatible con todos los motores de búsqueda
- Procesamiento inteligente de rutas: Recorta automáticamente los espacios en blanco al principio/final de cada línea y filtra las líneas vacías, evitando fallos de reglas debidos a espacios adicionales
- Diseño responsive de paneles divididos: Paneles divididos izquierda-derecha (configuración/previsualización) en escritorio, apilados arriba-abajo en móvil, funciona perfectamente tanto en escritorio como en teléfonos
- Previsualización con fuente monoespaciada: El área de previsualización utiliza fuente monoespaciada para mostrar los resultados generados, manteniendo el formato de robots.txt limpio y claro
- Soporte para la directiva Host: Configure su dominio Host preferido (compatible con Yandex y otros motores de búsqueda) para reducir problemas de contenido duplicado entre dominios
- Funciona completamente de forma local en el navegador: Todas las operaciones de configuración y generación se completan en JavaScript local del navegador; no se envía ningún dato a ningún servidor
- Uso instantáneo sin dependencias: Listo para usar en cuanto se abre la página, sin necesidad de registro, inicio de sesión ni instalación de software
- Vinculado con la herramienta de inspección: Los enlaces relacionados conducen directamente a la herramienta de inspección de robots.txt, lo que le permite verificar las reglas inmediatamente después de la generación
Preguntas Frecuentes
¿Para qué sirve robots.txt? ¿Por qué un sitio web necesita este archivo?
robots.txt es un archivo de texto sin formato ubicado en el directorio raíz de un sitio web, utilizado para indicar a los crawlers de motores de búsqueda (como Googlebot, Bingbot, Baiduspider, etc.) qué rutas se pueden rastrear y cuáles tienen prohibido el acceso. Es la implementación del protocolo Robots Exclusion Protocol (protocolo de exclusión de robots), el archivo central para la gestión del rastreo del sitio y la configuración SEO básica. Aunque no es estrictamente obligatorio, casi todos los sitios web legítimos configuran robots.txt para guiar el comportamiento de los crawlers.
¿Dónde debe ubicarse el archivo robots.txt?
robots.txt debe ubicarse en el directorio raíz del sitio web y ser accesible directamente en http://sudominio/robots.txt, por ejemplo https://example.com/robots.txt. Tenga en cuenta que ubicarlo en un subdirectorio (como /blog/robots.txt) no es válido: los crawlers solo buscan este archivo en el directorio raíz. El nombre del archivo debe estar completamente en minúsculas: robots.txt, no Robots.txt ni ROBOTS.TXT.
¿Qué contenido se genera cuando tanto Allow como Disallow están vacíos?
Cuando ni Allow ni Disallow están completos, el generador genera automáticamente Allow: / como regla de respaldo, lo que significa que se permite el rastreo de todo el sitio. Esto evita que se generen archivos vacíos o archivos robots.txt incompletos con solo líneas User-agent, evitando un comportamiento indefinido del crawler debido a reglas poco claras.
¿Puedo configurar múltiples direcciones Sitemap?
Sí. El área Sitemap admite entrada multilínea, y cada URL se mostrará como una línea de declaración Sitemap independiente. Por ejemplo, los sitios grandes suelen tener varios archivos sitemap (sitemap de artículos, sitemap de productos, sitemap de imágenes, etc.); puede completar una URL Sitemap completa por línea (debe ser una ruta absoluta completa que incluya http:// o https://).
¿Cuál es la función de la directiva Host? ¿Todos los motores de búsqueda la admiten?
La directiva Host especifica el dominio preferido de un sitio (como example.com o www.example.com), ayudando a los motores de búsqueda a identificar el dominio principal y reducir los problemas de contenido duplicado entre las versiones www y no www. Actualmente, la directiva Host es compatible principalmente con motores de búsqueda como Yandex; Google no utiliza directamente la directiva Host, sino que establece dominios preferidos a través de Google Search Console. Se recomienda configurarla pero no depender exclusivamente de ella.
¿Qué significa User-agent: *? ¿Cómo configuro reglas para crawlers específicos?
User-agent: * significa que las reglas se aplican a todos los crawlers (el asterisco es un comodín). Si necesita configurar reglas independientes para motores de búsqueda específicos, puede establecer User-agent en un nombre de crawler específico, como Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X), etc. Puede configurar varios grupos User-agent, separados por líneas vacías entre cada grupo.
¿Puede robots.txt proteger realmente los directorios sensibles del acceso?
No. robots.txt es solo un acuerdo de caballeros: los crawlers de motores de búsqueda conformes cumplen las reglas, pero los crawlers maliciosos y los escáneres de piratas informáticos pueden ignorarlo completamente. No confíe en robots.txt para proteger contenido realmente sensible (como contraseñas de backend, datos de privacidad del usuario); los directorios sensibles deben utilizar medidas de seguridad reales como autenticación en el lado del servidor (protección con contraseña, lista blanca de IP). El propósito de robots.txt es guiar a los crawlers conformes, no proporcionar protección de seguridad.
¿Cuál es la regla de coincidencia de ruta para Disallow?
Las reglas Disallow utilizan coincidencia de prefijo: Disallow: /admin coincide con todas las rutas que comienzan con /admin, como /admin, /admin/, /admin/login.html, /administrator, etc. Si solo desea coincidir con el contenido bajo el directorio /admin/, escriba Disallow: /admin/ (con barra diagonal final). Disallow: (valor vacío) significa que ninguna ruta está prohibida (es decir, todas están permitidas). Tenga en cuenta que las reglas distinguen entre mayúsculas y minúsculas.
¿Cómo implemento el robots.txt generado en mi sitio web?
Haga clic en el botón de copia para copiar el contenido generado en su portapapeles, luego cree un archivo de texto sin formato llamado robots.txt en su servidor, pegue el contenido y cargue el archivo en el directorio raíz de su sitio web (generalmente el directorio web root, public_html, www o dist). Después de la implementación, verifique que funcione accediendo a https://sudominio/robots.txt; también puede utilizar la herramienta de prueba robots.txt de Google Search Console para verificar las reglas.
¿Cuánto tiempo tardan los cambios en robots.txt en surtir efecto?
Los crawlers de motores de búsqueda recuperarán nuevamente el archivo robots.txt la próxima vez que visiten su sitio, generalmente surtiendo efecto en cuestión de horas a días. Si desea que los motores de búsqueda descubran la actualización lo antes posible, puede enviar una solicitud de actualización de robots.txt en Google Search Console o Bing Webmaster Tools. Nota: Las páginas ya indexadas pueden permanecer en los resultados de búsqueda durante un tiempo incluso después de ser Disallow; la eliminación completa requiere el uso de la etiqueta noindex o la herramienta de eliminación de URL.
¿Cuál tiene prioridad cuando Allow y Disallow entran en conflicto?
Según RFC 9309 (el estándar formal del protocolo Robots Exclusion Protocol), cuando las reglas Allow y Disallow tienen la misma longitud de ruta, Allow tiene prioridad sobre Disallow; cuando las longitudes de ruta difieren, la regla que coincide con la ruta más larga tiene prioridad. Por ejemplo, cuando Allow: /blog entra en conflicto con Disallow: /blog/, acceder a /blog/post.html coincide con Disallow (ruta más larga /blog/ > /blog), mientras que acceder a /blog en sí coincide con Allow. En términos simples, las reglas más específicas tienen mayor prioridad.
¿Puedo agregar comentarios en robots.txt?
Sí, las líneas que comienzan con # son líneas de comentario, y los crawlers ignoran el contenido después de #. Los comentarios pueden estar en su propia línea o al final de una línea de regla (después de #). Por ejemplo: # Block admin area o Disallow: /admin # admin panel. Agregar comentarios apropiados le ayuda a usted y a los miembros del equipo a comprender qué hace cada regla.
¿Las URL Sitemap deben ser rutas absolutas?
Sí, las directivas Sitemap deben utilizar URL absolutas completas (incluyendo protocolo y dominio), como Sitemap: https://example.com/sitemap.xml. No se pueden utilizar rutas relativas (como /sitemap.xml) porque los crawlers pueden acceder a su sitio desde diferentes dominios (como example.com y www.example.com), y las rutas relativas impedirían que los crawlers determinen la dirección correcta.
¿Se suben los datos de configuración al servidor?
En absoluto. Todas las operaciones de configuración y generación de robots.txt se completan localmente en su navegador a través de JavaScript; los datos de configuración, como las rutas y dominios ingresados, no se envían a ningún servidor externo. La página se puede utilizar sin conexión (funcionalidades básicas) una vez cargada; los datos se borran automáticamente cuando cierra la página, sin dejar registros.
¿Se puede utilizar el robots.txt generado en cualquier sitio web?
Sí, el generador produce un archivo de texto sin formato en formato estándar Robots Exclusion Protocol, adecuado para cualquier servidor web (Nginx, Apache, IIS, Caddy, etc.) y cualquier plataforma de creación de sitios (WordPress, Shopify, Next.js, Django, Rails, etc.). Simplemente impleméntelo en el directorio raíz de su sitio web y asegúrese de que sea accesible públicamente.
Solución de problemas
¿El acceso al archivo generado devuelve un error 404?
Confirme que el archivo robots.txt se haya cargado en el directorio raíz del sitio web (no en un subdirectorio), que el nombre del archivo esté completamente en minúsculas como robots.txt y que los permisos del archivo estén configurados como lectura pública (generalmente los permisos 644 son suficientes). Después de cargar, acceda directamente en un navegador a https://sudominio/robots.txt para confirmar que puede ver el contenido. Las ubicaciones de los directorios raíz varían según el servidor: Nginx/Apache generalmente es /var/www/html/ o /usr/share/nginx/html/, Vercel/Netlify generalmente es el directorio public/.
Las reglas Disallow no funcionan, ¿las páginas siguen indexadas?
Posibles causas: ① Los crawlers aún no han recuperado nuevamente robots.txt (espere unos días o envíe una actualización en Search Console); ② Coincidencia de prefijo de ruta incorrecta (por ejemplo, Disallow: admin sin /, debería ser Disallow: /admin/); ③ Las páginas ya estaban indexadas antes de agregar Disallow (las páginas ya indexadas no se eliminan automáticamente); ④ Los crawlers maliciosos no respetan robots.txt; ⑤ Conflicto de regla Allow sobrescribe Disallow (Allow tiene prioridad cuando la ruta es más larga). Para eliminar completamente del índice, utilice la etiqueta noindex.
¿Google Search Console informa que robots.txt está bloqueando páginas?
Esto generalmente significa que páginas importantes han sido accidentalmente Disallow. Verifique robots.txt en busca de reglas Disallow demasiado amplias (como Disallow: / o Disallow: /*?) y asegúrese de que los archivos CSS/JS no estén bloqueados (Google necesita recuperar estos archivos para renderizar las páginas). Utilice la herramienta de prueba robots.txt de Search Console para ingresar URL específicas y probar qué regla las está bloqueando.
¿Estableció accidentalmente Disallow: /, lo que provocó que se prohibiera el rastreo de todo el sitio?
Elimine o modifique inmediatamente esa regla, cambie robots.txt a Allow: / o elimine la línea Disallow: /, y cargue el archivo actualizado en el servidor. Luego envíe una solicitud de actualización de robots.txt en Google Search Console, y envíe un sitemap para acelerar el re-rastreo. Las páginas ya eliminadas del índice pueden tardar días o semanas en volver a indexarse.
Glosario
- robots.txt
- Un archivo de texto sin formato ubicado en el directorio raíz del sitio web, que sigue el protocolo Robots Exclusion Protocol, utilizado para indicar a los crawlers de motores de búsqueda conformes qué rutas están permitidas/prohibidas para el rastreo.
- Robots Exclusion Protocol (REP)
- El protocolo de exclusión de robots, propuesto en 1994 y estandarizado como RFC 9309 en 2022, es el estándar de facto para la comunicación de reglas de rastreo entre sitios web y crawlers.
- User-agent
- El campo de inicio de un grupo de reglas, que especifica el nombre del crawler al que se aplican las siguientes reglas Allow/Disallow; el comodín * coincide con todos los crawlers.
- Disallow
- Directiva de prohibición de rastreo, que especifica los prefijos de ruta a los que no desea que los crawlers accedan. Por ejemplo, Disallow: /admin prohíbe el rastreo de todas las rutas que comienzan con /admin.
- Allow
- Directiva de permiso de rastreo, que especifica las rutas para las que el acceso del crawler está explícitamente permitido. Se utiliza para abrir subrutas específicas bajo una ruta padre Disallow.
- Sitemap
- Directiva de declaración Sitemap, que indica a los motores de búsqueda la URL completa del sitemap XML del sitio web, ayudando a los crawlers a descubrir e indexar eficazmente todas las páginas del sitio.
- Host
- Directiva de dominio preferido, que especifica el dominio principal del sitio (como example.com frente a www.example.com); compatible con Yandex, Google utiliza Search Console para la configuración.
- Crawler/Bot/Spider
- Programas automatizados utilizados por los motores de búsqueda para acceder automáticamente a las páginas web y recopilar contenido, como Googlebot, Bingbot, Baiduspider, etc.
- Googlebot
- El crawler web del motor de búsqueda Google, responsable de recuperar contenido web para la indexación y clasificación de Google, uno de los crawlers de motores de búsqueda más comunes.
- Crawl Budget
- Presupuesto/cuota de rastreo, la frecuencia de rastreo y el límite de número de páginas asignados por los motores de búsqueda a cada sitio web. La configuración correcta de robots.txt puede evitar el desperdicio de cuota de rastreo.
- Prefix Matching
- Regla de coincidencia de prefijo, el método de coincidencia de ruta de robots.txt. Una coincidencia tiene éxito si la ruta URL comienza con el valor de regla; las reglas más largas tienen mayor prioridad.
- noindex
- Etiqueta meta HTML o directiva de encabezado HTTP (X-Robots-Tag: noindex), que indica a los motores de búsqueda que no incluyan la página en el índice de búsqueda. A diferencia de Disallow de robots.txt, noindex es un método más confiable para eliminar del índice.
Nombres User-agent comunes de crawlers de motores de búsqueda
Nombres User-agent utilizados al configurar reglas para crawlers específicos:
| Nombre del crawler | Motor de búsqueda propietario | Propósito |
|---|---|---|
* | Todos los crawlers | Comodín, coincide con todos los crawlers no configurados por separado |
Googlebot | Crawler de rastreo web de la búsqueda Google | |
Bingbot | Bing/Microsoft | Crawler de rastreo web de la búsqueda Bing |
Baiduspider | Baidu | Crawler de rastreo web de la búsqueda Baidu |
YandexBot | Yandex | Crawler de rastreo web de la búsqueda Yandex |
GPTBot | OpenAI | Crawler de rastreo de datos de entrenamiento ChatGPT |
Twitterbot | X/Twitter | Crawler de vista previa de tarjeta de enlace de la plataforma X |
facebookexternalhit | Crawler de vista previa de enlace Facebook |
Ejemplos de reglas robots.txt de uso común
Configuraciones de reglas comunes para diferentes escenarios de sitio:
| Regla | Efecto |
|---|---|
Disallow: /admin/ | Prohibir el rastreo de todo el contenido bajo el directorio /admin/ |
Disallow: /*? | Prohibir el rastreo de URL con parámetros de consulta (Googlebot admite el comodín *) |
Disallow: /search | Prohibir el rastreo de páginas de resultados de búsqueda interna del sitio |
Allow: /public/ | Permitir explícitamente el rastreo del directorio /public/ |
Disallow: / | ⚠️ Prohibir el rastreo de todo el sitio (error fatal, ¡úselo con precaución!) |
Allow: / | Permitir el rastreo de todo el contenido de todo el sitio |
Referencia rápida de directivas estándar robots.txt
Directivas estándar y uso definidos por RFC 9309:
| Directiva | Ámbito | Ejemplo de formato | Descripción |
|---|---|---|---|
User-agent | Inicio de grupo | User-agent: * | Especifica el nombre del crawler al que se aplican las reglas |
Disallow | En grupo | Disallow: /admin | Prefijo de ruta prohibido para el rastreo |
Allow | En grupo | Allow: /public | Prefijo de ruta permitido para el rastreo |
Sitemap | Nivel no grupo | Sitemap: https://example.com/sitemap.xml | Declara la ubicación del sitemap (URL absoluta) |
# | Cualquier posición | # This is a comment | Línea de comentario, ignorada por los crawlers |
Privacy & Security
Todas las operaciones de este Generador de Robots.txt se completan completamente de forma local en su navegador: User-agent, reglas de ruta, Sitemap, Host y otras entradas de configuración se ensamblan todas en tiempo real en la memoria del navegador a través de JavaScript en texto robots.txt, y no se envían a través de la red a ningún servidor. Listo para usar en cuanto se carga la página; no utiliza seguimiento de cookies, no recopila ningún dato de usuario. Después de cerrar o actualizar la página, todo el contenido de configuración se borra automáticamente y no se almacenará de forma persistente en el navegador.
Authoritative References
- Generador de cabecera Authentication
- Analizador de Cache-Control
- Analizador de Content-Disposition
- Generador de cabeceras CORS
- Inspector CORS
- Generador de CSP
- Generador de código cURL
- Verificación de Propagación DNS Global
- Consulta DNS
- Analizador de cabecera Forwarded
- Generador de etiquetas hreflang
- Analizador de HSTS
- Analizador de cookies HTTP
- Comprobador de cabeceras HTTP
- Probador de peticiones HTTP
- Consulta de códigos de estado HTTP
- Búsqueda de IP
- Convertidor IPv4
- Expansor de Rango IPv4
- Caja de Herramientas IPv6
- Analizador de Cabecera Link
- Consulta MX
- Verificador de Puertos
- Constructor de Parámetros URL
- Analizador de Cabeceras de Límite de Tasa
- Comprobador de Cadenas de Redirección
- Generador de Robots.txt
- Verificador de robots.txt
- Verificador de Cabeceras de Seguridad
- Generador de Security.txt
- Analizador Set-Cookie
- Auditoría de Red del Sitio
- Generador de Sitemap
- Inspector de Sitemap
- Comprobador de Certificados SSL
- Calculadora de Subredes
- Analizador de URL
- Analizador User-Agent
- Generador de Enlaces UTM
- Probador de WebSocket
- ¿Cuál es mi IP?
- Consulta WHOIS