Генератор Robots.txt

Генератор правил robots.txt

Поддерживает многострочные Allow / Disallow / Sitemap, автоматически собирает стандартный формат.

Конфигурация правил
Сгенерированный результат

Онлайн-генератор Robots.txt от GeekFormat позволяет настраивать User-agent, правила Allow/Disallow, объявления Sitemap и директивы Host через визуальные формы, генерируя в реальном времени файлы robots.txt, соответствующие стандарту Robots Exclusion Protocol. Страница открывается с предустановленными значениями примера, изменение любого поля мгновенно обновляет предпросмотр, копирование в один клик готово к развёртыванию в корневом каталоге сайта. Работает полностью в браузере, данные конфигурации не отправляются ни на какие серверы.

Похожие

О Robots.txt и Протоколе исключения для краулеров

robots.txt — один из самых базовых способов коммуникации между сайтом и краулерами поисковых систем, полное название Robots Exclusion Protocol (Протокол исключения для роботов, сокращённо REP). Это простой текстовый файл, размещаемый в корневом каталоге сайта, который посредством простых директив сообщает совместимым краулерам поисковых систем, какие части сайта разрешено сканировать, а какие части нежелательно сканировать. robots.txt был первоначально предложен Martijn Koster в 1994 году; после почти 30 лет развития был официально стандартизирован IETF как RFC 9309 в 2022 году.

Базовая структура robots.txt состоит из одной или нескольких групп правил (Group). Каждая группа правил начинается с одной или нескольких строк User-agent, указывающих краулеров, к которым применяются правила (* обозначает всех краулеров); за ними следуют несколько строк Allow и Disallow, указывающих соответственно префиксы путей, разрешённых и запрещённых для сканирования; в конце файла могут быть добавлены внегрупповые директивы, такие как Sitemap и Host. Группы правил разделяются пустыми строками. Типичный robots.txt содержит: объявление User-agent → правила путей Allow/Disallow → (опционально) больше групп User-agent → объявление Sitemap → директива Host.

Поле User-agent указывает имя краулера, к которому применяются правила. Распространённые имена краулеров поисковых систем включают: Googlebot (поиск Google), Bingbot (поиск Bing), Baiduspider (поиск Baidu), YandexBot (поиск Yandex), DuckDuckBot (поиск DuckDuckGo), Twitterbot (захват карточек Twitter/X), facebookexternalhit (предпросмотр ссылок Facebook), GPTBot (краулер OpenAI GPT), Bytespider (поиск ByteDance/Toutiao) и др. Используйте User-agent: * как подстановочный знак для соответствия всем краулерам, не сопоставленным индивидуально.

Директивы Allow и Disallow используют принцип префиксного сопоставления (Prefix Matching): если путь URL начинается с указанного значения, правило срабатывает. Например, Disallow: /admin заблокирует /admin, /admin/, /admin/login.html, /administrator и все пути, начинающиеся с /admin. Если вы хотите точно соответствовать только каталогу /admin/, напишите Disallow: /admin/ (с косой чертой в конце). Согласно стандарту RFC 9309, когда Allow и Disallow совпадают одновременно, выигрывает правило с наиболее длинным путём; при равной длине приоритет имеет Allow. Это означает, что чем конкретнее правило, тем выше приоритет.

Директива Sitemap используется для информирования поисковых систем о расположении карты сайта, помогая краулерам более эффективно обнаруживать и индексировать страницы сайта. Строки Sitemap должны размещаться после всех групп правил (или в конце файла); URL должны быть полными абсолютными адресами (включая http:// или https://). В robots.txt может быть объявлено несколько Sitemap, каждый на отдельной строке. Крупные сайты обычно разделяют несколько Sitemap (классифицированных по типу контента, частоте обновления) и управляют ими единообразно через файл индекса Sitemap.

Директива Host — это нестандартная, но широко используемая директива, предложенная Yandex, используемая для указания предпочтительного домена сайта (основного зеркала). Например, когда example.com и www.example.com существуют одновременно, Host: example.com сообщает поисковым системам, что example.com является предпочтительным. Важно отметить: Google заявил, что не использует директиву Host, необходимо настраивать предпочтительный домен через Google Search Console; Bing также явно не поддерживает её. Директива Host должна размещаться после Sitemap и появляться только один раз.

Правильная настройка robots.txt имеет важное значение для SEO: во-первых, предотвращает растрату краулерами бюджета сканирования на бессмысленные страницы (например, страницы результатов поиска, страницы фильтров, страницы дублированного контента), позволяя им более эффективно сканировать ценный контент; во-вторых, предотвращает индексацию приватных или малоценных страниц (таких как админка, тестовые страницы, страницы печати); в-третьих, активно направляет краулеры на обнаружение новых страниц через Sitemap. Но важно помнить: robots.txt — это джентльменское соглашение, оно не заменяет реальные меры безопасности; URL с Disallow, на которые ведут внешние ссылки, всё ещё могут отображаться в результатах поиска (только содержимое не будет сканироваться); полный запрет сканирования может повлиять на общую оценку веса сайта.

Распространённые ошибки в robots.txt включают: ① неправильно написанный путь (например Disallow: admin без начальной косой черты, должно быть /admin); ② использование регулярных выражений (стандартный REP не поддерживает regex, только Googlebot поддерживает ограниченные подстановочные знаки * и $); ③ запрет сканирования JS/CSS файлов (это помешает Google отрисовывать страницы); ④ Disallow: / (запрет всего сайта, фатальная ошибка, приводящая к полной неиндексации); ⑤ проблема кодировки файла (должна быть кодировка UTF-8); ⑥ размещение в подкаталоге вместо корневого; ⑦ права доступа к файлу, препятствующие доступу (должен возвращаться код статуса 200 OK). Рекомендуется проверять после генерации с помощью инструмента тестирования robots.txt Google Search Console или инструмента проверки robots.txt этой платформы.

Варианты использования

  • Настройка базового robots.txt перед запуском нового сайта, чёткое определение разрешённых и запрещённых для сканирования путей, направление поисковых систем на правильное сканирование
  • Обновление правил Disallow после редизайна сайта для предотвращения дальнейшего сканирования старых каталогов, влияющих на распределение SEO-веса
  • Добавление нескольких адресов Sitemap для помощи поисковым системам в более быстром обнаружении структуры страниц всего сайта, повышение эффективности индексации
  • Блокировка административных каталогов (/admin), тестовых сред и приватных каталогов для предотвращения индексации краулерами, снижение рисков безопасности
  • Настройка директивы Host для указания предпочтительного домена сайта (с www или без www), уменьшение проблем дублированного контента
  • Настройка независимых правил сканирования для разных краулеров поисковых систем (Googlebot, Bingbot, Baiduspider и др.)
  • Временный запрет доступа краулеров к каталогам на обслуживании, открытие сканирования после завершения обновлений
  • Генерация файлов robots.txt в стандартном формате, предотвращение сбоев парсинга поисковыми системами из-за ошибок ручного форматирования
  • Настройка множественных Sitemap (например, sitemap статей, sitemap продуктов, sitemap изображений) для охвата всех типов контента сайта
  • Демонстрация настройки правил robots.txt в frontend-разработке, обучение стандартному формату протокола краулеров
  • Использование вместе с инструментом проверки robots.txt для проверки соответствия сгенерированных правил ожиданиям, предотвращение ошибочной блокировки важных страниц
  • Быстрое создание шаблона robots.txt, загрузка и тонкая настройка под реальную ситуацию сайта перед развёртыванием

Как использовать

  1. В поле ввода User-agent укажите целевой краулер (по умолчанию * представляет все краулеры поисковых систем)
  2. В области Allow введите пути, разрешённые для сканирования, по одному правилу на строку (например /, /blog/)
  3. В области Disallow введите пути, запрещённые для сканирования, по одному правилу на строку (например /admin, /private)
  4. В области Sitemap добавьте адреса XML-карты сайта (поддерживается многострочный ввод), в области Host введите предпочтительный домен
  5. Область предпросмотра справа в реальном времени отображает сгенерированное содержимое robots.txt, после подтверждения нажмите кнопку копирования для развёртывания

Функции

  • Независимая настройка множества правил: User-agent, Allow, Disallow, Sitemap и Host имеют отдельные области ввода, правила чётко классифицированы и не смешиваются
  • Генерация с предпросмотром в реальном времени: содержимое robots.txt мгновенно обновляется после изменения любого правила, без необходимости вручную нажимать кнопку генерации, что видите — то и получаете
  • Правило по умолчанию (fallback): когда Allow и Disallow пусты, автоматически генерируется Allow: /, что предотвращает создание пустых файлов, вызывающих неопределённое поведение краулера
  • Поддержка множественных Sitemap: область Sitemap поддерживает многострочный ввод, каждый URL выводится отдельной строкой объявления Sitemap, идеально для сайтов с несколькими Sitemap
  • Копирование и развёртывание в один клик: результат поддерживает копирование в буфер обмена в один клик, готов к прямой вставке в корневой каталог сайта
  • Предзаполненный пример по умолчанию: страница открывается с примером конфигурации (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), новички могут сразу ознакомиться и изменить
  • Стандартный формат вывода: строго соответствует спецификации Robots Exclusion Protocol, строка User-agent сначала, строки правил после, Sitemap/Host в конце, совместимо со всеми поисковыми системами
  • Интеллектуальная обработка путей: автоматически удаляет пробелы в начале/конце каждой строки, фильтрует пустые строки, предотвращая недействительность правил из-за лишних пробелов
  • Адаптивный макет в колонках: на ПК разделение слева направо (настройка/предпросмотр), на мобильных расположение сверху вниз, удобно на десктопе и телефоне
  • Предпросмотр моноширинным шрифтом: область предпросмотра использует моноширинный шрифт для отображения результата, формат robots.txt аккуратный и чёткий
  • Поддержка директивы Host: можно настроить предпочтительный домен Host (поддерживается поисковыми системами как Yandex), уменьшая проблемы дублированного контента домена
  • Полностью локальная работа в браузере: все настройки и генерация выполняются в локальном JavaScript браузера, данные не отправляются на серверы
  • Мгновенное использование без зависимостей: откройте страницу и используйте, без регистрации и входа, без установки ПО
  • Связь с инструментом проверки: связанные ссылки ведут непосредственно к инструменту проверки robots.txt, можно сразу проверить правильность правил после генерации

Часто задаваемые вопросы

Для чего нужен robots.txt? Почему у сайта должен быть этот файл?

robots.txt — это простой текстовый файл, размещаемый в корневом каталоге сайта, используемый для сообщения краулерам поисковых систем (таким как Googlebot, Bingbot, Baiduspider и др.), какие пути можно сканировать, а какие запрещены. Это реализация Robots Exclusion Protocol (Протокола исключения для роботов), являющаяся центральным файлом для управления сканированием сайта и базовых настроек SEO. Хотя это не является обязательным требованием, почти все регулярные сайты настраивают robots.txt для направления поведения краулеров.

Где должен размещаться файл robots.txt?

robots.txt должен размещаться в корневом каталоге сайта и быть доступным напрямую по адресу http://ваш-домен/robots.txt. Например, https://example.com/robots.txt. Внимание: не размещайте в подкаталогах (например /blog/robots.txt недействителен), краулеры ищут этот файл только в корневом каталоге. Имя файла должно быть полностью в нижнем регистре: robots.txt, не Robots.txt или ROBOTS.TXT.

Что генерируется, когда Allow и Disallow пусты?

Когда Allow и Disallow не заполнены, генератор автоматически выводит Allow: / как резервное правило, обозначающее разрешение сканирования всего сайта. Это предотвращает генерацию пустых файлов или неполных robots.txt только со строкой User-agent, предотвращая неопределённое поведение краулера из-за неясных правил.

Можно ли настроить несколько адресов Sitemap?

Да. Область Sitemap поддерживает многострочный ввод; каждый URL выводится отдельной строкой объявления Sitemap. Например, крупные сайты обычно имеют несколько файлов sitemap (sitemap статей, sitemap продуктов, sitemap изображений и т.д.), можно вводить по одному полному URL Sitemap на строку (должен быть полный абсолютный путь, включая http:// или https://).

Какова функция директивы Host? Все ли поисковые системы её поддерживают?

Директива Host используется для указания предпочтительного домена сайта (например example.com или www.example.com), помогая поисковым системам идентифицировать основной домен и уменьшая проблемы дублированного контента между версиями www и без www. В настоящее время директива Host поддерживается в основном поисковыми системами как Yandex; Google не использует её напрямую, предпочитая настраивать предпочтительный домен через Google Search Console. Рекомендуется настроить, но не полагаться полностью на неё.

Что означает User-agent: *? Как настроить правила для определённых краулеров?

User-agent: * означает, что правила применяются ко всем краулерам (звёздочка — подстановочный знак). Если нужно настроить независимые правила для конкретной поисковой системы, установите User-agent в конкретное имя краулера, например Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X) и т.д. Можно настроить несколько групп User-agent, разделённых пустыми строками.

Может ли robots.txt реально защитить чувствительные каталоги от доступа?

Нет. robots.txt — это лишь джентльменское соглашение; совместимые краулеры поисковых систем соблюдают правила, но вредоносные краулеры и хакерские сканеры могут полностью игнорировать его. Не полагайтесь на robots.txt для защиты действительно чувствительного контента (например, паролей админки, пользовательских данных конфиденциальности); чувствительные каталоги должны использовать серверную аутентификацию (защиту паролем, белый список IP) и другие реальные меры безопасности. Функция robots.txt — направлять совместимые краулеры, а не обеспечивать безопасность.

Каковы правила сопоставления путей для Disallow?

Правило Disallow использует префиксное сопоставление: Disallow: /admin будет соответствовать /admin, /admin/, /admin/login.html, /administrator и всем путям, начинающимся с /admin. Если вы хотите соответствовать только содержимому каталога /admin/, напишите Disallow: /admin/ (с завершающей косой чертой). Disallow: (пустое значение) означает не запрещать ни одного пути (т.е. всё разрешено). Внимание: правила чувствительны к регистру.

Как развернуть сгенерированный robots.txt на сайте?

Нажмите кнопку копирования, чтобы скопировать сгенерированное содержимое в буфер обмена; на сервере создайте простой текстовый файл с именем robots.txt, вставьте содержимое и загрузите файл в корневой каталог сайта (обычно web root, public_html, www или каталог dist). После развёртывания проверьте доступ по адресу https://ваш-домен/robots.txt, чтобы убедиться, что он работает; также можно использовать инструмент тестирования robots.txt Google Search Console для проверки правил.

Через какое время изменения в robots.txt вступают в силу?

В следующий раз, когда краулер поисковой системы посетит ваш сайт, он повторно просканирует файл robots.txt; обычно это вступает в силу в течение нескольких часов или дней. Если вы хотите, чтобы поисковые системы обнаружили обновление как можно скорее, отправьте запрос на обновление robots.txt в Google Search Console или Bing Webmaster Tools. Внимание: уже проиндексированные страницы могут оставаться в результатах поиска некоторое время даже после Disallow; полное удаление требует использования тега noindex или инструмента удаления URL.

Когда Allow и Disallow конфликтуют, какое имеет приоритет?

Согласно RFC 9309 (формальному стандарту Robots Exclusion Protocol), когда длины путей правил Allow и Disallow совпадают, Allow имеет приоритет над Disallow; когда длины различаются, правило с наиболее длинным соответствующим путём имеет приоритет. Например, при конфликте между Allow: /blog и Disallow: /blog/ доступ к /blog/post.html будет соответствовать Disallow (путь длиннее /blog/ > /blog), а доступ к самому /blog будет соответствовать Allow. Проще говоря, чем конкретнее правило, тем выше приоритет.

Можно ли добавлять комментарии в robots.txt?

Да, строки, начинающиеся с #, являются строками комментариев; краулеры игнорируют содержимое после #. Комментарии можно писать на отдельной строке или в конце строк правил (содержимое после #). Например: # Block admin area или Disallow: /admin # admin panel. Добавление уместных комментариев помогает вам и членам команды понять назначение каждого правила.

Должны ли URL Sitemap быть абсолютными путями?

Да, директива Sitemap должна использовать полный абсолютный URL (включая протокол и домен), например Sitemap: https://example.com/sitemap.xml. Нельзя использовать относительные пути (например /sitemap.xml), так как краулеры могут получать доступ к вашему сайту с разных доменов (например example.com и www.example.com), и относительные пути помешают краулерам определить правильный адрес.

Отправляются ли данные конфигурации на сервер?

Совершенно нет. Все настройки и генерация robots.txt выполняются локально в вашем браузере через JavaScript; введённые пути, домены и другие данные конфигурации не отправляются ни на какие внешние серверы. Страница может использоваться офлайн (базовые функции) после загрузки; при закрытии страницы данные автоматически очищаются без оставления записей.

Можно ли использовать сгенерированный robots.txt на любом сайте?

Да, генератор выводит простой текстовый файл в стандартном формате Robots Exclusion Protocol, подходящий для любого веб-сервера (Nginx, Apache, IIS, Caddy и др.) и любой платформы создания сайтов (WordPress, Shopify, Next.js, Django, Rails и др.). Просто разверните в корневом каталоге сайта и обеспечьте публичный доступ.

Устранение неполадок

Доступ к сгенерированному файлу возвращает ошибку 404?

Убедитесь, что файл robots.txt загружен в корневой каталог сайта (не в подкаталог), имя файла в нижнем регистре robots.txt, и права доступа к файлу установлены на публичное чтение (обычно достаточно разрешения 644). После загрузки напрямую обратитесь к https://ваш-домен/robots.txt в браузере, чтобы подтвердить видимость содержимого. Расположение корневого каталога зависит от сервера: Nginx/Apache обычно /var/www/html/ или /usr/share/nginx/html/, Vercel/Netlify обычно каталог public/.

Правила Disallow не работают, страницы всё ещё индексируются?

Возможные причины: ① краулер ещё не повторно просканировал robots.txt (подождите несколько дней или отправьте обновление в Search Console); ② неправильное префиксное сопоставление пути (например Disallow: admin без /, должно быть Disallow: /admin/); ③ страница была проиндексирована до добавления Disallow (уже проиндексированные страницы не удаляются автоматически); ④ вредоносные краулеры не соблюдают robots.txt; ⑤ существует конфликтующее правило Allow, перекрывающее Disallow (Allow имеет приоритет при более длинном пути). Для полного удаления из индекса используйте тег noindex.

Google Search Console сообщает, что robots.txt блокирует страницы?

Обычно это означает, что важные страницы были случайно заблокированы Disallow. Проверьте robots.txt на наличие слишком широких правил Disallow (например Disallow: / или Disallow: /*?), убедитесь, что CSS/JS файлы не запрещены (Google нуждается в сканировании этих файлов для отрисовки страниц). Используйте инструмент тестирования robots.txt в Search Console для ввода конкретных URL и проверки, какое правило блокирует.

Случайно установили Disallow: / и весь сайт был запрещён для сканирования?

Немедленно удалите или измените это правило, измените robots.txt на Allow: / или удалите строку Disallow: /, загрузите обновлённый файл на сервер. Затем отправьте запрос на обновление robots.txt в Google Search Console и отправьте sitemap для ускорения повторного сканирования. Страницы, уже удалённые из индекса, могут потребовать от нескольких дней до нескольких недель для повторной индексации.

Глоссарий

robots.txt
Простой текстовый файл, размещаемый в корневом каталоге сайта, соответствующий Robots Exclusion Protocol, используемый для информирования совместимых краулеров поисковых систем о том, какие пути разрешены/запрещены для сканирования.
Robots Exclusion Protocol (REP)
Протокол исключения для роботов, предложенный в 1994 году и стандартизированный как RFC 9309 в 2022 году, является де-факто стандартом для коммуникации правил сканирования между сайтами и краулерами.
User-agent
Начальное поле группы правил, указывает имя краулера, к которому применяются последующие правила Allow/Disallow; подстановочный знак * соответствует всем краулерам.
Disallow
Директива запрета сканирования, указывает префиксы путей, к которым краулерам нежелательно обращаться. Например, Disallow: /admin запрещает сканирование всех путей, начинающихся с /admin.
Allow
Директива разрешения сканирования, указывает пути, явно разрешённые для краулеров. Используется для открытия определённых подпутей под родительским путём Disallow.
Sitemap
Директива объявления карты сайта, информирует поисковые системы о полном URL XML-карты сайта, помогая краулерам эффективно обнаруживать и индексировать все страницы.
Host
Директива предпочтительного домена, указывает основной домен сайта (например example.com vs www.example.com); поддерживается Yandex, Google настраивается через Search Console.
Crawler/Bot/Spider
Краулер/бот/паук, автоматизированная программа поисковых систем, которая обращается к веб-страницам и собирает контент, например Googlebot, Bingbot, Baiduspider и др.
Googlebot
Веб-краулер поисковой системы Google, отвечающий за захват содержимого веб-страниц для индексации и ранжирования Google, является одним из наиболее распространённых краулеров.
Crawl Budget
Бюджет/квота сканирования, предел частоты сканирования и количества страниц, которые поисковые системы выделяют для каждого сайта. Правильная настройка robots.txt позволяет избежать растраты квоты сканирования.
Prefix Matching
Правило префиксного сопоставления, метод сопоставления путей robots.txt. Путь URL, начинающийся со значения правила, считается совпадением; чем длиннее правило, тем выше приоритет.
noindex
HTML meta-тег или директива HTTP-заголовка (X-Robots-Tag: noindex), сообщает поисковым системам не индексировать эту страницу в результатах поиска. В отличие от Disallow robots.txt, noindex является более надёжным способом удаления из индекса.

Имена User-agent распространённых краулеров поисковых систем

Имена User-agent, используемые при настройке правил для определённых краулеров:

Имя краулераПоисковая системаНазначение
*Все краулерыПодстановочный знак, соответствует всем краулерам, не настроенным индивидуально
GooglebotGoogleВеб-краулер поиска Google
BingbotBing/MicrosoftВеб-краулер поиска Bing
BaiduspiderBaiduВеб-краулер поиска Baidu
YandexBotYandexВеб-краулер поиска Yandex
GPTBotOpenAIКраулер сбора обучающих данных ChatGPT
TwitterbotX/TwitterКраулер предпросмотра карточек ссылок платформы X
facebookexternalhitFacebookКраулер предпросмотра ссылок Facebook

Примеры распространённых правил robots.txt

Настройки распространённых правил для различных сценариев сайтов:

ПравилоЭффект
Disallow: /admin/Запрещает сканирование всего содержимого в каталоге /admin/
Disallow: /*?Запрещает сканирование URL с параметрами запроса (Googlebot поддерживает подстановочный знак *)
Disallow: /searchЗапрещает сканирование страниц результатов внутреннего поиска
Allow: /public/Явно разрешает сканирование каталога /public/
Disallow: /⚠️ Запрещает сканирование всего сайта (фатальная ошибка, используйте с осторожностью!)
Allow: /Разрешает сканирование всего содержимого сайта

Таблица быстрого справочника стандартных директив robots.txt

Стандартные директивы и их использование, определённые RFC 9309:

ДирективаОбластьПример форматаОписание
User-agentНачало группыUser-agent: *Указывает имя краулера, к которому применяются правила
DisallowВнутри группыDisallow: /adminПрефикс пути, запрещённый для сканирования
AllowВнутри группыAllow: /publicПрефикс пути, разрешённый для сканирования
SitemapВне группыSitemap: https://example.com/sitemap.xmlОбъявляет расположение карты сайта (абсолютный URL)
#Любая позиция# This is a commentСтрока комментария, игнорируется краулерами

Privacy & Security

Все операции этого Генератора Robots.txt выполняются полностью локально в вашем браузере: вводимые конфигурации, такие как User-agent, правила путей, Sitemap и Host, собираются в реальном времени через JavaScript в памяти браузера для генерации текста robots.txt, не отправляясь по сети на какие-либо серверы. Страница готова к использованию после загрузки, не использует отслеживание через Cookie и не собирает никаких пользовательских данных. После закрытия или обновления страницы всё содержимое конфигурации автоматически очищается, без постоянного хранения в браузере.

Authoritative References