Генератор Sitemap

Генератор sitemap.xml

Введите список URL, задайте changefreq, priority и lastmod глобально, генерируйте XML-карты сайта по стандарту sitemap.org в один клик.

Ввод и параметры
XML-вывод
3 действительных URL, размер 483 байт

Создавайте онлайн XML-файлы карты сайта Sitemap в соответствии с открытым стандартом протокола sitemap.org 0.9. Поддерживает полную настройку семи частот обновления changefreq, относительного приоритета priority от 0.0 до 1.0 и выбора даты lastmod. Предлагает автоматическое экранирование XML-сущностей, обнаружение недействительных URL в реальном времени, структурированный XML-предпросмотр в реальном времени, функции скачивания и копирования в один клик. Помогает ведущим поисковым системам, таким как Google и Bing, быстро находить и эффективно индексировать все важные страницы вашего сайта.

Похожие

Варианты использования

  • После запуска нового сайта создавайте пакетные Sitemap для основных страниц и отправляйте их в Google Search Console и Bing Webmaster Tools для ускорения обнаружения и индексации поисковыми системами
  • После редизайна сайта или изменения структуры URL заново генерируйте Sitemap и обновляйте индекс поисковых систем, чтобы битые ссылки не влияли на SEO-показатели
  • Для сайтов электронной коммерции импортируйте пакетно URL-адреса списков товаров и устанавливайте различные значения changefreq и priority в зависимости от категории товара и даты публикации
  • Для крупных порталов или новостных сайтов с более чем 50 000 URL разделяйте Sitemap по каналам и создавайте файл Sitemap Index
  • Для блогов настраивайте подходящие частоты обновления и параметры приоритета для страниц статей, страниц тегов, страниц категорий и страниц архивов
  • Для корпоративных сайтов упорядочивайте различные типы URL, такие как страницы продуктов, страницы новостей, страницы «О нас» и страницы контактов, устанавливая дифференцированные значения lastmod и priority
  • После завершения миграции сайта (обновление HTTP до HTTPS, смена домена) заново генерируйте Sitemap и отправляйте её, чтобы направить краулеров на быстрое сканирование новых адресов
  • Вручную дополняйте Sitemap, генерируемые плагинами вроде Yoast SEO, добавляя URL специальных страниц, не охваченных плагином
  • После SEO-диагностики и оптимизации заново генерируйте Sitemap, чтобы обеспечить корректность настроек priority важных страниц и повысить вес сканирования высокоценных страниц
  • Перед объявлением местоположения Sitemap в robots.txt используйте этот инструмент для проверки корректности XML-формата, чтобы избежать ошибок парсинга краулерами

Как использовать

  1. В области ввода URL вставьте список адресов страниц, подлежащих индексации, по одному полному URL в строке (должен содержать заголовок протокола http:// или https://)
  2. В выпадающем меню changefreq выберите частоту обновления страницы: для главной страницы выберите daily или hourly, для страниц статей — weekly, для статических страниц — yearly или monthly
  3. Перетащите ползунок priority или введите значение между 0.0 и 1.0 для установки приоритета: главную страницу установите на 1.0, важные страницы категорий на 0.8, обычные страницы статей на 0.5, страницы архивов на 0.3
  4. Нажмите на выбор даты lastmod, выберите дату последнего изменения содержимого сайта или оставьте поле lastmod пустым
  5. Проверьте в правой области предпросмотра в реальном времени, правильна ли сгенерированная XML-структура; недействительные URL будут помечены красным для исправления
  6. После подтверждения нажмите кнопку «Скачать sitemap.xml» для сохранения файла или кнопку «Копировать» для копирования XML-содержимого в буфер обмена
  7. Загрузите sitemap.xml в корневой каталог сайта, добавьте объявление Sitemap в robots.txt или отправьте напрямую в Google Search Console/Bing Webmaster

Функции

  • Поддержка пакетного ввода URL: один URL в строке, автоматическая фильтрация пустых строк и повторяющихся ссылок для быстрой обработки больших объёмов адресов страниц
  • Автоматическое экранирование XML-сущностей: специальные символы &, <, >, ", ' в URL автоматически экранируются в &amp;, &lt;, &gt;, &quot;, &apos;, полностью исключая ошибки парсинга XML
  • 7 вариантов частоты обновления changefreq: always, hourly, daily, weekly, monthly, yearly, never — покрывают все сценарии типов страниц
  • Точная настройка приоритета priority: поддерживает произвольные значения в диапазоне от 0.0 до 1.0 с точностью до одного знака после запятой для различения важности страниц
  • Выбор даты lastmod для времени последнего изменения: визуальный календарь, автоматическое форматирование в стандартный формат W3C Datetime (YYYY-MM-DD)
  • Обнаружение недействительных URL в реальном времени: автоматическое распознавание URL с ошибками формата (отсутствующий протокол, недопустимые символы и т.д.) с указанием номера проблемной строки для исправления
  • Генерация предпросмотра в реальном времени: XML-содержимое обновляется мгновенно при изменении списка URL или параметров конфигурации — не нужно вручную нажимать кнопку генерации
  • Скачивание sitemap.xml в один клик: сгенерированные результаты загружаются напрямую как стандартный XML-файл и могут быть немедленно загружены на сервер сайта
  • Предупреждение о лимите URL: автоматическое уведомление при достижении 50 000 URL о необходимости использования решения разделения через Sitemap Index
  • Копирование в буфер обмена: копирование полного XML-содержимого в буфер обмена в один клик для прямой вставки в серверные файлы или онлайн-отправки
  • Статистика размера в байтах: отображение в реальном времени размера в байтах сгенерированного XML-файла Sitemap для оценки соответствия ограничениям поисковых систем
  • Вывод стандартного корневого элемента urlset: строго соответствует спецификации протокола http://www.sitemaps.org/schemas/sitemap/0.9 с правильным объявлением пространства имён xmlns
  • Объявление кодировки UTF-8: автоматическое добавление объявления XML-кодировки для обеспечения корректной обработки многоязычных URL без ошибок кодировки

Часто задаваемые вопросы

Обязательно ли отправлять Sitemap? Будет ли сайт не проиндексирован без отправки?

Сайт может быть проиндексирован и без отправки Sitemap — поисковые системы могут обнаруживать ваши страницы через обратные ссылки с других сайтов и отслеживание внутренних ссылок. Однако отправка Sitemap может значительно ускорить скорость обнаружения, особенно для новых сайтов, крупных сайтов и сайтов с неполными внутренними ссылками. Google официально рекомендует всем сайтам отправлять Sitemap. Это базовая SEO-работа с очень низкими затратами и высокой отдачей.

Должны ли URL в Sitemap быть абсолютными путями? Можно ли писать относительные пути?

Должны быть полностью абсолютные URL, включающие заголовок протокола (http:// или https://) и полное доменное имя. Нельзя использовать относительные пути (вроде /page1.html) или формы без протокола. Поисковым системам нужны полные URL для корректного парсинга и сканирования Sitemap. Относительные пути приводят к ошибкам парсинга.

Действительно ли полезны настройки changefreq и priority? Будут ли поисковые системы их соблюдать?

Оба поля — «рекомендации», а не «директивы». Поисковые системы не обязательно соблюдают их на 100%, но точные настройки всё же имеют референсную ценность. Для сравнения, lastmod (время последнего изменения) — наиболее учитываемое поисковыми системами поле из трёх, поскольку оно может напрямую сообщать краулерам, есть ли на странице новый контент. Не устанавливайте нечестно все страницы на наивысший приоритет или always, поскольку это приведёт к тому, что поисковые системы перестанут доверять этим метаданным.

Должен ли файл Sitemap размещаться в корневом каталоге сайта?

Необязательно. Sitemap может размещаться по любому пути на сайте, если URL нормально доступен. Однако robots.txt должен размещаться в корневом каталоге. Если вы разделили несколько дочерних Sitemap с помощью Sitemap Index, нет ограничений на пути дочерних Sitemap. Однако по привычке размещение в корневом каталоге удобнее всего для управления и проще всего для обнаружения краулерами.

На сайте меньше 50 000 URL, но размер файла превышает 50 МБ — что делать?

Sitemap должна быть разделена. 50 000 URL и 50 МБ — два параллельных ограничения. При выполнении любого из условий превышения необходимо разделение. Вы можете разделить по типу контента или упростить Sitemap (например, удалив лишние пробелы и отступы, используя сжатие gzip). Однако если после сжатия она всё равно превышает 50 МБ, она должна быть разделена.

Могут ли в Sitemap содержаться страницы noindex или URL, запрещённые robots.txt?

Не рекомендуется. Sitemap должна содержать только страницы, которые вы хотите, чтобы поисковые системы сканировали и индексировали. Страницы noindex, страницы, запрещённые Disallow, страницы, требующие входа, и страницы с ошибкой 404 не должны появляться в Sitemap. Это снижает доверие поисковых систем к Sitemap и тратит бюджет сканирования.

Нужно ли повторно отправлять Sitemap после обновлений содержимого? Как часто следует обновлять Sitemap?

Пока URL файла Sitemap остаётся неизменным, поисковые системы периодически пересканируют. Нет необходимости повторно отправлять её вручную каждый раз при обновлении содержимого. Частота обновления зависит от частоты обновления содержимого вашего сайта: новостные сайты могут обновлять Sitemap ежедневно или даже ежечасно (автоматически генерируемую), корпоративные сайты — раз в неделю или месяц. Серверные скрипты можно настроить на автоматическое обновление файла Sitemap.

URL на каких языках поддерживает Sitemap? Нужно ли кодировать не-ASCII URL (в том числе кириллические)?

Sitemap поддерживает URL на любых языках, но URL с не-ASCII-символами (в том числе кириллические домены, кириллические пути, иероглифы, специальные символы) должны быть URL-закодированы (также называемое процентным кодированием, percent-encoding). Например, «страница» кодируется как %D1%81%D1%82%D1%80%D0%B0%D0%BD%D0%B8%D1%86%D0%B0. Большинство браузеров и инструментов обрабатывают это автоматически, но вам нужно убедиться, что URL в сгенерированной Sitemap закодированы правильно.

Можно ли отправлять несколько Sitemap одновременно? Например, одновременно Sitemap статей и Sitemap продуктов?

Да, есть два способа: ①Использовать файл Sitemap Index для единообразного управления всеми дочерними Sitemap. Это рекомендуемый метод, вам нужно отправить только URL файла индекса; ②Отправлять URL каждой дочерней Sitemap по отдельности на платформе веб-мастеров. Этот метод также возможен, но управление более сложное. Оба метода эффективны, поисковые системы будут сканировать оба.

Нужно ли сжимать сгенерированную Sitemap с помощью gzip? В чём преимущества сжатия?

Сжатие не является обязательным, но настоятельно рекомендуется. Сжатие gzip обычно уменьшает размер Sitemap на 70-80%, экономя пропускную способность и время сканирования краулеров, особенно для крупных сайтов эффект очевиден. Поисковые системы полностью поддерживают сжатый формат sitemap.xml.gz и автоматически распаковывают его. Пока после сжатия не превышает 50 МБ, всё в порядке.

Нужно ли отправлять Sitemap для обеих версий сайта — HTTP и HTTPS?

Вы должны отправлять только предпочтительную версию, которую хотите видеть проиндексированной. Если весь сайт использует HTTPS и выполнено перенаправление 301 с HTTP на HTTPS, необходимо отправить только HTTPS-версию Sitemap. Не отправляйте одновременно и HTTP, и HTTPS версии, поскольку это приводит к проблемам дублирующего контента. Аналогично для www и не-www необходимо определить предпочтительный домен и отправлять только Sitemap предпочтительного домена.

WordPress сгенерировал Sitemap с помощью Yoast SEO — нужен ли ещё этот инструмент?

Yoast SEO может автоматически генерировать Sitemap для большинства страниц, но может пропустить некоторые страницы — например вручную созданные отдельные страницы, неправильно настроенные пользовательские типы записей, специальные целевые страницы, внешне импортированные страницы и т.д. Вы можете использовать этот инструмент для дополнения этих URL, не охваченных Yoast, генерации отдельной дополнительной Sitemap или проверки полноты и правильности Sitemap, сгенерированной Yoast.

Важен ли порядок URL в Sitemap? Полезно ли размещать важные страницы в начале?

В протоколе Sitemap порядок URL не имеет какого-либо официального веса. Поисковые системы не сканируют URL предпочтительно только потому, что они размещены в начале. Однако некоторые SEO-специалисты наблюдали небольшой эффект предпочтения порядка. Поэтому размещение важных URL в начале не вредит, но не ожидайте от этого заметного эффекта. Вам следует по-прежнему правильно помечать приоритет через поле priority.

Нужно ли включать в Sitemap страницы с пагинацией (вроде /list?page=2, /page/3)?

Это зависит от ценности содержимого с пагинацией. Если пагинация представляет собой повторяющиеся списки вроде «показать больше» (например, страница 2, страница 3 списков статей), обычно не рекомендуется включать их в Sitemap, поскольку эти страницы имеют повторяющееся содержимое и низкую ценность. Акцент следует делать на главной странице списка и конкретных страницах статей. Однако если страницы с пагинацией имеют уникальное содержимое (например, просмотр по категориям, пагинация с самостоятельной ценностью), их можно включать с более низким priority.

Как проверить, правильна ли и действительна ли Sitemap?

Есть несколько способов проверки: ①После генерации этим инструментом сначала просмотрите локально структуру XML, проверьте нормальность закрытия тегов, пространств имён и экранирующих символов; ②Используйте инструмент sitemap-inspector для онлайн-проверки формата и доступности URL, пакетной проверки кодов статуса HTTP всех URL; ③После загрузки получите прямой доступ к URL Sitemap в браузере, чтобы увидеть, отображается ли она нормально без ошибок парсинга XML; ④После отправки в Google Search Console/Bing Webmaster Tools просмотрите отчёт о статусе, чтобы увидеть, есть ли сообщения об ошибках вроде ошибок формата, недоступности URL, превышения ограничений — это наиболее авторитетный метод проверки; ⑤Также можно использовать онлайн-инструменты проверки XML для проверки правильности синтаксиса XML.

Устранение неполадок

Сгенерированная XML-Sitemap при открытии в браузере показывает ошибки парсинга, указывая на неправильный формат

URL содержат специальные XML-символы вроде &, <, >, которые не были экранированы: при вставке инструмент автоматически экранировал, но если вы редактировали файл вручную, экранирование могло быть пропущено Неправильно написаны объявление XML или пространство имён urlset: проверьте, полностью ли значение xmlns в первой строке соответствует http://www.sitemaps.org/schemas/sitemap/0.9, без лишних косых черт Теги не закрыты правильно: все открывающие теги вроде &lt;url&gt;, &lt;loc&gt; должны иметь соответствующие закрывающие теги &lt;/url&gt;, &lt;/loc&gt;, самозакрывающиеся теги не должны быть написаны неправильно Кодировка файла — не UTF-8 без BOM: Блокнот Windows может сохранить в кодировке UTF-8 с BOM или Windows-1251, что вызывает ошибки парсинга; сохраняйте как UTF-8 без BOM URL содержат недопустимые символы: не-ASCII URL (в том числе кириллические) должны быть URL-закодированы (percent-encoding), незакодированные специальные символы приводят к ошибкам парсинга XML Неправильное объявление версии XML: первая строка должна быть &lt;?xml version="1.0" encoding="UTF-8"?&gt;, не пишите 1.1 или другие версии Неправильный порядок вложенности тегов: подтеги должны быть полностью содержаться в родительских тегах, без перекрёстной вложенности, как в неправильном порядке &lt;url&gt;&lt;loc&gt;&lt;/url&gt;&lt;/loc&gt;

После отправки Sitemap в Google Search Console отображается «Не удалось прочитать Sitemap» или «Ошибка формата»

URL файла Sitemap недоступен: проверьте, возвращает ли прямой доступ к URL Sitemap в браузере код статуса 200, без ошибок 403/404/500 Сервер возвращает неправильный Content-Type: должен возвращать application/xml или text/xml, возврат text/html приводит к ошибкам идентификации Sitemap содержит URL, запрещённые robots.txt: GSC сообщает об ошибке при обнаружении путей Disallow в Sitemap Проблема перенаправления URL: если URL Sitemap перенаправляет с 301/302 на другой адрес, это вызывает ошибки. Убедитесь, что URL напрямую доступны без перенаправлений HTTP/HTTPS или www/не-www не совпадают: домен отправленной Sitemap не соответствует домену, подтверждённому в GSC (например, подтверждён www.example.com, а Sitemap использует example.com) Файл Sitemap слишком большой, превышает ограничение в 50 МБ или URL превышают 50 000: GSC напрямую отклоняет обработку файлов, превышающих ограничения Использованы HTML-сущности вместо XML-сущностей: неразрывный пробел &amp;nbsp; — это HTML-сущность, а не XML-сущность, и не может использоваться в XML

Sitemap была отправлена очень давно, но многие URL до сих пор не проиндексированы Google

Проблема качества страниц: индексация не происходит автоматически после отправки. Страницы с низкой оригинальностью контента, дублирующимся содержимым или содержимым с низкой ценностью могут не индексироваться Google Период проверки для новых сайтов (эффект песочницы): новым сайтам после отправки Sitemap может потребоваться период наблюдения от нескольких недель до нескольких месяцев перед массовой индексацией Страница — noindex: страница, возвращаемая URL, содержит мета-тег noindex или заголовок ответа X-Robots-Tag: noindex, Google активно исключает её Недостаточный бюджет сканирования сайта: низкий вес сайта, медленный ответ сервера, плохая структура внутренних ссылок приводят к тому, что краулеры Google назначают низкую частоту сканирования и требуется больше времени Sitemap содержит много URL низкого качества: если многие URL в Sitemap — ошибки 404, ошибки 5xx, дублирующееся содержимое или страницы с низкой ценностью, Google снижает доверие ко всей Sitemap Домен наказан: сайт имеет проблемы, нарушающие правила качества Google (такие как спам, нежелательное содержимое, вредоносное ПО), что препятствует индексации Страницы — изолированные страницы: хотя страницы и находятся в Sitemap, во внутренних ссылках сайта нет входов, краулеры могут считать их неважными и не индексировать

В Sitemap отображаются обнаруженные URL, но фактическое количество проиндексированных очень мало

Это нормально: «Обнаружено» лишь означает, что Google посетил Sitemap и увидел URL, а не что все будут проиндексированы. Доля индексации зависит от качества страниц Проблема дублирующего контента: несколько URL с очень похожим содержимым (например, одна и та же страница с разными параметрами, версии для печати, пагинация). Google выбирает одну каноническую версию для индексации Тег канонизации (canonical) указывает на другие страницы: страница установила &lt;link rel="canonical" href="другой URL"&gt;. Google индексирует адрес, на который указывает canonical Содержимое страницы слишком скудное: слишком мало слов в содержимом, нет существенной ценности, собранный контент — Google считает его не заслуживающим индексации Скорость загрузки страницы слишком низкая: таймаут ответа сервера, слишком медленная загрузка страницы. После нескольких неудачных попыток сканирования краулеры снижают приоритет сканирования Проблема HTTPS-сертификата: недействительный SSL-сертификат, ошибка смешанного содержимого, одновременное существование HTTP/HTTPS версий вызывают проблемы канонизации Проблема мобильной адаптации: плохая мобильная удобство использования, ошибки мобильной адаптации влияют на индексацию в среде мобильно-ориентированного индексирования

Bing нормально сканирует Sitemap, но Google совершенно не сканирует

Проблема подтверждения в Google Search Console: подтвердите, что подтверждение права собственности на домен действительно и подтверждённый домен (www/не-www, http/https) соответствует фактически посещаемой версии Межсетевой экран сервера или CDN блокирует Googlebot: проверьте журналы доступа сервера, не блокируются ли запросы Googlebot (user-agent содержит Googlebot) и не возвращают ли они 403 Проблема DNS-разрешения: DNS-разрешение Google приводит к другому IP-адресу, чем Bing. Убедитесь, что все регионы могут нормально разрешать адрес вашего сервера robots.txt имеет специальные ограничения для Googlebot: проверьте, нет ли специальных правил Disallow под User-agent: Googlebot Сайт ранее имел историю спама и был понижен Google: домены, которые были вручную наказаны, должны сначала запросить повторную проверку URL Sitemap содержит содержимое, которое Google считает небезопасным: например, домены, помеченные как вредоносное ПО или фишинг Правила WAF CDN ошибочно блокируют: некоторые правила безопасности могут ошибочно интерпретировать поведение краулера Googlebot, необходимо проверить журналы безопасности CDN

Сгенерированная Sitemap нормально работает локально, но после загрузки на сервер доступ возвращает ошибку 404

Неправильный путь к файлу: sitemap.xml не был загружен в правильный каталог. Подтвердите, что он загружен в положение, соответствующее URL, который вы объявили в robots.txt и отправили поисковым системам Проблема регистра в имени файла: серверы Linux/Unix чувствительны к регистру. Sitemap.xml и sitemap.xml — разные файлы. Убедитесь, что имя файла полностью в нижнем регистре Конфигурация Nginx/Apache запрещает доступ к XML-файлам: проверьте конфигурацию сервера, нет ли правил location, запрещающих доступ к файлам с расширением .xml или возвращающих неправильные правила try_files Проблема прав доступа к файлу: права доступа к файлу на сервере установлены неправильно (например, права 600), пользователь веб-сервера не имеет прав на чтение. Обычно требуются права 644, каталоги требуют прав 755 CDN закэшировал старый ответ 404: для только что загруженных файлов CDN может всё ещё кэшировать предыдущую 404. Необходимо обновить кэш CDN или дождаться автоматического обновления источника CDN Правила постоянных ссылок CMS вроде WordPress конфликтуют: правила перезаписи CMS перехватили sitemap.xml. Необходимо настроить правила исключения, чтобы сервер напрямую обращался к статическим файлам Сервер настроил хотлинк-защиту или контроль доступа: проверки referrer, белые списки IP и другие правила в конфигурации .htaccess или Nginx могут блокировать доступ краулеров

Глоссарий

Sitemap
Файл стандарта протокола XML, информирующий поисковые системы обо всех страницах сайта, доступных для сканирования. Содержит полный список URL и метаданные для каждого URL, помогает краулерам вроде Googlebot и Bingbot более разумно и эффективно обнаруживать, понимать и сканировать содержимое сайта. Единый открытый стандарт протокола поддерживается организацией sitemaps.org (текущая версия 0.9).
urlset
Корневой элемент стандартного XML-файла Sitemap, должен содержать правильное объявление пространства имён xmlns, все подэлементы &lt;url&gt; вложены в него. Это ключевой идентификатор действительности Sitemap. Sitemap без правильной структуры urlset напрямую отклоняется поисковыми системами для парсинга.
Sitemap Index
Файл индекса Sitemap, который необходимо использовать, когда количество URL сайта превышает 50 000 или размер одного файла Sitemap превышает 50 МБ. Корневой элемент — &lt;sitemapindex&gt;, используется для единообразного перечисления и управления адресами нескольких файлов дочерних Sitemap и является стандартным решением для разделения Sitemap крупных сайтов.
changefreq
Опциональный элемент метаданных в Sitemap для указания примерной частоты обновления содержимого страницы. Существует семь допустимых значений: always, hourly, daily, weekly, monthly, yearly, never. Служит краулерам поисковых систем в качестве ориентира для планирования частоты посещений. Правильная настройка может оптимизировать распределение бюджета сканирования.
priority
Опциональный элемент метаданных в Sitemap для указания уровня приоритета важности этого URL относительно других страниц внутри сайта. Диапазон значений — от 0.0 до 1.0, значение по умолчанию — 0.5. priority влияет только на относительный приоритет сканирования между внутренними страницами сайта, а не на ранжирование в результатах поиска.
lastmod
Опциональный элемент метаданных в Sitemap, записывающий дату и время последнего существенного изменения содержимого страницы. Формат должен соответствовать спецификации W3C Datetime. Это наиболее учитываемое поисковыми системами поле из трёх опциональных полей метаданных, поскольку оно напрямую указывает, есть ли на странице новый контент для повторного сканирования.
loc
Обязательный подэлемент под элементом &lt;url&gt; для указания полного абсолютного URL-адреса страницы. Должен начинаться с протокола http:// или https://, содержать полное доменное имя, общая длина URL не должна превышать 2048 символов, относительные пути не допускаются.
Пространство имён XML (xmlns)
Атрибут пространства имён XML, который должен быть объявлен в корневом элементе urlset. Значение атрибута должно точно соответствовать http://www.sitemaps.org/schemas/sitemap/0.9, служит для идентификации версии протокола, используемой Sitemap. Отсутствующее или неверное пространство имён приводит к ошибкам парсинга Sitemap.
W3C Datetime
Формат представления даты и времени, установленный W3C (Консорциумом Всемирной паутины). Поле lastmod в Sitemap должно соответствовать этому формату. Часто используется упрощённый формат даты YYYY-MM-DD (лучшая совместимость); также поддерживает полный формат даты и времени с часами, минутами, секундами и информацией о часовом поясе.
Экранирование XML-сущностей
В синтаксисе XML специальные символы должны экранироваться в соответствующие ссылки на сущности для корректного парсинга: & становится &amp;, < становится &lt;, > становится &gt;, " становится &quot;, ' становится &apos;. URL, содержащие эти символы, должны экранироваться, иначе возникают ошибки парсинга XML.
Google Search Console (GSC)
Официально предоставляемая Google платформа для веб-мастеров для отправки Sitemap, просмотра статуса индексации сайта, анализа данных поискового трафика, отчётов об ошибках сканирования, уведомлений о проблемах безопасности, уведомлений о санкциях за ручные действия и т.д. Незаменимый инструмент для поисковой оптимизации Google (SEO).
Bing Webmaster Tools
Официальная платформа веб-мастеров поисковой системы Microsoft Bing с функциями, аналогичными Google Search Console. Поддерживает отправку Sitemap, статистику покрытия индекса, SEO-диагностический анализ, исследование ключевых слов, запросы обратных ссылок и т.д. Охватывает поисковый трафик двух поисковых систем — Bing и Yahoo.
robots.txt
Текстовый файл в корневом каталоге сайта, который через директивы вроде User-agent, Disallow, Allow информирует краулеров поисковых систем о том, какие пути разрешены для сканирования, а какие — нет. В то же время в файле может быть объявлено местоположение файла Sitemap для автоматического обнаружения краулерами.
Краулер (Crawler/Spider/Bot)
Программы, разрабатываемые поисковыми системами для автоматического сканирования веб-содержимого, такие как Googlebot (краулер Google), Bingbot (краулер Bing), YandexBot (краулер Яндекса). Обнаруживают новые страницы, отслеживая ссылки страниц и читая файлы Sitemap, загружают содержимое страниц и сохраняют его в индексе поисковых систем.
Бюджет сканирования (Crawl Budget)
Общий объём ресурсов сканирования, выделяемый поисковыми системами определённому сайту за определённый период времени. Совместно определяется различными факторами, такими как вес домена, скорость ответа сервера, качество содержимого страниц, исторические результаты сканирования. Правильная конфигурация Sitemap может помочь оптимизировать эффективность использования бюджета сканирования.
Кодировка UTF-8
Обязательная кодировка символов для XML-файлов Sitemap. UTF-8 поддерживает все символы Unicode, включая кириллицу и другие языки. Указывается в объявлении XML через атрибут encoding="UTF-8". Использование других кодировок (вроде Windows-1251, KOI8-R) может привести к ошибкам кодировки в не-ASCII URL и ошибкам парсинга.
Сжатие gzip
Протокол Sitemap поддерживает сжатую передачу с алгоритмом gzip (расширение файла .xml.gz), что позволяет уменьшить размер файлов Sitemap на 70–80%, значительно экономя пропускную способность сервера и время сканирования краулеров. Ведущие поисковые системы могут автоматически распаковывать и обрабатывать сжатые gzip файлы Sitemap. После сжатия ограничение в 50 МБ также должно соблюдаться.
Yoast SEO
Широко используемый SEO-плагин на CMS-платформах вроде WordPress и Shopify, способный автоматически генерировать Sitemap, мета-теги, хлебные крошки, XML-карты сайта, RSS-оптимизацию, метаданные социальных сетей и другие функции, связанные с SEO. Часто используемое SEO-решение для контентно-ориентированных сайтов.
Покрытие индекса (Index Coverage)
Один из ключевых отчётов в Google Search Console, подробно показывающий точное количество и причины проиндексированных, исключённых, с ошибками и с предупреждениями страниц на сайте. Может использоваться для проверки эффекта отправки Sitemap и диагностики проблем индексации страниц.
Кодировка URL (Percent-Encoding)
Также известная как процентное кодирование — метод кодировки для представления не-ASCII-символов (таких как иероглифы, специальные символы) в URL. Не-ASCII-символы кодируются в форму %XX%XX%XX (например, «中文» кодируется как %E4%B8%AD%E6%96%87). Не-ASCII-URL в Sitemap должны быть правильно закодированы для парсинга.

Сравнительная таблица сценариев частоты обновления changefreq

Значение changefreqЧастота обновленияТипичные подходящие типы страницПримечания
alwaysМожет меняться при каждом посещенииСтраницы данных в реальном времени, поисковые входы, страницы динамической агрегацииНе означает, что краулеры приходят каждый раз, лишь чрезвычайно высокая частота изменений; не злоупотребляйте, не устанавливайте обычные страницы на always
hourlyЕжечасное обновлениеГлавные страницы новостей, ленты социальных сетей, страницы котировок в реальном времениПодходит для страниц с ежечасно появляющимся новым контентом, не для сайтов с нечастыми обновлениями
dailyЕжедневное обновлениеГлавные страницы сайтов, страницы списков блогов, страницы новостных каналов, страницы категорий товаровОдно из наиболее часто используемых значений, подходит для главных страниц и страниц категорий большинства сайтов
weeklyЕженедельное обновлениеОбычные страницы деталей статей, страницы деталей продуктов, страницы содержимого блоговЭто подходит для основных содержательных страниц большинства контентно-ориентированных сайтов
monthlyЕжемесячное обновлениеСтраницы списков категорий, страницы архивов, страницы FAQ, страницы руководствВспомогательные страницы с нечастыми обновлениями контента, но с периодическими корректировками
yearlyЕжегодное обновлениеСтраницы представления компаний, страницы контактов, условия обслуживания, политика конфиденциальностиСтатические информационные страницы, почти никогда не меняющиеся
neverНикогда не обновляетсяАрхивы исторических статей, страницы истёкших мероприятий, архивированное старое содержимоеУстанавливайте на never для страниц, которые больше не будут изменяться; при обновлениях не забывайте своевременно вернуть значение

Эталонная таблица настроек приоритета priority

Значение priorityУровень приоритетаПодходящие типы страницРекомендуемая доля от общего числа страниц
1.0НаивысшийГлавная страница сайта, основные целевые страницы, главные страницы важнейших каналовВсего 1-3 страницы на всём сайте
0.8-0.9Очень высокийГлавные страницы категорий, популярные страницы категорий, основные страницы продуктов, важные темыПримерно 5-10% от общего числа страниц
0.6-0.7ВысокийВторостепенные страницы категорий, страницы подкатегорий, популярные статьи, важные детали продуктовПримерно 10-20% от общего числа страниц
0.4-0.5ОбычныйОбычные страницы деталей статей, общие страницы продуктов, обычные страницы содержимогоПримерно 40-60% от общего числа страниц (значение по умолчанию)
0.2-0.3НизкийСтраницы тегов, пагинация архивов, архивы старых статей, вспомогательные страницыПримерно 15-25% от общего числа страниц
0.0-0.1НизшийСтраницы с низкой ценностью, страницы с дублирующимся содержимым, страницы, не подлежащие приоритетному сканированиюВ пределах примерно 5% от общего числа страниц, 0 не означает запрет индексации

Таблица ограничений спецификации протокола Sitemap

Элемент ограниченияМаксимальное значениеОписаниеРешение при превышении ограничения
Количество URL в одной Sitemap50 000Жёстко регламентировано протоколом sitemap.org 0.9Использовать Sitemap Index для разделения на несколько дочерних Sitemap
Размер несжатого файла одной Sitemap50 МБ (52 428 800 байт)Размер исходного файла, включая все теги и пробелыИспользовать сжатие gzip, разделить Sitemap, уменьшить комментарии
Количество дочерних Sitemap в Sitemap Index50 000Ограничение записей URL самого файла индексаТеоретически поддерживает 2,5 миллиарда URL, для большинства сайтов не требуется
Длина одного URL2048 символовВключая протокол, доменное имя, путь, все параметры запросаСлишком длинные URL требуют упрощения параметров или URL rewriting
Поддерживаемые форматы кодировки SitemapUTF-8Протокол требует в обязательном порядке, другие кодировки могут привести к ошибкам парсингаПри сохранении файла убедитесь, что используется кодировка UTF-8
Поддерживаемые протоколы Sitemaphttp:// или https://URL должен содержать полный заголовок протоколаДругие протоколы вроде ftp:// не поддерживаются
Время ответа краулера после отправкиОт нескольких часов до нескольких днейЗависит от веса сайта и сложности SitemapНе требуется повторная отправка, терпеливо ожидайте обработки
Размер файла после сжатия gzip50 МБСжатый файл также не должен превышать ограничение в 50 МБПри превышении после сжатия Sitemap всё равно должна быть разделена