Generator Sitemap

Generator sitemap.xml

Wprowadź listę URL, ustaw changefreq, priority i lastmod globalnie, wygeneruj mapy witryny XML zgodne ze standardem sitemap.org jednym kliknięciem.

Wejście i parametry
Wyjście XML
3 poprawnych URL, rozmiar 483 bajtów

Generuj online pliki map witryny Sitemap XML zgodne z otwartym standardem protokołu sitemap.org 0.9. Obsługuje pełną konfigurację 7 częstotliwości aktualizacji changefreq, względnych poziomów priorytetu priority 0.0–1.0 oraz wybór daty lastmod. Zawiera automatyczne kodowanie encji XML, wykrywanie nieprawidłowych URL w czasie rzeczywistym, podgląd strukturalnego XML na żywo oraz funkcje pobierania i kopiowania jednym kliknięciem, pomagając głównym wyszukiwarkom, w tym Google i Bing, szybko odkrywać i efektywnie indeksować wszystkie ważne strony w Twojej witrynie.

Powiązane Rekomendacje

Przypadki użycia

  • Wsadowe generowanie Sitemap dla stron głównych po uruchomieniu nowej witryny i przesłanie ich do Google Search Console i Bing Webmaster Tools w celu przyspieszenia odkrywania i indeksowania przez wyszukiwarki
  • Ponowne generowanie map witryny po zmianach projektu sekcji witryny lub struktur URL w celu aktualizacji indeksów wyszukiwarek i zapobiegania wpływowi pozostałości martwych linków na wydajność SEO
  • Wsadowe importowanie URL list produktów w witrynach e-commerce, ustawianie różnych wartości changefreq i priority na podstawie kategorii produktów i dat dodania
  • Generowanie podzielone wielu Sitemap według kanałów dla dużych portali lub serwisów informacyjnych przekraczających 50 000 URL i tworzenie pliku indeksu Sitemap Index
  • Konfigurowanie odpowiednich częstotliwości aktualizacji i parametrów priorytetu dla stron artykułów, stron tagów, stron kategorii i stron archiwów w witrynach blogowych
  • Porządkowanie różnych typów URL w witrynach korporacyjnych, w tym stron produktów, stron z nowościami, stron o firmie i stron kontaktowych, ustawianie zróżnicowanych wartości lastmod i priority
  • Ponowne generowanie i przesyłanie Sitemap po migracji witryny (aktualizacja HTTP na HTTPS, zmiana nazwy domeny) w celu nakierowania crawlerów na szybkie pobieranie nowych adresów
  • Ręczne uzupełnianie Sitemap wygenerowanych przez wtyczki takie jak Yoast SEO, dodawanie URL specjalnych stron nieobjętych przez wtyczkę
  • Ponowne generowanie Sitemap po diagnostyce i optymalizacji SEO w celu zapewnienia rozsądnych ustawień priority dla ważnych stron, zwiększając wagę indeksowania dla stron o wysokiej wartości
  • Weryfikacja poprawności formatu XML za pomocą tego narzędzia przed zadeklarowaniem lokalizacji Sitemap w robots.txt w celu uniknięcia niepowodzeń parsowania przez crawlerów

Jak Używać

  1. Wklej listę adresów stron do zaindeksowania w obszarze wprowadzania URL, jeden pełny URL na linię (musi zawierać prefiks protokołu http:// lub https://)
  2. Wybierz częstotliwość aktualizacji strony z menu rozwijanego changefreq: wybierz daily lub hourly dla strony głównej, weekly dla stron artykułów, yearly lub monthly dla stron statycznych
  3. Przeciągnij suwak priorytetu lub wprowadź wartość z przedziału 0.0–1.0, aby ustawić priorytet: ustaw stronę główną na 1.0, ważne strony sekcji na 0.8, zwykłe strony artykułów na 0.5, strony archiwów na 0.3
  4. Kliknij selektor daty lastmod, aby wybrać datę ostatniej modyfikacji zawartości witryny, lub pozostaw puste, aby nie uwzględniać pola lastmod
  5. Sprawdź obszar podglądu w czasie rzeczywistym po prawej stronie, aby zweryfikować poprawność struktury wygenerowanego XML; nieprawidłowe URL będą podświetlone na czerwono w celu korekty
  6. Po potwierdzeniu poprawności kliknij przycisk „Pobierz sitemap.xml”, aby zapisać plik, lub kliknij przycisk „Kopiuj”, aby skopiować zawartość XML do schowka
  7. Wgraj plik sitemap.xml do katalogu głównego witryny, dodaj deklarację Sitemap w robots.txt lub prześlij bezpośrednio do Google Search Console/Bing Webmaster

Funkcje

  • Obsługa wsadowego wprowadzania URL: jeden URL na linię, automatyczne filtrowanie pustych linii i zduplikowanych linków do szybkiego przetwarzania dużych partii adresów stron
  • Automatyczne kodowanie encji XML: znaki specjalne w URL, w tym &, <, >, ", i ', są automatycznie kodowane do &amp;, &lt;, &gt;, &quot;, i &apos;, całkowicie eliminując błędy parsowania XML
  • 7 opcji częstotliwości aktualizacji changefreq: always, hourly, daily, weekly, monthly, yearly, never — obejmujące wszystkie scenariusze typów stron
  • Precyzyjne ustawienia priorytetu: obsługuje dowolną wartość z przedziału 0.0–1.0 z dokładnością do jednego miejsca po przecinku, umożliwiając rozróżnienie poziomów ważności stron
  • Wybór daty ostatniej modyfikacji lastmod: wizualny selektor kalendarza automatycznie formatujący datę do standardowego formatu W3C Datetime (YYYY-MM-DD)
  • Wykrywanie nieprawidłowych URL w czasie rzeczywistym: automatycznie identyfikuje nieprawidłowo sformatowane URL (brak protokołu, niedozwolone znaki itp.) i oznacza numery linii problematycznych w celu łatwej korekty
  • Generowanie podglądu w czasie rzeczywistym: zawartość XML aktualizuje się natychmiast po modyfikacji listy URL lub parametrów konfiguracyjnych — nie jest wymagane ręczne klikanie przycisku generowania
  • Pobieranie sitemap.xml jednym kliknięciem: wygenerowane wyniki są pobierane bezpośrednio jako standardowy plik XML, gotowy do natychmiastowego wgrania na serwer WWW po zapisaniu
  • Ostrzeżenie o limicie URL: automatycznie wyświetla monit o podziale na Sitemap Index, gdy liczba wprowadzonych URL osiągnie 50 000 wpisów
  • Kopiowanie do schowka: kopiowanie całej zawartości XML do schowka jednym kliknięciem w celu łatwego wklejenia do plików serwera lub przesłania online
  • Statystyki rozmiaru w bajtach: wyświetla liczbę bajtów wygenerowanego pliku Sitemap XML w czasie rzeczywistym w celu oceny, czy rozmiar pliku jest zgodny z limitami wyszukiwarek
  • Standardowe wyjście elementu głównego urlset: ściśle przestrzega specyfikacji protokołu http://www.sitemaps.org/schemas/sitemap/0.9 z poprawną deklaracją przestrzeni nazw xmlns
  • Deklaracja kodowania UTF-8: automatycznie dodaje deklarację kodowania XML, aby zapewnić poprawne parsowanie wielojęzycznych URL bez zniekształconych znaków

Często Zadawane Pytania

Czy przesłanie Sitemap jest obowiązkowe? Czy moja witryna nie zostanie zaindeksowana bez przesłania?

Witryna może zostać zaindeksowana nawet bez przesłania Sitemap — wyszukiwarki mogą odkryć Twoje strony za pomocą linków zewnętrznych z innych witryn i śledzenia linków wewnętrznych. Jednak przesłanie Sitemap może znacznie przyspieszyć szybkość odkrywania, szczególnie w przypadku nowych witryn, dużych witryn i witryn z niedoskonałymi linkami wewnętrznymi. Google oficjalnie zaleca, aby wszystkie witryny przesyłały Sitemap; jest to podstawowa praca SEO o bardzo niskich kosztach i wysokich korzyściach.

Czy URL w Sitemap muszą być ścieżkami bezwzględnymi? Czy można używać ścieżek względnych?

Muszą to być pełne bezwzględne URL, zawierające nagłówek protokołu (http:// lub https://) i pełną nazwę domeny; nie można używać ścieżek względnych (takich jak /page1.html) ani zapisów z pominięciem protokołu. Wyszukiwarki potrzebują pełnego URL podczas parsowania Sitemap, aby poprawnie indeksować; ścieżki względne spowodują błędy parsowania.

Czy ustawienia changefreq i priority naprawdę są przydatne? Czy wyszukiwarki ich przestrzegają?

Oba te pola są „wskazówkami”, a nie „dyrektywami”; wyszukiwarki niekoniecznie będą ich przestrzegać w 100%, ale dokładne ustawienie nadal ma wartość referencyjną. W porównaniu lastmod (czas ostatniej modyfikacji) jest najważniejszy z trzech pól dla wyszukiwarek, ponieważ może bezpośrednio poinformować crawlerów, czy strona ma nową zawartość. Nie fałszuj, ustawiając wszystkie strony na najwyższy priorytet lub always; spowoduje to, że wyszukiwarki przestaną ufać tym metadanym.

Czy plik Sitemap musi być umieszczony w katalogu głównym witryny?

Niekoniecznie; Sitemap może być umieszczony w dowolnej ścieżce w witrynie, o ile URL jest normalnie dostępny. Jednak robots.txt musi być umieszczony w katalogu głównym. Jeśli używasz Sitemap Index do podziału na wiele Sitemap, ścieżki podrzędnych Sitemap nie mają ograniczeń. Jednak zwyczajowo umieszczenie w katalogu głównym jest najwygodniejsze do zarządzania i ułatwia odkrycie przez crawlerów.

Co zrobić, jeśli liczba URL witryny jest mniejsza niż 50 000, ale rozmiar pliku przekracza 50MB?

Konieczne jest podzielenie Sitemap. 50 000 wpisów i 50MB to dwa równoległe limity; spełnienie dowolnego warunku przekroczenia wymaga podziału. Możesz podzielić według typu zawartości lub uprościć Sitemap (np. usunąć niepotrzebne spacje, wcięcia, użyć kompresji gzip), ale jeśli po kompresji nadal przekracza 50MB, musisz podzielić.

Czy w Sitemap można uwzględniać strony noindex lub URL zablokowane przez robots.txt?

Nie zaleca się. Sitemap powinny zawierać tylko strony, które chcesz, aby wyszukiwarki indeksowały i indeksowały. Strony noindex, strony zabronione przez Disallow, strony wymagające logowania w celu uzyskania dostępu, strony z błędami 404 nie powinny znajdować się w Sitemap; obniży to zaufanie wyszukiwarek do Sitemap i zmarnuje budżet indeksowania.

Czy trzeba ponownie przesyłać Sitemap po aktualizacji zawartości? Jak często należy aktualizować Sitemap?

O ile adres URL pliku Sitemap pozostaje niezmieniony, wyszukiwarki będą okresowo ponownie indeksować; nie ma potrzeby ręcznego ponownego przesyłania za każdym razem, gdy zawartość się aktualizuje. Częstotliwość aktualizacji zależy od częstotliwości aktualizacji zawartości Twojej witryny: witryny informacyjne mogą codziennie, a nawet co godzinę aktualizować Sitemap (generowane automatycznie), witryny korporacyjne mogą aktualizować raz w tygodniu lub raz w miesiącu. Możesz skonfigurować skrypt po stronie serwera do automatycznego aktualizowania pliku Sitemap.

Jakie języki URL obsługuje Sitemap? Czy wielojęzyczne URL wymagają kodowania?

Sitemap obsługuje URL w dowolnym języku, ale URL ze znakami nie-ASCII (takimi jak znaki diakrytyczne) wymagają kodowania URL (nazywanego również kodowaniem procentowym, percent-encoding). Na przykład „strona po polsku” musi zostać zakodowana w odpowiedniej formie procentowej. Większość przeglądarek i narzędzi obsługuje to automatycznie, ale musisz upewnić się, że URL w wygenerowanej Sitemap są poprawnie zakodowane.

Czy można jednocześnie przesłać wiele Sitemap? Na przykład mieć jednocześnie Sitemap artykułów i Sitemap produktów?

Tak, istnieją dwa sposoby: ①użyj pliku indeksu Sitemap Index do jednolitego zarządzania wszystkimi podrzędnymi Sitemap, jest to zalecany sposób, wystarczy przesłać URL pliku indeksu; ②prześlij indywidualnie adres URL każdego podrzędnego Sitemap na platformie webmasterskiej, ten sposób również działa, ale zarządzanie jest kłopotliwe. Oba sposoby są skuteczne, a wyszukiwarki będą je indeksować.

Czy po wygenerowaniu Sitemap wymagana jest kompresja gzip? Jakie są korzyści z kompresji?

Kompresja nie jest wymagana, ale jest bardzo zalecana. Kompresja gzip zazwyczaj zmniejsza rozmiar Sitemap o 70%–80%, oszczędzając przepustowość i czas pobierania przez crawlerów, szczególnie w przypadku dużych witryn efekt jest widoczny. Wyszukiwarki w pełni obsługują format skompresowany sitemap.xml.gz i automatycznie dekompresują. O ile po kompresji nie przekracza 50MB, nie ma problemu.

Czy obie wersje witryny HTTP i HTTPS wymagają przesłania Sitemap?

Powinieneś przesłać tylko preferowaną wersję, którą chcesz zaindeksować. Jeśli cała witryna jest już w HTTPS i wykonano przekierowanie 301 HTTP→HTTPS, wystarczy przesłać Sitemap w wersji HTTPS. Nie przesyłaj jednocześnie obu wersji HTTP i HTTPS; spowoduje to problemy z powieloną zawartością. Podobnie www i bez www również muszą określić domenę preferowaną i przesłać tylko Sitemap domeny preferowanej.

WordPress wygenerował Sitemap za pomocą Yoast SEO, czy nadal potrzebuję tego narzędzia?

Yoast SEO może automatycznie generować Sitemap większości stron, ale może pominąć niektóre strony — na przykład ręcznie utworzone strony pojedyncze, niestarannie skonfigurowane niestandardowe typy postów, specjalne strony docelowe, strony zaimportowane z zewnątrz itp. Możesz użyć tego narzędzia do uzupełnienia tych URL nieobjętych przez Yoast, wygenerować oddzielną uzupełniającą Sitemap lub porównać i sprawdzić, czy wygenerowana przez Yoast Sitemap jest kompletna i poprawna.

Czy kolejność URL w Sitemap ma znaczenie? Czy umieszczenie ważnych stron na początku jest przydatne?

W protokole Sitemap kolejność URL nie ma żadnej oficjalnej wagi; wyszukiwarki nie będą indeksować priorytetowo tylko dlatego, że URL są na początku. Jednak niektórzy praktycy SEO zaobserwowali niewielki efekt preferencji kolejności, więc umieszczenie ważnych URL na początku nie szkodzi, ale nie oczekuj, że przyniesie to wyraźny efekt; nadal należy poprawnie identyfikować priorytet za pomocą pola priority.

Czy strony podzielone na strony (takie jak /list?page=2, /page/3) należy umieszczać w Sitemap?

Zależy to od wartości zawartości podzielonej na strony. Jeśli podział na strony jest powieloną listą typu „zobacz więcej” (np. druga strona listy artykułów, trzecia strona), zazwyczaj nie zaleca się umieszczania w Sitemap, ponieważ te strony mają powieloną zawartość i niską wartość; należy skupić się na stronie głównej listy i konkretnych stronach artykułów. Jeśli jednak podział na strony ma unikalną zawartość (np. przeglądanie kategorii, podział na strony ma niezależną wartość), można rozważyć uwzględnienie, ustawiając niższy priority.

Jak zweryfikować, czy Sitemap jest poprawna i skuteczna?

Istnieje kilka sposobów weryfikacji: ①po wygenerowaniu za pomocą tego narzędzia najpierw przejrzyj lokalnie, czy struktura XML jest poprawna, sprawdź, czy zamknięcie tagów, przestrzeń nazw, znaki kodowania są normalne; ②użyj narzędzia sitemap-inspector do weryfikacji online formatu i dostępności URL, wsadowo sprawdź kody stanu HTTP wszystkich URL; ③po wgraniu uzyskaj bezpośredni dostęp do URL Sitemap w przeglądarce, aby sprawdzić, czy wyświetla się poprawnie bez błędów parsowania XML; ④po przesłaniu do Google Search Console/Bing Webmaster Tools przejrzyj raport stanu, aby sprawdzić, czy nie ma błędów formatu, niedostępnych URL, przekroczenia limitów i innych komunikatów o błędach; jest to najbardziej autorytatywny sposób weryfikacji; ⑤możesz również użyć internetowych narzędzi do weryfikacji XML w celu sprawdzenia poprawności składni XML.

Rozwiązywanie problemów

Wygenerowany Sitemap XML wyświetla błąd parsowania po otwarciu w przeglądarce, wskazujący na niepoprawny format

URL zawierają znaki specjalne XML takie jak &, <, > bez kodowania: narzędzie automatycznie koduje podczas wklejania, ale jeśli ręcznie edytowałeś plik, mogłeś pominąć kodowanie Deklaracja XML lub przestrzeń nazw urlset napisana niepoprawnie: sprawdź, czy wartość xmlns w pierwszej linii dokładnie pasuje do http://www.sitemaps.org/schemas/sitemap/0.9 bez dodatkowych ukośników Tagi niepoprawnie zamknięte: wszystkie tagi otwierające, takie jak <url>, <loc>, muszą mieć odpowiednie tagi zamykające </url>, </loc>; składnia tagów samozamykających się musi być poprawna Kodowanie pliku nie jest UTF-8 bez BOM: Notatnik Windows może zapisać jako UTF-8 BOM lub inne kodowanie, powodując błędy parsowania; zapisz jako UTF-8 bez BOM URL zawierają niedozwolone znaki: wielojęzyczne URL wymagają kodowania URL (kodowania procentowego); niezakodowane znaki specjalne spowodują niepowodzenie parsowania XML Błąd deklaracji wersji XML: pierwsza linia musi być <?xml version="1.0" encoding="UTF-8"?>; nie pisz 1.1 lub innych wersji Błąd kolejności zagnieżdżania tagów: tagi podrzędne muszą być całkowicie zawarte w tagach nadrzędnych; zagnieżdżanie krzyżowe, takie jak <url><loc></url></loc>, jest niepoprawną kolejnością

Google Search Console wyświetla „Nie można pobrać Sitemap” lub „Błąd formatu” po przesłaniu Sitemap

Adres URL pliku Sitemap jest niedostępny: sprawdź, czy bezpośrednie uzyskanie dostępu do URL Sitemap w przeglądarce zwraca kod stanu 200 bez błędów 403/404/500 Serwer zwrócił niepoprawny Content-Type: powinien zwrócić application/xml lub text/xml; zwrócenie text/html spowoduje niepowodzenie rozpoznawania Sitemap zawiera URL zablokowane przez robots.txt: GSC zgłasza błędy, gdy wykryje ścieżki Disallow w Sitemap Problemy z przekierowaniami URL: URL Sitemap, które przekierowują 301/302 na inne adresy, powodują błędy; upewnij się, że URL są bezpośrednio dostępne bez przekierowań Niezgodność HTTP/HTTPS lub www/bez www: przesłana domena Sitemap nie pasuje do domeny zweryfikowanej w GSC (np. zweryfikowano www.example.com, ale Sitemap używa example.com) Plik Sitemap jest zbyt duży, przekraczając limit 50MB lub liczba URL przekracza 50 000 wpisów: GSC bezpośrednio odrzuci przetwarzanie plików przekraczających limit Użyto encji HTML zamiast encji XML: &nbsp; dla spacji jest encją HTML, a nie encją XML i nie można jej używać w XML

Długo po przesłaniu Sitemap wiele URL nadal nie jest indeksowanych przez Google

Problemy z jakością strony: indeksowanie nie jest gwarantowane po przesłaniu; strony o słabej oryginalności, powielonej zawartości lub niskiej wartości zawartości mogą zostać wybrane przez Google jako nie do zaindeksowania Okres przeglądu nowej witryny (efekt piaskownicy): nowe witryny mogą wymagać okresu obserwacji od kilku tygodni do kilku miesięcy po przesłaniu Sitemap, zanim nastąpi indeksowanie wsadowe Strony są noindex: strony zwracają meta tagi noindex lub nagłówki odpowiedzi X-Robots-Tag: noindex; Google aktywnie je wykluczy Niewystarczający budżet indeksowania witryny: niski autorytet witryny, wolna odpowiedź serwera, słaba struktura linków wewnętrznych skutkują niską częstotliwością indeksowania przydzieloną przez crawler Google, co wymaga więcej czasu Sitemap zawiera wiele URL o niskiej jakości: jeśli wiele URL w Sitemap to 404, błędy 5xx, powielona zawartość lub strony o niskiej wartości, Google zmniejszy zaufanie do całej Sitemap Domena ukarana: witryna ma problemy naruszające wytyczne jakości Google (takie jak spam, zawartość skradziona, złośliwe oprogramowanie) powodujące zablokowanie indeksowania Strony są osieroconymi stronami: chociaż strony są w Sitemap, nie ma punktów wejścia z linków wewnętrznych witryny; crawler mogą uznać je za nieistotne i ich nie indeksować

Sitemap pokazuje odkryte URL, ale rzeczywista liczba zaindeksowanych jest bardzo niska

To normalne: „Odkryte” oznacza tylko, że Google odwiedził Sitemap i zobaczył URL, a nie że wszystkie zostaną zaindeksowane; wskaźnik indeksowania zależy od jakości strony Problemy z powieloną zawartością: wiele URL o bardzo podobnej zawartości (takich jak ta sama strona z różnymi parametrami, wersje do druku, podział na strony) spowoduje, że Google wybierze jedną kanoniczną wersję do zaindeksowania Tag kanoniczny wskazujący na inne strony: strona ma ustawione <link rel="canonical" href="inny URL">; Google zaindeksuje adres wskazywany przez kanoniczny Zawartość strony jest zbyt cienka: zbyt mało słów, brak istotnej wartości, zawartość skradziona — Google uważa, że nie warto jej indeksować Szybkość ładowania strony jest zbyt niska: limit czasu odpowiedzi serwera, zbyt wolne ładowanie stron; crawler zmniejszą priorytet indeksowania po wielu nieudanych pobraniach Problemy z certyfikatem HTTPS: nieprawidłowe certyfikaty SSL, błędy zawartości mieszanej, współistnienie wersji HTTP/HTTPS powodujące problemy kanonizacyjne Problemy z dostosowaniem do urządzeń mobilnych: słaba przyjazność dla urządzeń mobilnych, błędy dostosowania mobilnego wpływają na indeksowanie w środowisku indeksowania priorytetowego dla urządzeń mobilnych

Bing może indeksować Sitemap normalnie, ale Google w ogóle nie indeksuje

Problemy z weryfikacją Google Search Console: potwierdź, że weryfikacja własności domeny jest ważna, a zweryfikowana domena (www/bez www, http/https) pasuje do rzeczywistej wersji dostępu Zapora serwera lub CDN blokuje Googlebot: sprawdź dzienniki dostępu serwera, aby zobaczyć, czy żądania Googlebot (user-agent zawierający Googlebot) są blokowane lub zwracają 403 Problemy z rozdzielczością DNS: rozdzielczość DNS Google na różne adresy IP niż Bing; upewnij się, że wszystkie regiony mogą poprawnie rozdzielać na Twój serwer robots.txt ma specjalne ograniczenia dla Googlebot: sprawdź, czy istnieją specjalne reguły Disallow w sekcji User-agent: Googlebot Witryna miała wcześniejszą historię oszustw ukaraną przez Google: domeny, które otrzymały działania ręczne, muszą najpierw złożyć wniosek o ponowne rozpatrzenie Adres URL Sitemap zawiera zawartość, którą Google uważa za niebezpieczną: taką jak domeny oznaczone jako zawierające złośliwe oprogramowanie lub zawartość phishingową Reguły WAF CDN powodują fałszywe pozytywy: niektóre reguły bezpieczeństwa mogą błędnie zidentyfikować zachowanie crawlera Googlebot; sprawdź dzienniki bezpieczeństwa CDN

Wygenerowany Sitemap testuje się poprawnie lokalnie, ale uzyskanie dostępu do niego po wgraniu na serwer zwraca błąd 404

Niepoprawna ścieżka pliku: plik sitemap.xml nie został wgrany do poprawnego katalogu; potwierdź, że jest wgrany do lokalizacji odpowiadającej adresowi URL, który zadeklarowałeś w robots.txt i przesłałeś do wyszukiwarek Problemy z wielkością liter w nazwie pliku: serwery Linux/Unix rozróżniają wielkość liter; Sitemap.xml i sitemap.xml to różne pliki; upewnij się, że nazwa pliku jest zapisana małymi literami Konfiguracja Nginx/Apache blokująca dostęp do plików xml: sprawdź konfigurację serwera pod kątem reguł location odmawiających dostępu do rozszerzeń plików .xml lub niepoprawnych reguł try_files Problemy z uprawnieniami plików: niepoprawne uprawnienia plików na serwerze (takie jak uprawnienia 600), gdzie użytkownik serwera WWW nie ma uprawnień do odczytu; zazwyczaj wymagane są uprawnienia 644, katalogi wymagają uprawnień 755 CDN buforował starą odpowiedź 404: nowo wgrane pliki mogą mieć nadal buforowane poprzednie 404 w CDN; musisz odświeżyć pamięć podręczną CDN lub poczekać, aż CDN automatycznie odświeży źródło Konflikty reguł stałych linków w WordPress lub innym CMS: reguły przepisywania CMS przechwytują sitemap.xml; musisz skonfigurować reguły wykluczające, aby serwer bezpośrednio uzyskiwał dostęp do plików statycznych Serwer skonfigurował ochronę przed hotlinkowaniem lub kontrolę dostępu: sprawdzanie refererów, listy dozwolonych adresów IP lub inne reguły w konfiguracji .htaccess lub Nginx mogą blokować dostęp crawlerów

Słownik

Sitemap
Plik standardu protokołu XML, który informuje wyszukiwarki o wszystkich stronach dostępnych do indeksowania w witrynie, zawierający pełną listę URL i metadane dla każdego URL. Pomaga crawlerom takim jak Googlebot i Bingbot bardziej inteligentnie i efektywnie odkrywać, rozumieć i indeksować zawartość witryny. Utrzymywany przez organizację sitemaps.org jako ujednolicony otwarty standard protokołu (aktualna wersja 0.9).
urlset
Element główny standardowego pliku Sitemap XML, który musi zawierać poprawną deklarację przestrzeni nazw xmlns i zagnieżdżać wszystkie wpisy elementów podrzędnych <url> w sobie. Główny identyfikator ważności Sitemap — Sitemap bez poprawnej struktury urlset zostaną bezpośrednio odrzucone przez wyszukiwarki do parsowania.
Sitemap Index
Plik indeksu mapy witryny, który musi być używany, gdy liczba URL witryny przekracza 50 000 wpisów lub pojedynczy plik Sitemap przekracza 50MB. Element główny to <sitemapindex>, używany do jednolitego wymieniania i zarządzania wieloma adresami plików podrzędnych Sitemap i jest standardowym rozwiązaniem do podziału Sitemap w dużych witrynach.
changefreq
Opcjonalny element metadanych w Sitemap służący do określania przybliżonej częstotliwości aktualizacji zawartości strony. Ma siedem prawidłowych wartości: always, hourly, daily, weekly, monthly, yearly i never. Podawany jako odniesienie dla crawler wyszukiwarek do planowania częstotliwości indeksowania ponownych odwiedzin; poprawne ustawienie może zoptymalizować alokację budżetu indeksowania.
priority
Opcjonalny element metadanych w Sitemap służący do określania priorytetu ważności URL względem innych stron w obrębie witryny. Przyjmuje wartość dziesiętną z przedziału 0.0–1.0 z wartością domyślną 0.5. priority wpływa tylko na względny priorytet indeksowania między stronami w obrębie witryny i nie wpływa na rankingi w wynikach wyszukiwania.
lastmod
Opcjonalny element metadanych w Sitemap, który rejestruje datę i czas ostatniej istotnej modyfikacji zawartości strony. Format musi być zgodny ze specyfikacją W3C Datetime. Jest to najważniejsze z trzech opcjonalnych pól metadanych dla wyszukiwarek, ponieważ bezpośrednio wskazuje, czy strona ma nową zawartość wymagającą ponownego indeksowania.
loc
Wymagany element podrzędny w elementach <url> służący do określania pełnego bezwzględnego adresu URL strony. Musi zaczynać się od protokołu http:// lub https://, zawierać pełną nazwę domeny, całkowita długość URL nie może przekraczać 2048 znaków, a ścieżki względne są niedozwolone.
Przestrzeń nazw XML (xmlns)
Atrybut przestrzeni nazw XML, który musi być zadeklarowany w elemencie głównym urlset. Wartość atrybutu musi dokładnie pasować do http://www.sitemaps.org/schemas/sitemap/0.9 w celu identyfikacji wersji protokołu używanej przez Sitemap. Brakujące lub niepoprawnie napisane przestrzenie nazw spowodują niepowodzenie parsowania Sitemap.
W3C Datetime
Format reprezentacji daty i czasu określony przez W3C (World Wide Web Consortium). Pole lastmod w Sitemap musi być zgodne z tym formatem. Powszechnie używany jest uproszczony format daty YYYY-MM-DD (najlepsza zgodność), a obsługiwany jest również pełny format daty i czasu obejmujący godziny, minuty, sekundy i informacje o strefie czasowej.
Kodowanie encji XML
W składni XML znaki specjalne muszą być zakodowane do odpowiednich odwołań encji w celu poprawnego parsowania: & koduje się do &amp;, < koduje się do &lt;, > koduje się do &gt;, " koduje się do &quot;, ' koduje się do &apos;. URL zawierające te znaki muszą być zakodowane, w przeciwnym razie wystąpią błędy parsowania XML.
Google Search Console (GSC)
Oficjalne narzędzie platformy webmasterskiej Google służące do przesyłania Sitemap, przeglądania stanu indeksowania witryny, analizy danych ruchu wyszukiwania, raportów o błędach indeksowania, powiadomień o problemach bezpieczeństwa, powiadomień o karach za działania ręczne itp. Niezbędne narzędzie do optymalizacji wyszukiwarek (SEO) Google.
Bing Webmaster Tools
Oficjalna platforma webmasterska wyszukiwarki Microsoft Bing z funkcjonalnością podobną do Google Search Console. Obsługuje przesyłanie Sitemap, statystyki pokrycia indeksowania, analizę diagnostyczną SEO, badania słów kluczowych, zapytania o linki zwrotne itp., obejmując ruch wyszukiwania z obu wyszukiwarek Bing i Yahoo.
robots.txt
Plik tekstowy umieszczony w katalogu głównym witryny, który używa dyrektyw takich jak User-agent, Disallow i Allow, aby poinformować crawler wyszukiwarek, które ścieżki są dozwolone do indeksowania, a które ścieżki są zabronione. Może również deklarować lokalizacje plików Sitemap w pliku w celu automatycznego odkrycia przez crawlerów.
Crawler (Spider/Bot)
Automatyczne programy opracowane przez wyszukiwarki do pobierania zawartości sieci WWW, takie jak Googlebot (crawler Google), Bingbot (crawler Bing) i Baiduspider (crawler Baidu). Odkrywają nowe strony, śledząc linki stron i czytając pliki Sitemap, pobierając zawartość stron i przechowując ją w bazach danych indeksu wyszukiwarek.
Budżet Indeksowania (Crawl Budget)
Całkowita ilość zasobów indeksowania przydzielona przez wyszukiwarki witrynie w określonym okresie czasu, określona przez wiele czynników, w tym autorytet domeny, szybkość odpowiedzi serwera, jakość zawartości strony i historyczną skuteczność indeksowania. Poprawna konfiguracja Sitemap może pomóc zoptymalizować wydajność wykorzystania budżetu indeksowania.
Kodowanie UTF-8
Kodowanie znaków wymagane dla plików Sitemap XML. UTF-8 obsługuje wszystkie znaki Unicode, w tym polskie znaki, określone w deklaracji XML za pomocą atrybutu encoding="UTF-8". Używanie innych kodowań (takich jak ISO-8859-2) może spowodować zniekształcenie znaków w wielojęzycznych URL i niepowodzenie parsowania.
Kompresja gzip
Protokół Sitemap obsługuje transfer kompresji przy użyciu algorytmu gzip (rozszerzenie pliku .xml.gz), co może zmniejszyć rozmiar pliku Sitemap o 70%–80%, znacznie oszczędzając przepustowość serwera i czas pobierania przez crawlerów. Główne wyszukiwarki mogą automatycznie dekompresować i przetwarzać pliki Sitemap skompresowane gzip; skompresowane pliki nadal muszą przestrzegać limitu rozmiaru 50MB.
Yoast SEO
Szeroko używana wtyczka SEO na platformach CMS takich jak WordPress i Shopify, która może automatycznie generować Sitemap, meta tagi, nawigację okruszkową, mapy witryny XML, optymalizację RSS, metadane mediów społecznościowych i inne funkcje związane z SEO. Powszechnie używane rozwiązanie SEO dla witryn skupiających się na zawartości.
Pokrycie Indeksowania (Index Coverage)
Jeden z głównych raportów w Google Search Console, pokazujący szczegółowe liczby i przyczyny stron zaindeksowanych, wykluczonych, z błędami i z ostrzeżeniami w witrynie. Może być używany do weryfikacji skuteczności przesyłania Sitemap i diagnozowania problemów z indeksowaniem stron.
Kodowanie URL (Kodowanie Procentowe)
Nazywane również kodowaniem procentowym, metoda kodowania używana do reprezentowania znaków nie-ASCII (takich jak znaki diakrytyczne i symbole specjalne) w URL. Znaki narodowe są kodowane w formie %XX%XX%XX. Wielojęzyczne URL w Sitemap muszą być poprawnie zakodowane, aby zostały sparsowane.

Tabela referencyjna scenariuszy częstotliwości aktualizacji changefreq

Wartość changefreqCzęstotliwość aktualizacjiTypowe typy odpowiednich stronUwagi
alwaysMoże zmieniać się przy każdej wizycieStrony danych w czasie rzeczywistym, punkty wejścia wyszukiwania, dynamiczne strony agregacjiNie oznacza to, że crawler odwiedzają za każdym razem, tylko wskazuje na ekstremalnie wysoką częstotliwość zmian; nie nadużywaj — zwykłe strony nie powinny być ustawione na always
hourlyAktualizuje się co godzinęStrony główne wiadomości, kanały mediów społecznościowych, strony notowań w czasie rzeczywistymOdpowiednie dla stron z godzinną nową zawartością; witryny nieczęsto aktualizowane nie powinny być ustawione na hourly
dailyAktualizuje się codziennieStrona główna witryny, strony list blogów, strony kanałów informacyjnych, strony kategorii produktówJedna z najczęściej używanych wartości; odpowiednia dla większości stron głównych i stron sekcji witryn
weeklyAktualizuje się co tydzieńZwykłe strony szczegółów artykułów, strony szczegółów produktów, strony postów blogowychOdpowiednie dla stron zawartości w większości witryn skupiających się na zawartości
monthlyAktualizuje się co miesiącStrony katalogów kategorii, strony archiwów, strony FAQ, strony przewodników użytkownikaStrony pomocnicze z rzadkimi aktualizacjami zawartości, ale okazjonalnymi dostosowaniami
yearlyAktualizuje się co rokStrony wprowadzające firmę, strony kontaktowe, warunki świadczenia usług, polityka prywatnościStatyczne strony informacyjne, które prawie nigdy się nie zmieniają
neverNigdy nie aktualizuje sięArchiwa historycznych artykułów, strony wydarzeń wygasłych, zarchiwizowana stara zawartośćUstaw strony potwierdzone jako niemodyfikowane na never; pamiętaj, aby zmienić je z powrotem natychmiast, jeśli wystąpią aktualizacje

Tabela referencyjna ustawiania priorytetu priority

Wartość priorityPoziom priorytetuOdpowiednie typy stronZalecany stosunek liczby stron
1.0NajwyższyStrona główna witryny, główne strony docelowe, najważniejsze punkty wejścia kanałówTylko 1–3 strony w całej witrynie
0.8-0.9Bardzo wysokiGłówne strony sekcji, popularne strony kategorii, główne strony produktów, kluczowe tematy specjalneOkoło 5–10% wszystkich stron
0.6-0.7WysokiDrugorzędne strony sekcji, strony podkategorii, popularne artykuły, ważne szczegóły produktówOkoło 10–20% wszystkich stron
0.4-0.5NormalnyZwykłe strony szczegółów artykułów, ogólne strony produktów, standardowe strony zawartościOkoło 40–60% wszystkich stron (wartość domyślna)
0.2-0.3NiskiStrony tagów, podział na strony archiwów, archiwa starych artykułów, strony pomocniczeOkoło 15–25% wszystkich stron
0.0-0.1NajniższyStrony o niskiej wartości, strony z powieloną zawartością, strony niepriorytetowe do indeksowaniaW granicach około 5% wszystkich stron; 0 nie oznacza noindex

Tabela limitów specyfikacji protokołu Sitemap

Element limituGórny limitOpisRozwiązanie w przypadku przekroczenia
Liczba URL na pojedynczy Sitemap50,000 wpisówWymaganie stałe protokołu sitemap.org 0.9Użyj Sitemap Index do podziału na wiele podrzędnych Sitemap
Nieskompresowany rozmiar pojedynczego pliku Sitemap50MB (52428800 bajtów)Surowy rozmiar pliku wraz ze wszystkimi tagami i białymi znakamiUżyj kompresji gzip, podziel Sitemap, zminimalizuj komentarze
Liczba podrzędnych Sitemap na Sitemap Index50,000 wpisówLimit wpisów URL dla samego pliku indeksuTeoretycznie obsługuje 2,5 miliarda URL; niepotrzebne dla większości witryn
Długość pojedynczego URL2,048 znakówW tym protokół, domena, ścieżka i wszystkie parametry zapytaniaZbyt długie URL wymagają uproszczenia parametrów lub przepisania URL
Kodowanie obsługiwane przez SitemapUTF-8Wymagane przez protokół; inne kodowania mogą spowodować niepowodzenie parsowaniaUpewnij się, że pliki są zapisywane przy użyciu kodowania UTF-8
Protokoły obsługiwane przez Sitemaphttp:// lub https://URL muszą zawierać pełny prefiks protokołuftp:// i inne protokoły nie są obsługiwane
Czas odpowiedzi crawlera po przesłaniuOd kilku godzin do kilku dniZależy od autorytetu witryny i złożoności SitemapNie ma potrzeby ponownego przesyłania; poczekaj cierpliwie na przetworzenie
Rozmiar pliku skompresowanego gzip50MBSkompresowane pliki również nie mogą przekraczać limitu 50MBPrzekroczenie po kompresji nadal wymaga podziału Sitemap