Generator Robots.txt
Generator reguł robots.txt
Obsługuje wielo-liniowe Allow / Disallow / Sitemap, automatycznie składa standardowy format.
Internetowy generator Robots.txt od GeekFormat pozwala konfigurować User-agent, reguły Allow/Disallow, deklaracje Sitemap i dyrektywy Host za pomocą wizualnych formularzy, generując w czasie rzeczywistym pliki robots.txt zgodne ze standardem Robots Exclusion Protocol. Strona otwiera się z domyślnymi wartościami przykładowymi, modyfikacja dowolnego pola natychmiast aktualizuje podgląd, a kopiowanie jednym kliknięciem jest gotowe do wdrożenia w katalogu głównym witryny. Działa w całości w przeglądarce, dane konfiguracyjne nie są wysyłane na żadne serwery.
Powiązane Rekomendacje
O Robots.txt i Protokole Wykluczenia Crawlerów
robots.txt to jeden z najbardziej podstawowych sposobów komunikacji witryny z crawlerami wyszukiwarek, pełna nazwa Robots Exclusion Protocol (Protokół Wykluczenia Robotów, w skrócie REP). Jest to prosty plik tekstowy umieszczony w katalogu głównym witryny, który za pomocą prostych dyrektyw informuje zgodne crawlery wyszukiwarek, które części witryny mogą być indeksowane, a które części nie powinny być indeksowane. robots.txt został pierwotnie zaproponowany przez Martijna Kostera w 1994 roku; po prawie 30 latach rozwoju został formalnie ustandaryzowany przez IETF jako RFC 9309 w 2022 roku.
Podstawowa struktura robots.txt składa się z jednej lub więcej grup reguł (Group). Każda grupa reguł zaczyna się od jednego lub więcej wierszy User-agent, określających crawlery, do których reguły mają zastosowanie (* oznacza wszystkie crawlery); następnie następuje kilka wierszy Allow i Disallow, określających odpowiednio prefiksy ścieżek dozwolonych i zabronionych do indeksowania; na końcu pliku można dodać dyrektywy niegrupowe, takie jak Sitemap i Host. Grupy reguł są oddzielone pustymi wierszami. Typowy robots.txt zawiera: deklarację User-agent → reguły ścieżki Allow/Disallow → (opcjonalnie) więcej grup User-agent → deklarację Sitemap → dyrektywę Host.
Pole User-agent określa nazwę crawlera, do którego reguły mają zastosowanie. Typowe nazwy crawlerów wyszukiwarek obejmują: Googlebot (wyszukiwanie Google), Bingbot (wyszukiwanie Bing), Baiduspider (wyszukiwanie Baidu), YandexBot (wyszukiwanie Yandex), DuckDuckBot (wyszukiwanie DuckDuckGo), Twitterbot (pobieranie kart Twitter/X), facebookexternalhit (podgląd linków Facebook), GPTBot (crawler OpenAI GPT), Bytespider (wyszukiwanie ByteDance/Toutiao) itp. Użyj User-agent: * jako symbolu wieloznacznego, aby dopasować wszystkie crawlery nie dopasowane indywidualnie.
Dyrektywy Allow i Disallow używają zasady dopasowywania prefiksów (Prefix Matching): o ile ścieżka URL zaczyna się od określonej wartości, reguła jest dopasowana. Na przykład Disallow: /admin zablokuje /admin, /admin/, /admin/login.html, /administrator i wszystkie ścieżki zaczynające się od /admin. Jeśli chcesz precyzyjnie dopasować tylko katalog /admin/, napisz Disallow: /admin/ (z ukośnikiem końcowym). Według standardu RFC 9309, gdy Allow i Disallow są dopasowane jednocześnie, reguła z najdłuższą ścieżką wygrywa; przy równej długości pierwszeństwo ma Allow. Oznacza to, że im bardziej szczegółowa reguła, tym wyższy priorytet.
Dyrektywa Sitemap służy do informowania wyszukiwarek o lokalizacji mapy witryny, pomagając crawlerom bardziej efektywnie odkrywać i indeksować strony witryny. Wiersze Sitemap muszą być umieszczone po wszystkich grupach reguł (lub na końcu pliku); adresy URL muszą być pełnymi adresami bezwzględnymi (w tym http:// lub https://). W pliku robots.txt można zadeklarować wiele Sitemap, każdy w osobnym wierszu. Duże witryny zazwyczaj dzielą wiele Sitemap (sklasyfikowanych według typu treści, częstotliwości aktualizacji) i zarządzają nimi jednolicie przez plik indeksu Sitemap.
Dyrektywa Host to niestandardowa, ale szeroko stosowana dyrektywa zaproponowana przez Yandex, służąca do określania preferowanej domeny witryny (głównego lustra). Na przykład, gdy example.com i www.example.com istnieją jednocześnie, Host: example.com informuje wyszukiwarki, że example.com jest preferowana. Ważna uwaga: Google oświadczył, że nie używa dyrektywy Host, preferowaną domenę należy ustawić przez Google Search Console; Bing również nie obsługuje jej jednoznacznie. Dyrektywa Host powinna być umieszczona po Sitemap i występować tylko raz.
Prawidłowa konfiguracja robots.txt ma znaczenie dla SEO: po pierwsze, zapobiega marnowaniu przez crawlery budżetu indeksowania na bezsensowne strony (takie jak strony wyników wyszukiwania, stron filtrów, stron zduplikowanej treści), pozwalając im bardziej efektywnie indeksować wartościową treść; po drugie, zapobiega indeksowaniu prywatnych lub niskowartościowych stron (takich jak admin, strony testowe, strony do druku); po trzecie, aktywnie kieruje crawlery do odkrywania nowych stron przez Sitemap. Należy jednak pamiętać: robots.txt to umowa dżentelmeńska i nie zastępuje rzeczywistych środków bezpieczeństwa; adresy URL z Disallow, do których prowadzą zewnętrzne linki, mogą nadal być wyświetlane w wynikach wyszukiwania z adresem URL (tylko treść nie będzie indeksowana); całkowite zabronienie indeksowania może wpłynąć na ogólną ocenę wagi witryny.
Typowe błędy w robots.txt obejmują: ① błędnie zapisaną ścieżkę (np. Disallow: admin bez początkowego ukośnika, powinno być /admin); ② używanie wyrażeń regularnych (standardowy REP nie obsługuje regex, tylko Googlebot obsługuje ograniczone symbole wieloznaczne * i $); ③ zabronienie indeksowania plików JS/CSS (uniemożliwi Google renderowanie stron); ④ Disallow: / (zabronienie całej witryny, fatalny błąd prowadzący do całkowitej nieindeksacji); ⑤ problem z kodowaniem pliku (musi być kodowanie UTF-8); ⑥ umieszczenie w podkatalogu zamiast w katalogu głównym; ⑦ uprawnienia pliku uniemożliwiające dostęp (musi zwracać kod statusu 200 OK). Zaleca się sprawdzenie po wygenerowaniu za pomocą narzędzia testowego robots.txt Google Search Console lub narzędzia inspekcji robots.txt tej platformy.
Przypadki użycia
- Konfiguracja podstawowego robots.txt przed uruchomieniem nowej witryny, jasne określenie ścieżek dozwolonych i zabronionych do indeksowania, kierowanie wyszukiwarek do prawidłowego indeksowania
- Aktualizacja reguł Disallow po przebudowie witryny, aby zapobiec dalszemu indeksowaniu starych katalogów wpływających na rozkład wagi SEO
- Dodawanie wielu adresów Sitemap, aby pomóc wyszukiwarkom szybciej odkrywać strukturę stron całej witryny, poprawiając efektywność indeksowania
- Blokowanie katalogów administracyjnych (/admin), środowisk testowych i prywatnych katalogów, aby zapobiec indeksowaniu przez crawlery, zmniejszając ryzyko bezpieczeństwa
- Konfiguracja dyrektywy Host w celu określenia preferowanej domeny witryny (z www lub bez www), zmniejszając problemy z zduplikowaną treścią
- Konfiguracja niezależnych reguł indeksowania dla różnych crawlerów wyszukiwarek (Googlebot, Bingbot, Baiduspider itp.)
- Czasowe zabronienie dostępu crawlerom do katalogów w trakcie konserwacji, ponowne zezwolenie na indeksowanie po zakończeniu aktualizacji
- Generowanie plików robots.txt w standardowym formacie, zapobiegając błędom parsowania przez wyszukiwarki z powodu ręcznych błędów formatowania
- Konfiguracja wielu Sitemap (np. sitemap artykułów, sitemap produktów, sitemap obrazów) w celu obejmowania wszystkich typów treści witryny
- Prezentacja konfiguracji reguł robots.txt w rozwoju frontend, nauczanie standardowego formatu protokołu crawlerów
- Używanie wraz z narzędziem inspekcji robots.txt w celu sprawdzenia, czy wygenerowane reguły odpowiadają oczekiwaniom, zapobiegając przypadkowemu zablokowaniu ważnych stron
- Szybkie tworzenie szablonu robots.txt, pobieranie i dostosowywanie do rzeczywistej sytuacji witryny przed wdrożeniem
Jak Używać
- W polu wprowadzania User-agent określ docelowego crawlera (domyślnie * reprezentuje wszystkie crawlery wyszukiwarek)
- W obszarze Allow wpisz ścieżki dozwolone do indeksowania, po jednej regule na wiersz (np. /, /blog/)
- W obszarze Disallow wpisz ścieżki zabronione do indeksowania, po jednej regule na wiersz (np. /admin, /private)
- W obszarze Sitemap dodaj adresy mapy witryny XML (obsługuje wiele wierszy); w obszarze Host wpisz preferowaną domenę
- Obszar podglądu po prawej stronie wyświetla w czasie rzeczywistym wygenerowaną zawartość robots.txt; po potwierdzeniu kliknij przycisk kopiowania, aby wdrożyć
Funkcje
- Niezależna konfiguracja wielu reguł: User-agent, Allow, Disallow, Sitemap i Host mają oddzielne pola wprowadzania, reguły są jasno skategoryzowane i nie mieszają się
- Generowanie z podglądem w czasie rzeczywistym: zawartość robots.txt jest natychmiast aktualizowana po zmianie dowolnej reguły, bez konieczności ręcznego klikania przycisku generuj, co widzisz, to dostajesz
- Domyślna reguła awaryjna: gdy Allow i Disallow są puste, automatycznie generowane jest Allow: /, co zapobiega tworzeniu pustych plików powodujących niepewne zachowanie crawlera
- Obsługa wielu Sitemap: obszar Sitemap obsługuje wprowadzanie w wielu wierszach, każdy URL jest wyświetlany jako osobna deklaracja Sitemap, idealne dla witryn z wieloma Sitemap
- Kopiowanie i wdrażanie jednym kliknięciem: wynik obsługuje kopiowanie do schowka jednym kliknięciem, gotowy do bezpośredniego wklejenia w katalogu głównym witryny
- Wstępnie wypełniony domyślny przykład: strona otwiera się z domyślną przykładową konfiguracją (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), początkujący mogą od razu zapoznać się i zmodyfikować
- Wyjście w standardowym formacie: ściśle przestrzega specyfikacji Robots Exclusion Protocol, wiersz User-agent najpierw, wiersze reguł potem, Sitemap/Host na końcu, kompatybilne ze wszystkimi wyszukiwarkami
- Inteligentne przetwarzanie ścieżek: automatycznie usuwa spacje na początku/końcu każdego wiersza, filtruje puste wiersze, zapobiega unieważnianiu reguł przez dodatkowe spacje
- Responsywny układ kolumnowy: na PC podział lewo-prawo (konfiguracja/podgląd), na urządzeniach mobilnych układ góra-dół, działa dobrze na komputerze i telefonie
- Podgląd czcionką o stałej szerokości: obszar podglądu używa czcionki o stałej szerokości do wyświetlania wyniku, format robots.txt jest uporządkowany i czytelny
- Obsługa dyrektywy Host: można skonfigurować preferowaną domenę Host (obsługiwaną przez wyszukiwarki takie jak Yandex), zmniejszając problemy z zduplikowaną treścią domeny
- Całkowicie lokalne działanie w przeglądarce: wszystkie konfiguracje i generowanie odbywają się lokalnie w JavaScript w przeglądarce, bez wysyłania danych na serwery
- Natychmiastowe użycie bez zależności: otwórz stronę i używaj od razu, bez rejestracji lub logowania, bez instalowania oprogramowania
- Integracja z narzędziem inspekcyjnym: powiązane linki prowadzą bezpośrednio do narzędzia inspekcji robots.txt, można od razu sprawdzić poprawność reguł po wygenerowaniu
Często Zadawane Pytania
Do czego służy robots.txt? Dlaczego witryna powinna mieć ten plik?
robots.txt to prosty plik tekstowy umieszczony w katalogu głównym witryny, używany do informowania crawlerów wyszukiwarek (takich jak Googlebot, Bingbot, Baiduspider itp.), które ścieżki mogą być indeksowane, a które są zabronione. Jest to implementacja Robots Exclusion Protocol (Protokołu Wykluczenia Robotów) i jest centralnym plikiem do zarządzania indeksowaniem witryny oraz podstawowych ustawień SEO. Chociaż nie jest to wymagane, prawie wszystkie regularne witryny konfigurują robots.txt, aby kierować zachowaniem crawlerów.
Gdzie powinien być umieszczony plik robots.txt?
robots.txt musi być umieszczony w katalogu głównym witryny i być dostępny bezpośrednio pod adresem http://twoja-domena/robots.txt. Na przykład https://example.com/robots.txt. Uwaga: nie umieszczaj w podkatalogach (np. /blog/robots.txt jest nieprawidłowe), crawlery szukają tego pliku tylko w katalogu głównym. Nazwa pliku musi być napisana małymi literami: robots.txt, nie Robots.txt lub ROBOTS.TXT.
Co jest generowane, gdy Allow i Disallow są puste?
Gdy Allow i Disallow nie są wypełnione, generator automatycznie wyświetla Allow: / jako regułę awaryjną, oznaczającą zezwolenie na indeksowanie całej witryny. Zapobiega to generowaniu pustych plików lub niekompletnych robots.txt z tylko wierszem User-agent, zapobiegając niepewnemu zachowaniu crawlera z powodu niejasnych reguł.
Czy mogę skonfigurować wiele adresów Sitemap?
Tak. Obszar Sitemap obsługuje wprowadzanie w wielu wierszach; każdy URL jest wyświetlany jako osobna deklaracja Sitemap. Na przykład duże witryny zazwyczaj mają wiele plików sitemap (sitemap artykułów, sitemap produktów, sitemap obrazów itp.), można wpisać jeden pełny adres URL Sitemap na wiersz (musi być pełną ścieżką bezwzględną, w tym http:// lub https://).
Jaka jest funkcja dyrektywy Host? Czy wszystkie wyszukiwarki ją obsługują?
Dyrektywa Host służy do określania preferowanej domeny witryny (np. example.com lub www.example.com), pomagając wyszukiwarkom zidentyfikować domenę główną i zmniejszając problemy z zduplikowaną treścią między wersjami www i bez www. Obecnie dyrektywa Host jest obsługiwana głównie przez wyszukiwarki takie jak Yandex; Google nie używa jej bezpośrednio, preferując ustawianie preferowanej domeny przez Google Search Console. Zaleca się jej skonfigurowanie, ale nie poleganie na niej całkowicie.
Co oznacza User-agent: *? Jak skonfigurować reguły dla określonych crawlerów?
User-agent: * oznacza, że reguły dotyczą wszystkich crawlerów (gwiazdka to symbol wieloznaczny). Jeśli chcesz skonfigurować niezależne reguły dla konkretnej wyszukiwarki, ustaw User-agent na konkretną nazwę crawlera, taką jak Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X) itp. Możesz skonfigurować wiele grup User-agent oddzielonych pustymi wierszami.
Czy robots.txt naprawdę chroni wrażliwe katalogi przed dostępem?
Nie. robots.txt to tylko umowa dżentelmeńska; zgodne crawlery wyszukiwarek przestrzegają reguł, ale złośliwe crawlery i skanery hakerskie mogą je całkowicie zignorować. Nie polegaj na robots.txt do ochrony naprawdę wrażliwej treści (takiej jak hasła administracyjne, dane prywatności użytkowników); wrażliwe katalogi powinny używać uwierzytelniania po stronie serwera (ochrona hasłem, biała lista IP) i innych rzeczywistych środków bezpieczeństwa. Funkcją robots.txt jest kierowanie zgodnych crawlerów, a nie ochrona bezpieczeństwa.
Jakie są reguły dopasowywania ścieżek dla Disallow?
Reguła Disallow używa dopasowywania prefiksów: Disallow: /admin dopasuje /admin, /admin/, /admin/login.html, /administrator i wszystkie ścieżki zaczynające się od /admin. Jeśli chcesz dopasować tylko zawartość katalogu /admin/, napisz Disallow: /admin/ (z ukośnikiem końcowym). Disallow: (pusta wartość) oznacza nie zabraniać żadnej ścieżki (czyli wszystko dozwolone). Uwaga: reguły rozróżniają wielkość liter.
Jak wdrożyć wygenerowany robots.txt na witrynie?
Kliknij przycisk kopiowania, aby skopiować wygenerowaną zawartość do schowka; na serwerze utwórz prosty plik tekstowy o nazwie robots.txt, wklej zawartość i prześlij plik do katalogu głównego witryny (zazwyczaj web root, public_html, www lub katalog dist). Po wdrożeniu sprawdź dostęp pod adresem https://twoja-domena/robots.txt, aby potwierdzić, że działa; możesz również użyć narzędzia testowego robots.txt Google Search Console do sprawdzenia reguł.
Po jakim czasie zmiany w robots.txt zaczynają obowiązywać?
Następnym razem, gdy crawler wyszukiwarki odwiedzi Twoją witrynę, ponownie zaindeksuje plik robots.txt; zazwyczaj zaczyna obowiązywać w ciągu kilku godzin do kilku dni. Jeśli chcesz, aby wyszukiwarki jak najszybciej odkryły aktualizację, prześlij żądanie aktualizacji robots.txt w Google Search Console lub Bing Webmaster Tools. Uwaga: już zindeksowane strony mogą pozostać w wynikach przez pewien czas nawet po Disallow; całkowite usunięcie wymaga użycia tagu noindex lub narzędzia usuwania URL.
Gdy Allow i Disallow są w konflikcie, która ma pierwszeństwo?
Według RFC 9309 (formalnego standardu Robots Exclusion Protocol), gdy długości ścieżek reguł Allow i Disallow są takie same, Allow ma pierwszeństwo przed Disallow; gdy długości się różnią, reguła z najdłuższą dopasowaną ścieżką ma pierwszeństwo. Na przykład w konflikcie między Allow: /blog a Disallow: /blog/ dostęp do /blog/post.html dopasuje Disallow (ścieżka dłuższa /blog/ > /blog), podczas gdy dostęp do samego /blog dopasuje Allow. Mówiąc prościej: im bardziej szczegółowa reguła, tym wyższy priorytet.
Czy mogę dodawać komentarze w robots.txt?
Tak, wiersze zaczynające się od # to wiersze komentarzy; crawlery ignorują zawartość po #. Komentarze mogą być napisane w osobnym wierszu lub na końcu wierszy reguł (zawartość po #). Na przykład: # Block admin area lub Disallow: /admin # admin panel. Dodawanie odpowiednich komentarzy pomaga Tobie i członkom zespołu zrozumieć funkcję każdej reguły.
Czy adresy URL Sitemap muszą być ścieżkami bezwzględnymi?
Tak, dyrektywa Sitemap musi używać pełnego bezwzględnego adresu URL (w tym protokołu i domeny), np. Sitemap: https://example.com/sitemap.xml. Nie używaj ścieżek względnych (np. /sitemap.xml), ponieważ crawlery mogą uzyskiwać dostęp do Twojej witryny z różnych domen (np. example.com i www.example.com), a ścieżki względne uniemożliwią crawlerom określenie prawidłowego adresu.
Czy dane konfiguracyjne są wysyłane na serwer?
Absolutnie nie. Wszystkie konfiguracje i generowanie robots.txt odbywają się lokalnie w Twojej przeglądarce przez JavaScript; wprowadzone ścieżki, domeny i inne dane konfiguracyjne nie są wysyłane na żadne zewnętrzne serwery. Strona może być używana offline (podstawowe funkcje) po załadowaniu; po zamknięciu strony dane są automatycznie czyszczone bez pozostawiania rekordów.
Czy wygenerowany robots.txt może być używany na dowolnej witrynie?
Tak, generator tworzy prosty plik tekstowy w standardowym formacie Robots Exclusion Protocol, odpowiedni dla dowolnego serwera WWW (Nginx, Apache, IIS, Caddy itp.) i dowolnej platformy tworzenia witryn (WordPress, Shopify, Next.js, Django, Rails itp.). Wystarczy wdrożyć w katalogu głównym witryny i zapewnić publiczny dostęp.
Rozwiązywanie problemów
Dostęp do wygenerowanego pliku zwraca błąd 404?
Upewnij się, że plik robots.txt został przesłany do katalogu głównego witryny (nie podkatalogu), nazwa pliku jest małymi literami robots.txt, a uprawnienia pliku są ustawione na publiczne odczyt (zazwyczaj uprawnienia 644 są wystarczające). Po przesłaniu bezpośrednio przejdź do https://twoja-domena/robots.txt w przeglądarce, aby potwierdzić widoczność treści. Lokalizacja katalogu głównego różni się w zależności od serwera: Nginx/Apache zazwyczaj /var/www/html/ lub /usr/share/nginx/html/, Vercel/Netlify zazwyczaj katalog public/.
Reguły Disallow nie działają, strony są nadal indeksowane?
Możliwe przyczyny: ① crawler jeszcze nie ponownie zaindeksował robots.txt (poczekaj kilka dni lub prześlij aktualizację w Search Console); ② nieprawidłowe dopasowanie prefiksu ścieżki (np. Disallow: admin bez /, powinno być Disallow: /admin/); ③ strona była już zaindeksowana przed dodaniem Disallow (już zaindeksowane strony nie są automatycznie usuwane); ④ złośliwe crawlery nie przestrzegają robots.txt; ⑤ istnieje konfliktująca reguła Allow obejmująca Disallow (Allow ma pierwszeństwo przy dłuższej ścieżce). Do całkowitego usunięcia z indeksu użyj tagu noindex.
Google Search Console zgłasza, że robots.txt blokuje strony?
Zazwyczaj oznacza to, że ważne strony zostały przypadkowo zablokowane przez Disallow. Sprawdź robots.txt pod kątem zbyt szerokich reguł Disallow (takich jak Disallow: / lub Disallow: /*?); upewnij się, że pliki CSS/JS nie są zabronione (Google potrzebuje indeksować te pliki, aby renderować strony). Użyj narzędzia testowego robots.txt w Search Console, aby wprowadzić określone adresy URL i sprawdzić, która reguła blokuje.
Przypadkowo ustawiono Disallow: / i cała witryna została zabroniona do indeksowania?
Natychmiast usuń lub zmień tę regułę, zmień robots.txt na Allow: / lub usuń wiersz Disallow: /, prześlij zaktualizowany plik na serwer. Następnie prześlij żądanie aktualizacji robots.txt w Google Search Console i prześlij sitemap, aby przyspieszyć ponowne indeksowanie. Strony już usunięte z indeksu mogą potrzebować od kilku dni do kilku tygodni na ponowne zaindeksowanie.
Słownik
- robots.txt
- Prosty plik tekstowy umieszczony w katalogu głównym witryny, zgodny z Robots Exclusion Protocol, używany do informowania zgodnych crawlerów wyszukiwarek, które ścieżki są dozwolone/zabronione do indeksowania.
- Robots Exclusion Protocol (REP)
- Protokół Wykluczenia Robotów, zaproponowany w 1994 roku i ustandaryzowany jako RFC 9309 w 2022 roku, jest de facto standardem komunikacji reguł indeksowania między witrynami a crawlerami.
- User-agent
- Początkowe pole grupy reguł, określa nazwę crawlera, do którego mają zastosowanie kolejne reguły Allow/Disallow; symbol wieloznaczny * dopasowuje wszystkie crawlery.
- Disallow
- Dyrektywa zabronienia indeksowania, określa prefiksy ścieżek, do których crawlery nie powinny uzyskiwać dostępu. Na przykład Disallow: /admin zabrania indeksowania wszystkich ścieżek zaczynających się od /admin.
- Allow
- Dyrektywa zezwolenia na indeksowanie, określa ścieżki jawnie dozwolone dla crawlerów. Używana do otwierania określonych podścieżek pod nadrzędną ścieżką Disallow.
- Sitemap
- Dyrektywa deklaracji mapy witryny, informuje wyszukiwarki o pełnym adresie URL mapy witryny XML witryny, pomaga crawlerom efektywnie odkrywać i indeksować wszystkie strony.
- Host
- Dyrektywa preferowanej domeny, określa domenę główną witryny (np. example.com vs www.example.com); obsługiwana przez Yandex, Google konfiguruje przez Search Console.
- Crawler/Bot/Spider
- Crawler/bot/pająk, zautomatyzowany program wyszukiwarek, który uzyskuje dostęp do stron internetowych i zbiera treści, taki jak Googlebot, Bingbot, Baiduspider itp.
- Googlebot
- Crawler sieciowy wyszukiwarki Google, odpowiedzialny za pobieranie treści stron internetowych do indeksowania i rankingu Google, jest jednym z najczęstszych crawlerów wyszukiwarek.
- Crawl Budget
- Budżet/kwota indeksowania, limit częstotliwości indeksowania i liczby stron, które wyszukiwarki przydzielają każdej witrynie. Prawidłowa konfiguracja robots.txt zapobiega marnowaniu kwoty indeksowania.
- Prefix Matching
- Zasada dopasowywania prefiksów, metoda dopasowywania ścieżek robots.txt. Ścieżka URL zaczynająca się od wartości reguły jest pomyślnie dopasowana; im dłuższa reguła, tym wyższy priorytet.
- noindex
- Znacznik meta HTML lub dyrektywa nagłówka HTTP (X-Robots-Tag: noindex), informuje wyszukiwarki, aby nie indeksowały tej strony w wynikach wyszukiwania. W przeciwieństwie do Disallow robots.txt, noindex jest bardziej wiarygodnym sposobem usunięcia z indeksu.
Nazwy User-agent Typowych Crawlerów Wyszukiwarek
Nazwy User-agent używane podczas konfiguracji reguł dla określonych crawlerów:
| Nazwa Crawlera | Wyszukiwarka | Przeznaczenie |
|---|---|---|
* | Wszystkie crawlery | Symbol wieloznaczny, dopasowuje wszystkie crawlery nie skonfigurowane indywidualnie |
Googlebot | Crawler stron sieciowych wyszukiwania Google | |
Bingbot | Bing/Microsoft | Crawler stron sieciowych wyszukiwania Bing |
Baiduspider | Baidu | Crawler stron sieciowych wyszukiwania Baidu |
YandexBot | Yandex | Crawler stron sieciowych wyszukiwania Yandex |
GPTBot | OpenAI | Crawler zbierania danych treningowych ChatGPT |
Twitterbot | X/Twitter | Crawler podglądu kart linków platformy X |
facebookexternalhit | Crawler podglądu linków Facebook |
Przykłady Typowych Reguł robots.txt
Konfiguracje typowych reguł dla różnych scenariuszy witryn:
| Reguła | Efekt |
|---|---|
Disallow: /admin/ | Zabrania indeksowania całej treści w katalogu /admin/ |
Disallow: /*? | Zabrania indeksowania URL z parametrami zapytania (Googlebot obsługuje symbol wieloznaczny *) |
Disallow: /search | Zabrania indeksowania stron wyników wyszukiwania wewnętrznego |
Allow: /public/ | Jawnie zezwala na indeksowanie katalogu /public/ |
Disallow: / | ⚠️ Zabrania indeksowania całej witryny (fatalny błąd, używaj ostrożnie!) |
Allow: / | Zezwala na indeksowanie całej treści witryny |
Tabela Szybkiego Odniesienia Standardowych Dyrektyw robots.txt
Standardowe dyrektywy i ich użycie zdefiniowane przez RFC 9309:
| Dyrektywa | Zakres | Przykład Format | Opis |
|---|---|---|---|
User-agent | Początek grupy | User-agent: * | Określa nazwę crawlera, do którego reguły mają zastosowanie |
Disallow | W grupie | Disallow: /admin | Prefiks ścieżki zabroniony do indeksowania |
Allow | W grupie | Allow: /public | Prefiks ścieżki dozwolony do indeksowania |
Sitemap | Poza grupą | Sitemap: https://example.com/sitemap.xml | Deklaruje lokalizację mapy witryny (bezwzględny URL) |
# | Dowolna pozycja | # This is a comment | Wiersz komentarza, ignorowany przez crawlery |
Privacy & Security
Wszystkie operacje tego Generatora Robots.txt są wykonywane w całości lokalnie w Twojej przeglądarce: wprowadzane konfiguracje, takie jak User-agent, reguły ścieżek, Sitemap i Host, są wszystkie składane w czasie rzeczywistym przez JavaScript w pamięci przeglądarki w celu wygenerowania tekstu robots.txt, bez wysyłania przez sieć na jakikolwiek serwer. Strona jest gotowa do użycia po załadowaniu, nie używa śledzenia przez Cookie i nie zbiera żadnych danych użytkownika. Po zamknięciu lub odświeżeniu strony cała zawartość konfiguracji jest automatycznie czyszczona, bez trwałego przechowywania w przeglądarce.
Authoritative References
- Generator nagłówka Authentication
- Parser nagłówka Cache-Control
- Parser nagłówka Content-Disposition
- Generator nagłówków CORS
- Inspektor CORS
- Generator CSP
- Konwerter cURL na kod
- Globalne Sprawdzanie Propagacji DNS
- Wyszukiwanie DNS
- Parser nagłówków Forwarded
- Generator tagów hreflang
- Analizator HSTS
- Parser plików cookie HTTP
- Sprawdzanie nagłówków HTTP
- Tester żądań HTTP
- Wyszukiwarka kodów statusu HTTP
- Wyszukiwanie IP
- Konwerter IPv4
- Ekspander zakresu IPv4
- Zestaw narzędzi IPv6
- Parser nagłówka Link
- Wyszukiwanie MX
- Sprawdzanie portów
- Kreator parametrów URL
- Parser nagłówka Rate Limit
- Sprawdzanie przekierowań
- Generator Robots.txt
- Inspekcja robots.txt
- Sprawdzanie nagłówków bezpieczeństwa
- Generator security.txt
- Parser Set-Cookie
- Audyt sieci strony
- Generator Sitemap
- Inspekcja Sitemap
- Sprawdzanie Certyfikatów SSL
- Kalkulator Podsieci
- Parser URL
- Parser User-Agent
- Generator linków UTM
- Tester WebSocket
- What Is My IP?
- Wyszukiwanie WHOIS