Robots.txt-Generator
robots.txt-Regelgenerator
Unterstützt mehrzeilige Allow / Disallow / Sitemap, stellt automatisch das Standardformat zusammen.
Der Online-Robots.txt-Generator von GeekFormat ermöglicht es Ihnen, User-agent, Allow/Disallow-Regeln, Sitemap-Deklarationen und Host-Direktiven über ein visuelles Formular zu konfigurieren und in Echtzeit robots.txt-Dateien gemäß dem Robots Exclusion Protocol zu generieren. Die Seite wird mit Standardbeispielwerten geöffnet – ändern Sie ein beliebiges Feld, um Ergebnisse sofort anzuzeigen, und kopieren Sie sie mit einem Klick, um sie im Stammverzeichnis Ihrer Website bereitzustellen. Läuft vollständig lokal in Ihrem Browser; keine Konfigurationsdaten werden an einen Server hochgeladen.
Ähnliche Tools
Über Robots.txt und das Robots-Ausschlussprotokoll
robots.txt ist eine der grundlegendsten Methoden, mit denen Websites mit Suchmaschinen-Crawlern kommunizieren, vollständiger Name Robots Exclusion Protocol (Robots-Ausschlussprotokoll, Abkürzung REP). Es ist eine reine Textdatei im Stammverzeichnis einer Website, die einfache Direktiven verwendet, um konformen Suchmaschinen-Crawlern mitzuteilen, welche Teile der Website gecrawlt werden dürfen und welche nicht erwünscht sind. robots.txt wurde erstmals 1994 von Martijn Koster vorgeschlagen; nach fast 30 Jahren Entwicklung wurde es 2022 von der IETF als RFC 9309 formal standardisiert.
Die Grundstruktur von robots.txt besteht aus einer oder mehreren Regelgruppen. Jede Regelgruppe beginnt mit einer oder mehreren User-agent-Zeilen, die die Crawler angeben, für die die Regeln gelten (* bedeutet alle Crawler); gefolgt von mehreren Allow- und Disallow-Zeilen, die jeweils Pfadpräfixe angeben, die für das Crawlen erlaubt und verboten sind; am Ende der Datei können nicht-gruppenebene Direktiven wie Sitemap und Host hinzugefügt werden. Jede Regelgruppe ist durch Leerzeilen getrennt. Eine typische robots.txt enthält: User-agent-Deklaration → Allow/Disallow-Pfadregeln → (optional) weitere User-agent-Gruppen → Sitemap-Deklaration → Host-Direktive.
Das User-agent-Feld gibt den Namen des Crawlers an, für den die Regeln gelten. Häufige Suchmaschinen-Crawlernamen sind: Googlebot (Google-Suche), Bingbot (Bing-Suche), Baiduspider (Baidu-Suche), YandexBot (Yandex-Suche), DuckDuckBot (DuckDuckGo-Suche), Twitterbot (Twitter/X-Kartenabruf), facebookexternalhit (Facebook-Linkvorschau), GPTBot (OpenAI-GPT-Crawler), Bytespider (ByteDance/Toutiao-Suche) usw. Verwenden Sie User-agent: * als Platzhalter, um alle nicht separat übereinstimmenden Crawler zu erfassen.
Allow- und Disallow-Direktiven verwenden das Prinzip der Präfixübereinstimmung (Prefix Matching): Solange ein URL-Pfad mit dem angegebenen Wert beginnt, stimmt die Regel überein. Zum Beispiel blockiert Disallow: /admin alle Pfade, die mit /admin beginnen, wie /admin, /admin/, /admin/login.html, /administrator usw. Wenn Sie nur genau mit dem Verzeichnis /admin/ übereinstimmen möchten, schreiben Sie Disallow: /admin/ (abschießenden Schrägstrich hinzugefügt). Gemäß RFC 9309-Standards gewinnt bei Übereinstimmung sowohl von Allow als auch Disallow die Regel mit dem längeren Pfad; bei gleicher Länge hat Allow Vorrang. Dies bedeutet, dass spezifischere Regeln höhere Priorität haben.
Die Sitemap-Direktive teilt Suchmaschinen den Speicherort von Sitemaps mit und hilft Crawlern, Website-Seiten effizienter zu entdecken und zu indexieren. Sitemap-Zeilen müssen nach allen Regelgruppen (oder am Ende der Datei) platziert werden, und URLs müssen vollständige absolute Adressen sein (einschließlich http:// oder https://). In einer robots.txt können mehrere Sitemaps deklariert werden, jede in einer eigenen Zeile. Große Websites teilen sich typischerweise in mehrere Sitemaps auf (kategorisiert nach Inhaltstyp, Aktualisierungshäufigkeit), die einheitlich über eine Sitemap-Indexdatei verwaltet werden.
Die Host-Direktive ist eine nicht standardmäßige, aber weit verbreitete Direktive, die von Yandex vorgeschlagen wurde und zur Angabe der bevorzugten Domain (primärer Spiegel) einer Website dient. Wenn beispielsweise sowohl example.com als auch www.example.com vorhanden sind, teilt Host: example.com Suchmaschinen mit, example.com zu bevorzugen. Hinweis: Google hat erklärt, die Host-Direktive nicht zu verwenden; bevorzugte Domains müssen über die Google Search Console festgelegt werden; Bing hat sie ebenfalls nicht explizit unterstützt. Die Host-Direktive sollte nach Sitemap platziert werden und kann nur einmal vorkommen.
Die korrekte Konfiguration von robots.txt ist für SEO von großer Bedeutung: Erstens verhindert sie, dass Crawler Crawling-Budget für bedeutungslose Seiten (wie Suchergebnisseiten, gefilterte Seiten, doppelte Inhaltsseiten) verschwenden, sodass Crawler wertvolle Inhalte effizienter crawlen können; zweitens verhindert sie, dass private oder wenig wertvolle Seiten (wie Backends, Testseiten, Druckseiten) indexiert werden; drittens lenkt sie Crawler proaktiv über Sitemaps zu neuen Seiten. Beachten Sie jedoch: robots.txt ist ein Gentlemen's Agreement und kann echte Sicherheitsmaßnahmen nicht ersetzen; Disallowte URLs können dennoch URLs in Suchergebnissen anzeigen, wenn externe Links darauf verweisen (Inhalt wird nur nicht gecrawlt); ein vollständiges Blockieren des Crawlings kann sich tatsächlich auf die Gesamtgewichtungsbewertung der Website auswirken.
Häufige robots.txt-Fehler sind: ① Falsche Pfade (wie Disallow: admin ohne führenden Schrägstrich, sollte /admin sein); ② Verwendung regulärer Ausdrücke (Standard-REP unterstützt keine regulären Ausdrücke, nur Googlebot unterstützt begrenzte Platzhalter * und $); ③ Blockieren von JS/CSS-Dateien (was Google daran hindert, Seiten zu rendern); ④ Disallow: / (Blockieren der gesamten Website, ein fataler Fehler, der dazu führt, dass die Website überhaupt nicht indexiert wird); ⑤ Dateicodierungsprobleme (muss UTF-8-Codierung sein); ⑥ Platzierung in einem Unterverzeichnis statt im Stammverzeichnis; ⑦ Zugriffsverweigerung aufgrund von Dateiberechtigungen (sollte den Statuscode 200 OK zurückgeben). Es wird empfohlen, nach der Generierung mit dem robots.txt-Testtool der Google Search Console oder dem robots.txt-Prüftool dieser Plattform zu überprüfen.
Anwendungsfälle
- Konfigurieren Sie eine grundlegende robots.txt vor dem Start einer neuen Website, um erlaubte und verbotene Crawling-Pfade klar zu definieren und Suchmaschinen zum korrekten Crawlen zu führen
- Aktualisieren Sie Disallow-Regeln nach einer Website-Neugestaltung, um zu verhindern, dass alte Verzeichnisse weiterhin gecrawlt werden, was die SEO-Gewichtsverteilung beeinträchtigen könnte
- Fügen Sie mehrere Sitemap-Adressdeklarationen hinzu, um Suchmaschinen zu helfen, die gesamte Seitenstruktur der Website schneller zu entdecken und die Indexierungseffizienz zu verbessern
- Blockieren Sie Backend-Administratorverzeichnisse (/admin), Testumgebungen und private Verzeichnisse davor, von Crawlern indexiert zu werden, um Sicherheitsrisiken zu reduzieren
- Legen Sie die Host-Direktive fest, um die bevorzugte Domain Ihrer Website (mit oder ohne www) anzugeben und Probleme mit doppeltem Inhalt zu reduzieren
- Konfigurieren Sie unabhängige Crawling-Regeln für verschiedene Suchmaschinen-Crawler (Googlebot, Bingbot, Baiduspider usw.)
- Blockieren Sie Crawler vorübergehend am Zugriff auf sich in Wartung befindliche Verzeichnisse und öffnen Sie den Crawling-Zugriff wieder, sobald Website-Updates abgeschlossen sind
- Generieren Sie korrekt formatierte robots.txt-Dateien, um Suchmaschinen-Parsing-Fehler aufgrund handschriftlicher Formatierungsfehler zu vermeiden
- Konfigurieren Sie mehrere Sitemaps (z. B. Artikel-Sitemap, Produkt-Sitemap, Bild-Sitemap), um alle Inhaltstypen der Website abzudecken
- Frontend-Entwicklungsdemonstration der robots.txt-Regelkonfiguration, Lehrvorstellung des Standardformats des Crawler-Protokolls
- Verwenden Sie zusammen mit einem robots.txt-Prüftool, um zu überprüfen, ob generierte Regeln den Erwartungen entsprechen, und ein versehentliches Blockieren wichtiger Seiten zu vermeiden
- Erstellen Sie schnell eine robots.txt-Vorlage, laden Sie sie herunter, passen Sie sie an die tatsächliche Website-Situation an und stellen Sie sie bereit
Anleitung
- Geben Sie den Ziel-Crawler im User-agent-Eingabefeld an (Standard * steht für alle Suchmaschinen-Crawler)
- Geben Sie im Allow-Bereich Pfade ein, für die Crawling erlaubt ist, eine Regel pro Zeile (z. B. /, /blog/)
- Geben Sie im Disallow-Bereich Pfade ein, für die Crawling verboten ist, eine Regel pro Zeile (z. B. /admin, /private)
- Fügen Sie XML-Sitemap-Adressen im Sitemap-Bereich hinzu (mehrzeilig unterstützt) und geben Sie Ihre bevorzugte Domain im Host-Bereich ein
- Der rechte Vorschaubereich zeigt den generierten robots.txt-Inhalt in Echtzeit an; sobald Sie bestätigt haben, dass er korrekt ist, klicken Sie auf die Kopierschaltfläche, um bereitzustellen
Funktionen
- Unabhängige Konfiguration mehrerer Regeln: Separate Eingabebereiche für User-agent, Allow, Disallow, Sitemap und Host halten Regeln klar kategorisiert statt gemischt
- Echtzeit-Vorschau-Generierung: Der robots.txt-Inhalt wird sofort aktualisiert, wenn Sie eine Regel ändern – kein manuelles Klicken auf eine Generierungsschaltfläche erforderlich, was Sie sehen, ist was Sie bekommen
- Standard-Fallback-Regel: Gibt automatisch Allow: / aus, wenn sowohl Allow als auch Disallow leer sind, wodurch leere Dateien verhindert werden, die zu undefiniertem Crawler-Verhalten führen
- Unterstützung mehrerer Sitemaps: Der Sitemap-Bereich unterstützt mehrzeilige Eingaben, wobei jede URL als unabhängige Sitemap-Deklarationszeile ausgegeben wird – perfekt für Websites mit mehreren Sitemaps
- Ein-Klick-Kopie für die Bereitstellung: Ergebnisse können mit einem Klick in die Zwischenablage kopiert werden, bereit zum direkten Einfügen in das Stammverzeichnis Ihrer Website zur Bereitstellung
- Standardbeispiel vorausgefüllt: Die Seite wird mit einer Standardbeispielkonfiguration geöffnet (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), die Anfänger direkt referenzieren und ändern können
- Standardformatausgabe: Folgt streng den Spezifikationen des Robots Exclusion Protocol – User-agent-Zeilen zuerst, Regelzeilen danach, Sitemap/Host am Ende – kompatibel mit allen Suchmaschinen
- Intelligente Pfadverarbeitung: Schneidet automatisch führende/nachfolgende Leerzeichen aus jeder Zeile und filtert leere Zeilen, um Regelausfälle durch zusätzliche Leerzeichen zu verhindern
- Geteiltes responsives Layout: Linkes und rechtes geteiltes Fenster (Konfiguration/Vorschau) auf Desktop, oben und unten gestapelt auf Mobilgeräten – funktioniert sowohl auf Desktop als auch auf Smartphones hervorragend
- Monospace-Schriftvorschau: Der Vorschaubereich verwendet Monospace-Schrift zur Anzeige generierter Ergebnisse, wodurch die robots.txt-Formatierung sauber und klar bleibt
- Unterstützung der Host-Direktive: Konfigurieren Sie Ihre bevorzugte Host-Domain (unterstützt von Yandex und anderen Suchmaschinen), um Probleme mit doppeltem Inhalt zwischen Domains zu reduzieren
- Läuft vollständig lokal im Browser: Alle Konfigurations- und Generierungsvorgänge werden in lokalem Browser-JavaScript abgeschlossen – keine Daten werden an einen Server gesendet
- Null-Abhängigkeiten sofort nutzbar: Sofort einsatzbereit, sobald die Seite geöffnet wird – keine Registrierung, Anmeldung oder Softwareinstallation erforderlich
- Verknüpft mit Prüftool: Relevante Links führen direkt zum robots.txt-Prüftool, sodass Sie Regeln sofort nach der Generierung überprüfen können
Häufig gestellte Fragen
Wofür ist robots.txt? Warum braucht eine Website diese Datei?
robots.txt ist eine reine Textdatei im Stammverzeichnis einer Website, die Suchmaschinen-Crawlern (wie Googlebot, Bingbot, Baiduspider usw.) mitteilt, welche Pfade gecrawlt werden dürfen und welche nicht. Sie ist die Implementierung des Robots Exclusion Protocol (Robots-Ausschlussprotokoll), die Kerndatei für die Verwaltung des Website-Crawlings und die grundlegende SEO-Einrichtung. Obwohl nicht streng erforderlich, konfigurieren fast alle seriösen Websites robots.txt, um das Crawler-Verhalten zu lenken.
Wo sollte die robots.txt-Datei platziert werden?
robots.txt muss im Stammverzeichnis der Website platziert werden und direkt über http://ihredomain/robots.txt zugänglich sein, zum Beispiel https://example.com/robots.txt. Beachten Sie, dass die Platzierung in einem Unterverzeichnis (wie /blog/robots.txt) ungültig ist – Crawler suchen diese Datei nur im Stammverzeichnis. Der Dateiname muss vollständig kleingeschrieben robots.txt sein, nicht Robots.txt oder ROBOTS.TXT.
Welcher Inhalt wird generiert, wenn sowohl Allow als auch Disallow leer sind?
Wenn weder Allow noch Disallow ausgefüllt ist, gibt der Generator automatisch Allow: / als Fallback-Regel aus, was bedeutet, dass das Crawlen der gesamten Website erlaubt ist. Dies verhindert, dass leere Dateien oder unvollständige robots.txt-Dateien mit nur User-agent-Zeilen generiert werden, und vermeidet undefiniertes Crawler-Verhalten aufgrund unklarer Regeln.
Kann ich mehrere Sitemap-Adressen konfigurieren?
Ja. Der Sitemap-Bereich unterstützt mehrzeilige Eingaben, und jede URL wird als unabhängige Sitemap-Deklarationszeile ausgegeben. Zum Beispiel haben große Websites typischerweise mehrere Sitemap-Dateien (Artikel-Sitemap, Produkt-Sitemap, Bild-Sitemap usw.) – Sie können eine vollständige Sitemap-URL pro Zeile eingeben (muss ein vollständiger absoluter Pfad sein, einschließlich http:// oder https://).
Was bewirkt die Host-Direktive? Unterstützen alle Suchmaschinen sie?
Die Host-Direktive gibt die bevorzugte Domain einer Website an (wie example.com oder www.example.com) und hilft Suchmaschinen, die primäre Domain zu identifizieren und Probleme mit doppeltem Inhalt zwischen www- und nicht-www-Versionen zu reduzieren. Derzeit wird die Host-Direktive hauptsächlich von Suchmaschinen wie Yandex unterstützt; Google verwendet die Host-Direktive nicht direkt, sondern legt bevorzugte Domains über die Google Search Console fest. Es wird empfohlen, sie zu konfigurieren, sich aber nicht ausschließlich darauf zu verlassen.
Was bedeutet User-agent: *? Wie konfiguriere ich Regeln für bestimmte Crawler?
User-agent: * bedeutet, dass die Regeln für alle Crawler gelten (das Sternchen ist ein Platzhalter). Wenn Sie unabhängige Regeln für bestimmte Suchmaschinen konfigurieren müssen, können Sie User-agent auf einen bestimmten Crawlernamen setzen, wie Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X) usw. Sie können mehrere User-agent-Gruppen konfigurieren, getrennt durch Leerzeilen zwischen jeder Gruppe.
Kann robots.txt vertrauliche Verzeichnisse wirklich vor Zugriff schützen?
Nein. robots.txt ist nur ein Gentlemen's Agreement – konforme Suchmaschinen-Crawler befolgen die Regeln, aber bösartige Crawler und Hacker-Scanner können sie vollständig ignorieren. Verlassen Sie sich nicht auf robots.txt, um wirklich vertrauliche Inhalte (wie Backend-Passwörter, Benutzer-Privatdaten) zu schützen; vertrauliche Verzeichnisse sollten echte Sicherheitsmaßnahmen wie serverseitige Authentifizierung (Passwortschutz, IP-Whitelisting) verwenden. Der Zweck von robots.txt besteht darin, konforme Crawler zu lenken, nicht im Sicherheitsschutz.
Wie lautet die Pfadübereinstimmungsregel für Disallow?
Disallow-Regeln verwenden Präfixübereinstimmung: Disallow: /admin stimmt mit allen Pfaden überein, die mit /admin beginnen, wie /admin, /admin/, /admin/login.html, /administrator usw. Wenn Sie nur mit Inhalten unter dem Verzeichnis /admin/ übereinstimmen möchten, schreiben Sie Disallow: /admin/ (mit abschließendem Schrägstrich). Disallow: (leerer Wert) bedeutet, dass keine Pfade verboten sind (d. h. alle erlaubt sind). Beachten Sie, dass Regeln zwischen Groß- und Kleinschreibung unterscheiden.
Wie stelle ich die generierte robots.txt auf meiner Website bereit?
Klicken Sie auf die Kopierschaltfläche, um den generierten Inhalt in Ihre Zwischenablage zu kopieren, erstellen Sie dann eine reine Textdatei namens robots.txt auf Ihrem Server, fügen Sie den Inhalt ein und laden Sie die Datei in das Stammverzeichnis Ihrer Website hoch (normalerweise das Web-Root-, public_html-, www- oder dist-Verzeichnis). Überprüfen Sie nach der Bereitstellung, ob es funktioniert, indem Sie auf https://ihredomain/robots.txt zugreifen; Sie können auch das robots.txt-Testtool der Google Search Console verwenden, um Regeln zu überprüfen.
Wie lange dauert es, bis Änderungen an robots.txt wirksam werden?
Suchmaschinen-Crawler holen die robots.txt-Datei beim nächsten Besuch Ihrer Website erneut ab, normalerweise innerhalb von Stunden bis Tagen wirksam. Wenn Sie möchten, dass Suchmaschinen das Update so schnell wie möglich entdecken, können Sie eine robots.txt-Update-Anfrage in der Google Search Console oder den Bing Webmaster Tools einreichen. Hinweis: Bereits indexierte Seiten können auch nach Disallow eine Zeit lang in den Suchergebnissen verbleiben; die vollständige Entfernung erfordert die Verwendung des noindex-Tags oder URL-Entfernungstools.
Welche hat Vorrang, wenn Allow und Disallow kollidieren?
Gemäß RFC 9309 (dem formellen Robots Exclusion Protocol-Standard) hat Allow Vorrang vor Disallow, wenn Allow- und Disallow-Regeln die gleiche Pfadlänge haben; bei unterschiedlichen Pfadlängen hat die Regel Vorrang, die mit dem längeren Pfad übereinstimmt. Wenn beispielsweise Allow: /blog mit Disallow: /blog/ kollidiert, entspricht der Zugriff auf /blog/post.html Disallow (längerer Pfad /blog/ > /blog), während der Zugriff auf /blog selbst Allow entspricht. Einfach ausgedrückt: Spezifischere Regeln haben höhere Priorität.
Kann ich Kommentare in robots.txt hinzufügen?
Ja, Zeilen, die mit # beginnen, sind Kommentarzeilen, und Crawler ignorieren den Inhalt nach #. Kommentare können in einer eigenen Zeile oder am Ende einer Regelzeile (nach #) stehen. Zum Beispiel: # Block admin area oder Disallow: /admin # admin panel. Das Hinzufügen geeigneter Kommentare hilft Ihnen und Teammitgliedern zu verstehen, was jede Regel bewirkt.
Müssen Sitemap-URLs absolute Pfade sein?
Ja, Sitemap-Direktiven müssen vollständige absolute URLs verwenden (einschließlich Protokoll und Domain), wie Sitemap: https://example.com/sitemap.xml. Relative Pfade (wie /sitemap.xml) können nicht verwendet werden, da Crawler von verschiedenen Domains (wie example.com und www.example.com) auf Ihre Site zugreifen können und relative Pfade Crawler daran hindern würden, die richtige Adresse zu bestimmen.
Werden Konfigurationsdaten an den Server hochgeladen?
Überhaupt nicht. Alle Konfigurations- und Generierungsvorgänge für robots.txt werden lokal in Ihrem Browser über JavaScript abgeschlossen – Konfigurationsdaten wie eingegebene Pfade und Domains werden an keine externen Server gesendet. Die Seite kann nach dem Laden (Grundfunktionen) offline verwendet werden; Daten werden automatisch gelöscht, wenn Sie die Seite schließen, und hinterlassen keine Aufzeichnungen.
Kann die generierte robots.txt auf jeder Website verwendet werden?
Ja, der Generator gibt eine reine Textdatei im Standard-Robots-Exclusion-Protocol-Format aus, die für jeden Webserver (Nginx, Apache, IIS, Caddy usw.) und jede Website-Erstellungsplattform (WordPress, Shopify, Next.js, Django, Rails usw.) geeignet ist. Stellen Sie sie einfach im Stammverzeichnis Ihrer Website bereit und stellen Sie sicher, dass sie öffentlich zugänglich ist.
Fehlerbehebung
Zugriff auf generierte Datei gibt 404-Fehler zurück?
Stellen Sie sicher, dass die robots.txt-Datei in das Stammverzeichnis der Website (nicht in ein Unterverzeichnis) hochgeladen wurde, der Dateiname vollständig kleingeschrieben robots.txt ist und die Dateiberechtigungen auf öffentlich lesbar gesetzt sind (normalerweise reichen 644-Berechtigungen). Besuchen Sie nach dem Hochladen direkt in einem Browser https://ihredomain/robots.txt, um zu bestätigen, dass Sie den Inhalt sehen können. Die Speicherorte der Stammverzeichnisse variieren je nach Server: Nginx/Apache ist normalerweise /var/www/html/ oder /usr/share/nginx/html/, Vercel/Netlify ist normalerweise das public/-Verzeichnis.
Disallow-Regeln funktionieren nicht, Seiten werden immer noch indexiert?
Mögliche Gründe: ①Crawler haben robots.txt noch nicht erneut abgerufen (warten Sie einige Tage oder senden Sie ein Update in der Search Console); ②Falsche Pfadpräfixübereinstimmung (z. B. Disallow: admin ohne /, sollte Disallow: /admin/ sein); ③Seiten waren bereits indexiert, bevor Disallow hinzugefügt wurde (bereits indexierte Seiten werden nicht automatisch entfernt); ④Bösartige Crawler respektieren robots.txt nicht; ⑤Allow-Regelkonflikt überschreibt Disallow (Allow hat Vorrang, wenn der Pfad länger ist). Um vollständig aus dem Index entfernt zu werden, verwenden Sie das noindex-Tag.
Die Google Search Console meldet, dass robots.txt Seiten blockiert?
Dies bedeutet normalerweise, dass wichtige Seiten versehentlich Disallowt wurden. Überprüfen Sie robots.txt auf zu breite Disallow-Regeln (wie Disallow: / oder Disallow: /*?) und stellen Sie sicher, dass CSS/JS-Dateien nicht blockiert sind (Google muss diese Dateien abrufen, um Seiten zu rendern). Verwenden Sie das robots.txt-Testtool der Search Console, um bestimmte URLs einzugeben und zu testen, welche Regel sie blockiert.
Versehentlich Disallow: / gesetzt, wodurch die gesamte Website vom Crawlen ausgeschlossen wurde?
Entfernen oder ändern Sie diese Regel sofort, ändern Sie robots.txt in Allow: / oder löschen Sie die Disallow: /-Zeile und laden Sie die aktualisierte Datei auf den Server hoch. Senden Sie dann eine robots.txt-Update-Anfrage in der Google Search Console und senden Sie eine Sitemap, um das erneute Crawlen zu beschleunigen. Seiten, die bereits aus dem Index entfernt wurden, können Tage bis Wochen benötigen, um erneut indexiert zu werden.
Glossar
- robots.txt
- Eine reine Textdatei im Stammverzeichnis der Website, die dem Robots Exclusion Protocol folgt und konformen Suchmaschinen-Crawlern mitteilt, welche Pfade für das Crawlen erlaubt/verboten sind.
- Robots Exclusion Protocol (REP)
- Das Robots-Ausschlussprotokoll, 1994 vorgeschlagen und 2022 als RFC 9309 standardisiert, ist der de-facto-Standard für die Kommunikation von Crawling-Regeln zwischen Websites und Crawlern.
- User-agent
- Das Startfeld einer Regelgruppe, das den Namen des Crawlers angibt, für den nachfolgende Allow/Disallow-Regeln gelten; der *-Platzhalter stimmt mit allen Crawlern überein.
- Disallow
- Crawling-verbieten-Direktive, die Pfadpräfixe angibt, auf die Crawler nicht zugreifen sollen. Zum Beispiel verbietet Disallow: /admin das Crawlen aller Pfade, die mit /admin beginnen.
- Allow
- Crawling-erlauben-Direktive, die Pfade angibt, für die der Crawler-Zugriff explizit erlaubt ist. Wird verwendet, um bestimmte Teilpfade unter einem übergeordneten Disallow-Pfad freizugeben.
- Sitemap
- Sitemap-Deklarationsdirektive, die Suchmaschinen die vollständige URL der XML-Sitemap der Website mitteilt und Crawlern hilft, alle Seiten der Website effizient zu entdecken und zu indexieren.
- Host
- Bevorzugte-Domain-Direktive, die die primäre Domain der Website angibt (wie example.com vs. www.example.com); wird von Yandex unterstützt, Google verwendet die Search Console für Einstellungen.
- Crawler/Bot/Spider
- Automatisierte Programme, die von Suchmaschinen verwendet werden, um automatisch auf Webseiten zuzugreifen und Inhalte zu sammeln, wie Googlebot, Bingbot, Baiduspider usw.
- Googlebot
- Der Web-Crawler der Google-Suchmaschine, der für das Abrufen von Webinhalten für die Google-Indexierung und -Rangfolge verantwortlich ist und einer der häufigsten Suchmaschinen-Crawler ist.
- Crawl Budget
- Crawling-Budget/Kontingent, die von Suchmaschinen jeder Website zugewiesene Crawling-Häufigkeit und Obergrenze für die Seitenanzahl. Die korrekte Konfiguration von robots.txt kann die Verschwendung von Crawling-Kontingent vermeiden.
- Prefix Matching
- Präfixübereinstimmungsregel, die Pfadübereinstimmungsmethode von robots.txt. Eine Übereinstimmung ist erfolgreich, wenn der URL-Pfad mit dem Regelwert beginnt; längere Regeln haben höhere Priorität.
- noindex
- HTML-Meta-Tag oder HTTP-Header-Direktive (X-Robots-Tag: noindex), die Suchmaschinen anweist, die Seite nicht in den Suchindex aufzunehmen. Im Gegensatz zu robots.txt Disallow ist noindex eine zuverlässigere Methode zum Entfernen aus dem Index.
Häufige User-agent-Namen von Suchmaschinen-Crawlern
User-agent-Namen zur Verwendung bei der Konfiguration von Regeln für bestimmte Crawler:
| Crawler-Name | Zugehörige Suchmaschine | Zweck |
|---|---|---|
* | Alle Crawler | Platzhalter, stimmt mit allen nicht separat konfigurierten Crawlern überein |
Googlebot | Web-Crawling-Crawler der Google-Suche | |
Bingbot | Bing/Microsoft | Web-Crawling-Crawler der Bing-Suche |
Baiduspider | Baidu | Web-Crawling-Crawler der Baidu-Suche |
YandexBot | Yandex | Web-Crawling-Crawler der Yandex-Suche |
GPTBot | OpenAI | ChatGPT-Trainingsdaten-Crawling-Crawler |
Twitterbot | X/Twitter | Linkkarten-Vorschau-Crawler der X-Plattform |
facebookexternalhit | Facebook-Linkvorschau-Crawler |
Beispiele für häufig verwendete robots.txt-Regeln
Häufige Regelkonfigurationen für verschiedene Website-Szenarien:
| Regel | Wirkung |
|---|---|
Disallow: /admin/ | Verbietet das Crawlen aller Inhalte unter dem Verzeichnis /admin/ |
Disallow: /*? | Verbietet das Crawlen von URLs mit Abfrageparametern (Googlebot unterstützt Platzhalter *) |
Disallow: /search | Verbietet das Crawlen von internen Suchergebnisseiten |
Allow: /public/ | Erlaubt explizit das Crawlen des Verzeichnisses /public/ |
Disallow: / | ⚠️ Verbietet das Crawlen der gesamten Website (fataler Fehler, mit Vorsicht verwenden!) |
Allow: / | Erlaubt das Crawlen aller Inhalte der gesamten Website |
Schnellreferenz für robots.txt-Standarddirektiven
Von RFC 9309 definierte Standarddirektiven und ihre Verwendung:
| Direktive | Geltungsbereich | Formatbeispiel | Beschreibung |
|---|---|---|---|
User-agent | Gruppenstart | User-agent: * | Gibt den Namen des Crawlers an, für den Regeln gelten |
Disallow | In Gruppe | Disallow: /admin | Pfadpräfix, für das Crawlen verboten ist |
Allow | In Gruppe | Allow: /public | Pfadpräfix, für das Crawlen erlaubt ist |
Sitemap | Nicht-gruppenebene | Sitemap: https://example.com/sitemap.xml | Deklariert den Speicherort der Sitemap (absolute URL) |
# | Beliebige Position | # This is a comment | Kommentarzeile, von Crawlern ignoriert |
Privacy & Security
Alle Vorgänge dieses Robots.txt-Generators werden vollständig lokal in Ihrem Browser abgeschlossen: User-agent, Pfadregeln, Sitemap, Host und andere Konfigurationseingaben werden alle im Browserspeicher über JavaScript in Echtzeit zu robots.txt-Text zusammengesetzt und nicht über das Netzwerk an einen Server gesendet. Sofort einsatzbereit, sobald die Seite geladen ist; verwendet kein Cookie-Tracking, sammelt keine Benutzerdaten. Nach dem Schließen oder Aktualisieren der Seite werden alle Konfigurationsinhalte automatisch gelöscht und nicht dauerhaft im Browser gespeichert.
Authoritative References
- Authorization-Header-Generator
- Cache-Control-Parser
- Content-Disposition-Parser
- CORS-Header-Generator
- CORS-Inspektor
- CSP-Generator
- cURL Code-Generator
- Globale DNS-Propagationsprüfung
- DNS-Abfrage
- Forwarded-Header-Parser
- Hreflang Tag Generator
- HSTS-Analysator
- HTTP-Cookie-Parser
- HTTP-Header-Prüfer
- HTTP Request Tester
- HTTP-Statuscodes-Suche
- IP-Suche
- IPv4-Konverter
- IPv4-Bereichs-Expander
- IPv6-Toolbox
- Link-Header-Parser
- MX-Lookup
- Port Checker
- URL Parameter Generator
- Rate-Limit-Header-Parser
- Redirect-Kettenprüfer
- Robots.txt-Generator
- Robots.txt Checker
- Security Headers Checker
- Security.txt Generator
- Set-Cookie-Parser
- Site Network Audit
- Sitemap-Generator
- Sitemap Inspector
- SSL-Zertifikatsprüfer
- Subnetzrechner
- URL Parser
- User-Agent-Parser
- UTM Link-Generator
- WebSocket-Test
- Was ist meine IP?
- WHOIS-Abfrage