Robots.txt Generator

robots.txt-regelgenerator

Ondersteunt multi-line Allow / Disallow / Sitemap, stelt automatisch de standaardindeling samen.

Regelconfiguratie
Gegenereerd resultaat

De online Robots.txt Generator van GeekFormat stelt je in staat om User-agent, Allow/Disallow-regels, Sitemap-declaraties en Host-instructies te configureren via visuele formulieren, en genereert in realtime robots.txt-bestanden die voldoen aan de Robots Exclusion Protocol-standaard. De pagina opent met standaard voorbeeldwaarden, het aanpassen van elk veld werkt de preview direct bij, en met één klik kopieer je om te implementeren in de rootmap van de website. Werkt volledig in de browser, configuratiegegevens worden naar geen enkele server verzonden.

Gerelateerde aanbevelingen

Over Robots.txt en het Crawler Uitsluitingsprotocol

robots.txt is een van de meest basale manieren waarop een website communiceert met zoekmachinecrawlers, volledige naam Robots Exclusion Protocol (Robots Uitsluitingsprotocol, afgekort REP). Het is een eenvoudig tekstbestand in de rootmap van een website dat via eenvoudige instructies conforme zoekmachinecrawlers vertelt welke delen van de site gecrawld mogen worden en welke delen niet gecrawld dienen te worden. robots.txt werd oorspronkelijk voorgesteld door Martijn Koster in 1994; na bijna 30 jaar ontwikkeling werd het in 2022 formeel gestandaardiseerd door IETF als RFC 9309.

De basisstructuur van robots.txt bestaat uit een of meer regelgroepen (Group). Elke regelgroep begint met een of meer User-agent-regels, die specificeren op welke crawlers de regels van toepassing zijn (* vertegenwoordigt alle crawlers); gevolgd door verschillende Allow- en Disallow-regels, die respectievelijk de toegestane en verboden padprefixen specificeren; aan het eind van het bestand kunnen niet-groepsinstructies zoals Sitemap en Host worden toegevoegd. Regelgroepen worden gescheiden door lege regels. Een typische robots.txt bevat: User-agent-verklaring → Allow/Disallow-padregels → (optioneel) meer User-agent-groepen → Sitemap-verklaring → Host-instructie.

Het User-agent-veld specificeert de naam van de crawler waarop de regels van toepassing zijn. Veel voorkomende zoekmachine crawlernamen zijn onder andere: Googlebot (Google Zoeken), Bingbot (Bing Zoeken), Baiduspider (Baidu Zoeken), YandexBot (Yandex Zoeken), DuckDuckBot (DuckDuckGo Zoeken), Twitterbot (Twitter/X card ophalen), facebookexternalhit (Facebook link preview), GPTBot (OpenAI GPT crawler), Bytespider (ByteDance/Toutiao zoeken), enz. Gebruik User-agent: * als wildcard om alle niet-afzonderlijk overeenkomende crawlers te matchen.

De Allow- en Disallow-instructies gebruiken het Prefix Matching-principe: zolang het URL-pad met de opgegeven waarde begint, komt de regel overeen. Bijvoorbeeld, Disallow: /admin blokkeert /admin, /admin/, /admin/login.html, /administrator en alle paden die met /admin beginnen. Als je alleen de map /admin/ precies wilt overeenkomen, schrijf je Disallow: /admin/ (met schuine streep aan het eind). Volgens de RFC 9309-standaard, wanneer Allow en Disallow tegelijkertijd overeenkomen, wint de regel met het langste pad; bij gelijke lengte heeft Allow voorrang. Dit betekent dat hoe specifieker de regel, hoe hoger de prioriteit.

De Sitemap-instructie wordt gebruikt om zoekmachines te informeren over de locatie van de sitemap, waardoor crawlers pagina's van de site efficiënter kunnen ontdekken en indexeren. Sitemap-regels moeten na alle regelgroepen worden geplaatst (of aan het eind van het bestand); URL's moeten volledige absolute adressen zijn (inclusief http:// of https://). In een robots.txt kunnen meerdere Sitemaps worden gedeclareerd, elk op een afzonderlijke regel. Grote sites splitsen meestal meerdere Sitemaps (geclassificeerd op contenttype, updatefrequentie) en beheren deze uniform via een Sitemap-indexbestand.

De Host-instructie is een niet-standaard maar veelgebruikte instructie voorgesteld door Yandex, die wordt gebruikt om het voorkeursdomein van de site op te geven (hoofdspiegel). Wanneer bijvoorbeeld example.com en www.example.com tegelijkertijd bestaan, vertelt Host: example.com zoekmachines dat example.com de voorkeur heeft. Belangrijke opmerking: Google heeft verklaard de Host-instructie niet te gebruiken; het voorkeursdomein moet worden ingesteld via Google Search Console; Bing ondersteunt dit ook niet expliciet. De Host-instructie moet na Sitemap worden geplaatst en mag maar één keer voorkomen.

Het correct configureren van robots.txt is belangrijk voor SEO: ten eerste voorkomt het dat crawlers crawlbudget verspillen aan zinloze pagina's (zoals zoekresultaatpagina's, filterpagina's, dubbele contentpagina's), waardoor ze waardevolle content efficiënter kunnen crawlen; ten tweede voorkomt het dat privé- of laagwaardige pagina's (zoals admin, testpagina's, afdrukpagina's) worden geïndexeerd; ten derde begeleidt het crawlers proactief om nieuwe pagina's te ontdekken via Sitemap. Maar let op: robots.txt is een herenakkoord en vervangt geen echte beveiligingsmaatregelen; URL's met Disallow waarnaar externe links verwijzen, kunnen nog steeds in zoekresultaten worden weergegeven met de URL (alleen wordt de inhoud niet gecrawld); het volledig verbieden van crawlen kan de algehele gewichtsbeoordeling van de site beïnvloeden.

Veelvoorkomende fouten in robots.txt zijn onder andere: ① verkeerd geschreven pad (zoals Disallow: admin zonder beginnende schuine streep, dit moet /admin zijn); ② gebruik van reguliere expressies (standaard REP ondersteunt geen regex, alleen Googlebot ondersteunt beperkte wildcards * en $); ③ crawlen van JS/CSS-bestanden verbieden (dit voorkomt dat Google pagina's rendert); ④ Disallow: / (hele site verbieden, een fatale fout die leidt tot volledige niet-indexering); ⑤ bestandscoderingsprobleem (moet UTF-8-codering zijn); ⑥ in een submap geplaatst in plaats van de root; ⑦ bestandsrechten die toegang verhinderen (moet 200 OK-statuscode retourneren). Het wordt aanbevolen om na generatie te controleren met de robots.txt-testtool van Google Search Console of de robots.txt-inspectietool van dit platform.

Toepassingsgevallen

  • Een basis robots.txt configureren vóór de lancering van een nieuwe site, duidelijk vaststellen welke paden wel en niet gecrawld mogen worden, zoekmachines begeleiden om correct te crawlen
  • Disallow-regels bijwerken na een website herontwerp om te voorkomen dat oude mappen blijven worden gecrawld en de SEO-gewichtverdeling beïnvloeden
  • Meerdere Sitemap-adressen toevoegen om zoekmachines te helpen de paginastructuur van de hele site sneller te ontdekken, de indexeringsefficiëntie verbeteren
  • Beheermappen (/admin), testomgevingen en privémappen blokkeren om te voorkomen dat ze door crawlers worden geïndexeerd, beveiligingsrisico's verminderen
  • De Host-instructie configureren om het voorkeursdomein van de site op te geven (met of zonder www), problemen met dubbele content verminderen
  • Onafhankelijke crawlregels configureren voor verschillende zoekmachinecrawlers (Googlebot, Bingbot, Baiduspider, enz.)
  • Tijdelijk de toegang van crawlers tot mappen in onderhoud blokkeren, en crawlen weer vrijgeven nadat updates zijn voltooid
  • Robots.txt-bestanden in gestandaardiseerd formaat genereren, voorkomen dat zoekmachines falen bij het parseren door handmatige formatteringsfouten
  • Meerdere Sitemaps configureren (zoals artikel-sitemap, product-sitemap, afbeelding-sitemap) om alle contenttypen van de site te dekken
  • Het demonstreren van robots.txt-regelconfiguratie in frontend-ontwikkeling, lesgeven in het standaardformaat van het crawlerprotocol
  • Gebruiken in combinatie met de robots.txt-inspectietool om te controleren of de gegenereerde regels aan de verwachtingen voldoen, voorkomen dat belangrijke pagina's per ongeluk worden geblokkeerd
  • Snel een robots.txt-sjabloon maken, downloaden en verfijnen op basis van de werkelijke situatie van de site vóór implementatie

Hoe te gebruiken

  1. Specificeer in het User-agent invoerveld de doelcrawler (standaard * vertegenwoordigt alle zoekmachinecrawlers)
  2. Vul in het Allow-gebied de paden in die gecrawld mogen worden, één regel per regel (zoals /, /blog/)
  3. Vul in het Disallow-gebied de paden in die niet gecrawld mogen worden, één regel per regel (zoals /admin, /private)
  4. Voeg in het Sitemap-gebied XML-sitemapadressen toe (ondersteunt meerdere regels); vul in het Host-gebied het voorkeursdomein in
  5. Het previewgebied rechts toont in realtime de gegenereerde robots.txt-inhoud; bevestig en klik op de kopieerknop om te implementeren

Functies

  • Onafhankelijke configuratie van meerdere regels: User-agent, Allow, Disallow, Sitemap en Host hebben afzonderlijke invoervelden, regels zijn duidelijk gecategoriseerd en lopen niet door elkaar
  • Generatie met realtime preview: de inhoud van robots.txt wordt onmiddellijk bijgewerkt na het wijzigen van een regel, zonder handmatig op een genereerknop te hoeven klikken, wat je ziet is wat je krijgt
  • Standaard fallback-regel: wanneer Allow en Disallow leeg zijn, wordt automatisch Allow: / uitgevoerd, waardoor lege bestanden worden vermeden die onzeker crawlgedrag veroorzaken
  • Ondersteuning voor meerdere Sitemaps: het Sitemap-gebied ondersteunt invoer op meerdere regels, elke URL wordt als een afzonderlijke Sitemap-verklaring uitgevoerd, ideaal voor sites met meerdere Sitemaps
  • Kopiëren en implementeren met één klik: het resultaat ondersteunt kopiëren naar het klembord met één klik, klaar om direct in de rootmap van de website te plakken
  • Vooraf ingevuld standaardvoorbeeld: de pagina opent met een standaard voorbeeldconfiguratie (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), beginners kunnen direct raadplegen en aanpassen
  • Standaard formaatuitvoer: volgt strikt de Robots Exclusion Protocol-specificatie, User-agent-regel eerst, regelregels daarna, Sitemap/Host aan het eind, compatibel met alle zoekmachines
  • Intelligente padverwerking: verwijdert automatisch spaties aan het begin/einde van elke regel, filtert lege regels, voorkomt dat regels ongeldig worden door overbodige spaties
  • Responsieve kolomindeling: op pc links-rechts verdeling (configuratie/preview), op mobiel boven-onder plaatsing, werkt goed op desktop en telefoon
  • Preview met monospaced lettertype: het previewgebied gebruikt een monospaced lettertype om het resultaat weer te geven, robots.txt-formaat is overzichtelijk en duidelijk
  • Ondersteuning voor Host-instructie: kan de voorkeursdomein Host configureren (ondersteund door zoekmachines zoals Yandex), vermindert problemen met dubbele content van domeinen
  • Volledig lokale uitvoering in de browser: alle configuratie en generatie gebeurt lokaal in JavaScript in de browser, zonder gegevens naar servers te verzenden
  • Direct gebruik zonder afhankelijkheden: open de pagina en gebruik direct, zonder registratie of login, zonder software te installeren
  • Koppeling met inspectietool: gerelateerde links leiden direct naar de robots.txt-inspectietool, zodat je direct na generatie kunt controleren of de regels correct zijn

Veelgestelde vragen

Waar is robots.txt voor? Waarom zou een website dit bestand moeten hebben?

robots.txt is een eenvoudig tekstbestand in de rootmap van een website, dat wordt gebruikt om zoekmachinecrawlers (zoals Googlebot, Bingbot, Baiduspider, enz.) te vertellen welke paden gecrawld mogen worden en welke verboden zijn. Het is de implementatie van het Robots Exclusion Protocol (Robots Uitsluitingsprotocol), en is het centrale bestand voor het beheer van sitecrawling en SEO-basisinstellingen. Hoewel het niet verplicht is, configureren bijna alle reguliere websites robots.txt om crawlgedrag te begeleiden.

Waar moet het robots.txt-bestand worden geplaatst?

robots.txt moet in de rootmap van de website worden geplaatst en direct toegankelijk zijn via http://jouw-domein/robots.txt. Bijvoorbeeld https://example.com/robots.txt. Let op: plaats het niet in submappen (zoals /blog/robots.txt is ongeldig), crawlers zoeken dit bestand alleen in de rootmap. De bestandsnaam moet volledig in kleine letters zijn: robots.txt, niet Robots.txt of ROBOTS.TXT.

Wat wordt er gegenereerd wanneer Allow en Disallow leeg zijn?

Wanneer Allow en Disallow niet zijn ingevuld, genereert de generator automatisch Allow: / als fallback-regel, wat aangeeft dat de hele site gecrawld mag worden. Dit voorkomt het genereren van lege bestanden of onvolledige robots.txt met alleen een User-agent-regel, en voorkomt onzeker crawlgedrag door onduidelijke regels.

Kan ik meerdere Sitemap-adressen configureren?

Ja. Het Sitemap-gebied ondersteunt invoer op meerdere regels; elke URL wordt als een afzonderlijke Sitemap-verklaring uitgevoerd. Grote sites hebben bijvoorbeeld meestal meerdere sitemap-bestanden (artikel-sitemap, product-sitemap, afbeelding-sitemap, enz.), je kunt per regel een volledige Sitemap-URL invullen (moet een volledig absoluut pad zijn, inclusief http:// of https://).

Wat is de functie van de Host-instructie? Ondersteunen alle zoekmachines dit?

De Host-instructie wordt gebruikt om het voorkeursdomein van de site op te geven (zoals example.com of www.example.com), zodat zoekmachines het hoofddomein kunnen identificeren en problemen met dubbele content tussen www- en niet-www-versies worden verminderd. Momenteel wordt de Host-instructie voornamelijk ondersteund door zoekmachines zoals Yandex; Google gebruikt deze niet direct, maar verkiest het voorkeursdomein in te stellen via Google Search Console. Het wordt aanbevolen om het te configureren, maar vertrouw er niet volledig op.

Wat betekent User-agent: *? Hoe configureer ik regels voor specifieke crawlers?

User-agent: * betekent dat de regels van toepassing zijn op alle crawlers (de asterisk is een wildcard). Als je onafhankelijke regels voor een specifieke zoekmachine wilt configureren, stel User-agent dan in op de specifieke crawlernaam, zoals Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X), enz. Je kunt meerdere User-agent-groepen configureren, gescheiden door lege regels.

Kan robots.txt gevoelige mappen echt beschermen tegen toegang?

Nee. robots.txt is slechts een herenakkoord; conforme zoekmachinecrawlers respecteren de regels, maar kwaadwillende crawlers en hackscanners kunnen het volledig negeren. Vertrouw niet op robots.txt om echt gevoelige content te beschermen (zoals beheerderswachtwoorden, gebruikersprivacygegevens); gevoelige mappen moeten server-side authenticatie gebruiken (wachtwoordbeveiliging, IP-whitelist) en andere echte beveiligingsmaatregelen. De functie van robots.txt is het begeleiden van conforme crawlers, niet beveiliging.

Wat zijn de padovereenkomstregels voor Disallow?

De Disallow-regel gebruikt prefixovereenkomst: Disallow: /admin komt overeen met /admin, /admin/, /admin/login.html, /administrator en alle paden die met /admin beginnen. Als je alleen de inhoud van de map /admin/ wilt overeenkomen, schrijf je Disallow: /admin/ (met afsluitende schuine streep). Disallow: (lege waarde) betekent geen enkel pad verbieden (dwz alles toegestaan). Let op: regels zijn hoofdlettergevoelig.

Hoe implementeer ik de gegenereerde robots.txt op de website?

Klik op de kopieerknop om de gegenereerde inhoud naar het klembord te kopiëren; maak op de server een eenvoudig tekstbestand met de naam robots.txt, plak de inhoud en upload het bestand naar de rootmap van de website (meestal web root, public_html, www of dist-map). Controleer na implementatie de toegang via https://jouw-domein/robots.txt om te bevestigen dat het werkt; je kunt ook de robots.txt-testtool van Google Search Console gebruiken om de regels te valideren.

Hoe lang duurt het voordat wijzigingen in robots.txt van kracht worden?

De volgende keer dat de zoekmachinecrawler je site bezoekt, zal deze het robots.txt-bestand opnieuw crawlen; meestal wordt dit binnen enkele uren tot enkele dagen van kracht. Als je wilt dat zoekmachines de update zo snel mogelijk ontdekken, dien dan een robots.txt-updateverzoek in bij Google Search Console of Bing Webmaster Tools. Let op: reeds geïndexeerde pagina's kunnen nog enige tijd in de resultaten verschijnen, zelfs na Disallow; volledige verwijdering vereist het gebruik van de noindex-tag of URL-verwijderingstool.

Wanneer Allow en Disallow conflicteren, welke heeft voorrang?

Volgens RFC 9309 (formele standaard van het Robots Exclusion Protocol), wanneer de padlengten van Allow- en Disallow-regels gelijk zijn, heeft Allow voorrang op Disallow; wanneer de lengten verschillen, heeft de regel met het langste overeenkomende pad voorrang. Bijvoorbeeld, bij een conflict tussen Allow: /blog en Disallow: /blog/ zal toegang tot /blog/post.html overeenkomen met Disallow (pad langer /blog/ > /blog), terwijl toegang tot /blog zelf overeenkomt met Allow. Simpel gezegd: hoe specifieker de regel, hoe hoger de prioriteit.

Kan ik opmerkingen toevoegen in robots.txt?

Ja, regels die beginnen met # zijn commentaarregels; crawlers negeren de inhoud na #. Commentaar kan op een aparte regel staan of aan het eind van regelregels (inhoud na #). Bijvoorbeeld: # Block admin area of Disallow: /admin # admin panel. Het toevoegen van passend commentaar helpt jou en teamleden de functie van elke regel te begrijpen.

Moeten Sitemap-URLs absolute paden zijn?

Ja, de Sitemap-instructie moet een volledige absolute URL gebruiken (inclusief protocol en domein), zoals Sitemap: https://example.com/sitemap.xml. Gebruik geen relatieve paden (zoals /sitemap.xml), omdat crawlers je site mogelijk vanaf verschillende domeinen bezoeken (zoals example.com en www.example.com), en relatieve paden voorkomen dat crawlers het juiste adres bepalen.

Worden configuratiegegevens naar de server verzonden?

Helemaal niet. Alle configuratie en generatie van robots.txt gebeurt lokaal in je browser via JavaScript; ingevoerde paden, domeinen en andere configuratiegegevens worden naar geen enkele externe server verzonden. De pagina kan na het laden offline worden gebruikt (basisfuncties); bij het sluiten van de pagina worden gegevens automatisch gewist zonder records achter te laten.

Kan de gegenereerde robots.txt op elke website worden gebruikt?

Ja, de generator produceert een eenvoudig tekstbestand in het standaard Robots Exclusion Protocol-formaat, geschikt voor elke webserver (Nginx, Apache, IIS, Caddy, enz.) en elk websitebouwplatform (WordPress, Shopify, Next.js, Django, Rails, enz.). Je hoeft het alleen in de rootmap van de website te implementeren en openbare toegang te garanderen.

Probleemoplossing

Toegang tot het gegenereerde bestand geeft een 404-fout?

Controleer of het robots.txt-bestand is geüpload naar de rootmap van de website (geen submap), de bestandsnaam volledig in kleine letters robots.txt is, en de bestandsrechten zijn ingesteld op openbare leestoegang (meestal is 644-rechten voldoende). Ga na het uploaden direct naar https://jouw-domein/robots.txt in de browser om te bevestigen dat de inhoud zichtbaar is. De locatie van de rootmap verschilt per server: Nginx/Apache is meestal /var/www/html/ of /usr/share/nginx/html/, Vercel/Netlify is meestal de public/-map.

Disallow-regels werken niet, pagina's worden nog steeds geïndexeerd?

Mogelijke oorzaken: ① de crawler heeft robots.txt nog niet opnieuw gecrawld (wacht enkele dagen of dien een update in bij Search Console); ② onjuiste prefixovereenkomst van het pad (zoals Disallow: admin zonder /, dit moet Disallow: /admin/ zijn); ③ de pagina was al geïndexeerd voordat Disallow werd toegevoegd (reeds geïndexeerde pagina's worden niet automatisch verwijderd); ④ kwaadwillende crawlers respecteren robots.txt niet; ⑤ er is een conflicterende Allow-regel die Disallow overschrijft (Allow heeft voorrang bij een langer pad). Gebruik voor volledige verwijdering uit de index de noindex-tag.

Google Search Console meldt dat robots.txt pagina's blokkeert?

Dit betekent meestal dat belangrijke pagina's per ongeluk door Disallow worden geblokkeerd. Controleer of er te brede Disallow-regels in robots.txt staan (zoals Disallow: / of Disallow: /*?); bevestig dat CSS/JS-bestanden niet zijn verboden (Google heeft deze bestanden nodig om pagina's te renderen). Gebruik de robots.txt-testtool in Search Console om specifieke URL's in te voeren en te testen welke regel blokkeert.

Per ongeluk Disallow: / ingesteld waardoor de hele site is verboden om te crawlen?

Verwijder of wijzig die regel onmiddellijk, verander robots.txt naar Allow: / of verwijder de Disallow: /-regel, upload het bijgewerkte bestand naar de server. Dien daarna een robots.txt-updateverzoek in bij Google Search Console en dien de sitemap in om opnieuw crawlen te versnellen. Pagina's die al uit de index zijn verwijderd, kunnen enkele dagen tot weken nodig hebben om opnieuw te worden geïndexeerd.

Woordenlijst

robots.txt
Eenvoudig tekstbestand in de rootmap van de website, volgens het Robots Exclusion Protocol, gebruikt om conforme zoekmachinecrawlers te informeren welke paden wel/niet gecrawld mogen worden.
Robots Exclusion Protocol (REP)
Robots Uitsluitingsprotocol, voorgesteld in 1994 en gestandaardiseerd als RFC 9309 in 2022, is de de facto standaard voor het communiceren van crawlregels tussen sites en crawlers.
User-agent
Beginnend veld van een regelgroep, specificeert de naam van de crawler waarop de volgende Allow/Disallow-regels van toepassing zijn; de wildcard * komt overeen met alle crawlers.
Disallow
Crawlverbodsinstructie, specificeert padprefixen die crawlers niet mogen bezoeken. Bijvoorbeeld, Disallow: /admin verbiedt het crawlen van alle paden die met /admin beginnen.
Allow
Crawltoestemmingsinstructie, specificeert paden die expliciet zijn toegestaan voor crawlers. Gebruikt om specifieke subpaden onder een bovenliggend Disallow-pad open te stellen.
Sitemap
Sitemap-verklaringsinstructie, informeert zoekmachines over de volledige URL van de XML-sitemap van de site, helpt crawlers alle pagina's efficiënt te ontdekken en te indexeren.
Host
Voorkeursdomeininstructie, specificeert het hoofddomein van de site (zoals example.com vs www.example.com); ondersteund door Yandex, Google configureert via Search Console.
Crawler/Bot/Spider
Crawler/bot/spin, geautomatiseerd programma van zoekmachines dat webpagina's bezoekt en content verzamelt, zoals Googlebot, Bingbot, Baiduspider, enz.
Googlebot
Webcrawler van de Google-zoekmachine, verantwoordelijk voor het ophalen van webpaginacontent voor indexering en ranking van Google, is een van de meest voorkomende zoekmachinecrawlers.
Crawl Budget
Crawlbudget/-quotum, limiet van crawlfrequentie en aantal pagina's dat zoekmachines aan elke site toewijzen. Een correcte configuratie van robots.txt voorkomt verspilling van crawlquotum.
Prefix Matching
Prefixovereenkomstregel, padovereenkomstmethode van robots.txt. Een URL-pad dat met de regelwaarde begint, is een succesvolle overeenkomst; hoe langer de regel, hoe hoger de prioriteit.
noindex
HTML meta-tag of HTTP-headerinstructie (X-Robots-Tag: noindex), vertelt zoekmachines de pagina niet in de zoekindex op te nemen. In tegenstelling tot Disallow van robots.txt is noindex een betrouwbaardere manier om uit de index te verwijderen.

User-agent-namen van Veelvoorkomende Zoekmachinecrawlers

User-agent-namen die worden gebruikt bij het configureren van regels voor specifieke crawlers:

CrawlernaamZoekmachineDoel
*Alle crawlersWildcard, komt overeen met alle niet-afzonderlijk geconfigureerde crawlers
GooglebotGoogleWebpagina-crawler van Google Zoeken
BingbotBing/MicrosoftWebpagina-crawler van Bing Zoeken
BaiduspiderBaiduWebpagina-crawler van Baidu Zoeken
YandexBotYandexWebpagina-crawler van Yandex Zoeken
GPTBotOpenAICrawler voor het verzamelen van trainingsgegevens van ChatGPT
TwitterbotX/TwitterLinkcard-previewcrawler van het X-platform
facebookexternalhitFacebookLinkpreviewcrawler van Facebook

Voorbeelden van Veelgebruikte robots.txt-regels

Configuraties van veelgebruikte regels voor verschillende websitescenario's:

RegelEffect
Disallow: /admin/Verbiedt crawlen van alle inhoud in de map /admin/
Disallow: /*?Verbiedt crawlen van URL's met queryparameters (Googlebot ondersteunt wildcard *)
Disallow: /searchVerbiedt crawlen van interne zoekresultaatpagina's
Allow: /public/Staat crawlen van de map /public/ expliciet toe
Disallow: /⚠️ Verbiedt crawlen van de hele site (fatale fout, wees voorzichtig!)
Allow: /Staat crawlen van alle inhoud van de site toe

Snelle Referentietabel voor Standaard robots.txt-instructies

Standaardinstructies en gebruik zoals gedefinieerd door RFC 9309:

InstructieBereikFormaatvoorbeeldBeschrijving
User-agentGroepsbeginUser-agent: *Specificeert de naam van de crawler waarop de regels van toepassing zijn
DisallowBinnen groepDisallow: /adminPadprefix dat verboden is om te crawlen
AllowBinnen groepAllow: /publicPadprefix dat is toegestaan om te crawlen
SitemapNiet-groepsniveauSitemap: https://example.com/sitemap.xmlVerklaart de locatie van de sitemap (absolute URL)
#Elke positie# This is a commentCommentaarregel, genegeerd door crawlers

Privacy & Security

Alle bewerkingen van deze Robots.txt Generator worden volledig lokaal in uw browser uitgevoerd: configuratie-invoer zoals User-agent, padregels, Sitemap en Host worden allemaal in realtime via JavaScript in het browsergeheugen samengesteld om de robots.txt-tekst te genereren, zonder via het netwerk naar een server te worden verzonden. De pagina is direct klaar voor gebruik na het laden, maakt geen gebruik van Cookie-tracking en verzamelt geen gebruikersgegevens. Na het sluiten of vernieuwen van de pagina wordt alle configuratie-inhoud automatisch gewist, zonder permanente opslag in de browser.

Authoritative References