Robots.txt Oluşturucu
robots.txt Kural Üreteci
Çoklu satır Allow / Disallow / Sitemap'i destekler, standart biçimi otomatik olarak birleştirir.
GeekFormat çevrimiçi Robots.txt Oluşturucu, görsel formlar aracılığıyla User-agent, Allow/Disallow kuralları, Sitemap bildirimleri ve Host yönergelerini yapılandırmanıza olanak tanır ve Robots Exclusion Protocol standardına uygun robots.txt dosyalarını gerçek zamanlı olarak oluşturur. Sayfa açıldığında varsayılan örnek değerlerle gelir, herhangi bir alanı değiştirmek önizlemeyi anında günceller ve tek tıklamayla kopyalayarak web sitesinin kök dizinine dağıtıma hazır hale gelir. Tamamen tarayıcıda çalışır, yapılandırma verileri hiçbir sunucuya gönderilmez.
İlgili Öneriler
Robots.txt ve Crawler Dışlama Protokolü Hakkında
robots.txt, bir web sitesinin arama motoru crawler'larıyla iletişim kurmasının en temel yollarından biridir, tam adı Robots Exclusion Protocol (Robotlar Dışlama Protokolü, kısaca REP). Bu, web sitesinin kök dizinine yerleştirilen basit bir metin dosyasıdır ve basit yönergeler aracılığıyla uyumlu arama motoru crawler'larına sitenin hangi bölümlerinin taranabileceğini ve hangi bölümlerinin taranmasının istenmediğini bildirir. robots.txt ilk olarak 1994 yılında Martijn Koster tarafından önerildi; yaklaşık 30 yıllık gelişimin ardından 2022 yılında IETF tarafından RFC 9309 olarak resmi olarak standartlaştırıldı.
robots.txt'nin temel yapısı bir veya daha fazla kural grubundan (Group) oluşur. Her kural grubu bir veya daha fazla User-agent satırıyla başlar, kuralların uygulanacağı crawler'ları belirtir (* tüm crawler'ları temsil eder); ardından sırasıyla taranmasına izin verilen ve yasaklanan yol öneklerini belirten birkaç Allow ve Disallow satırı gelir; dosyanın sonuna Sitemap ve Host gibi grup dışı yönergeler eklenebilir. Kural grupları boş satırlarla ayrılır. Tipik bir robots.txt şunları içerir: User-agent bildirimi → Allow/Disallow yol kuralları → (isteğe bağlı) daha fazla User-agent grubu → Sitemap bildirimi → Host yönergesi.
User-agent alanı kuralların uygulanacağı crawler'ın adını belirtir. Yaygın arama motoru crawler adları şunları içerir: Googlebot (Google Arama), Bingbot (Bing Arama), Baiduspider (Baidu Arama), YandexBot (Yandex Arama), DuckDuckBot (DuckDuckGo Arama), Twitterbot (Twitter/X kart yakalama), facebookexternalhit (Facebook bağlantı önizlemesi), GPTBot (OpenAI GPT crawler'ı), Bytespider (ByteDance/Toutiao arama) vb. Ayrı olarak eşleşmeyen tüm crawler'ları eşleştirmek için joker karakter olarak User-agent: * kullanın.
Allow ve Disallow yönergeleri önek eşleştirme (Prefix Matching) ilkesini kullanır: URL yolu belirtilen değerle başladığı sürece kural eşleşir. Örneğin, Disallow: /admin /admin, /admin/, /admin/login.html, /administrator ve /admin ile başlayan tüm yolları engelleyecektir. Yalnızca /admin/ dizinini tam olarak eşleştirmek istiyorsanız, Disallow: /admin/ yazın (sondaki eğik çizgi ile). RFC 9309 standardına göre, Allow ve Disallow aynı anda eşleştiğinde en uzun yola sahip kural kazanır; uzunluklar aynı olduğunda Allow önceliğe sahiptir. Bu, kural ne kadar spesifikse önceliğin o kadar yüksek olduğu anlamına gelir.
Sitemap yönergesi arama motorlarını site haritasının konumu hakkında bilgilendirmek için kullanılır ve crawler'ların web sitesinin sayfalarını daha verimli bir şekilde keşfetmesine ve dizine eklemesine yardımcı olur. Sitemap satırları tüm kural gruplarından sonra (veya dosyanın sonunda) yerleştirilmelidir; URL'ler tam mutlak adresler olmalıdır (http:// veya https:// dahil). Bir robots.txt'de her biri ayrı satırda olmak üzere birden fazla Sitemap bildirilebilir. Büyük siteler genellikle birden fazla Sitemap'i (içerik türüne, güncelleme sıklığına göre sınıflandırılmış) böler ve bunları bir Sitemap dizin dosyası aracılığıyla tek tip olarak yönetir.
Host yönergesi, Yandex tarafından önerilen standart dışı ancak yaygın olarak kullanılan bir yönergedir ve sitenin tercih edilen alan adını (ana yansıma) belirtmek için kullanılır. Örneğin, example.com ve www.example.com aynı anda mevcut olduğunda, Host: example.com arama motorlarına example.com'un tercih edildiğini bildirir. Önemli not: Google Host yönergesini kullanmadığını beyan etmiştir; tercih edilen alan adını Google Search Console üzerinden ayarlamanız gerekir; Bing de bunu açıkça desteklememektedir. Host yönergesi Sitemap'ten sonra yerleştirilmeli ve yalnızca bir kez görünmelidir.
robots.txt'yi doğru şekilde yapılandırmak SEO için önemlidir: birincisi, crawler'ların anlamsız sayfalarda (arama sonucu sayfaları, filtre sayfaları, yinelenen içerik sayfaları gibi) tarama bütçesini boşa harcamasını önler, değerli içeriği daha verimli bir şekilde taramalarını sağlar; ikincisi, özel veya düşük değerli sayfaların (yönetim, test sayfaları, yazdırma sayfaları gibi) dizine eklenmesini önler; üçüncüsü, Sitemap aracılığıyla crawler'ları yeni sayfaları keşfetmeye proaktif olarak yönlendirir. Ancak şunu unutmamak önemlidir: robots.txt bir centilmenlik anlaşmasıdır ve gerçek güvenlik önlemlerinin yerini tutmaz; harici bağlantıların işaret ettiği Disallow'lu URL'ler arama sonuçlarında URL olarak görünebilir (yalnızca içerik taranmaz); taramayı tamamen yasaklamak sitenin genel ağırlık değerlendirmesini etkileyebilir.
robots.txt'deki yaygın hatalar şunları içerir: ① yanlış yazılmış yol (örneğin Disallow: admin başında eğik çizgi eksik, /admin olmalıdır); ② düzenli ifadeler kullanmak (standart REP regex desteklemez, yalnızca Googlebot sınırlı joker karakterler * ve $ destekler); ③ JS/CSS dosyalarının taranmasını yasaklamak (Google'ın sayfaları oluşturmasını engeller); ④ Disallow: / (tüm siteyi yasaklamak, tamamen dizine eklenmemeye neden olan ölümcül bir hatadır); ⑤ dosya kodlama sorunu (UTF-8 kodlaması olmalıdır); ⑥ kök dizin yerine alt dizine yerleştirilmiş; ⑦ dosya izinleri erişimi engelliyor (200 OK durum kodu döndürmelidir). Oluşturmadan sonra Google Search Console'un robots.txt test aracını veya bu platformun robots.txt denetleme aracını kullanarak kontrol etmeniz önerilir.
Kullanım senaryoları
- Yeni bir siteyi başlatmadan önce temel bir robots.txt yapılandırın, taranmasına izin verilen ve yasaklanan yolları net olarak tanımlayın, arama motorlarını doğru şekilde taramaya yönlendirin
- Web sitesi yeniden tasarımından sonra eski dizinlerin taranmaya devam etmesini ve SEO ağırlık dağılımını etkilemesini önlemek için Disallow kurallarını güncelleyin
- Arama motorlarının tüm sitenin sayfa yapısını daha hızlı keşfetmesine yardımcı olmak, dizine ekleme verimliliğini artırmak için birden fazla Sitemap adresi ekleyin
- Yönetim dizinlerini (/admin), test ortamlarını ve özel dizinleri crawler'lar tarafından dizine eklenmesini önlemek için engelleyin, güvenlik risklerini azaltın
- Sitenin tercih edilen alan adını (www ile veya www olmadan) belirtmek için Host yönergesini yapılandırın, yinelenen içerik sorunlarını azaltın
- Farklı arama motoru crawler'ları (Googlebot, Bingbot, Baiduspider vb.) için bağımsız tarama kuralları yapılandırın
- Bakımdaki dizinlere crawler erişimini geçici olarak yasaklayın, web sitesi güncellemeleri tamamlandıktan sonra taramayı yeniden açın
- Standart formatta robots.txt dosyaları oluşturun, manuel biçimlendirme hatalarından kaynaklanan arama motoru ayrıştırma hatalarını önleyin
- Tüm site içerik türlerini kapsamak için birden fazla Sitemap yapılandırın (makale sitemap'i, ürün sitemap'i, resim sitemap'i vb.)
- Frontend geliştirmede robots.txt kural yapılandırmasını gösterin, crawler protokolünün standart formatını öğretin
- Oluşturulan kuralların beklentilere uygun olup olmadığını doğrulamak için robots.txt denetleme aracıyla birlikte kullanın, önemli sayfaların yanlışlıkla engellenmesini önleyin
- Hızlıca bir robots.txt şablonu oluşturun, dağıtımdan önce indirin ve sitenin gerçek durumuna göre ince ayar yapın
Nasıl Kullanılır
- User-agent giriş alanında hedef crawler'ı belirtin (varsayılan * tüm arama motoru crawler'larını temsil eder)
- Allow alanında taranmasına izin verilen yolları girin, satır başına bir kural (örneğin /, /blog/)
- Disallow alanında taranması yasaklanan yolları girin, satır başına bir kural (örneğin /admin, /private)
- Sitemap alanında XML site haritası adreslerini ekleyin (çok satırlı desteği vardır), Host alanında tercih edilen alan adını girin
- Sağdaki önizleme alanı oluşturulan robots.txt içeriğini gerçek zamanlı olarak gösterir, onayladıktan sonra kopyala düğmesine tıklayarak dağıtın
Özellikler
- Çoklu kural bağımsız yapılandırması: User-agent, Allow, Disallow, Sitemap ve Host ayrı giriş alanlarına sahiptir, kurallar net şekilde sınıflandırılmıştır ve birbirine karışmaz
- Gerçek zamanlı önizleme ile oluşturma: Herhangi bir kuralı değiştirdikten sonra robots.txt içeriği anında güncellenir, manuel olarak oluştur düğmesine tıklamaya gerek yoktur, ne görüyorsanız onu alırsınız
- Varsayılan yedek kural: Allow ve Disallow her ikisi de boş olduğunda otomatik olarak Allow: / çıktısı verilir, bu da crawler'ın belirsiz davranışına neden olan boş dosya oluşumunu önler
- Çoklu Sitemap desteği: Sitemap alanı çok satırlı girişi destekler, her URL bağımsız bir Sitemap bildirimi satırı olarak çıktı verir, çoklu Sitemap'e sahip siteler için idealdir
- Tek tıklamayla kopyalama ve dağıtım: Oluşturulan sonuç tek tıklamayla panoya kopyalamayı destekler, doğrudan web sitesinin kök dizinine yapıştırmak için hazırdır
- Varsayılan örnek önceden doldurulmuş: Sayfa açıldığında varsayılan örnek yapılandırma ile gelir (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), yeni başlayanlar doğrudan inceleyip değiştirebilir
- Standart format çıktısı: Robots Exclusion Protocol spesifikasyonuna sıkı sıkıya uyar, User-agent satırı önce, kural satırları sonra, Sitemap/Host sonda, tüm arama motorlarıyla uyumlu
- Akıllı yol işleme: Her satırın başındaki/sonundaki boşlukları otomatik olarak kırpar, boş satırları filtreler, fazla boşluklardan kaynaklanan kural geçersizliğini önler
- Sütunlu duyarlı düzen: PC'de sol-sağ sütun (yapılandırma/önizleme), mobilde üst-alt düzen, masaüstü ve telefonda iyi çalışır
- Eşit genişlikli yazı tipi önizlemesi: Önizleme alanı sonucu eşit genişlikli yazı tipiyle görüntüler, robots.txt formatı düzenli ve nettir
- Host yönergesi desteği: Tercih edilen Host alan adını yapılandırabilirsiniz (Yandex gibi arama motorları tarafından desteklenir), alan adı yinelenen içerik sorunlarını azaltır
- Tamamen tarayıcıda yerel çalışma: Tüm yapılandırma ve oluşturma işlemleri tarayıcının yerel JavaScript'inde tamamlanır, hiçbir veri sunucuya gönderilmez
- Bağımlılık olmadan anında kullanım: Sayfayı açın ve kullanın, kayıt veya giriş gerekmez, hiçbir yazılım yüklemeye gerek yoktur
- Denetleme aracıyla entegrasyon: İlgili bağlantılar doğrudan robots.txt denetleme aracına gider, oluşturmadan hemen sonra kuralların doğru olup olmadığını doğrulayabilirsiniz
Sık Sorulan Sorular
robots.txt ne işe yarar? Bir web sitesinin neden bu dosyaya sahip olması gerekir?
robots.txt, bir web sitesinin kök dizinine yerleştirilen basit bir metin dosyasıdır ve arama motoru crawler'larına (Googlebot, Bingbot, Baiduspider vb.) hangi yolların taranabileceğini ve hangilerinin yasaklandığını söylemek için kullanılır. Bu, Robots Exclusion Protocol (Robotlar Dışlama Protokolü)'nün uygulamasıdır ve site tarama yönetimi ile temel SEO ayarları için merkezi dosyadır. Zorunlu olmamasına rağmen, neredeyse tüm düzenli web siteleri crawler davranışını yönlendirmek için robots.txt yapılandırır.
robots.txt dosyası nereye yerleştirilmelidir?
robots.txt web sitesinin kök dizinine yerleştirilmeli ve http://alan-adınız/robots.txt adresinden doğrudan erişilebilir olmalıdır. Örneğin https://example.com/robots.txt. Dikkat: alt dizinlere yerleştirmeyin (örneğin /blog/robots.txt geçersizdir), crawler'lar bu dosyayı yalnızca kök dizinde arar. Dosya adı tamamen küçük harfle robots.txt olmalıdır, Robots.txt veya ROBOTS.TXT olmamalıdır.
Allow ve Disallow boş olduğunda ne üretilir?
Allow ve Disallow doldurulmadığında, oluşturucu otomatik olarak Allow: / çıktısını verir, bu da tüm sitenin taranmasına izin verildiğini belirtir. Bu, yalnızca User-agent satırı içeren boş dosyalar veya eksik robots.txt oluşumunu önler ve belirsiz kurallardan kaynaklanan crawler'ın belirsiz davranışını engeller.
Birden fazla Sitemap adresi yapılandırabilir miyim?
Evet. Sitemap alanı çok satırlı girişi destekler; her URL bağımsız bir Sitemap bildirimi satırı olarak çıktı verir. Örneğin, büyük siteler genellikle birden fazla sitemap dosyasına sahiptir (makale sitemap'i, ürün sitemap'i, resim sitemap'i vb.), satır başına tam bir Sitemap URL'si girebilirsiniz (http:// veya https:// içeren tam mutlak yol olmalıdır).
Host yönergesinin işlevi nedir? Tüm arama motorları bunu destekliyor mu?
Host yönergesi sitenin tercih edilen alan adını (örneğin example.com veya www.example.com) belirtmek için kullanılır, arama motorlarının ana alan adı tanımlamasına yardımcı olur ve www ile www olmayan sürümler arasındaki yinelenen içerik sorunlarını azaltır. Şu anda Host yönergesi esas olarak Yandex gibi arama motorları tarafından desteklenmektedir; Google bunu doğrudan kullanmaz, tercih edilen alan adını Google Search Console üzerinden ayarlamayı tercih eder. Yapılandırılması önerilir ancak tamamen buna güvenmeyin.
User-agent: * ne anlama gelir? Belirli crawler'lar için kuralları nasıl yapılandırırım?
User-agent: * kuralların tüm crawler'lar için geçerli olduğu anlamına gelir (yıldız işareti joker karakterdir). Belirli bir arama motoru için bağımsız kurallar yapılandırmanız gerekirse, User-agent'ı belirli crawler adı olarak ayarlayın, örneğin Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X) vb. Boş satırlarla ayrılmış birden fazla User-agent grubu yapılandırabilirsiniz.
robots.txt hassas dizinleri erişime karşı gerçekten koruyabilir mi?
Hayır. robots.txt yalnızca bir centilmenlik anlaşmasıdır; uyumlu arama motoru crawler'ları kurallara saygı gösterir, ancak kötü niyetli crawler'lar ve bilgisayar korsanı tarayıcıları bunu tamamen görmezden gelebilir. Gerçekten hassas içeriği (yönetici şifreleri, kullanıcı gizlilik verileri gibi) korumak için robots.txt'ye güvenmeyin; hassas dizinler sunucu tarafı kimlik doğrulaması (şifre koruması, IP beyaz listesi) ve diğer gerçek güvenlik önlemleri kullanmalıdır. robots.txt'nin işlevi uyumlu crawler'ları yönlendirmektir, güvenlik koruması değildir.
Disallow kuralı için yol eşleştirme kuralları nelerdir?
Disallow kuralı önek eşleştirmesi kullanır: Disallow: /admin /admin, /admin/, /admin/login.html, /administrator ve /admin ile başlayan tüm yollarla eşleşecektir. Yalnızca /admin/ dizininin içeriğiyle eşleşmek istiyorsanız, Disallow: /admin/ yazın (sondaki eğik çizgi ile). Disallow: (boş değer) hiçbir yolu yasaklamamak anlamına gelir (yani hepsine izin verilir). Dikkat: kurallar büyük/küçük harf duyarlıdır.
Oluşturulan robots.txt'yi web sitesine nasıl dağıtırım?
Oluşturulan içeriği panoya kopyalamak için kopyala düğmesine tıklayın; sunucuda robots.txt adında basit bir metin dosyası oluşturun, içeriği yapıştırın ve dosyayı web sitesinin kök dizinine yükleyin (genellikle web root, public_html, www veya dist dizini). Dağıtımdan sonra çalıştığını doğrulamak için https://alan-adınız/robots.txt adresine erişin; ayrıca kuralları doğrulamak için Google Search Console'un robots.txt test aracını kullanabilirsiniz.
robots.txt'deki değişiklikler ne kadar sürede yürürlüğe girer?
Arama motoru crawler'ı web sitenizi bir sonraki ziyaretinde robots.txt dosyasını yeniden tarayacaktır; genellikle birkaç saat ila birkaç gün içinde yürürlüğe girer. Arama motorlarının güncellemeyi mümkün olduğunca çabuk keşfetmesini istiyorsanız, Google Search Console veya Bing Webmaster Tools'da bir robots.txt güncelleme isteği gönderin. Dikkat: zaten dizine eklenmiş sayfalar Disallow'dan sonra bile bir süre arama sonuçlarında kalabilir; tam kaldırma noindex etiketi veya URL kaldırma aracı kullanmayı gerektirir.
Allow ve Disallow çakıştığında hangisi önceliğe sahiptir?
RFC 9309'a (Robots Exclusion Protocol resmi standardı) göre, Allow ve Disallow kurallarının yol uzunlukları aynı olduğunda Allow Disallow'a göre önceliğe sahiptir; yol uzunlukları farklı olduğunda, en uzun eşleşen yola sahip kural önceliğe sahiptir. Örneğin, Allow: /blog ile Disallow: /blog/ arasındaki çakışmada, /blog/post.html'ye erişim Disallow ile eşleşir (daha uzun yol /blog/ > /blog), /blog'un kendisine erişim ise Allow ile eşleşir. Basitçe söylemek gerekirse, kural ne kadar spesifikse önceliği o kadar yüksektir.
robots.txt'ye yorum ekleyebilir miyim?
Evet, # ile başlayan satırlar yorum satırlarıdır; crawler'lar # işaretinden sonraki içeriği yok sayar. Yorumlar ayrı bir satıra yazılabilir veya kural satırlarının sonuna yazılabilir (# işaretinden sonraki içerik). Örneğin: # Block admin area veya Disallow: /admin # admin panel. Uygun yorumlar eklemek, sizin ve ekip üyelerinin her kuralın işlevini anlamanıza yardımcı olur.
Sitemap URL'lerinin mutlak yol olması gerekir mi?
Evet, Sitemap yönergesi tam mutlak URL kullanmalıdır (protokol ve alan adı dahil), örneğin Sitemap: https://example.com/sitemap.xml. Göreceli yollar kullanmayın (örneğin /sitemap.xml), çünkü crawler'lar sitenize farklı alan adlarından erişebilir (örneğin example.com ve www.example.com) ve göreli yollar crawler'ların doğru adresi belirlemesini engeller.
Yapılandırma verileri sunucuya gönderilir mi?
Kesinlikle hayır. robots.txt'nin tüm yapılandırma ve oluşturma işlemleri tarayıcınızda yerel olarak JavaScript aracılığıyla gerçekleşir; girilen yollar, alan adları ve diğer yapılandırma verileri hiçbir dış sunucuya gönderilmez. Sayfa yüklendikten sonra (temel işlevler) çevrimdışı olarak kullanılabilir; sayfayı kapattığınızda veriler hiçbir kayıt bırakmadan otomatik olarak temizlenir.
Oluşturulan robots.txt herhangi bir web sitesinde kullanılabilir mi?
Evet, oluşturucu standart Robots Exclusion Protocol formatında basit bir metin dosyası üretir, herhangi bir Web sunucusu (Nginx, Apache, IIS, Caddy vb.) ve herhangi bir web sitesi oluşturma platformu (WordPress, Shopify, Next.js, Django, Rails vb.) için uygundur. Sadece web sitesinin kök dizinine dağıtın ve genel erişilebilir olduğundan emin olun.
Sorun Giderme
Oluşturulan dosyaya erişim 404 hatası veriyor?
robots.txt dosyasının web sitesinin kök dizinine yüklendiğinden (alt dizin değil), dosya adının tamamen küçük harfle robots.txt olduğundan ve dosya izinlerinin genel okuma olarak ayarlandığından emin olun (genellikle 644 izinleri yeterlidir). Yükledikten sonra içeriğin görünür olduğunu doğrulamak için doğrudan tarayıcıda https://alan-adınız/robots.txt adresine gidin. Kök dizinin konumu sunucuya göre değişir: Nginx/Apache genellikle /var/www/html/ veya /usr/share/nginx/html/, Vercel/Netlify genellikle public/ dizinidir.
Disallow kuralları çalışmıyor, sayfalar hala dizine ekleniyor?
Olası nedenler: ① crawler henüz robots.txt'yi yeniden taramadı (birkaç gün bekleyin veya Search Console'da güncelleme gönderin); ② yol öneki eşleşmesi yanlış (örneğin Disallow: admin / eksik, Disallow: /admin/ olmalıdır); ③ sayfa Disallow eklenmeden önce zaten dizine eklenmişti (zaten dizine eklenen sayfalar otomatik olarak kaldırılmaz); ④ kötü niyetli crawler'lar robots.txt'ye uymuyor; ⑤ Disallow'u kapsayan bir çakışan Allow kuralı var (daha uzun yol olduğunda Allow önceliğe sahiptir). Dizinden tamamen kaldırmak için noindex etiketini kullanın.
Google Search Console robots.txt'nin sayfaları engellediğini bildiriyor?
Bu genellikle önemli sayfaların yanlışlıkla Disallow tarafından engellendiği anlamına gelir. robots.txt'de çok geniş Disallow kuralları olup olmadığını kontrol edin (Disallow: / veya Disallow: /*? gibi); CSS/JS dosyalarının yasaklanmadığından emin olun (Google'ın sayfaları oluşturması için bu dosyaları taraması gerekir). Belirli URL'leri girmek ve hangi kuralın engellediğini test etmek için Search Console'daki robots.txt test aracını kullanın.
Yanlışlıkla Disallow: / ayarladım ve tüm sitenin taranması yasaklandı?
Bu kuralı hemen kaldırın veya değiştirin, robots.txt'yi Allow: / olarak değiştirin veya Disallow: / satırını silin, güncellenen dosyayı sunucuya yükleyin. Ardından Google Search Console'da bir robots.txt güncelleme isteği gönderin ve yeniden taramayı hızlandırmak için sitemap'i gönderin. Zaten dizinden kaldırılan sayfaların yeniden dizine eklenmesi birkaç günden birkaç haftaya kadar sürebilir.
Sözlük
- robots.txt
- Web sitesinin kök dizinine yerleştirilen, Robots Exclusion Protocol'e uyan basit metin dosyası, uyumlu arama motoru crawler'larına hangi yolların taranmasına izin verildiğini/yasaklandığını bildirmek için kullanılır.
- Robots Exclusion Protocol (REP)
- Robotlar Dışlama Protokolü, 1994'te önerildi ve 2022'de RFC 9309 olarak standartlaştırıldı, siteler ve crawler'lar arasında tarama kuralları iletişimi için fiili standarttır.
- User-agent
- Bir kural grubunun başlangıç alanı, sonraki Allow/Disallow kurallarının uygulanacağı crawler'ın adını belirtir; joker karakter * tüm crawler'larla eşleşir.
- Disallow
- Tarama yasağı yönergesi, crawler'ların erişmemesi gereken yol öneklerini belirtir. Örneğin, Disallow: /admin /admin ile başlayan tüm yolların taranmasını yasaklar.
- Allow
- Tarama izni yönergesi, crawler'lara açıkça izin verilen yolları belirtir. Bir Disallow üst yolu altında belirli alt yolları açmak için kullanılır.
- Sitemap
- Site haritası bildirim yönergesi, arama motorlarını sitenin XML site haritasının tam URL'si hakkında bilgilendirir, crawler'ların tüm sayfaları verimli bir şekilde keşfetmesine ve dizine eklemesine yardımcı olur.
- Host
- Tercih edilen alan adı yönergesi, sitenin ana alan adını belirtir (örneğin example.com vs www.example.com); Yandex tarafından desteklenir, Google Search Console üzerinden yapılandırılır.
- Crawler/Bot/Spider
- Crawler/bot/örümcek, web sayfalarına otomatik olarak erişen ve içerik toplayan arama motorlarının otomatik programı, örneğin Googlebot, Bingbot, Baiduspider vb.
- Googlebot
- Google arama motorunun web crawler'ı, Google'ın dizine eklemesi ve sıralaması için web sayfası içeriğini yakalamaktan sorumludur, en yaygın arama motoru crawler'larından biridir.
- Crawl Budget
- Tarama bütçesi/kotası, arama motorlarının her web sitesine tahsis ettiği tarama sıklığı ve sayfa sayısı sınırı. robots.txt'yi doğru şekilde yapılandırmak tarama kotasının boşa harcanmasını önler.
- Prefix Matching
- Önek eşleştirme kuralı, robots.txt'nin yol eşleştirme yöntemi. Kural değeriyle başlayan bir URL yolu başarılı bir eşleşmedir; kural ne kadar uzunsa önceliği o kadar yüksektir.
- noindex
- HTML meta etiketi veya HTTP başlık yönergesi (X-Robots-Tag: noindex), arama motorlarına sayfayı arama dizinine eklememesini söyler. robots.txt Disallow'unun aksine, noindex dizinden kaldırmak için daha güvenilir bir yöntemdir.
Yaygın Arama Motoru Crawler'larının User-agent Adları
Belirli crawler'lar için kurallar yapılandırılırken kullanılan User-agent adları:
| Crawler Adı | Arama Motoru | Amaç |
|---|---|---|
* | Tüm crawler'lar | Joker karakter, ayrı olarak yapılandırılmayan tüm crawler'larla eşleşir |
Googlebot | Google Arama web sayfası crawler'ı | |
Bingbot | Bing/Microsoft | Bing Arama web sayfası crawler'ı |
Baiduspider | Baidu | Baidu Arama web sayfası crawler'ı |
YandexBot | Yandex | Yandex Arama web sayfası crawler'ı |
GPTBot | OpenAI | ChatGPT eğitim verisi toplama crawler'ı |
Twitterbot | X/Twitter | X platformu bağlantı kartı önizleme crawler'ı |
facebookexternalhit | Facebook bağlantı önizleme crawler'ı |
Yaygın robots.txt Kural Örnekleri
Farklı site senaryoları için yaygın kural yapılandırmaları:
| Kural | Etki |
|---|---|
Disallow: /admin/ | /admin/ dizinindeki tüm içeriğin taranmasını yasaklar |
Disallow: /*? | Sorgu parametreli URL'lerin taranmasını yasaklar (Googlebot joker karakter * destekler) |
Disallow: /search | Site içi arama sonucu sayfalarının taranmasını yasaklar |
Allow: /public/ | /public/ dizininin taranmasına açıkça izin verir |
Disallow: / | ⚠️ Tüm sitenin taranmasını yasaklar (ölümcül hata, dikkatli kullanın!) |
Allow: / | Sitenin tüm içeriğinin taranmasına izin verir |
Standart robots.txt Yönergeleri Hızlı Başvuru Tablosu
RFC 9309 tarafından tanımlanan standart yönergeler ve kullanımları:
| Yönerge | Kapsam | Format Örneği | Açıklama |
|---|---|---|---|
User-agent | Grup başlangıcı | User-agent: * | Kuralların uygulanacağı crawler'ın adını belirtir |
Disallow | Grup içi | Disallow: /admin | Taranması yasak olan yol öneki |
Allow | Grup içi | Allow: /public | Taranmasına izin verilen yol öneki |
Sitemap | Grup dışı | Sitemap: https://example.com/sitemap.xml | Site haritasının konumunu bildirir (mutlak URL) |
# | Herhangi bir konum | # This is a comment | Yorum satırı, crawler'lar tarafından yok sayılır |
Privacy & Security
Bu Robots.txt Oluşturucu'nun tüm işlemleri tamamen tarayıcınızda yerel olarak gerçekleştirilir: User-agent, yol kuralları, Sitemap ve Host gibi yapılandırma girdilerinin tümü, JavaScript aracılığıyla tarayıcı belleğinde gerçek zamanlı olarak birleştirilerek robots.txt metni oluşturulur, ağ üzerinden herhangi bir sunucuya gönderilmez. Sayfa yüklendikten sonra kullanıma hazırdır, Cookie ile izleme kullanmaz ve hiçbir kullanıcı verisi toplamaz. Sayfayı kapattıktan veya yeniledikten sonra tüm yapılandırma içeriği otomatik olarak temizlenir, tarayıcıda kalıcı olarak depolanmaz.
Authoritative References
- Kimlik Doğrulama Başlığı Oluşturucu
- Cache-Control Çözümleyici
- Content-Disposition Çözümleyici
- CORS Başlık Oluşturucu
- CORS Denetleyici
- CSP Oluşturucu
- cURL'den Koda Dönüştürücü
- Global DNS Yayılma Kontrolü
- DNS Sorgulama
- Forwarded Başlık Çözümleyici
- Hreflang Etiket Oluşturucu
- HSTS Analizörü
- HTTP Çerez Ayrıştırıcı
- HTTP Başlık Denetleyici
- HTTP İstek Test Aracı
- HTTP Durum Kodları Sorgulama
- IP Sorgulama
- IPv4 Dönüştürücü
- IPv4 Aralık Genişletici
- IPv6 Araç Kutusu
- Link Başlık Ayrıştırıcı
- MX Sorgulama
- Port Denetleyici
- URL Parametre Oluşturucu
- Rate Limit Başlık Ayrıştırıcı
- Yönlendirme Denetleyici
- Robots.txt Oluşturucu
- Robots.txt Denetimi
- Güvenlik Başlığı Denetleyici
- Security.txt Oluşturucu
- Set-Cookie Ayrıştırıcı
- Site Ağ Denetimi
- Sitemap Generator
- Sitemap Denetleyici
- SSL Sertifika Denetleyicisi
- Alt Ağ Hesaplayıcı
- URL Çözümleyici
- User-Agent Ayrıştırıcı
- UTM Bağlantı Oluşturucu
- WebSocket Test Aracı
- What Is My IP?
- WHOIS Sorgulama