Generator Robots.txt

Generator aturan robots.txt

Mendukung multi-baris Allow / Disallow / Sitemap, secara otomatis merakit format standar.

Konfigurasi Aturan
Hasil yang dihasilkan

Generator Robots.txt online GeekFormat, melalui formulir visual mengonfigurasi User-agent, aturan Allow/Disallow, deklarasi Sitemap dan perintah Host, membuat file robots.txt yang sesuai dengan standar Robots Exclusion Protocol secara real-time. Saat halaman dibuka sudah memiliki nilai default contoh, ubah bidang apa pun pratinjau hasil pembuatan segera, salin dengan satu klik dapat diterapkan ke direktori root situs. Berjalan sepenuhnya secara lokal di browser, data konfigurasi tidak diunggah ke server mana pun.

Rekomendasi Terkait

Tentang Robots.txt dan Protokol Pengecualian Perayap

robots.txt adalah salah satu cara paling dasar bagi situs untuk berkomunikasi dengan perayap mesin pencari, nama lengkapnya adalah Robots Exclusion Protocol (Protokol Pengecualian Perayap, disingkat REP). Ini adalah file teks biasa yang ditempatkan di direktori root situs, melalui perintah sederhana memberi tahu perayap mesin pencari yang patuh: bagian situs mana yang diizinkan untuk dirayapi, bagian mana yang tidak ingin dirayapi. robots.txt pertama kali diusulkan oleh Martijn Koster pada tahun 1994, setelah hampir 30 tahun perkembangan, secara resmi distandarisasi oleh IETF menjadi RFC 9309 pada tahun 2022.

Struktur dasar robots.txt terdiri dari satu atau lebih kelompok aturan (Group). Setiap kelompok aturan dimulai dengan satu atau lebih baris User-agent, menentukan perayap yang dikenai aturan (* mewakili semua perayap); diikuti oleh beberapa baris Allow dan Disallow, masing-masing menentukan awalan jalur yang diizinkan dan dilarang untuk dirayapi; di akhir file dapat ditambahkan perintah non-kelompok seperti Sitemap dan Host. Antar kelompok aturan dipisahkan oleh baris kosong. robots.txt khas mencakup: Deklarasi User-agent → Aturan jalur Allow/Disallow → (Opsional) Lebih banyak kelompok User-agent → Deklarasi Sitemap → Perintah Host.

Bidang User-agent menentukan nama perayap yang dikenai aturan. Nama perayap mesin pencari umum meliputi: Googlebot (Pencarian Google), Bingbot (Pencarian Bing), Baiduspider (Pencarian Baidu), YandexBot (Pencarian Yandex), DuckDuckBot (Pencarian DuckDuckGo), Twitterbot (Pengambilan kartu Twitter/X), facebookexternalhit (Pratinjau tautan Facebook), GPTBot (Perayap OpenAI GPT), Bytespider (Pencarian ByteDance/Toutiao), dll. Gunakan User-agent: * sebagai wildcard untuk mencocokkan semua perayap yang tidak dicocokkan secara terpisah.

Perintah Allow dan Disallow menggunakan prinsip Pencocokan Awalan (Prefix Matching): Selama jalur URL dimulai dengan nilai yang ditentukan, aturan akan cocok. Misalnya Disallow: /admin akan memblokir /admin, /admin/, /admin/login.html, /administrator dan semua jalur yang dimulai dengan /admin. Jika hanya ingin mencocokkan direktori /admin/ secara tepat, harus menulis Disallow: /admin/ (tambah garis miring di akhir). Menurut standar RFC 9309, ketika Allow dan Disallow cocok secara bersamaan, aturan dengan jalur terpanjang menang; ketika panjang sama Allow diprioritaskan. Ini berarti aturan yang lebih spesifik prioritasnya lebih tinggi.

Perintah Sitemap digunakan untuk memberitahu mesin pencari lokasi peta situs, membantu perayap menemukan dan mengindeks halaman situs dengan lebih efisien. Baris Sitemap harus ditempatkan setelah semua kelompok aturan (atau di akhir file), URL harus alamat absolut lengkap (termasuk http:// atau https://). Satu robots.txt dapat mendeklarasikan beberapa Sitemap, masing-masing satu baris independen. Situs besar biasanya membagi menjadi beberapa Sitemap (diklasifikasikan berdasarkan jenis konten, frekuensi pembaruan), dan dikelola secara terpadu melalui file indeks Sitemap.

Perintah Host adalah perintah non-standar tetapi banyak digunakan yang diusulkan oleh Yandex, digunakan untuk menentukan domain pilihan situs (mirror utama). Misalnya ketika example.com dan www.example.com ada secara bersamaan, Host: example.com memberitahu mesin pencari untuk mengambil example.com sebagai pilihan. Perlu diperhatikan: Google telah menyatakan tidak menggunakan perintah Host, perlu melalui Google Search Console mengatur domain pilihan; Bing juga tidak mendukung secara eksplisit. Perintah Host harus ditempatkan setelah Sitemap, dan hanya dapat muncul sekali.

Mengonfigurasi robots.txt dengan benar memiliki arti penting bagi SEO: Pertama adalah menghindari perayap membuang anggaran perayapan pada halaman yang tidak berarti (seperti halaman hasil pencarian, halaman filter, halaman konten duplikat), membiarkan perayap merayapi konten berharga dengan lebih efisien; Kedua adalah mencegah halaman pribadi atau bernilai rendah (seperti area administrasi, halaman pengujian, halaman cetak) diindeks; Ketiga adalah melalui Sitemap secara aktif mengarahkan perayap menemukan halaman baru. Tetapi perlu diperhatikan: robots.txt adalah kesepakatan gentlemen, tidak dapat menggantikan langkah keamanan nyata; URL yang di-Disallow jika ada tautan eksternal yang menunjuk, masih dapat menampilkan URL di hasil pencarian (hanya tidak merayapi konten); Melarang perayapan sepenuhnya justru dapat memengaruhi penilaian bobot seluruh situs.

Kesalahan umum robots.txt meliputi: ①Salah menulis jalur (seperti Disallow: admin kurang garis miring di awal, harus menulis /admin); ②Menggunakan ekspresi reguler (REP standar tidak mendukung regex, hanya Googlebot mendukung wildcard terbatas * dan $); ③Melarang perayapan file JS/CSS (akan menyebabkan Google tidak dapat merender halaman); ④Disallow: / (melarang seluruh situs, ini adalah kesalahan fatal, akan menyebabkan situs sama sekali tidak diindeks); ⑤Masalah pengkodean file (harus pengkodean UTF-8); ⑥Ditempatkan di subdirektori bukan direktori root; ⑦Izin file menyebabkan tidak dapat diakses (harus mengembalikan kode status 200 OK). Disarankan setelah dibuat menggunakan alat uji robots.txt Google Search Console atau alat inspeksi robots.txt platform ini untuk memverifikasi.

Kasus penggunaan

  • Konfigurasi robots.txt dasar sebelum peluncuran situs baru, jelaskan rentang jalur yang diizinkan dan dilarang untuk dirayapi, arahkan mesin pencari merayapi dengan benar
  • Perbarui aturan Disallow setelah perombakan situs untuk mencegah direktori lama terus dirayapi memengaruhi distribusi bobot SEO
  • Tambahkan beberapa alamat Sitemap deklarasi membantu mesin pencari menemukan struktur halaman seluruh situs lebih cepat, tingkatkan efisiensi pengindeksan
  • Blokir direktori administrasi (/admin), lingkungan pengujian, direktori pribadi agar tidak diindeks oleh perayap, kurangi risiko keamanan
  • Atur perintah Host tentukan domain pilihan situs (dengan www atau tanpa www), kurangi masalah konten duplikat
  • Konfigurasi aturan perayapan independen untuk perayap mesin pencari yang berbeda (Googlebot, Bingbot, Baiduspider, dll.)
  • Sementara melarang perayap mengakses direktori yang sedang dalam pemeliharaan, buka kembali perayapan setelah pembaruan situs selesai
  • Buat file robots.txt format standar, hindari kesalahan format tulisan tangan menyebabkan mesin pencari gagal mengurai
  • Konfigurasi multi-Sitemap (seperti sitemap artikel, sitemap produk, sitemap gambar) mencakup semua jenis konten seluruh situs
  • Pengembang frontend mendemonstrasikan konfigurasi aturan robots.txt, pengajaran menampilkan format standar protokol perayap
  • Bekerja sama dengan alat inspeksi robots.txt verifikasi apakah aturan yang dibuat sesuai harapan, hindari salah memblokir halaman penting
  • Cepat buat templat robots.txt, setelah unduh sesuaikan sedikit sesuai situasi situs aktual lalu terapkan

Cara Penggunaan

  1. Di kotak input User-agent tentukan perayap target (default * mewakili semua perayap mesin pencari)
  2. Di area Allow isi jalur yang diizinkan untuk dirayapi, setiap baris satu aturan (seperti /, /blog/)
  3. Di area Disallow isi jalur yang dilarang untuk dirayapi, setiap baris satu aturan (seperti /admin, /private)
  4. Di area Sitemap tambahkan alamat peta situs XML (dukung multi-baris), di area Host isi domain pilihan
  5. Area pratinjau kanan menampilkan konten robots.txt yang dibuat secara real-time, setelah konfirmasi tidak ada kesalahan klik tombol salin dapat diterapkan

Fitur

  • Konfigurasi independen multi-aturan: Area input terpisah untuk User-agent, Allow, Disallow, Sitemap, Host, aturan diklasifikasikan dengan jelas tidak lagi tercampur
  • Pratinjau pembuatan real-time: Konten robots.txt diperbarui segera setelah mengubah aturan apa pun, tidak perlu mengklik tombol buat secara manual, apa yang Anda lihat adalah apa yang Anda dapatkan
  • Aturan cadangan default: Ketika Allow dan Disallow keduanya kosong, secara otomatis mengeluarkan Allow: /, menghindari pembuatan file kosong yang menyebabkan perilaku perayap tidak pasti
  • Dukungan multi-Sitemap: Area Sitemap mendukung input multi-baris, setiap URL mengeluarkan satu baris deklarasi Sitemap secara independen, cocok untuk situs dengan banyak Sitemap
  • Salin dan terapkan dengan satu klik: Hasil pembuatan mendukung penyalinan ke papan klip dengan satu klik, cocok untuk ditempel langsung ke direktori root situs untuk diterapkan
  • Contoh default terisi: Saat halaman dibuka sudah memiliki konfigurasi contoh default (User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host), pemula dapat langsung merujuk dan memodifikasi
  • Output format standar: Mematuhi ketat spesifikasi Robots Exclusion Protocol, baris User-agent di depan, baris aturan di belakang, Sitemap/Host di akhir, kompatibel dengan semua mesin pencari
  • Pemrosesan jalur cerdas: Secara otomatis memangkas spasi di awal dan akhir setiap baris, memfilter baris kosong, menghindari aturan tidak valid karena spasi berlebih
  • Tata letak responsif dua kolom: Di PC dibagi dua kolom kiri kanan (konfigurasi/pratinjau), di perangkat seluler disusun atas bawah, mudah digunakan di desktop maupun ponsel
  • Pratinjau font monospasi: Area pratinjau menggunakan font monospasi untuk menampilkan hasil pembuatan, format robots.txt rapi dan jelas
  • Dukungan perintah Host: Dapat mengonfigurasi domain pilihan untuk Host (didukung oleh mesin pencari seperti Yandex), mengurangi masalah konten duplikat domain
  • Berjalan sepenuhnya secara lokal di browser: Semua operasi konfigurasi dan pembuatan diselesaikan dalam JavaScript lokal di browser Anda, tidak mengirim data apa pun ke server
  • Gunakan segera tanpa dependensi: Buka halaman dapat digunakan langsung, tidak perlu mendaftar masuk, tidak perlu menginstal perangkat lunak apa pun
  • Terintegrasi dengan alat inspeksi: Tautan terkait langsung menuju alat inspeksi robots.txt, setelah dibuat dapat segera memverifikasi apakah aturan benar

Pertanyaan Umum

Apa gunanya robots.txt? Mengapa situs perlu memiliki file ini?

robots.txt adalah file teks biasa yang ditempatkan di direktori root situs, digunakan untuk memberi tahu perayap mesin pencari (seperti Googlebot, Bingbot, Baiduspider, dll.) jalur mana yang dapat dirayapi, jalur mana yang dilarang diakses. Ini adalah cara implementasi Robots Exclusion Protocol (Protokol Pengecualian Perayap), adalah file inti untuk manajemen perayapan situs dan pengaturan dasar SEO. Meskipun tidak wajib, hampir semua situs formal mengonfigurasi robots.txt untuk mengarahkan perilaku perayap.

Di mana file robots.txt harus ditempatkan?

robots.txt harus ditempatkan di direktori root situs, dan dapat diakses langsung melalui http://domain Anda/robots.txt. Misalnya https://example.com/robots.txt. Perhatikan jangan ditempatkan di subdirektori (seperti /blog/robots.txt tidak valid), perayap hanya mencari file ini di direktori root. Nama file harus robots.txt huruf kecil semua, tidak boleh Robots.txt atau ROBOTS.TXT.

Apa yang akan dihasilkan ketika Allow dan Disallow keduanya kosong?

Ketika Allow dan Disallow keduanya tidak diisi, generator akan secara otomatis mengeluarkan Allow: / sebagai aturan cadangan, berarti mengizinkan perayapan seluruh situs. Ini dapat menghindari pembuatan file kosong atau robots.txt tidak lengkap yang hanya memiliki baris User-agent, mencegah perayap memiliki perilaku tidak pasti karena aturan tidak jelas.

Bisakah mengonfigurasi beberapa alamat Sitemap?

Bisa. Area Sitemap mendukung input multi-baris, setiap URL akan mengeluarkan satu baris deklarasi Sitemap secara independen. Misalnya situs besar biasanya memiliki beberapa file sitemap (sitemap artikel, sitemap produk, sitemap gambar, dll.), dapat mengisi satu URL Sitemap lengkap di setiap baris (harus jalur absolut lengkap, termasuk http:// atau https://).

Apa fungsi perintah Host? Apakah semua mesin pencari mendukung?

Perintah Host digunakan untuk menentukan domain pilihan situs (seperti example.com atau www.example.com), membantu mesin pencari mengenali domain utama, mengurangi masalah konten duplikat antara versi www dan non-www. Saat ini perintah Host terutama didukung oleh mesin pencari seperti Yandex, Google tidak menggunakan perintah Host secara langsung, melainkan melalui Google Search Console mengatur domain pilihan. Disarankan untuk mengonfigurasi tetapi tidak sepenuhnya bergantung padanya.

Apa arti User-agent: *? Bagaimana cara mengonfigurasi aturan untuk perayap tertentu?

User-agent: * berarti aturan berlaku untuk semua perayap (tanda bintang adalah wildcard). Jika perlu mengonfigurasi aturan independen untuk mesin pencari tertentu, dapat mengatur User-agent ke nama perayap spesifik, seperti Googlebot (Google), Bingbot (Bing), Baiduspider (Baidu), Twitterbot (Twitter/X), dll. Dapat mengonfigurasi beberapa kelompok User-agent, antar kelompok dipisahkan oleh baris kosong.

Bisakah robots.txt benar-benar melindungi direktori sensitif dari akses?

Tidak bisa. robots.txt hanyalah kesepakatan gentlemen, perayap mesin pencari yang patuh akan mematuhi aturan, tetapi perayap berbahaya, pemindai peretas sepenuhnya dapat mengabaikannya. Jangan mengandalkan robots.txt untuk melindungi konten sensitif yang sebenarnya (seperti kata sandi administrasi, data privasi pengguna), direktori sensitif harus menggunakan langkah keamanan nyata seperti otentikasi sisi server (perlindungan kata sandi, daftar putih IP). Fungsi robots.txt adalah mengarahkan perayap yang patuh, bukan perlindungan keamanan.

Apa aturan pencocokan jalur dari aturan Disallow?

Aturan Disallow menggunakan pencocokan awalan: Disallow: /admin akan mencocokkan /admin, /admin/, /admin/login.html, /administrator dan semua jalur yang dimulai dengan /admin. Jika hanya ingin mencocokkan konten di direktori /admin/, harus menulis Disallow: /admin/ (dengan garis miring di akhir). Disallow: (nilai kosong) berarti tidak melarang jalur apa pun (yaitu mengizinkan semua). Perhatikan aturan peka huruf besar-kecil.

Bagaimana cara menerapkan robots.txt yang dibuat ke situs?

Klik tombol salin untuk menyalin konten yang dibuat ke papan klip, kemudian di server buat file teks biasa bernama robots.txt, tempel konten lalu unggah file ke direktori root situs (biasanya direktori web root, public_html, www atau dist). Setelah diterapkan dapat mengakses https://domain Anda/robots.txt untuk verifikasi apakah berfungsi, juga dapat menggunakan alat uji robots.txt Google Search Console untuk memverifikasi aturan.

Berapa lama setelah mengubah robots.txt berlaku?

Perayap mesin pencari akan merayapi ulang file robots.txt saat mengunjungi situs Anda lain kali, biasanya berlaku dalam beberapa jam hingga beberapa hari. Jika Anda ingin mesin pencari segera menemukan pembaruan, dapat mengirimkan permintaan pembaruan robots.txt di Google Search Console atau Bing Webmaster Tools. Perhatikan: Halaman yang sudah diindeks meskipun di-Disallow juga dapat tetap ada di hasil pencarian untuk sementara waktu, penghapusan total perlu dikombinasikan dengan tag noindex atau alat penghapusan URL.

Ketika Allow dan Disallow bertentangan mana yang diprioritaskan?

Menurut RFC 9309 (standar resmi Robots Exclusion Protocol), ketika panjang jalur aturan Allow dan Disallow sama, Allow diprioritaskan daripada Disallow; ketika panjang jalur berbeda, aturan yang mencocokkan jalur terpanjang diprioritaskan. Misalnya ketika Allow: /blog dan Disallow: /blog/ bertentangan, mengakses /blog/post.html akan mencocokkan Disallow (jalur lebih panjang /blog/ > /blog), sedangkan mengakses /blog itu sendiri akan mencocokkan Allow. Singkatnya, aturan yang lebih spesifik prioritasnya lebih tinggi.

Bisakah menambahkan komentar di robots.txt?

Bisa, baris yang dimulai dengan tanda # adalah baris komentar, perayap akan mengabaikan konten setelah tanda #. Komentar dapat ditulis di baris terpisah, juga dapat ditulis di akhir baris aturan (konten setelah tanda #). Misalnya: # Block admin area atau Disallow: /admin # admin panel. Menambahkan komentar yang sesuai membantu diri sendiri dan anggota tim memahami fungsi setiap aturan.

Apakah Sitemap URL perlu jalur absolut?

Ya, perintah Sitemap harus menggunakan URL absolut lengkap (termasuk protokol dan domain), seperti Sitemap: https://example.com/sitemap.xml. Tidak dapat menggunakan jalur relatif (seperti /sitemap.xml), karena perayap dapat mengakses situs Anda dari domain yang berbeda (seperti example.com dan www.example.com), jalur relatif akan menyebabkan perayap tidak dapat menentukan alamat yang benar.

Apakah data konfigurasi diunggah ke server?

Sama sekali tidak. Semua operasi konfigurasi dan pembuatan robots.txt diselesaikan secara lokal melalui JavaScript di browser Anda, data konfigurasi seperti jalur, domain yang dimasukkan tidak dikirim ke server eksternal mana pun. Setelah halaman dimuat dapat digunakan secara offline (fungsi dasar), setelah menutup halaman data otomatis terhapus, tidak meninggalkan catatan apa pun.

Bisakah robots.txt yang dibuat digunakan di situs mana pun?

Bisa, generator mengeluarkan file teks biasa format Robots Exclusion Protocol standar, cocok untuk server Web mana pun (Nginx, Apache, IIS, Caddy, dll.) dan platform pembuatan situs mana pun (WordPress, Shopify, Next.js, Django, Rails, dll.). Cukup terapkan ke direktori root situs dan pastikan dapat diakses secara publik.

Pemecahan Masalah

Mengakses file yang dibuat mengembalikan kesalahan 404?

Konfirmasi file robots.txt telah diunggah ke direktori root situs (bukan subdirektori), nama file huruf kecil semua adalah robots.txt, izin file diatur agar dapat dibaca publik (biasanya izin 644 sudah cukup). Setelah mengunggah akses langsung https://domain Anda/robots.txt di browser konfirmasi dapat melihat konten. Lokasi direktori root server berbeda-beda: Nginx/Apache biasanya /var/www/html/ atau /usr/share/nginx/html/, Vercel/Netlify biasanya direktori public/.

Aturan Disallow tidak berfungsi, halaman masih diindeks?

Kemungkinan penyebab: ①Perayap belum merayapi ulang robots.txt (tunggu beberapa hari atau kirim pembaruan di Search Console); ②Pencocokan awalan jalur tidak benar (seperti Disallow: admin kurang /, harus menulis Disallow: /admin/); ③Halaman sudah diindeks sebelum menambahkan Disallow (halaman yang sudah diindeks tidak terhapus otomatis); ④Perayap berbahaya tidak mematuhi robots.txt; ⑤Ada aturan Allow yang bertentangan menimpa Disallow (Allow diprioritaskan saat jalur lebih panjang). Perlu menghapus indeks sepenuhnya harus menggunakan tag noindex.

Google Search Console melaporkan robots.txt memblokir halaman?

Ini biasanya berarti halaman penting di-Disallow secara tidak sengaja. Periksa di robots.txt apakah ada aturan Disallow yang terlalu luas (seperti Disallow: / atau Disallow: /*?), konfirmasi file CSS/JS tidak dilarang (Google perlu merayapi file-file ini untuk merender halaman). Gunakan alat uji robots.txt Search Console masukkan URL spesifik uji aturan mana yang memblokir.

Tidak sengaja mengatur Disallow: / menyebabkan seluruh situs dilarang dirayapi?

Segera hapus atau ubah aturan tersebut, ubah robots.txt menjadi Allow: / atau hapus baris Disallow: /, unggah file yang diperbarui ke server. Kemudian kirim permintaan pembaruan robots.txt di Google Search Console, dan kirim sitemap untuk mempercepat perayapan ulang. Halaman yang sudah dihapus dari indeks mungkin membutuhkan beberapa hari hingga beberapa minggu untuk diindeks ulang.

Glosarium

robots.txt
File teks biasa yang ditempatkan di direktori root situs, mematuhi Robots Exclusion Protocol, digunakan untuk memberitahu perayap mesin pencari yang patuh jalur mana yang diizinkan/dilarang untuk dirayapi.
Robots Exclusion Protocol (REP)
Protokol pengecualian perayap, diusulkan tahun 1994, distandarisasi menjadi RFC 9309 tahun 2022, adalah standar de facto untuk komunikasi aturan perayapan antara situs dan perayap.
User-agent
Bidang awal kelompok aturan, menentukan nama perayap yang dikenai aturan Allow/Disallow berikutnya, wildcard * berarti mencocokkan semua perayap.
Disallow
Perintah larangan perayapan, menentukan awalan jalur yang tidak ingin diakses perayap. Misalnya Disallow: /admin melarang perayapan semua jalur yang dimulai dengan /admin.
Allow
Perintah izin perayapan, menentukan jalur yang secara eksplisit diizinkan diakses perayap. Digunakan saat membuka subjalur tertentu di bawah jalur induk Disallow.
Sitemap
Perintah deklarasi peta situs, memberitahu mesin pencari URL lengkap peta situs XML situs, membantu perayap menemukan dan mengindeks seluruh halaman situs secara efisien.
Host
Perintah domain pilihan, menentukan domain utama situs (seperti example.com vs www.example.com), Yandex mendukung, Google mengatur melalui Search Console.
Crawler/Bot/Spider
Perayap/laba-laba/robot, program otomatis mesin pencari yang secara otomatis mengakses halaman web dan mengumpulkan konten, seperti Googlebot, Bingbot, Baiduspider, dll.
Googlebot
Perayap halaman web mesin pencari Google, bertanggung jawab merayapi konten halaman web untuk diindeks dan diberi peringkat oleh Google, adalah salah satu perayap mesin pencari paling umum.
Crawl Budget
Anggaran/kuota perayapan, batas frekuensi perayapan dan jumlah halaman yang dialokasikan mesin pencari untuk setiap situs. Mengonfigurasi robots.txt dengan benar dapat menghindari pemborosan kuota perayapan.
Prefix Matching
Aturan pencocokan awalan, cara pencocokan jalur robots.txt. Jalur URL dimulai dengan nilai aturan berarti cocok, aturan yang lebih panjang prioritasnya lebih tinggi.
noindex
Tag meta HTML atau perintah header HTTP (X-Robots-Tag: noindex), memberitahu mesin pencari untuk tidak mengindeks halaman ini ke dalam indeks pencarian. Berbeda dengan Disallow robots.txt, noindex adalah cara penghapusan indeks yang lebih andal.

Nama User-agent perayap mesin pencari umum

Nama User-agent yang digunakan saat mengonfigurasi aturan perayap tertentu:

Nama perayapMesin pencari pemilikTujuan
*Semua perayapWildcard, cocokkan semua perayap yang tidak dikonfigurasi secara terpisah
GooglebotGooglePerayap halaman web pencarian Google
BingbotBing/MicrosoftPerayap halaman web pencarian Bing
BaiduspiderBaiduPerayap halaman web pencarian Baidu
YandexBotYandexPerayap halaman web pencarian Yandex
GPTBotOpenAIPerayap pengambilan data pelatihan ChatGPT
TwitterbotX/TwitterPerayap pratinjau kartu tautan platform X
facebookexternalhitFacebookPerayap pratinjau tautan Facebook

Contoh aturan robots.txt umum

Konfigurasi aturan umum untuk skenario situs yang berbeda:

AturanEfek
Disallow: /admin/Larang perayapan semua konten di direktori /admin/
Disallow: /*?Larang perayapan URL dengan parameter kueri (Googlebot mendukung wildcard *)
Disallow: /searchLarang perayapan halaman hasil pencarian dalam situs
Allow: /public/Secara eksplisit izinkan perayapan direktori /public/
Disallow: /⚠️ Larang perayapan seluruh situs (kesalahan fatal, gunakan dengan hati-hati!)
Allow: /Izinkan perayapan semua konten seluruh situs

Tabel referensi perintah standar robots.txt

Perintah standar dan penggunaan yang didefinisikan oleh RFC 9309:

PerintahLingkupContoh formatDeskripsi
User-agentAwal kelompokUser-agent: *Tentukan nama perayap yang dikenai aturan
DisallowDalam kelompokDisallow: /adminAwalan jalur yang dilarang untuk dirayapi
AllowDalam kelompokAllow: /publicAwalan jalur yang diizinkan untuk dirayapi
SitemapNon-kelompokSitemap: https://example.com/sitemap.xmlDeklarasikan lokasi peta situs (URL absolut)
#Posisi mana pun# This is a commentBaris komentar, diabaikan oleh perayap

Privacy & Security

Semua operasi Generator Robots.txt ini sepenuhnya diselesaikan secara lokal di browser Anda: User-agent, aturan jalur, Sitemap, Host dan input konfigurasi lainnya semua dirakit dan dibuat teks robots.txt secara real-time melalui JavaScript di memori browser, tidak dikirim ke server mana pun melalui jaringan. Setelah halaman dimuat dapat digunakan langsung, tidak menggunakan Cookie pelacakan, tidak mengumpulkan data pengguna apa pun. Setelah menutup atau menyegarkan halaman, semua konten konfigurasi otomatis terhapus, tidak disimpan secara persisten di browser.

Authoritative References