Apa Itu Alat Ini?
robots.txt adalah file teks biasa di root situs Anda yang memberi tahu web crawler bagian mana dari situs yang boleh atau tidak boleh diakses. Mesin pencari seperti Google dan Bing mematuhinya untuk pengindeksan; pada 2026 ini juga menjadi cara standar bagi situs untuk memilih keluar dari penggunaan kontennya untuk melatih model AI, lewat nama bot spesifik seperti GPTBot, CCBot, dan Google-Extended.
Membuat sintaksnya benar-benar tepat itu penting — path Disallow yang salah bisa secara tidak sengaja memblokir mesin pencari dari seluruh situs Anda, atau aturan blokir AI yang ditempatkan keliru bisa gagal memblokir apa pun. Generator ini menghasilkan output yang sintaksnya benar untuk setiap skenario.
Mengapa Menggunakannya?
- Preset khusus pemblokiran AI crawler mencakup GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider, dan anthropic-ai — sambil secara eksplisit tetap mengizinkan akses mesin pencari.
- Path disallow khusus untuk konten yang ingin Anda sembunyikan dari semua crawler.
- Kolom URL sitemap — tambahan kecil yang membantu mesin pencari menemukan halaman Anda lebih cepat.
- Sintaks yang benar setiap saat — tidak ada risiko salah ketik yang tidak sengaja memblokir seluruh situs Anda.
- Gratis, instan, unduh file-nya langsung atau salin teksnya.
Cara Menggunakan
- Pilih preset: izinkan semua, blokir semua, atau hanya blokir AI crawler.
- Opsional, tambahkan path disallow khusus, satu per baris (misalnya /admin/).
- Opsional, tambahkan URL sitemap Anda.
- Klik Copy atau Download, lalu unggah file-nya ke root situs Anda sebagai /robots.txt.
Contoh
Input
Preset: Blokir AI crawler, izinkan mesin pencari. Sitemap: https://example.com/sitemap.xmlOutput
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xmlSetiap AI crawler mendapat blokir eksplisitnya sendiri, sementara aturan wildcard di akhir tetap membuka akses mesin pencari normal.
Haruskah Anda memblokir crawler ini?
Tidak semua bot punya tujuan yang sama — memblokir yang salah bisa memutus trafik pencarian, bukannya sekadar memilih keluar dari pelatihan AI.
| Crawler | Fungsinya | Blokir jika… |
|---|---|---|
| Googlebot, Bingbot | Mengindeks situs Anda untuk hasil pencarian | Jangan pernah — memblokir ini menghilangkan situs Anda sepenuhnya dari pencarian Google/Bing. |
| GPTBot, ChatGPT-User | Crawler OpenAI — GPTBot melatih model, ChatGPT-User mengambil halaman yang diminta pengguna untuk dijelajahi ChatGPT | Anda tidak ingin konten dipakai untuk pelatihan AI, tapi perlu diingat ChatGPT-User yang menjelajahi halaman yang ditautkan pengguna adalah kasus berbeda yang dipilih diizinkan oleh sebagian situs. |
| Google-Extended | Mengontrol apakah Google memakai konten Anda untuk pelatihan Gemini/AI — terpisah dari pengindeksan pencarian Googlebot | Anda ingin tetap tampil di Google Search tapi memilih keluar dari pelatihan AI Google — direktif ini melakukan persis itu tanpa merugikan ranking. |
| CCBot, Bytespider, anthropic-ai, ClaudeBot | Common Crawl (memasok banyak dataset AI), ByteDance, crawler Anthropic | Alasan yang sama seperti GPTBot — blokir jika Anda tidak ingin konten masuk ke dataset pelatihan AI. |
Pertanyaan yang Sering Diajukan
Apakah robots.txt benar-benar mencegah AI menggunakan konten saya?
Ini bekerja berdasarkan sistem kejujuran — crawler perusahaan AI yang bereputasi baik memang mematuhinya (itulah sebabnya GPTBot, CCBot, dan sejenisnya ada sebagai user-agent yang terpisah dan terdokumentasi, khusus agar situs bisa memilih keluar). Ini tidak mencegah crawler yang mengabaikan standar tersebut, dan tidak berpengaruh pada konten yang sudah di-scrape sebelum Anda menambahkan blokirnya.
Apakah memblokir AI crawler akan merugikan ranking pencarian Google/Bing saya?
Tidak — preset AI crawler hanya memblokir bot AI yang disebutkan secara spesifik dan tetap menyisakan wildcard "Allow: /" untuk yang lainnya, jadi Googlebot dan Bingbot tidak terpengaruh.
Di mana saya harus meletakkan file robots.txt?
Di root domain Anda, sehingga bisa diakses persis di yourdomain.com/robots.txt — bukan di dalam subfolder. Sebagian besar hosting situs dan static site generator punya folder public/root khusus untuk ini.
Untuk apa baris sitemap itu?
Ini mengarahkan crawler ke sitemap.xml Anda, yang mendaftar semua halaman yang bisa diindeks. Sifatnya opsional tapi umum direkomendasikan — satu baris tambahan yang bisa mempercepat penemuan halaman baru.
Bisakah saya menggabungkan path disallow khusus dengan preset blokir AI?
Bisa — preset blokir AI menambahkan blokir bot AI terlebih dahulu, lalu menerapkan path disallow khusus Anda (jika ada) di bawah aturan wildcard umum yang tetap mengizinkan mesin pencari.