Apakah alat ini?
robots.txt ialah fail teks biasa di root laman anda yang memberitahu perayap web bahagian mana laman yang boleh atau tidak boleh mereka akses. Enjin carian seperti Google dan Bing menghormatinya untuk pengindeksan; pada 2026 ia juga cara standard laman menarik diri daripada kandungan mereka digunakan untuk melatih model AI, melalui nama bot khusus seperti GPTBot, CCBot dan Google-Extended.
Mendapatkan sintaks dengan tepat penting — laluan Disallow yang salah boleh secara tidak sengaja menyekat enjin carian daripada keseluruhan laman anda, atau peraturan sekatan AI yang diletakkan secara tidak betul boleh gagal menyekat apa-apa sebenarnya. Penjana ini menghasilkan output yang betul dari segi sintaks untuk setiap senario.
Selepas hampir tiga dekad sebagai konvensyen tidak formal bermula sejak 1994, Protokol Pengecualian Robot akhirnya diseragamkan sebagai RFC 9309 pada 2022 — peraturan yang dihasilkan penjana ini (User-agent, Disallow, Allow, ditambah sambungan Sitemap) mengikut spesifikasi itu.
Kenapa guna alat ini?
- Prasetan sekatan perayap AI khusus meliputi GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider dan anthropic-ai — sambil secara jelas mengekalkan akses enjin carian.
- Laluan disallow tersuai untuk kandungan yang anda mahu sembunyikan daripada semua perayap.
- Medan URL peta laman — tambahan kecil yang membantu enjin carian menemui halaman anda lebih pantas.
- Sintaks yang betul setiap kali — tiada risiko taip tersalah secara tidak sengaja menyekat keseluruhan laman anda.
- Percuma, serta-merta, muat turun fail terus atau salin teks.
Cara menggunakannya
- Pilih prasetan: benarkan semua, sekat semua, atau sekat perayap AI sahaja.
- Secara pilihan, tambah laluan disallow tersuai, satu setiap baris (cth. /admin/).
- Secara pilihan, tambah URL peta laman anda.
- Klik Copy atau Download, kemudian muat naik fail ke root laman anda sebagai /robots.txt.
Contoh
Input
Prasetan: Sekat perayap AI, kekalkan enjin carian. Peta laman: https://example.com/sitemap.xmlHasil
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xmlSetiap perayap AI mendapat sekatan eksplisitnya sendiri, manakala peraturan kad liar di hujung mengekalkan akses enjin carian biasa terbuka.
Patutkah anda sekat perayap ini?
Tidak semua bot berkhidmat untuk tujuan yang sama — menyekat yang salah boleh memotong trafik carian berbanding sekadar menarik diri daripada latihan AI.
| Perayap | Apa yang ia lakukan | Sekat jika… |
|---|---|---|
| Googlebot, Bingbot | Mengindeks laman anda untuk keputusan carian | Jangan sekali-kali — menyekat ini mengeluarkan anda daripada carian Google/Bing sepenuhnya. |
| GPTBot, ChatGPT-User | Perayap OpenAI — GPTBot melatih model, ChatGPT-User mengambil halaman yang pengguna minta ChatGPT semak imbas | Anda tidak mahu kandungan anda digunakan untuk latihan AI, tetapi ambil perhatian ChatGPT-User menyemak imbas halaman yang dipautkan pengguna adalah kes berbeza yang sesetengah laman pilih untuk benarkan. |
| Google-Extended | Mengawal sama ada Google menggunakan kandungan anda untuk latihan Gemini/AI — berasingan daripada pengindeksan carian Googlebot | Anda mahu kekal dalam Carian Google tetapi menarik diri daripada latihan AI Google — arahan ini melakukan tepat itu tanpa menjejaskan kedudukan. |
| CCBot, Bytespider, anthropic-ai, ClaudeBot | Common Crawl (memberi makan banyak set data AI), ByteDance, perayap Anthropic | Sebab yang sama seperti GPTBot — sekat jika anda tidak mahu kandungan dalam set latihan AI. |
Soalan lazim
Adakah robots.txt benar-benar menghalang AI daripada menggunakan kandungan saya?
Ia berfungsi berdasarkan sistem kehormatan — perayap syarikat AI yang bereputasi memang menghormatinya (itulah sebabnya GPTBot, CCBot dll wujud sebagai ejen pengguna berasingan, terdokumen khusus supaya laman boleh menarik diri). Ia tidak menghalang perayap yang mengabaikan standard, dan ia tidak memberi kesan pada kandungan yang telah dikikis sebelum anda menambah sekatan.
Adakah menyekat perayap AI akan menjejaskan kedudukan carian Google/Bing saya?
Tidak — prasetan perayap AI khusus menyekat hanya bot AI yang dinamakan dan meninggalkan "Allow: /" kad liar untuk semua yang lain, jadi Googlebot dan Bingbot tidak terjejas.
Di mana saya letakkan fail robots.txt?
Di root domain anda, supaya boleh dicapai di yourdomain.com/robots.txt dengan tepat — bukan dalam subfolder. Kebanyakan hos laman web dan penjana laman statik mempunyai folder public/root khusus untuk ini.
Apakah kegunaan baris sitemap?
Ia menunjuk perayap kepada sitemap.xml anda, yang menyenaraikan semua halaman boleh diindeks anda. Ia pilihan tetapi biasanya disyorkan — satu baris tambahan yang boleh mempercepatkan penemuan halaman baharu.
Bolehkah saya gabungkan laluan disallow tersuai dengan prasetan sekatan AI?
Boleh — prasetan sekatan AI menambah sekatan bot AI dahulu, kemudian menggunakan laluan disallow tersuai anda (jika ada) di bawah peraturan kad liar umum yang masih membenarkan enjin carian.