Mis see tööriist on?
robots.txt on lihttekstifail su saidi juurkataloogis, mis ütleb veebirobotitele, millistele saidi osadele nad tohivad või ei tohi ligi pääseda. Otsingumootorid nagu Google ja Bing austavad seda indekseerimisel; 2026. aastal on see ka standardne viis, kuidas saidid keelduvad oma sisu kasutamisest AI mudelite treenimiseks, kasutades spetsiifilisi robotinimesid nagu GPTBot, CCBot ja Google-Extended.
Süntaksi täpselt õigeks saamine on oluline — vale Disallow tee võib kogemata blokeerida otsingumootorid kogu su saidilt, või valesti paigutatud AI-blokeerimise reegel ei pruugi tegelikult midagi blokeerida. See generaator loob süntaktiliselt korrektse väljundi iga stsenaariumi jaoks.
Pärast peaaegu kolme aastakümmet mitteametliku tavana, mis ulatub tagasi aastasse 1994, standardiseeriti Robots Exclusion Protocol lõpuks kui RFC 9309 2022. aastal — reeglid, mida see generaator väljastab (User-agent, Disallow, Allow, pluss Sitemap laiendus), järgivad seda spetsifikatsiooni.
Miks seda kasutada?
- Pühendatud AI-robotite blokeerimise eelseadistus, mis katab GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider ja anthropic-ai — säilitades samal ajal selgesõnaliselt otsingumootorite ligipääsu.
- Kohandatud keeldude teed sisu jaoks, mida soovid kõigi robotite eest peita.
- Saidikaardi aadressi väli — väike lisandus, mis aitab otsingumootoritel su lehti kiiremini avastada.
- Korrektne süntaks iga kord — pole riski, et kogemata kirjaviga blokeeriks kogu su saidi.
- Tasuta, kohene, laadi fail otse alla või kopeeri tekst.
Kuidas kasutada
- Vali eelseadistus: luba kõik, blokeeri kõik või blokeeri ainult AI robotid.
- Soovi korral lisa kohandatud keelatud teed, üks reale (nt /admin/).
- Soovi korral lisa oma saidikaardi aadress.
- Klõpsa Kopeeri või Laadi alla ning laadi fail seejärel oma saidi juurkataloogi kui /robots.txt.
Näide
Sisend
Eelseadistus: Blokeeri AI robotid, säilita otsingumootorid. Saidikaart: https://example.com/sitemap.xmlTulemus
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xmlIga AI robot saab oma selgesõnalise bloki, samal ajal kui lõpus olev üldreegel hoiab tavapärase otsingumootorite ligipääsu avatuna.
Kas peaksid selle roboti blokeerima?
Kõik robotid ei teeni sama eesmärki — vale roboti blokeerimine võib katkestada otsingumootorite liikluse, selle asemel et lihtsalt AI treeningust loobuda.
| Robot | Mida see teeb | Blokeeri see, kui… |
|---|---|---|
| Googlebot, Bingbot | Indekseerib su saidi otsingutulemuste jaoks | Mitte kunagi — nende blokeerimine eemaldab su täielikult Google'i/Bingi otsingust. |
| GPTBot, ChatGPT-User | OpenAI robotid — GPTBot treenib mudeleid, ChatGPT-User laadib lehti, mida kasutaja palus ChatGPT-l sirvida | Sa ei taha, et su sisu kasutataks AI treenimiseks, aga arvesta, et ChatGPT-User poolt kasutaja lingitud lehe sirvimine on eraldi juhtum, mida mõned saidid otsustavad lubada. |
| Google-Extended | Kontrollib, kas Google kasutab su sisu Gemini/AI treenimiseks — eraldiseisev Googlebot'i otsinguindekseerimisest | Sa tahad püsida Google'i otsingus, aga loobuda Google'i AI treeningust — see direktiiv teeb täpselt seda ilma asetust kahjustamata. |
| CCBot, Bytespider, anthropic-ai, ClaudeBot | Common Crawl (toidab paljusid AI andmestikke), ByteDance, Anthropicu robotid | Sama loogika mis GPTBotiga — blokeeri, kui ei taha sisu AI treeningkomplektides. |
Korduma kippuvad küsimused
Kas robots.txt tegelikult takistab AI-l mu sisu kasutamast?
See toimib au-süsteemi alusel — usaldusväärsete AI-ettevõtete robotid austavad seda tõesti (seepärast eksisteerivadki GPTBot, CCBot jne eraldi, dokumenteeritud kasutajaagentidena, spetsiifiliselt selleks, et saidid saaksid keelduda). See ei peata roboteid, kes standardit ignoreerivad, ega mõjuta sisu, mis on juba enne blokeeringu lisamist kraabitud.
Kas AI-robotite blokeerimine kahjustab mu Google'i/Bingi otsingu asetust?
Ei — AI-robotite eelseadistus blokeerib spetsiifiliselt ainult nimetatud AI robotid ja jätab üldreegli "Allow: /" kõigile teistele, seega Googlebot ja Bingbot ei ole mõjutatud.
Kuhu ma peaksin robots.txt faili paigutama?
Su domeeni juurkataloogi, nii et see on täpselt kättesaadav aadressil sinudomeen.com/robots.txt — mitte alamkaustas. Enamikul veebimajutuse teenustel ja staatilise saidi generaatoritel on selleks eraldi public/root kaust.
Milleks on saidikaardi rida?
See suunab robotid su sitemap.xml faili juurde, mis loetleb kõik su indekseeritavad lehed. See on valikuline, kuid üldiselt soovitatav — üks lisarida, mis võib kiirendada uute lehtede avastamist.
Kas ma saan kohandatud keelu-teid kombineerida AI-blokeerimise eelseadistusega?
Jah — AI-blokeerimise eelseadistus lisab kõigepealt AI robotite blokid ja rakendab seejärel su kohandatud keelu-teed (kui neid on) üldreegli all, mis endiselt lubab otsingumootoreid.