Che cos'è questo strumento?
Il file robots.txt è un file di testo semplice situato nella directory principale del tuo sito che indica ai crawler web a quali parti del sito possono o non possono accedere. I motori di ricerca come Google e Bing lo rispettano durante l’indicizzazione; nel 2026 rappresenta anche il metodo standard con cui i siti impediscono che i propri contenuti vengano utilizzati per addestrare modelli di intelligenza artificiale, tramite nomi specifici di bot come GPTBot, CCBot e Google-Extended.
È fondamentale che la sintassi sia esatta: un percorso “Disallow” errato può impedire accidentalmente ai motori di ricerca di accedere all’intero sito, oppure una regola di blocco dell’IA inserita in modo errato potrebbe non riuscire a bloccare effettivamente nulla. Questo generatore produce un output sintatticamente corretto per ogni scenario.
Perché usarlo?
- Un’impostazione predefinita dedicata al blocco dei crawler basati sull’intelligenza artificiale, che copre GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider e anthropic-ai, pur mantenendo esplicitamente l’accesso ai motori di ricerca.
- Imposta percorsi personalizzati da escludere per i contenuti che desideri nascondere a tutti i crawler.
- Campo URL della mappa del sito — una piccola aggiunta che aiuta i motori di ricerca a individuare più rapidamente le tue pagine.
- Sintassi sempre corretta: nessun rischio che un errore di battitura accidentale blocchi l'intero sito.
- Gratis, immediato: scarica direttamente il file o copia il testo.
Come si usa
- Scegli un'impostazione predefinita: consenti tutto, blocca tutto oppure blocca solo i crawler basati sull'intelligenza artificiale.
- Se lo si desidera, è possibile aggiungere percorsi personalizzati da escludere, uno per riga (ad es. /admin/).
- Se lo desideri, aggiungi l'URL della tua mappa del sito.
- Fai clic su "Copia" o "Scarica", quindi carica il file nella directory principale del tuo sito con il nome /robots.txt.
Esempio
Input
Preset: Block AI crawlers, keep search engines. Sitemap: https://example.com/sitemap.xmlRisultato
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xmlA ogni crawler di intelligenza artificiale viene assegnato un blocco specifico, mentre la regola con carattere jolly alla fine garantisce l'accesso ai normali motori di ricerca.
È il caso di bloccare questo crawler?
Non tutti i bot hanno lo stesso scopo: bloccare quello sbagliato può interrompere il traffico proveniente dai motori di ricerca, invece di limitarsi a escluderlo dall'addestramento dell'IA.
| Crawler | Cosa fa | Bloccalo se… |
|---|---|---|
| Googlebot, Bingbot | Indicizza il tuo sito per i risultati di ricerca | Mai: bloccandoli verrai completamente escluso dai risultati di ricerca di Google e Bing. |
| GPTBot, ChatGPT-User | I crawler di OpenAI: GPTBot addestra i modelli, mentre ChatGPT-User recupera le pagine che un utente ha chiesto a ChatGPT di consultare | Non vuoi che i tuoi contenuti vengano utilizzati per l'addestramento dell'IA, ma tieni presente che la navigazione da parte di ChatGPT-User su una pagina a cui un utente ha fornito un link è un caso diverso che alcuni siti scelgono di consentire. |
| Google-Extended | Determina se Google utilizza i tuoi contenuti per l'addestramento di Gemini/IA — indipendentemente dall'indicizzazione per la ricerca effettuata da Googlebot | Vuoi continuare a utilizzare la Ricerca Google ma non vuoi contribuire all'addestramento dell'IA di Google? Questa guida ti permette proprio di farlo senza compromettere il posizionamento nei risultati di ricerca. |
| CCBot, Bytespider, anthropic-ai, ClaudeBot | Common Crawl (alimenta numerosi set di dati per l'IA), ByteDance, i crawler di Anthropic | Lo stesso ragionamento valido per GPTBot: bloccalo se non vuoi che quel contenuto finisca nei set di addestramento dell'IA. |
Domande frequenti
Il file robots.txt impedisce davvero all'intelligenza artificiale di utilizzare i miei contenuti?
Funziona sulla base del sistema dell’autodisciplina: i crawler delle aziende di intelligenza artificiale affidabili lo rispettano (ecco perché GPTBot, CCBot ecc. esistono come user-agent distinti e documentati, proprio per consentire ai siti di escludersi). Non blocca i crawler che ignorano lo standard e non ha alcun effetto sui contenuti già estratti prima dell’aggiunta del blocco.
Bloccare i crawler basati sull'intelligenza artificiale potrebbe influire negativamente sul mio posizionamento nei risultati di ricerca di Google/Bing?
No — l'impostazione predefinita del crawler AI blocca specificatamente solo i bot AI indicati e lascia un carattere jolly "Allow: /" per tutti gli altri, quindi Googlebot e Bingbot non ne sono interessati.
Dove devo mettere il file robots.txt?
Nella directory principale del tuo dominio, in modo che sia raggiungibile esattamente all'indirizzo yourdomain.com/robots.txt — non in una sottocartella. La maggior parte dei provider di hosting e dei generatori di siti statici dispone di una cartella "public" o "root" dedicata a questo scopo.
A cosa serve la riga relativa alla mappa del sito?
Indica ai crawler il tuo file sitemap.xml, che elenca tutte le tue pagine indicizzabili. È facoltativo, ma viene comunemente raccomandato: basta una riga in più per accelerare la velocità con cui le nuove pagine vengono individuate.
Posso combinare i percorsi personalizzati da escludere con il preset di blocco AI?
Sì — il preset di blocco dei bot basati sull'intelligenza artificiale applica innanzitutto il blocco dei bot AI, quindi applica i percorsi di esclusione personalizzati (se presenti) in base alla regola generale con caratteri jolly che continua a consentire l'accesso ai motori di ricerca.