CodeKitHub
Italiano
Strumenti per webmaster

Generatore di file robots.txt

Crea un file robots.txt valido in pochi secondi: parti da un'impostazione predefinita (consenti tutto, blocca tutto oppure blocca specificatamente i crawler utilizzati per l'addestramento dell'IA, mantenendo l'indicizzazione di Google/Bing), aggiungi i percorsi e l'URL della mappa del sito che desideri escludere, quindi copia o scarica il file.

Che cos'è questo strumento?

Il file robots.txt è un file di testo semplice situato nella directory principale del tuo sito che indica ai crawler web a quali parti del sito possono o non possono accedere. I motori di ricerca come Google e Bing lo rispettano durante l’indicizzazione; nel 2026 rappresenta anche il metodo standard con cui i siti impediscono che i propri contenuti vengano utilizzati per addestrare modelli di intelligenza artificiale, tramite nomi specifici di bot come GPTBot, CCBot e Google-Extended.

È fondamentale che la sintassi sia esatta: un percorso “Disallow” errato può impedire accidentalmente ai motori di ricerca di accedere all’intero sito, oppure una regola di blocco dell’IA inserita in modo errato potrebbe non riuscire a bloccare effettivamente nulla. Questo generatore produce un output sintatticamente corretto per ogni scenario.

Perché usarlo?

  • Un’impostazione predefinita dedicata al blocco dei crawler basati sull’intelligenza artificiale, che copre GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider e anthropic-ai, pur mantenendo esplicitamente l’accesso ai motori di ricerca.
  • Imposta percorsi personalizzati da escludere per i contenuti che desideri nascondere a tutti i crawler.
  • Campo URL della mappa del sito — una piccola aggiunta che aiuta i motori di ricerca a individuare più rapidamente le tue pagine.
  • Sintassi sempre corretta: nessun rischio che un errore di battitura accidentale blocchi l'intero sito.
  • Gratis, immediato: scarica direttamente il file o copia il testo.

Come si usa

  1. Scegli un'impostazione predefinita: consenti tutto, blocca tutto oppure blocca solo i crawler basati sull'intelligenza artificiale.
  2. Se lo si desidera, è possibile aggiungere percorsi personalizzati da escludere, uno per riga (ad es. /admin/).
  3. Se lo desideri, aggiungi l'URL della tua mappa del sito.
  4. Fai clic su "Copia" o "Scarica", quindi carica il file nella directory principale del tuo sito con il nome /robots.txt.

Esempio

Input

Preset: Block AI crawlers, keep search engines. Sitemap: https://example.com/sitemap.xml

Risultato

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

...

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

A ogni crawler di intelligenza artificiale viene assegnato un blocco specifico, mentre la regola con carattere jolly alla fine garantisce l'accesso ai normali motori di ricerca.

È il caso di bloccare questo crawler?

Non tutti i bot hanno lo stesso scopo: bloccare quello sbagliato può interrompere il traffico proveniente dai motori di ricerca, invece di limitarsi a escluderlo dall'addestramento dell'IA.

CrawlerCosa faBloccalo se…
Googlebot, BingbotIndicizza il tuo sito per i risultati di ricercaMai: bloccandoli verrai completamente escluso dai risultati di ricerca di Google e Bing.
GPTBot, ChatGPT-UserI crawler di OpenAI: GPTBot addestra i modelli, mentre ChatGPT-User recupera le pagine che un utente ha chiesto a ChatGPT di consultareNon vuoi che i tuoi contenuti vengano utilizzati per l'addestramento dell'IA, ma tieni presente che la navigazione da parte di ChatGPT-User su una pagina a cui un utente ha fornito un link è un caso diverso che alcuni siti scelgono di consentire.
Google-ExtendedDetermina se Google utilizza i tuoi contenuti per l'addestramento di Gemini/IA — indipendentemente dall'indicizzazione per la ricerca effettuata da GooglebotVuoi continuare a utilizzare la Ricerca Google ma non vuoi contribuire all'addestramento dell'IA di Google? Questa guida ti permette proprio di farlo senza compromettere il posizionamento nei risultati di ricerca.
CCBot, Bytespider, anthropic-ai, ClaudeBotCommon Crawl (alimenta numerosi set di dati per l'IA), ByteDance, i crawler di AnthropicLo stesso ragionamento valido per GPTBot: bloccalo se non vuoi che quel contenuto finisca nei set di addestramento dell'IA.

Domande frequenti

Il file robots.txt impedisce davvero all'intelligenza artificiale di utilizzare i miei contenuti?

Funziona sulla base del sistema dell’autodisciplina: i crawler delle aziende di intelligenza artificiale affidabili lo rispettano (ecco perché GPTBot, CCBot ecc. esistono come user-agent distinti e documentati, proprio per consentire ai siti di escludersi). Non blocca i crawler che ignorano lo standard e non ha alcun effetto sui contenuti già estratti prima dell’aggiunta del blocco.

Bloccare i crawler basati sull'intelligenza artificiale potrebbe influire negativamente sul mio posizionamento nei risultati di ricerca di Google/Bing?

No — l'impostazione predefinita del crawler AI blocca specificatamente solo i bot AI indicati e lascia un carattere jolly "Allow: /" per tutti gli altri, quindi Googlebot e Bingbot non ne sono interessati.

Dove devo mettere il file robots.txt?

Nella directory principale del tuo dominio, in modo che sia raggiungibile esattamente all'indirizzo yourdomain.com/robots.txt — non in una sottocartella. La maggior parte dei provider di hosting e dei generatori di siti statici dispone di una cartella "public" o "root" dedicata a questo scopo.

A cosa serve la riga relativa alla mappa del sito?

Indica ai crawler il tuo file sitemap.xml, che elenca tutte le tue pagine indicizzabili. È facoltativo, ma viene comunemente raccomandato: basta una riga in più per accelerare la velocità con cui le nuove pagine vengono individuate.

Posso combinare i percorsi personalizzati da escludere con il preset di blocco AI?

Sì — il preset di blocco dei bot basati sull'intelligenza artificiale applica innanzitutto il blocco dei bot AI, quindi applica i percorsi di esclusione personalizzati (se presenti) in base alla regola generale con caratteri jolly che continua a consentire l'accesso ai motori di ricerca.

Strumenti correlati