¿Qué es esta herramienta?
El archivo «robots.txt» es un archivo de texto sin formato ubicado en la raíz de tu sitio web que indica a los rastreadores web a qué partes del sitio pueden o no pueden acceder. Los motores de búsqueda como Google y Bing lo respetan a la hora de indexar; en 2026, también es la forma estándar en que los sitios web excluyen que su contenido se utilice para entrenar modelos de IA, mediante nombres de bots específicos como GPTBot, CCBot y Google-Extended.
Es importante que la sintaxis sea totalmente correcta: una ruta «Disallow» errónea puede impedir accidentalmente que los motores de búsqueda accedan a todo tu sitio web, o una regla de bloqueo de IA mal configurada puede no bloquear nada en realidad. Este generador produce resultados sintácticamente correctos para cada caso.
¿Por qué utilizarlo?
- Una configuración predefinida específica para bloquear los rastreadores de IA que abarca GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider y anthropic-ai, al tiempo que mantiene explícitamente el acceso a los motores de búsqueda.
- Especifica rutas que no se indexen para el contenido que quieras ocultar a todos los rastreadores.
- Campo «URL del mapa del sitio»: un pequeño añadido que ayuda a los motores de búsqueda a encontrar tus páginas más rápido.
- Sintaxis correcta en todo momento: sin riesgo de que un error tipográfico accidental bloquee toda tu web.
- Gratis e inmediato: descarga el archivo directamente o copia el texto.
Cómo utilizarlo
- Elige una configuración predeterminada: permitir todo, bloquear todo o bloquear solo los rastreadores de IA.
- Si lo deseas, puedes añadir rutas personalizadas que no estén permitidas, una por línea (por ejemplo, /admin/).
- Si lo deseas, añade la URL de tu mapa del sitio.
- Haz clic en «Copiar» o «Descargar» y, a continuación, sube el archivo a la carpeta raíz de tu sitio web con el nombre /robots.txt.
Ejemplo
Entrada
Preset: Block AI crawlers, keep search engines. Sitemap: https://example.com/sitemap.xmlResultado
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xmlCada rastreador de IA tiene su propio bloque explícito, mientras que la regla comodín al final mantiene abierto el acceso normal a los motores de búsqueda.
¿Deberías bloquear este rastreador?
No todos los bots tienen la misma finalidad: bloquear el que no se debe puede reducir el tráfico de búsqueda, en lugar de limitarse a excluirlo del entrenamiento de la IA.
| Rastreador | Para qué sirve | Bloquéalo si… |
|---|---|---|
| Googlebot, Bingbot | Indexa tu sitio web para los resultados de búsqueda | Nunca: si los bloqueas, desaparecerás por completo de los resultados de búsqueda de Google y Bing. |
| GPTBot, ChatGPT-User | Los rastreadores de OpenAI: GPTBot entrena modelos, mientras que ChatGPT-User recupera las páginas que un usuario ha pedido a ChatGPT que explore | No quieres que tu contenido se utilice para el entrenamiento de la IA, pero ten en cuenta que el hecho de que un usuario de ChatGPT navegue por una página a la que otro usuario ha enlazado es un caso distinto que algunos sitios web deciden permitir. |
| Google-Extended | Determina si Google utiliza tu contenido para el entrenamiento de Gemini/IA, independientemente de la indexación de búsqueda de Googlebot. | Si quieres seguir apareciendo en la búsqueda de Google pero no quieres que tus datos se utilicen para entrenar la IA de Google, esta configuración te permite precisamente eso sin afectar a tu posicionamiento. |
| CCBot, Bytespider, anthropic-ai, ClaudeBot | Common Crawl (que alimenta muchos conjuntos de datos de IA), ByteDance, los rastreadores de Anthropic | El mismo razonamiento que con GPTBot: bloquéalo si no quieres que ese contenido forme parte de los conjuntos de entrenamiento de la IA. |
Preguntas frecuentes
¿El archivo robots.txt impide realmente que la IA utilice mi contenido?
Funciona basándose en la confianza: los rastreadores de las empresas de IA de prestigio sí lo respetan (por eso existen GPTBot, CCBot, etc., como agentes de usuario distintos y documentados, precisamente para que los sitios web puedan excluirse). No detiene a los rastreadores que ignoran el estándar, y no tiene ningún efecto sobre el contenido que ya se haya extraído antes de que añadieras el bloqueo.
¿Afectará negativamente a mi posicionamiento en las búsquedas de Google y Bing el hecho de bloquear los rastreadores de IA?
No: la configuración predeterminada del rastreador de IA bloquea específicamente solo los bots de IA mencionados y deja un comodín «Allow: /» para todos los demás, por lo que Googlebot y Bingbot no se ven afectados.
¿Dónde se guarda el archivo robots.txt?
En la raíz de tu dominio, de modo que se pueda acceder a él exactamente en tudominio.com/robots.txt, y no en una subcarpeta. La mayoría de los proveedores de alojamiento web y generadores de sitios estáticos disponen de una carpeta pública o raíz específica para ello.
¿Para qué sirve la línea del mapa del sitio?
Indica a los rastreadores dónde se encuentra tu archivo sitemap.xml, que recoge todas tus páginas indexables. Es opcional, pero se suele recomendar: se trata de una línea adicional que puede acelerar el proceso de descubrimiento de nuevas páginas.
¿Puedo combinar las rutas de exclusión personalizadas con el ajuste preestablecido de bloqueo mediante IA?
Sí: el ajuste preestablecido para bloquear bots de IA aplica primero los bloqueos de bots de IA y, a continuación, aplica las rutas de exclusión personalizadas (si las hay) bajo la regla general de comodín que sigue permitiendo el acceso a los motores de búsqueda.