Was ist dieses Tool?
„robots.txt“ ist eine Klartextdatei im Stammverzeichnis Ihrer Website, die Webcrawlern mitteilt, auf welche Teile der Website sie zugreifen dürfen und auf welche nicht. Suchmaschinen wie Google und Bing berücksichtigen diese Datei bei der Indizierung; im Jahr 2026 ist dies zudem die Standardmethode, mit der Websites verhindern können, dass ihre Inhalte zum Trainieren von KI-Modellen verwendet werden – und zwar über bestimmte Bot-Namen wie GPTBot, CCBot und Google-Extended.
Es ist wichtig, die Syntax exakt richtig zu gestalten – ein falscher „Disallow“-Pfad kann versehentlich Suchmaschinen den Zugriff auf Ihre gesamte Website verwehren, oder eine falsch platzierte Regel zum Blockieren von KI kann dazu führen, dass tatsächlich gar nichts blockiert wird. Dieser Generator erzeugt für jedes Szenario eine syntaktisch korrekte Ausgabe.
Warum sollte man es nutzen?
- Eine spezielle Voreinstellung zum Blockieren von KI-Crawlern, die GPTBot, ChatGPT-User, CCBot, Google-Extended, ClaudeBot, Bytespider und anthropic-ai abdeckt – wobei der Zugriff für Suchmaschinen ausdrücklich erhalten bleibt.
- Legen Sie benutzerdefinierte Ausschlusspfade für Inhalte fest, die vor allen Crawlern verborgen bleiben sollen.
- Feld „Sitemap-URL“ – eine kleine Ergänzung, die Suchmaschinen dabei hilft, Ihre Seiten schneller zu finden.
- Jedes Mal korrekte Syntax – keine Gefahr, dass ein versehentlicher Tippfehler Ihre gesamte Website lahmlegt.
- Kostenlos, sofort – laden Sie die Datei direkt herunter oder kopieren Sie den Text.
Anleitung
- Wählen Sie eine Voreinstellung aus: „Alle zulassen“, „Alle blockieren“ oder „Nur KI-Crawler blockieren“.
- Fügen Sie optional benutzerdefinierte unzulässige Pfade hinzu, jeweils einen pro Zeile (z. B. /admin/).
- Geben Sie optional die URL Ihrer Sitemap ein.
- Klicken Sie auf „Kopieren“ oder „Herunterladen“ und laden Sie die Datei anschließend als „/robots.txt“ in das Stammverzeichnis Ihrer Website hoch.
Beispiel
Eingabe
Preset: Block AI crawlers, keep search engines. Sitemap: https://example.com/sitemap.xmlAusgabe
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
...
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xmlJeder KI-Crawler erhält einen eigenen expliziten Block, während die Platzhalterregel am Ende den normalen Zugriff durch Suchmaschinen weiterhin ermöglicht.
Sollten Sie diesen Crawler blockieren?
Nicht alle Bots dienen demselben Zweck – wenn man den falschen blockiert, kann dies den Suchverkehr unterbrechen, anstatt lediglich das KI-Training zu deaktivieren.
| Crawler | Was es bewirkt | Blockiere es, wenn… |
|---|---|---|
| Googlebot, Bingbot | Indiziert Ihre Website für Suchergebnisse | Auf keinen Fall – wenn Sie diese blockieren, werden Sie vollständig aus der Google-/Bing-Suche entfernt. |
| GPTBot, ChatGPT-Nutzer | Die Crawler von OpenAI – GPTBot trainiert Modelle, ChatGPT-User ruft Seiten ab, die ein Nutzer von ChatGPT zum Durchsuchen angefordert hat | Sie möchten nicht, dass Ihre Inhalte für das Training von KI verwendet werden, aber beachten Sie, dass das Aufrufen einer Seite, auf die ein Nutzer verlinkt hat, durch ChatGPT-Nutzer ein anderer Fall ist, den manche Websites zulassen. |
| Google-Extended | Legt fest, ob Google Ihre Inhalte für das Training von Gemini/KI verwendet – unabhängig von der Suchindexierung durch Googlebot | Sie möchten weiterhin in der Google-Suche erscheinen, aber nicht am KI-Training von Google teilnehmen – mit dieser Anweisung erreichen Sie genau das, ohne dass Ihre Platzierungen darunter leiden. |
| CCBot, Bytespider, anthropic-ai, ClaudeBot | Common Crawl (speist zahlreiche KI-Datensätze), ByteDance, die Crawler von Anthropic | Gleiche Begründung wie bei GPTBot – blockieren Sie den Inhalt, wenn Sie nicht möchten, dass er in KI-Trainingsdatensätzen verwendet wird. |
Häufig gestellte Fragen
Verhindert die „robots.txt“-Datei tatsächlich, dass KI meine Inhalte nutzt?
Es basiert auf dem Vertrauensprinzip – die Crawler seriöser KI-Unternehmen halten sich daran (deshalb gibt es GPTBot, CCBot usw. als eigenständige, dokumentierte User-Agents, damit Websites sich ausdrücklich davon abmelden können). Es hält keine Crawler auf, die den Standard ignorieren, und hat keine Auswirkungen auf Inhalte, die bereits vor dem Hinzufügen des Blocks erfasst wurden.
Beeinträchtigt das Blockieren von KI-Crawlern mein Suchranking bei Google/Bing?
Nein – die AI-Crawler-Voreinstellung blockiert ausdrücklich nur die namentlich genannten KI-Bots und lässt für alle anderen einen Platzhalter „Allow: /“ stehen, sodass Googlebot und Bingbot davon nicht betroffen sind.
Wo speichere ich die robots.txt-Datei?
Im Stammverzeichnis Ihrer Domain, sodass die Datei genau unter „yourdomain.com/robots.txt“ erreichbar ist – nicht in einem Unterordner. Die meisten Webhosts und Generatoren für statische Websites verfügen hierfür über einen eigens dafür vorgesehenen „public“- bzw. „root“-Ordner.
Wozu dient die Sitemap-Zeile?
Sie verweist Crawler auf Ihre „sitemap.xml“, in der alle Ihre indexierbaren Seiten aufgelistet sind. Dies ist zwar optional, wird jedoch häufig empfohlen – eine zusätzliche Zeile, die dazu beitragen kann, dass neue Seiten schneller entdeckt werden.
Kann ich benutzerdefinierte Sperrpfade mit der Voreinstellung „KI-Blockierung“ kombinieren?
Ja – die Voreinstellung zum Blockieren von KI-Bots fügt zunächst die Blockierungen für KI-Bots hinzu und wendet anschließend Ihre benutzerdefinierten Ausschlusspfade (falls vorhanden) im Rahmen der allgemeinen Platzhalterregel an, die Suchmaschinen weiterhin zulässt.