robots.txt für KI-Crawler: Solltest du GPTBot und ClaudeBot erlauben?
robots.txt ist eine kleine Textdatei, die Crawlern sagt, welche Teile deiner Website sie lesen dürfen. KI-Crawler beachten sie – diese eine Datei kann also entscheiden, ob ChatGPT, Claude und Perplexity deinen Inhalt überhaupt nutzen dürfen.
Was robots.txt macht
Sie liegt im Stammverzeichnis deiner Website (deineseite.de/robots.txt) und listet Regeln für jeden Crawler auf. Jeder Crawler weist sich mit einem „User-Agent”-Namen aus, und du kannst für jeden Pfade erlauben oder verbieten.
Die wichtigsten KI-Crawler
- GPTBot – der Crawler von OpenAI.
- OAI-SearchBot – der Crawler von OpenAI für die Suchergebnisse von ChatGPT.
- ChatGPT-User – ruft eine Seite ab, wenn ein Nutzer ChatGPT bittet, einen Link zu öffnen.
- ClaudeBot – der Crawler von Anthropic (Claude).
- PerplexityBot – der Crawler von Perplexity.
- Google-Extended – steuert, ob Google deinen Inhalt für seine KI-Produkte nutzen darf, getrennt von der normalen Google-Suche.
Erlauben oder blockieren?
- Willst du in KI-Antworten zitiert werden, erlaube sie. Gelesen zu werden ist der Weg, als Quelle aufzutauchen.
- Blockieren ist ebenfalls eine gültige Wahl. Manche Verlage blockieren KI-Crawler, um ihre Inhalte zu schützen. Das ist in Ordnung – solange es bewusst geschieht. Das eigentliche Problem ist, sie versehentlich zu blockieren, etwa durch ein übrig gebliebenes
Disallow: /von einer Staging-Seite.
Ein Beispiel zum Kopieren (KI willkommen heißen)
User-agent: *
Allow: /
User-agent: GPTBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
Sitemap: https://deineseite.de/sitemap.xml
Um stattdessen einen bestimmten Crawler zu blockieren, gib ihm einen eigenen Block:
User-agent: GPTBot
Disallow: /
Häufige Fehler
- Ein übrig gebliebenes
Disallow: /, das still alle blockiert. - Einen Ordner blockieren, von dem dein Inhalt tatsächlich abhängt.
- Die
Sitemap:-Zeile vergessen – so entdecken Crawler all deine Seiten.
Fazit
robots.txt ist das Eingangstor und eine der vier Schichten unserer GEO-Einführung. Öffne deineseite.de/robots.txt, stell sicher, dass KI-Crawler nicht versehentlich blockiert sind, und füge eine Sitemap:-Zeile hinzu. Das dauert zwei Minuten und entscheidet, ob KI dich überhaupt lesen kann.
Kostenloses Tool ausprobieren: robots.txt- & llms.txt-Generator →