KI-Crawler-Liste: GPTBot, ClaudeBot, PerplexityBot und wie du sie erlaubst
KI-Unternehmen lesen das Web mit benannten Crawlern (jeder hat einen „User-Agent”-Namen). Sie zu kennen erlaubt dir eine bewusste Entscheidung: Erlaube die, von denen du zitiert werden willst, und blockiere die, von denen nicht. Hier sind die wichtigsten zum jetzigen Zeitpunkt.
Die wichtigsten KI-Crawler
- GPTBot (OpenAI) – der allgemeine Crawler von OpenAI, der Inhalte für seine Modelle sammelt.
- OAI-SearchBot (OpenAI) – ruft Seiten ab, um sie in den Suchergebnissen von ChatGPT zu zeigen und zu verlinken.
- ChatGPT-User (OpenAI) – ruft eine Seite auf Anfrage ab, wenn ein Nutzer ChatGPT bittet, einen bestimmten Link zu besuchen.
- ClaudeBot (Anthropic) – der Crawler von Anthropic für Claude.
- PerplexityBot (Perplexity) – crawlt Seiten, damit Perplexity mit ihnen antworten und sie zitieren kann.
- Google-Extended (Google) – kein eigener Crawler, sondern ein
robots.txt-Token, das steuert, ob dein Inhalt für Googles generative KI (Gemini) genutzt wird. Das normale Crawling macht weiterhin der Googlebot.
Microsofts Copilot stützt sich stark auf den Bing-Index, also zählt dort auch der Standard-Bingbot.
Wie du sie erlaubst (robots.txt)
Willst du lesbar und zitierbar sein, ist die einfachste Regel, alle zu erlauben (der Standard, wenn du keine robots.txt hast). Um es ausdrücklich zu machen:
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
Wie du einen blockierst
Möchtest du, dass ein bestimmter Crawler deinen Inhalt nicht nutzt, verbiete ihn namentlich:
User-agent: GPTBot
Disallow: /
Für Googles generative KI im Speziellen füge das Token hinzu (das betrifft die normale Google-Suche nicht):
User-agent: Google-Extended
Disallow: /
Trainings-Crawler zu blockieren ist eine legitime Wahl – aber sei dir bewusst, dass es auch verringern kann, wie oft dich die KI dieses Unternehmens liest und zitiert. Entscheide pro Crawler.
Eine Warnung: Namen ändern sich
KI-Crawler sind neu, und ihre Namen und Verhalten verschieben sich. Nimm das als Ausgangspunkt und prüfe die offizielle Dokumentation jedes Unternehmens für den aktuellen User-Agent und die Regeln. Ein Tippfehler in der robots.txt – etwa versehentlich / für alle zu verbieten – kann dich unsichtbar machen, also kontrolliere nach dem Bearbeiten.
Fazit
Kenne die Crawler und wähle dann bewusst: Erlaube die KIs, in denen du gefunden werden willst, blockiere die, die du nicht willst, und prüfe deine robots.txt gründlich. Wie robots.txt im Detail funktioniert, siehst du unter robots.txt für KI-Crawler, oder in der GEO-Einführung für das große Bild.
Kostenloses Tool ausprobieren: robots.txt- & llms.txt-Generator →