Korrigiert am 17. September 2026

Die erste Fassung dieses Leitfadens hat die Gruppenlogik von RFC 9309 falsch beschrieben, versprochen, Disallow-Regeln machten Crawl-Budget für andere Seiten frei, Yandex Unterstützung für Crawl-delay und Host zugeschrieben und den 2023 eingestellten robots.txt-Tester der Search Console empfohlen. Ihre KI-Crawler-Tabelle enthielt undokumentierte Tokens (DeepSeekBot, xAI-Web-Crawler, cohere-ai), nannte das eingestellte Token anthropic-ai aktiv, beschrieb Google-Extended als Abruf-Crawler und behauptete ohne auffindbare Quelle, die großen KI-Labore hielten sich bei all ihren Bots an robots.txt. Das „Live-Audit von 10 Guides“ widersprach sich selbst und hatte keine gespeicherten Daten, deshalb ist es raus. Luminas Crawler Access Checker hat untereinander stehende User-agent-Zeilen falsch gelesen, das ist ebenfalls behoben.

Im Oktober 2025 veröffentlichte Heise einen Nachruf auf die robots.txt: KI-Crawler hätten das Protokoll bedeutungslos gemacht. Das stimmt zur Hälfte. Durchsetzbar war robots.txt nie, und die Zahl der Bots, die eine typische Website abrufen, ist von ein paar Suchmaschinen auf Dutzende KI-Crawler und Abrufdienste gewachsen, jeder mit eigener Haltung. Manche, vor allem die Abrufer, die im Auftrag eines Nutzers handeln, sagen offen, dass robots.txt für sie in der Regel nicht gilt.

Die andere Hälfte: Die Crawler, die für die meisten Websites zählen, darunter Googlebot, Bingbot, GPTBot, OAI-SearchBot, ClaudeBot und PerplexityBot, dokumentieren, dass sie robots.txt befolgen. Die Datei steuert also weiterhin viel. Ein Schloss ist sie nur nicht.

Was robots.txt eigentlich ist

Die robots.txt ist eine Textdatei im Stammverzeichnis deines Hosts (deineseite.de/robots.txt), die Crawlern sagt, welche Pfade sie abrufen dürfen. Das Format ist in RFC 9309 standardisiert, von der IETF im September 2022 veröffentlicht, 28 Jahre nachdem das Protokoll 1994 entstanden war.

Crawler, die das Protokoll befolgen, laden die robots.txt, bevor sie einen Host crawlen, werten sie aus und speichern sie zwischen. Google hält sie bis zu 24 Stunden im Cache. Freiwillig ist das Ganze trotzdem: Technisch zwingt nichts einen Bot zum Gehorsam. Für die Bots, die sich daran halten, ist robots.txt aber der einfachste Weg zu steuern, was sie crawlen.

Ein Detail, das viele Guides auslassen: robots.txt steuert das Crawling, nicht die Indexierung. Eine gesperrte URL wird nicht abgerufen, Google kann sie aber trotzdem ohne Snippet indexieren, wenn andere Seiten auf sie verlinken. Was du stattdessen tust, steht bei Fehler Nummer eins weiter unten.

Warum robots.txt weiterhin zählt

Die robots.txt erfüllt heute zwei Aufgaben. Sie hält Crawler von URL-Bereichen fern, deren Crawling nichts bringt, und sie ist die eine standardisierte Stelle, an der du KI-Trainings-Crawlern und KI-Such-Crawlern Unterschiedliches sagen kannst.

Die erste Aufgabe wird oft überschätzt. Googles Dokumentation zum Crawl-Budget richtet sich an sehr große Websites mit etwa einer Million Seiten oder mehr und an mittelgroße, deren Inhalte sich täglich ändern. Außerdem steht dort, dass Google das Budget, das du durch gesperrte URLs frei machst, nicht auf andere Seiten verlagert, solange Google nicht ohnehin an die Kapazitätsgrenze deines Servers stößt. Für eine typische Website geht es beim Sperren interner Suchergebnisse oder endloser Filterkombinationen also darum, Müll aus dem Crawl zu halten, nicht darum, wichtige Seiten schneller gecrawlt zu bekommen.

Die zweite Aufgabe ist neuer. In der robots.txt kannst du in einer Datei „nein“ zum KI-Training und „ja“ zur KI-Suche sagen, mit der Einschränkung, dass für Abrufer im Nutzerauftrag andere Regeln gelten (siehe welche KI-Bots sich wirklich an robots.txt halten).

Das Dateiformat (RFC 9309)

RFC 9309 definiert Gruppen aus einer oder mehreren User-agent-Zeilen, gefolgt von Allow- und Disallow-Regeln, dazu Kommentare mit #. Andere Einträge wie Sitemap und Crawl-delay gehören nicht zum Standard, das RFC erlaubt Crawlern aber, sie zu unterstützen.

Hier eine kleine, gültige Datei:

User-agent: *
Disallow: /admin/
Disallow: /search?
Allow: /admin/help/

User-agent: Googlebot
Disallow: /staging/

Sitemap: https://example.com/sitemap.xml

Drei Regeln bestimmen, wie ein Crawler sie liest. Erstens: Mehrere User-agent-Zeilen direkt untereinander teilen sich die Regeln darunter. Zweitens: Ein Crawler nutzt die Gruppe, die ihn namentlich nennt, und greift nur dann auf User-agent: * zurück, wenn keine Gruppe passt. Gibt es mehrere Gruppen für denselben User-Agent, führt der Crawler sie zusammen. Drittens: Innerhalb der Gruppe gewinnt der spezifischste (längste) passende Pfad, und bei Gleichstand zwischen Allow und Disallow gewinnt Allow. Die Reihenfolge spielt keine Rolle.

Die zweite Regel versteckt im Beispiel oben eine Falle. Googlebot hat eine eigene Gruppe und ignoriert die *-Gruppe deshalb komplett. Er darf /admin/ und /search? crawlen, weil seine eigene Gruppe nur /staging/ sperrt (Fehler 4 weiter unten).

Pfade kennen zwei Platzhalter: * steht für eine beliebige Zeichenfolge, $ für das Ende der URL. Disallow: /*.pdf$ sperrt jede URL, die auf .pdf endet. User-Agent-Namen kennen keine Platzhalter, User-agent: GPT* trifft GPTBot also nicht.

Drei Dinge wirken wie Teil der Spezifikation, sind es aber nicht. Crawl-delay: Bing beachtet es, Google ignoriert es, und Yandex hat es im Februar 2018 aufgegeben. Host: ein alter Yandex-Eintrag, den Yandex nicht mehr aufführt. Und eine noindex-Zeile in der robots.txt: Die unterstützt Google seit September 2019 nicht mehr.

Die KI-Crawler: Welche User-Agents es gibt

Die Betreiber trennen ihre Bots nach Zweck, und der Zweck entscheidet, was eine Sperre bewirkt. Trainings-Crawler sammeln Inhalte für künftige Modelle. Such-Crawler bauen einen Index für Antworten mit Quellenangaben. Abrufer im Nutzerauftrag laden eine Seite, weil jemand danach gefragt hat. Steuerungs-Tokens sind gar keine Bots: Du nutzt sie in der robots.txt, um einer Verwendung zu widersprechen, und der normale Crawler liest die Regel.

BetreiberUser-AgentZweck
OpenAIGPTBotTrainings-Crawler für OpenAIs Modelle
OpenAIOAI-SearchBotSuch-Crawler für die Suchergebnisse in ChatGPT
OpenAIChatGPT-UserRuft eine Seite ab, wenn eine Anfrage in ChatGPT sie braucht; laut OpenAI gelten robots.txt-Regeln hier möglicherweise nicht
AnthropicClaudeBotTrainings-Crawler für Claude-Modelle
AnthropicClaude-SearchBotSuch-Crawler für die Suchergebnisse in Claude
AnthropicClaude-UserRuft eine Seite ab, wenn eine Anfrage in Claude sie braucht; laut Anthropic beachtet er robots.txt
PerplexityPerplexityBotSuch-Crawler für den Perplexity-Index
PerplexityPerplexity-UserRuft Seiten für die Frage eines Nutzers ab; laut Perplexity ignoriert er robots.txt in der Regel
GoogleGoogle-ExtendedSteuerungs-Token, kein Crawler: widerspricht dem Training von Gemini-Modellen und dem Grounding in Gemini-Apps und Vertex AI; ohne Einfluss auf die Google-Suche und AI Overviews
GoogleGoogle-AgentVon Google gehostete Agenten im Auftrag eines Nutzers; ignoriert robots.txt in der Regel
AppleApplebot-ExtendedSteuerungs-Token, kein Crawler: widerspricht dem Training von Apples KI-Modellen
Common CrawlCCBotCrawler für den öffentlichen Common-Crawl-Datensatz, mit dem viele KI-Modelle trainiert werden
MetaMeta-ExternalAgentCrawler für KI-Training und Meta-Produkte
MistralMistralAI-UserRuft Seiten für Nutzeranfragen in Le Chat ab
ByteDanceBytespiderByteDance zugeschriebener Crawler; keine offizielle Dokumentation, und Berichten zufolge hält er sich nicht verlässlich an robots.txt

In vielen Sperrlisten findest du weitere Namen. anthropic-ai und Claude-Web sind eingestellte Anthropic-Tokens, die ClaudeBot ersetzt hat. cohere-ai, DeepSeekBot und xAI-Web-Crawler werden von Cohere, DeepSeek und xAI nicht dokumentiert; Cohere sagt sogar, dass es das Web nicht crawlt, um seine Modelle zu trainieren. Eine Regel für sie schadet nicht, du kannst aber auch nicht darauf zählen, dass sie etwas bewirkt. Traffic-Zahlen und was große Verlage sperren, stehen im KI-Crawler-Guide.

Die sinnvolle Trennung ist Training gegen Suche. Wenn du nicht als Trainingsmaterial dienen, aber in der KI-Suche zitiert werden willst, sperr die Trainings-Crawler und lass die Such-Crawler zu. Bei OpenAI heißt das: eine Gruppe, die GPTBot sperrt, während OAI-SearchBot erlaubt bleibt. Bei Anthropic sperrst du ClaudeBot und lässt Claude-SearchBot zu. Bei Google deckt ein Disallow für Google-Extended das Gemini-Training ab, ohne die Suche zu berühren.

Die 5 Muster, die funktionieren

Die meisten Websites brauchen eines davon oder eine Kombination aus zweien.

1. Die minimale Datei ohne Sperren

Für eine Website, die nichts sperren muss:

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Alle Crawler willkommen, ganze Website erlaubt, Sitemap angegeben. Ein leeres Disallow oder gar keine robots.txt hat denselben Effekt, diese Variante ist aber eindeutig und enthält die Sitemap-Zeile.

2. Müll-URLs aus dem Crawl halten

Für Websites mit interner Suche, Session- oder Tracking-Parametern:

User-agent: *
Disallow: /search?
Disallow: /*?session=
Disallow: /*?utm_

Sitemap: https://example.com/sitemap.xml

Sperr URL-Muster, die endlose Varianten erzeugen, nie die eigentlichen Produkt-, Artikel- oder Leistungsseiten.

3. Widerspruch gegen KI-Training, KI-Suche erlaubt

Für Verlage, die kein Trainingsmaterial sein, aber zitiert werden wollen:

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: Bytespider
Disallow: /

# Such-Crawler wie OAI-SearchBot, Claude-SearchBot
# und PerplexityBot landen in dieser Gruppe
User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Zwei Grenzen. Google-Extended umfasst auch das Grounding in Gemini-Apps und Vertex AI, bei Google sperrt das also mehr als nur Training. Und für Bytespider ist kein Verhalten bei robots.txt dokumentiert, betrachte die Zeile also als Bitte, nicht als Sperre.

4. KI-Crawler sperren, so weit robots.txt reicht

Für Inhalte hinter Paywall, lizenzierte oder sensible Inhalte:

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Google-Agent
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: Meta-ExternalAgent
User-agent: MistralAI-User
User-agent: Bytespider
Disallow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Sei dir im Klaren, was das bewirkt. Die dokumentierten Crawler wie GPTBot, OAI-SearchBot, ClaudeBot und PerplexityBot bleiben draußen. ChatGPT-User, Perplexity-User und Google-Agent wenden robots.txt bei Abrufen im Nutzerauftrag in der Regel nicht an, die Zeilen drücken also deinen Wunsch aus, setzen ihn aber nicht durch. Wenn diese Abrufe wirklich unterbleiben sollen, sperr sie am Server oder CDN, etwa mit einer WAF-Regel auf Basis ihrer veröffentlichten IP-Bereiche oder mit den Bot-Einstellungen von Cloudflare.

5. Regeln pro Bereich

Für Websites, auf denen KI-Trainings-Bots den Blog lesen dürfen, die Doku aber nicht:

User-agent: GPTBot
User-agent: ClaudeBot
Disallow: /docs/
Allow: /

User-agent: *
Allow: /

Sitemap: https://example.com/sitemap.xml

Der längste Treffer gewinnt, Disallow: /docs/ schlägt also Allow: / für URLs unter /docs/, und der Rest der Website bleibt für beide Bots offen.

Die 6 häufigsten Fehler

1. Eine Seite sperren, die aus dem Index soll

Um eine Seite aus Google zu entfernen, ist das noindex-Tag das richtige Werkzeug. Ist die Seite zusätzlich in der robots.txt gesperrt, ruft Googlebot sie nie ab, sieht das noindex nie und kann die URL wegen eingehender Links im Index behalten. Die richtige Reihenfolge: Seite crawlbar lassen, noindex setzen, warten, bis Google sie neu gecrawlt und entfernt hat, und erst dann ein Disallow ergänzen, falls künftiges Crawling unterbleiben soll.

2. CSS oder JavaScript sperren

Ältere Dateien sperren oft /wp-content/, /assets/ oder /js/. Google rendert Seiten wie ein Browser und braucht diese Dateien, um die Seite so zu sehen wie Nutzer. Ohne sie können Inhalt und Layout falsch verstanden werden. Lass CSS und JavaScript zu, außer du hast einen sehr konkreten Grund dagegen.

3. robots.txt als Sicherheitsmaßnahme nutzen

Jeder kann deine robots.txt lesen. Wer dort /admin/, /staging/ oder /backup/ auflistet, zeigt genau, welche Pfade es gibt. Schütz private Bereiche mit Anmeldung, IP-Freigaben oder VPN. Nutz robots.txt für Pfade, die nicht gecrawlt werden sollen, nicht für Pfade, die verborgen bleiben sollen.

4. Einem Bot eine eigene Gruppe geben und die gemeinsamen Regeln vergessen

Sobald ein Crawler eine Gruppe mit seinem Namen findet, ignoriert er User-agent: *. Eine Datei, die /admin/ für alle sperrt und dann User-agent: Googlebot mit einer einzigen Regel ergänzt, hat /admin/ für Googlebot gerade freigegeben. Wiederhol die gemeinsamen Regeln in jeder benannten Gruppe oder schreib den Bot in dieselbe Gruppe wie *.

5. robots.txt aus zwei Quellen

Jeder Host liefert genau eine robots.txt aus. Erzeugt ein CMS-Plugin eine virtuelle Datei und liegt im Repository zusätzlich eine statische, wird nur eine davon ausgeliefert, je nachdem, wie der Server die Anfrage verarbeitet, und vielleicht nicht die, die du bearbeitet hast. Ruf deineseite.de/robots.txt nach jeder Änderung selbst ab und prüf, ob live das steht, was du willst. Denk auch daran, dass jede Subdomain und jedes Protokoll eine eigene Datei braucht.

6. Fehlende Sitemap-Zeile

Die Sitemap-Zeile zeigt jedem Crawler, wo deine Sitemap liegt, nicht nur den Suchmaschinen, bei denen du sie eingereicht hast. WordPress (seit Version 5.5), Shopify und Wix ergänzen sie automatisch, viele eigene Setups nicht. Eine Zeile reicht: Sitemap: https://deineseite.de/sitemap.xml. Bei mehreren Sitemaps nimmst du mehrere Zeilen.

robots.txt, noindex oder WAF: Was wann passt

Die Frage ist, ob der Bot die URL abrufen darf, indexieren darf oder gar keine Antwort bekommen soll.

WerkzeugWas es tutWann passend
robots.txt DisallowBittet regelkonforme Bots, die URL nicht abzurufen. Verhindert keine Indexierung, wenn die URL anderswo verlinkt ist.Endlose URL-Varianten, interne Suche, Widerspruch gegen KI-Training.
noindex-Meta-TagDie Seite darf abgerufen werden, bleibt aber aus den Suchergebnissen. Pro Seite.Danke-Seiten, dünne Templates, Seiten, die aus dem Index sollen.
X-Robots-Tag-HeaderWie noindex, aber als HTTP-Header, funktioniert also auch für PDFs und andere Dateien.PDFs, Downloads und andere Nicht-HTML-Dateien aus dem Index halten.
WAF / Firewall-SperreLehnt die Anfrage am Server oder CDN ab. Echte Durchsetzung.Bots, die robots.txt ignorieren, unerwünschte Abrufer im Nutzerauftrag, nicht deklarierte Scraper, Paywall-Inhalte.
HTTP-AuthentifizierungVerlangt eine Anmeldung, bevor Inhalte ausgeliefert werden.Wirklich private Inhalte, Staging-Umgebungen, interne Tools.

robots.txt prüfen (3 Methoden)

Methode 1: Lumina Crawler Access Checker

Gib deine Domain in Luminas Crawler Access Checker ein. Er lädt deine robots.txt, wertet die Gruppen aus und zeigt für 37 Such-, KI- und Social-Bots ein Urteil auf Website-Ebene: erlaubt, teilweise gesperrt oder gesperrt. Außerdem schickt er Live-Anfragen mit dem User-Agent jedes Bots, sodass du siehst, wenn Server oder CDN einem Bot anders antworten, als die robots.txt sagt. Einen einzelnen Pfad nach der Längster-Treffer-Regel bewertet er nicht, für Fragen zu einer bestimmten URL nimmst du die Search-Console-Werkzeuge unten.

Methode 2: robots.txt-Bericht und URL-Prüfung in der Search Console

In der Search Console zeigt der robots.txt-Bericht unter „Einstellungen“, welche robots.txt-Dateien Google für die wichtigsten Hosts deiner Property gefunden hat, wann sie zuletzt abgerufen wurden und welche Warnungen oder Fehler es gibt. Nach einer dringenden Änderung kannst du dort einen erneuten Abruf anfordern. Den alten robots.txt-Tester, mit dem man einzelne URLs prüfen konnte, hat Google Ende 2023 eingestellt. Ob Google eine bestimmte URL crawlen darf, prüfst du stattdessen mit der URL-Prüfung.

Methode 3: Direkt abrufen und von Hand prüfen

Öffne deineseite.de/robots.txt im Browser. Prüf, ob sie mit HTTP 200 antwortet, eine Sitemap-Zeile hat, die gewünschten Bots aufführt und keine Überraschungen enthält: von Plugins ergänzte Pfade, vergessene Staging-Regeln oder doppelte Gruppen. Eine 4xx-Antwort heißt für Crawler, dass es keine Einschränkungen gibt. Eine 5xx-Antwort lässt Google die ganze Website eine Zeit lang als gesperrt behandeln, das ist schlimmer als gar keine Datei. Wiederhol den Check nach Deployments und Plugin-Updates.

Welche KI-Bots sich wirklich an robots.txt halten

Für jeden Bot ist robots.txt freiwillig. Entscheidend ist, was die Betreiber dokumentieren, und das unterscheidet sich je nach Bot-Typ.

Die meisten Trainings- und Such-Crawler erklären, dass sie robots.txt befolgen. OpenAI dokumentiert das für GPTBot und OAI-SearchBot, Anthropic für ClaudeBot, Claude-SearchBot und Claude-User, Perplexity für PerplexityBot und Common Crawl für CCBot.

Die Ausnahme sind Abrufer im Nutzerauftrag, wie die Tabelle oben für ChatGPT-User, Perplexity-User und Google-Agent zeigt. Anthropics Claude-User ist unter den vier großen die dokumentierte Ausnahme. Bei diesen Bots drückt robots.txt einen Wunsch aus, echte Kontrolle gibt nur eine Firewall-Regel.

Dazu kommt Verhalten jenseits der Dokumentation: Wired berichtete im Juni 2024, dass Perplexity trotz robots.txt-Sperren auf Inhalte zugriff, Cloudflare veröffentlichte im August 2025 Belege für nicht deklarierte Perplexity-Crawler, die Sperren umgingen, was Perplexity bestritt, und für Bytespider gibt es überhaupt keine offizielle Dokumentation. Deshalb kombinieren Websites mit wertvollen Inhalten robots.txt mit Bot-Regeln am CDN oder Server.

Noch eine Grenze: Wer CCBot sperrt, hält seine Seiten aus künftigen Common-Crawl-Schnappschüssen heraus, entfernt aber nichts aus älteren und hält auch die vielen Modelle nicht auf, die bereits damit trainiert wurden.

Ein Ablauf in 5 Schritten

01
Aktuelle Datei prüfen

Ruf deineseite.de/robots.txt ab und prüf deine Domain mit Luminas Crawler Access Checker. Notier, welche KI-Bots du sperrst, welche du zulässt, ob die Sitemap-Zeile da ist und ob einer benannten Gruppe die gemeinsamen Regeln fehlen.

Crawler Access Checker starten →
02
KI-Richtlinie festlegen

Drei realistische Optionen: alles erlauben, Training widersprechen und KI-Suche zulassen, oder KI-Crawler sperren, so weit robots.txt reicht, plus Firewall-Regel für Abrufer im Nutzerauftrag. Halte die Entscheidung schriftlich fest, damit die nächste Person weiß, was die Datei bezweckt.

Die 5 Muster →
03
Müll im Crawl suchen

Öffne den Bericht „Crawling-Statistiken“ in der Search Console und such nach vielen Anfragen auf interne Suche, Parameter-URLs oder Kalenderseiten. Das sind Kandidaten für ein Disallow. Erwarte nicht, dass andere Seiten dadurch schneller gecrawlt werden, solange dein Server nicht am Limit ist.

Sitemap prüfen →
04
Neue Datei schreiben

Bau sie aus den Mustern oben. Halte sie kurz, prüf jede benannte Gruppe auf die Regeln, die sie teilen soll, und kopier keine lange Datei von einer anderen Website, deren Bedarf anders ist als deiner.

Vor dem Deployment testen →
05
Veröffentlichen und prüfen

Veröffentlich die Datei, ruf die Live-Version selbst ab und lass den Crawler Access Checker erneut laufen. Schau in den nächsten 24 Stunden in den robots.txt-Bericht der Search Console, weil Google die Datei so lange zwischenspeichert.

Nach dem Deployment prüfen →

FAQ

Die robots.txt ist eine Textdatei im Stammverzeichnis deines Hosts (deineseite.de/robots.txt), die Crawlern sagt, welche Pfade sie abrufen dürfen. Das Format ist seit September 2022 in RFC 9309 standardisiert. Wichtig ist sie, weil neben Suchmaschinen inzwischen viele KI-Bots Websites abrufen und du sie dort unterschiedlich behandeln kannst, etwa dem KI-Training widersprechen und trotzdem für KI-Such-Crawler erreichbar bleiben.
Bei den dokumentierten Trainings-Crawlern ja. GPTBot, ClaudeBot und CCBot erklären, dass sie robots.txt befolgen, und Google-Extended und Applebot-Extended sind Tokens, die die jeweiligen Crawler beachten. Was schon in bestehenden Datensätzen steckt, entfernt die Datei nicht, und Bots, die sie ignorieren, hält sie nicht auf. Solche Fälle haben Wired und Cloudflare dokumentiert. Für echte Durchsetzung brauchst du zusätzlich eine Firewall- oder CDN-Regel.
Disallow bittet Crawler, eine URL nicht abzurufen. Noindex erlaubt den Abruf, hält die URL aber aus den Suchergebnissen. Sperrst du eine Seite per Disallow, kann Google ihr noindex nicht sehen und die URL ohne Snippet im Index behalten, wenn andere Seiten darauf verlinken. Um eine Seite aus Google zu entfernen, lass sie crawlbar, setz noindex und lass Google sie neu crawlen. Disallow nutzt du für URLs, die gar nicht gecrawlt werden sollen, etwa interne Suchergebnisse.
Nein. Googlebot ignoriert Crawl-delay, und Yandex nutzt es seit 2018 nicht mehr; Bing beachtet es weiterhin. Die Einstellung zur Crawling-Frequenz hat Google im Januar 2024 aus der Search Console entfernt und passt die Rate automatisch an. Überlastet Googlebot deinen Server, antworte vorübergehend mit 503 oder 429, dann drosselt Google, und behebe das Kapazitätsproblem. Gib diese Codes nicht lange zurück, sonst kann Google URLs verwerfen.
Nein. Jeder kann deineseite.de/robots.txt abrufen und alle gesperrten Pfade sehen, /admin oder /staging dort aufzulisten macht sie also erst bekannt. Private Inhalte schützt du mit Anmeldung, IP-Freigaben oder VPN. Nutz robots.txt nur, um Crawler von Routineseiten wegzulenken, nie als Sicherheitsgrenze.
KI-Betreiber trennen ihre Bots nach Aufgabe. Trainings-Crawler (GPTBot, ClaudeBot, CCBot) sammeln Inhalte für künftige Modelle. Such-Crawler (OAI-SearchBot, Claude-SearchBot, PerplexityBot) bauen den Index, aus dem KI-Antworten zitieren. Google-Extended ist kein Crawler, sondern ein Token für Gemini-Training und Grounding und hat keinen Einfluss auf die Google-Suche oder AI Overviews. Nutzerausgelöste Bots wie Google-Agent, ChatGPT-User und Perplexity-User rufen Seiten ab, weil ein Nutzer danach gefragt hat, und ignorieren robots.txt in der Regel (Anthropics Claude-User ist die dokumentierte Ausnahme). Du kannst also dem Training widersprechen und trotzdem zitierbar bleiben, indem du die Such-Crawler zulässt.

Wo du anfängst

Wenn du diese Woche nur eine Sache machst, prüf deine Domain mit Luminas Crawler Access Checker und lies deine Live-robots.txt direkt daneben. Achte auf drei Dinge: eine benannte Gruppe, der die gemeinsamen Regeln fehlen, eine KI-Richtlinie, die nicht zu deinem Ziel passt, und eine fehlende Sitemap-Zeile.

Wenn du mehr Zeit hast, geh den Ablauf in fünf Schritten durch. Für die meisten Verlage ist Muster 3 die nützlichste Änderung, also Widerspruch gegen Training bei erlaubter KI-Suche, zusammen mit einem klaren Hinweis, welche Abrufer im Nutzerauftrag robots.txt nicht aufhalten kann.

Prüf jetzt deine robots.txt

Luminas Crawler Access Checker wertet deine robots.txt für 37 Such-, KI- und Social-Bots aus und prüft, wie dein Server jedem von ihnen antwortet. Kostenlos, ohne Anmeldung.

Crawler Access Checker starten →
Julien El-Bahy

Julien El-Bahy

Web Development Lead und Schöpfer von Lumina SEO. Spezialisiert auf SEO, GEO und KI-gestützte Such-Tools.

Auf LinkedIn vernetzen →

Verwandte Tools & Artikel