Startseite Über uns Kontakt Blog Ask AI
Dashboards +
On-Page SEO +
Technical SEO +
SERP & Content +
Local SEO +
Chrome Extension holen
Kostenloses SEO & GEO Tool

Crawler Checker

Prüfe welche Crawler durch robots.txt erlaubt oder blockiert werden, und verifiziere mit Live-Serverprüfungen unter dem echten User-Agent jedes Bots.

Zuletzt aktualisiert: September 2026

So funktioniert dieser robots.txt Checker

Die meisten kostenlosen Crawler Checker testen nur Googlebot. Aber 2026 sind GPTBot, ClaudeBot, PerplexityBot und Google-Extended genauso wichtig für die Sichtbarkeit in KI-Suchen. Dieser KI-Crawler-Checker testet 37 Bots — inklusive OpenAIs neuem OAI-AdsBot (ChatGPT-Ads-Validator) — gegen deine robots.txt-Regeln und schickt dann einen Live-Request mit dem User-Agent jedes Bots an deine Startseite. Google-Extended und Applebot-Extended sind reine robots.txt-Tokens ohne eigenen User-Agent. Bei diesen beiden zeigt die Server-Spalte nur, wie dein Server auf diesen String reagiert.

Dieser zweite Check ist der, den die meisten übersehen. Ein Bot kann in der robots.txt "erlaubt" sein, aber trotzdem einen 403 von einer Cloudflare-Regel oder einem CDN-Bot-Schutz bekommen. Dieses Tool zeigt dir beide Ebenen: was deine robots.txt sagt, und was tatsächlich durchkommt. Das gilt auch umgekehrt. Google-Agent, ChatGPT-User und Perplexity-User rufen Seiten ab, wenn ein Mensch danach fragt, und laut ihren Betreibern gilt die robots.txt dabei in der Regel nicht. Eine Disallow-Zeile hält sie nicht auf, eine Server-Regel schon. Achte dabei auf die Such-Bots: GPTBot sammelt Trainingsdaten, die ChatGPT-Suche ruft Seiten aber mit OAI-SearchBot ab. Blockiert dein Server den, hilft dir keine Content-Arbeit, um dort zitiert zu werden.

Häufige robots.txt-Fehler, die dieser Checker findet

Die meisten Fehler sind trivial, nicht subtil. Der Klassiker: ein Disallow: / aus der Staging-Umgebung, das beim Go-Live niemand entfernt hat. Der Checker zeigt das bei jedem betroffenen Bot als BLOCKIERT. Auch eine fehlende robots.txt fällt auf, dann ist jede URL standardmäßig crawlbar.

Bei Pfadregeln musst du selbst hinschauen. Disallow: /ordner sperrt auch /ordner-archiv und /ordner.html, weil Regeln per Präfix greifen. Der Checker listet die gesperrten Pfade pro Bot unter „Regeln“ (Maus über das Badge), und die rohe Datei steht unten in den Ergebnissen. Eine einzelne URL prüft er aber nicht gegen die Regeln.

Blockiert meine robots.txt Suchmaschinen?

Lass diesen Checker gegen deine Live-URL laufen. Ist Googlebot komplett gesperrt, steht das als BLOCKIERT in der ersten Ergebniszeile. Teilsperren erscheinen als „Regeln“, und genau dort verstecken sich die meisten Unfälle: ein Wildcard-Pattern (Disallow: /*.php), das für einen Pfad gedacht war und Tausende trifft. Google speichert die robots.txt bis zu 24 Stunden zwischen, eine Korrektur kann also einen Tag brauchen. Im robots.txt-Bericht der Search Console kannst du einen erneuten Abruf anfordern.

robots.txt Tester vs. robots.txt Checker

Google hat den robots.txt Tester in der Search Console Ende 2023 abgeschaltet. Der Ersatz ist ein kurzer Report unter Einstellungen → robots.txt, der nur die aktuell abgerufene Datei zeigt. Eigene User-Agents oder eine Vorschau auf Regeländerungen sind damit nicht möglich. Dieser Checker schließt einen Teil der Lücke: Er prüft deine Live-Datei gegen 37 benannte Crawler und schaut, was der Server jedem davon tatsächlich zurückgibt. Einen Entwurf oder einen eigenen User-Agent nimmt er nicht an, Regeländerungen testest du also vorher auf Staging.

Weitere Tools entdecken

FAQ

Was ist eine robots.txt-Datei?+
Eine Textdatei im Root-Verzeichnis deiner Website (beispiel.de/robots.txt), die Crawlern mitteilt, welche Seiten sie aufrufen dürfen. Sie verwendet User-Agent-, Allow- und Disallow-Direktiven zur Steuerung pro Bot.
Was bedeutet „Regeln" vs. „BLOCKIERT"?+
„Regeln" bedeutet, der Bot darf deine Seite crawlen, aber bestimmte Pfade sind eingeschränkt (z.B. /admin/, /api/). Das ist normal. „BLOCKIERT" bedeutet Disallow: /. Ein Bot, der sich an die robots.txt hält, crawlt dann keine einzige Seite. Fetcher, die im Auftrag eines Nutzers abrufen, also Google-Agent, ChatGPT-User und Perplexity-User, ignorieren die robots.txt in der Regel. Bei ihnen entscheidet der Live-Check am Server. Claude-User ist die Ausnahme und hält sich daran.
Warum zeigt der Server-Check 403 bei manchen Bots?+
Ein 403 bedeutet, dass der Server diesen Bot aktiv ablehnt, unabhängig von den robots.txt-Regeln. Dies geschieht typischerweise über Firewall-Regeln, CDN-Einstellungen oder serverseitige Bot-Erkennung.
Was passiert ohne eine robots.txt?+
Alle Crawler gehen davon aus, dass sie auf jede Seite zugreifen dürfen. Dieses Tool zeigt dann alle 37 Bots als „erlaubt" an. Der Zugriff kann trotzdem serverseitig eingeschränkt sein (was der Live-Check aufdeckt).
Was ist Crawl-Delay?+
Eine robots.txt-Direktive, die Bots vorschreibt, eine bestimmte Anzahl Sekunden zwischen Requests zu warten. Sie begrenzt die Crawling-Geschwindigkeit. Google ignoriert sie, und die Einstellung zur Crawling-Frequenz in der Search Console gibt es auch nicht mehr. Um Googlebot im Notfall zu bremsen, empfiehlt Google, für ein, zwei Tage 500, 503 oder 429 zurückzugeben.
KI-Crawler-Check auf jeder Seite

Lumina zeigt robots.txt-Regeln und X-Robots-Tag der Seite, auf der du gerade bist, und, sobald du GA4 verbindest, einen Bericht über Besuche, die von ChatGPT, Perplexity und anderen KI-Assistenten kommen. Kostenlos.

Lumina zu Chrome hinzufügen — Kostenlos