Permission
Is the crawler allowed?
Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.
Is the crawler allowed?
Are useful facts present in raw HTML?
Does JavaScript successfully expose them?
Can an agent identify and use semantic controls?
Do page, schema, feed and checkout facts agree?
HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.
Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.
No log evidence uploaded.
Die Prüfungen laufen auf unserem Server. Wir rufen die von dir eingegebene URL ab und speichern die Ergebnisse nicht. Anonyme Ergebniszähler auf Ausführungsebene können für aggregierte Forschung verwendet werden; URLs, Domains, IP-Adressen und Kennungen werden nie einbezogen, und Statistiken werden erst ab 100 Ausführungen veröffentlicht.
+ speichert die aktuelle Website oder Seite. Nutze ☆ neben einer gespeicherten Website, Seite oder Liste, um sie als Favorit zu markieren. Der Verlauf der letzten Prüfungen erscheint darunter.
Ziel aus deinen lokalen Auswahlen übernommen.
Gespeicherte Ziele, benannte Listen und Zusammenfassungen der letzten Prüfungen bleiben nur in diesem Browser.
nosnippet, max-snippet, and data-nosnippet can limit preview/use but also affect normal Search snippets. Google-Extended only controls Gemini/Vertex training and grounding, not Search or Overviews.
nosnippet can block content from generative-model context without preventing title-based discovery, while Bing documents AI-answer/training effects for noarchive and noindex. Use the page audit or extension to inspect those meta and HTTP-header directives.
These fetch pages to answer questions and cite sources. Blocking a cooperating crawler can prevent that crawler from accessing the page, but it does not guarantee absence from every answer or citation.
These collect pages for model training. A provider's documented robots control governs future crawling; it does not remove content already collected or guarantee deletion from an existing training dataset.
Pick what to block; copy the generated rules into your robots.txt.
Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.
Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).
Prüfe, ob GPTBot, ClaudeBot, PerplexityBot, Google-Extended und weitere KI-Crawler deine robots.txt-Regeln für eine öffentliche URL erlauben oder blockieren. Der Matcher verwendet Googles Open-Source-Parser und zeigt die gewinnende Regel sowie eine llms.txt-Prüfung.
robots.txt ist eine Empfehlung, keine Sperre; Allowed/Blocked beschreibt dokumentierte Haltung, nicht tatsächliche Durchsetzung.
Gib eine URL ein und löse Turnstile. Der Server holt robots.txt sowie llms.txt, der Browser wendet den Parser auf jeden Crawler an und zeigt Regel/Zeile. Wähle im Generator Training/Retrieval und Pfad; exportiere die Regeln, blockiere nicht pauschal Googlebot.
Nicht zwingend. Trainings-, Such- und Nutzerabrufe können unterschiedliche Systeme und Regeln verwenden. Eine robots.txt-Regel kontrolliert nur Crawler, die sie beachten.
Nicht separat über eine spezielle Overview-Regel. Googles dokumentierte Such-Crawler-Regeln und Vorschaukontrollen gelten; eine Blockierung von Googlebot kann auch die normale Suche beeinträchtigen.
Nein. robots.txt ist eine freiwillige Richtlinie. Für eine technische Sperre brauchst du `CDN`- oder `WAF`-Regeln sowie eine Prüfung der tatsächlichen Client-IP; `User-Agent`-Zeichenfolgen allein lassen sich fälschen.
Für den behaupteten Crawler fehlt eine veröffentlichte IP- oder `FCrDNS`-Prüfmethode. Das ist kein Beweis für echt oder falsch, sondern eine getrennte Evidenzstufe.
Nein. `llms.txt` ist eine vorgeschlagene Inhaltskonvention und keine Zugriffskontrolle. Die Urteile beruhen auf `robots.txt` und verifizierbaren Crawler-Signalen.