Permission
Is the crawler allowed?
Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.
Is the crawler allowed?
Are useful facts present in raw HTML?
Does JavaScript successfully expose them?
Can an agent identify and use semantic controls?
Do page, schema, feed and checkout facts agree?
HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.
Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.
No log evidence uploaded.
Las comprobaciones se ejecutan desde nuestro servidor; consultamos la URL que introduces y no conservamos los resultados. Los contadores anónimos de resultados por ejecución pueden utilizarse para investigación agregada; nunca incluyen URL, dominios, IP ni identificadores, y no se publica ninguna estadística con menos de 100 ejecuciones.
+ guarda el sitio o la página actuales. Usa ☆ junto a cualquier sitio, página o lista guardados para añadirlos a favoritos. El historial de comprobaciones recientes aparece debajo.
Destino rellenado desde tus selecciones locales.
Los destinos guardados, las listas con nombre y los resúmenes de comprobaciones recientes permanecen solo en este navegador.
nosnippet, max-snippet, and data-nosnippet can limit preview/use but also affect normal Search snippets. Google-Extended only controls Gemini/Vertex training and grounding, not Search or Overviews.
nosnippet can block content from generative-model context without preventing title-based discovery, while Bing documents AI-answer/training effects for noarchive and noindex. Use the page audit or extension to inspect those meta and HTTP-header directives.
These fetch pages to answer questions and cite sources. Blocking a cooperating crawler can prevent that crawler from accessing the page, but it does not guarantee absence from every answer or citation.
These collect pages for model training. A provider's documented robots control governs future crawling; it does not remove content already collected or guarantee deletion from an existing training dataset.
Pick what to block; copy the generated rules into your robots.txt.
Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.
Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).
No por sí solo. Bloquearlo excluye el contenido del entrenamiento futuro, pero no detiene los robots de recuperación en directo que obtienen páginas para responder preguntas y citar fuentes. Esos robots de búsqueda y acceso del usuario se controlan por separado. Para no aparecer en respuestas también tendrías que bloquearlos, tal como muestra la sección de recuperación en directo y citas.
No existe un rastreador separado para esos resúmenes ni una exclusión exclusiva que deje la página sin cambios en la Búsqueda. Bloquear el robot principal impide el rastreo, pero no garantiza por sí solo que una URL conocida desaparezca. Los controles de fragmentos también afectan los resultados normales. El control ampliado de Google regula por separado el entrenamiento y la fundamentación de sus modelos, no la Búsqueda ni sus resúmenes.
robots.txt es orientativo, no un candado. Comunica preferencias a los rastreadores colaboradores, pero no las impone. Los operadores responsables lo respetan; otros pueden ignorarlo y la herramienta los identifica. Para detenerlos de verdad, bloquéalos en la red de distribución o cortafuegos de aplicaciones y verifica la solicitud mediante su IP en vez de confiar en la cadena declarada.
La etiqueta refleja si el operador publica una forma de validar la declaración: intervalos de IP actuales o resolución inversa seguida de confirmación directa. Un agente de usuario por sí solo siempre puede falsificarse. Algunos operadores publican listas oficiales de IP, lo que permite comprobar la coincidencia con un intervalo, pero no equivale a una confirmación mediante resolución inversa.
No. Ese archivo es una propuesta comunitaria y no consta que los principales rastreadores de IA lo lean. Su presencia o ausencia no determina si un robot está permitido o bloqueado. La herramienta solo informa si existe en el dominio; cada veredicto de acceso se decide mediante robots.txt.