Comprobador de acceso de rastreadores de IA

Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.

Five separate tests · registry 2026-07-29

Crawler access is only the first layer

Permission

Is the crawler allowed?

Extractability

Are useful facts present in raw HTML?

Renderability

Does JavaScript successfully expose them?

Operability

Can an agent identify and use semantic controls?

Commerce readiness

Do page, schema, feed and checkout facts agree?

HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.

Validate a protocol response

Upload verified-bot log evidence

Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.

No log evidence uploaded.

robots.txt is advisory, not a lock. It tells cooperating crawlers what you prefer — it does not enforce anything. Some crawlers below are reported to ignore it (flagged ⚠). To actually stop a crawler, block it at your CDN/WAF and verify it's genuine by IP.

Las comprobaciones se ejecutan desde nuestro servidor; consultamos la URL que introduces y no conservamos los resultados. Los contadores anónimos de resultados por ejecución pueden utilizarse para investigación agregada; nunca incluyen URL, dominios, IP ni identificadores, y no se publica ninguna estadística con menos de 100 ejecuciones.

Comentarios
Informar de un error

¿Algo no funciona en Comprobador de acceso de rastreadores de IA? Cuéntanos qué ha ocurrido. El informe va directamente a una cola privada de revisión, no a una lista pública.

Datos que se enviarán
 No se adjuntan automáticamente entradas de la herramienta, archivos subidos, fuentes pegadas, resultados completos, parámetros de consulta ni fragmentos de URL. Puedes editar o eliminar arriba el pasaje seleccionado. Los metadatos del navegador y de protección contra abusos se procesan para prevenir spam. 
Set your posture → robots.txt block

Pick what to block; copy the generated rules into your robots.txt.

  

Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.

Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).

Preguntas frecuentes

¿Bloquear el rastreador de entrenamiento impide que un asistente cite mi sitio?

No por sí solo. Bloquearlo excluye el contenido del entrenamiento futuro, pero no detiene los robots de recuperación en directo que obtienen páginas para responder preguntas y citar fuentes. Esos robots de búsqueda y acceso del usuario se controlan por separado. Para no aparecer en respuestas también tendrías que bloquearlos, tal como muestra la sección de recuperación en directo y citas.

¿Puedo excluirme de los resúmenes con IA de Google mediante robots.txt?

No existe un rastreador separado para esos resúmenes ni una exclusión exclusiva que deje la página sin cambios en la Búsqueda. Bloquear el robot principal impide el rastreo, pero no garantiza por sí solo que una URL conocida desaparezca. Los controles de fragmentos también afectan los resultados normales. El control ampliado de Google regula por separado el entrenamiento y la fundamentación de sus modelos, no la Búsqueda ni sus resúmenes.

¿robots.txt realmente detiene un rastreador de IA?

robots.txt es orientativo, no un candado. Comunica preferencias a los rastreadores colaboradores, pero no las impone. Los operadores responsables lo respetan; otros pueden ignorarlo y la herramienta los identifica. Para detenerlos de verdad, bloquéalos en la red de distribución o cortafuegos de aplicaciones y verifica la solicitud mediante su IP en vez de confiar en la cadena declarada.

¿Por qué un rastreador aparece como no verificable?

La etiqueta refleja si el operador publica una forma de validar la declaración: intervalos de IP actuales o resolución inversa seguida de confirmación directa. Un agente de usuario por sí solo siempre puede falsificarse. Algunos operadores publican listas oficiales de IP, lo que permite comprobar la coincidencia con un intervalo, pero no equivale a una confirmación mediante resolución inversa.

¿Un archivo de orientación para modelos cambia estos veredictos?

No. Ese archivo es una propuesta comunitaria y no consta que los principales rastreadores de IA lo lean. Su presencia o ausencia no determina si un robot está permitido o bloqueado. La herramienta solo informa si existe en el dominio; cada veredicto de acceso se decide mediante robots.txt.

Siguiente pasoGenerador de robots.txt — generate the corrected version. La orientación está disponible en inglés.