Analizador de archivos de registro
Free, no signup. Server logs answer a question your analytics can't: what are crawlers actually doing on your site. Drop one in and see crawl budget by bot and by section, how much is wasted on 404s and redirects, how AI crawlers compare to search engines, and which requests are impostors faking a crawler user-agent.
Handles nginx / Apache (combined & common), IIS / W3C Extended, and JSON logs (incl. Cloudflare Logpush) — format auto-detected. Crawler ranges updated 22 days ago.
Se ejecuta por completo en tu navegador: nada de lo que pegues se sube ni se almacena. Spot-checking a suspicious IP against the Googlebot Verifier sends only that IP to our server. Los contadores anónimos de resultados por ejecución pueden utilizarse para investigación agregada; nunca incluyen URL, dominios, IP ni identificadores, y no se publica ninguna estadística con menos de 100 ejecuciones.
Pasaporte del sitio Contexto local de este sitio guardado
Datos locales
Los destinos guardados, las listas con nombre y los resúmenes de comprobaciones recientes permanecen solo en este navegador.
Who's crawling you
Requests grouped by crawler type. AI crawlers and search engines want different things from your site. "Other / unclassified" is everything with no known crawler user-agent — human browsers and untracked tools.
Crawl over time
Daily crawl requests by crawler type across the log's date range.
Crawl budget by bot
Each crawler seen in the log: how many requests, how it was verified, and how much of its crawl hit redirects or errors (excluding 304 revalidation).
Spoofer report
Requests that sent a crawler's user-agent from an IP outside that operator's published ranges — likely impostors. robots.txt won't stop these (impostors ignore it); block by IP or ASN. Spot-check any IP for the real network owner via forward-confirmed reverse DNS — this is the one action that leaves your browser (a single lookup to our verifier API).
Crawler × page-type matrix
Where each recognized crawler concentrates requests across inferred page cohorts. Cell intensity represents request count; the label also shows wasted requests.
Crawl budget by section
Where crawlers spend their time on your site (bot traffic only). High waste in a section means crawlers are burning budget on broken or redirecting URLs there.
Most-wasted URLs
Individual URLs where crawlers hit redirects or errors most often (excluding 304 revalidation) — the highest-leverage fixes for crawl budget.
AI-invented URL candidates
Observed 404/410 requests with an AI crawler or known AI-assistant referrer. This is the primary evidence mode: a row is a candidate, not proof that a model invented it — it may be a deleted or migrated URL. Suggested destinations compare only against the sitemap/URL list you supplied above.
Optional URL probe simulation
Ask the site’s open-model simulator for plausible paths, then check their live status. This is explicitly a simulation, never observed assistant output; log evidence above is stronger.
Expected URLs vs crawler requests
Recommendations
Valorar esta herramienta
Preguntas frecuentes
¿Mis archivos de registro se suben a algún lugar?
No. El análisis se ejecuta por completo en el navegador mediante un hilo auxiliar: el archivo se lee del disco y se procesa localmente por fragmentos. La única excepción es la comprobación opcional de una IP en el informe de suplantación, que envía solo esa IP al verificador para consultar la resolución inversa confirmada y el propietario de red. Al cerrar la pestaña desaparecen todos los datos procesados.
¿Qué formatos de registro admite?
El formato se detecta automáticamente. Lee formatos habituales de servidores web, el formato ampliado de Microsoft y registros JSON, incluidas exportaciones de proveedores perimetrales. Puedes soltar varios archivos a la vez; los grandes se procesan por fragmentos para que incluso varios gigabytes no bloqueen la pestaña.
¿Cómo distingue un rastreador auténtico de uno suplantado?
Cada solicitud se asocia con un rastreador conocido mediante el agente de usuario y después se compara la IP de origen con los intervalos publicados por el operador, actualizados semanalmente. Una cadena de Googlebot procedente de una IP ajena a Google se marca como posible suplantación. Algunos operadores no publican intervalos, por lo que esos accesos se marcan como no verificables.
¿Qué se considera desperdicio del presupuesto de rastreo?
Cualquier solicitud de robot que recibe una redirección, salvo una revalidación útil 304 sin cambios, un fallo 4xx como 404 o 410, o un fallo de servidor 5xx. La herramienta agrupa el desperdicio por robot, sección y URL concreta para mostrar dónde están las correcciones de mayor impacto.
¿Puedo bloquear suplantadores con robots.txt?
No. Los impostores declaran un agente de rastreador precisamente para ignorar robots.txt; bloquéalos por IP o propietario de red en el perímetro o cortafuegos. robots.txt sí sirve para rastreadores genuinos que desperdician recursos en secciones que no quieres rastrear, y la sección de recomendaciones genera reglas de exclusión listas para copiar.
Problemas habituales y cómo solucionarlos
- Advertencia La afirmación del rastreador queda fuera del intervalo publicado por el operador Solución: Trata el rastreador como no verificado y bloquéalo o investígalo hasta que su IP coincida con el intervalo publicado por el operador.
- Advertencia El rastreador dedica solicitudes a URL que no son útiles Solución: Bloquea o aplica una referencia canónica a las URL de parámetros, filtros, búsquedas y duplicados de poco valor; después, refuerza los enlaces hacia las URL que deban priorizar los rastreadores.
- Advertencia El rastreador recibe respuestas fallidas repetidamente Solución: Repara o redirige las URL más solicitadas por el rastreador que devuelvan respuestas 4xx/5xx y elimina los enlaces internos hacia las URL que deban seguir retiradas.
- Requiere revisión El rastreador encuentra demasiadas redirecciones Solución: Actualiza los enlaces internos y las entradas del mapa del sitio para que apunten directamente a las URL finales y reduce las cadenas de redirección a un solo salto.
- Requiere revisión El rastreador visita una URL ajena al conjunto previsto Solución: Añade la URL descubierta por el rastreador al conjunto canónico de enlaces internos y del mapa del sitio, o redirígela o elimínala si no es intencionada.
- Requiere revisión Una URL importante prevista no tiene visitas del rastreador Solución: Añade enlaces internos rastreables y una entrada canónica en el mapa del sitio para la URL prevista; después, comprueba las barreras de robots y autenticación.
- Advertencia La actividad del rastreador disminuye de forma considerable Solución: Compara la fecha de la caída con los cambios de robots, estado, mapa del sitio, despliegue y capacidad del servidor; después, restaura la ruta de rastreo afectada.
- Requiere revisión La actividad del rastreador aumenta de forma considerable Solución: Identifica el patrón de URL que provoca el aumento y controla los parámetros, trampas, redirecciones o rutas de rastreo duplicadas que se hayan expuesto recientemente.
- Requiere revisión Los tiempos de respuesta al rastreador son lentos Solución: Almacena en caché u optimiza los puntos de conexión más lentos para el rastreador y disminuye la latencia del origen antes de solicitar un rastreo nuevo.