Permission
Is the crawler allowed?
Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.
Is the crawler allowed?
Are useful facts present in raw HTML?
Does JavaScript successfully expose them?
Can an agent identify and use semantic controls?
Do page, schema, feed and checkout facts agree?
HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.
Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.
No log evidence uploaded.
Pemeriksaan dijalankan dari server kami; kami mengambil URL yang Anda masukkan dan tidak menyimpan hasilnya. Penghitung hasil anonim per proses dapat digunakan untuk riset agregat; URL, domain, IP, dan pengenal tidak pernah disertakan, dan statistik tidak dirilis jika jumlah proses kurang dari 100.
+ menyimpan situs atau halaman saat ini. Gunakan ☆ di samping situs, halaman, atau daftar tersimpan untuk menambahkannya ke favorit. Riwayat pemeriksaan terbaru muncul di bawah.
Target diisi dari pilihan lokal Anda.
Target tersimpan, daftar bernama, dan ringkasan pemeriksaan terbaru hanya tersimpan di browser ini.
nosnippet, max-snippet, and data-nosnippet can limit preview/use but also affect normal Search snippets. Google-Extended only controls Gemini/Vertex training and grounding, not Search or Overviews.
nosnippet can block content from generative-model context without preventing title-based discovery, while Bing documents AI-answer/training effects for noarchive and noindex. Use the page audit or extension to inspect those meta and HTTP-header directives.
These fetch pages to answer questions and cite sources. Blocking a cooperating crawler can prevent that crawler from accessing the page, but it does not guarantee absence from every answer or citation.
These collect pages for model training. A provider's documented robots control governs future crawling; it does not remove content already collected or guarantee deletion from an existing training dataset.
Pick what to block; copy the generated rules into your robots.txt.
Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.
Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).
verifiable / unverifiable tag — apakah operator menerbitkan IP ranges atau
halaman sekarang untuk jawaban dan cite) dan Model pelatihan (bot yang kumpulkan halaman untuk latih
robots.txt adalah advisory, tidak lock. Ini tells cooperating perayap apa Anda prefer — ini melakukan
Berjalan terhadap apa pun publik URL — tidak ada sign-di, tidak ada disimpan; share diperiksa URL melalui copyable tautan. balik DNS so Anda dapat konfirmasi nyata hit. "Unverifiable" berarti pengguna-agen dapat menjadi spoofed dan Perayap grouped oleh tujuan — langsung retrieval & citation vs. model pelatihan — so Anda atur setiap posture pada tujuan. Posture generator: tick pelatihan dan/or retrieval, atur jalur, dan salin ready robots.txt block. Ini tidak tambah Googlebot larang karena yang akan prevent Google dari perayapan terdampak URLs.
Tidak dengan sendirinya. GPTBot adalah perayap pelatihan OpenAI—memblokirnya mencegah konten Anda digunakan untuk pelatihan sistem AI mendatang, tetapi tidak menghentikan perayap pengambilan langsung yang mengambil halaman untuk menjawab pertanyaan dan mengutip sumber. Perayap tersebut adalah OAI-SearchBot (untuk hasil penelusuran dan kutipan ChatGPT) serta ChatGPT-User (ketika pengguna mengikuti tautan, sebuah halaman diambil). Agar tidak muncul dalam jawaban ChatGPT, Anda juga harus memblokir keduanya; pemeriksa mencantumkannya secara terpisah di bawah “Pengambilan langsung dan kutipan jawaban”.
Tidak ada perayap AI Overviews terpisah, dan Google tidak menawarkan pilihan keluar yang hanya berlaku untuk AI Overviews sambil membiarkan halaman tetap tidak berubah dalam Penelusuran. Memblokir Googlebot mencegah perayapan, tetapi tidak dengan sendirinya menjamin bahwa URL yang sudah diketahui akan hilang dari Penelusuran. Kontrol cuplikan juga memengaruhi cuplikan Penelusuran biasa. Google-Extended mengatur pelatihan dan pembumian Gemini/Vertex secara terpisah, bukan Penelusuran atau AI Overviews.
robots.txt bersifat anjuran, bukan kunci. Berkas ini memberi tahu perayap yang kooperatif tentang preferensi Anda, tetapi tidak menegakkannya. Pengelola yang mematuhi aturan biasanya menghormatinya, tetapi beberapa perayap dilaporkan mengabaikannya—pemeriksa menandai mereka dengan label “⚠ mengabaikan robots”. Untuk benar-benar menghentikan perayap, blokir aksesnya di CDN atau WAF, lalu verifikasi bahwa permintaan itu asli berdasarkan IP, bukan hanya mempercayai teks agen-pengguna.
Label “dapat diverifikasi” atau “tidak dapat diverifikasi” menunjukkan apakah pengelola menerbitkan cara untuk memeriksa klaim tentang perayap—berupa rentang IP terkini atau DNS balik dengan konfirmasi maju (FCrDNS)—yang dicocokkan dengan daftar Bot Verifier. Agen-pengguna saja selalu dapat dipalsukan. Anthropic kini menerbitkan daftar IP perayap resmi di claude.com/crawling/bots.json, sehingga lalu lintas Claude dapat diperiksa kecocokannya dengan rentang yang diterbitkan; cara ini berbeda dari konfirmasi DNS balik.
Tidak. llms.txt adalah konvensi komunitas yang diusulkan, dan tidak ada perayap AI besar yang diketahui membacanya. Karena itu, keberadaan atau ketiadaannya tidak memengaruhi apakah perayap diizinkan atau diblokir. Pemeriksa melaporkan keberadaan llms.txt di domain hanya sebagai informasi; semua keputusan akses ditentukan oleh robots.txt.