Pemeriksa Perayap AI

Free, no signup. “Am I letting ChatGPT, Claude, Perplexity, and Google’s AI read this page — and did I mean to?” Enter a URL and get the answer for every major AI crawler, with the exact robots.txt rule that decided it.

Five separate tests · registry 2026-07-29

Crawler access is only the first layer

Permission

Is the crawler allowed?

Extractability

Are useful facts present in raw HTML?

Renderability

Does JavaScript successfully expose them?

Operability

Can an agent identify and use semantic controls?

Commerce readiness

Do page, schema, feed and checkout facts agree?

HTML remains primary. llms.txt, UCP, and other protocol files are optional distribution layers and cannot compensate for inaccessible or unextractable HTML.

Validate a protocol response

Upload verified-bot log evidence

Expected columns: crawler, timestamp, url, status, verification. A user-agent string alone is never treated as verified identity.

No log evidence uploaded.

robots.txt is advisory, not a lock. It tells cooperating crawlers what you prefer — it does not enforce anything. Some crawlers below are reported to ignore it (flagged ⚠). To actually stop a crawler, block it at your CDN/WAF and verify it's genuine by IP.

Pemeriksaan dijalankan dari server kami; kami mengambil URL yang Anda masukkan dan tidak menyimpan hasilnya. Penghitung hasil anonim per proses dapat digunakan untuk riset agregat; URL, domain, IP, dan pengenal tidak pernah disertakan, dan statistik tidak dirilis jika jumlah proses kurang dari 100.

Masukan
Laporkan bug

Ada yang rusak di Pemeriksa Perayap AI? Beri tahu kami apa yang terjadi—laporan ini langsung masuk ke antrean triase privat, bukan daftar publik.

Yang akan dikirim
 Input alat, unggahan, sumber yang ditempel, hasil lengkap, parameter kueri, dan fragmen URL tidak dilampirkan secara otomatis. Anda dapat mengedit atau menghapus kutipan yang dipilih di atas. Metadata browser dan antipenyalahgunaan diproses untuk mencegah spam. 
Set your posture → robots.txt block

Pick what to block; copy the generated rules into your robots.txt.

  

Blocking here means “documented posture,” not enforcement — a cooperating crawler will honor it; a hostile one may not.

Crawler roster last reviewed . Data is hand-maintained and editable (src/data/ai-crawlers.json).

Tentang alat ini

verifiable / unverifiable tag — apakah operator menerbitkan IP ranges atau

halaman sekarang untuk jawaban dan cite) dan Model pelatihan (bot yang kumpulkan halaman untuk latih

robots.txt adalah advisory, tidak lock. Ini tells cooperating perayap apa Anda prefer — ini melakukan

Fitur

  • Home › Alat › AI-Perayap Akses Pemeriksa
  • way untuk periksa identitas — ini tidak jaminan apa pun given permintaan adalah genuine.
  • robots.txt adalah advisory, tidak lock — ini tells cooperating perayap apa
  • memeriksa untuk llms.TXT, dan evaluates setiap perayap di roster terhadap Anda URL.
  • Anda prefer dan enforces tidak ada. perayap tagged "⚠ mengabaikan robots" mungkin ambil "Diblokir" halaman anyway;

Cara kerja

Berjalan terhadap apa pun publik URL — tidak ada sign-di, tidak ada disimpan; share diperiksa URL melalui copyable tautan. balik DNS so Anda dapat konfirmasi nyata hit. "Unverifiable" berarti pengguna-agen dapat menjadi spoofed dan Perayap grouped oleh tujuan — langsung retrieval & citation vs. model pelatihan — so Anda atur setiap posture pada tujuan. Posture generator: tick pelatihan dan/or retrieval, atur jalur, dan salin ready robots.txt block. Ini tidak tambah Googlebot larang karena yang akan prevent Google dari perayapan terdampak URLs.

Batasan

  • Tidak pada sendiri-nya. GPTBot adalah OpenAI’s pelatihan perayap — memblokir ini opts Anda konten keluar dari future model pelatihan, tetapi ini tidak hentikan langsung-retrieval bot yang ambil halaman untuk jawaban pertanyaan dan cite sumber. Itu adalah OAI-SearchBot (ChatGPT pencarian hasil dan citations) dan ChatGPT-Pengguna ( halaman diambil ketika pengguna mengikuti tautan). Untuk stay keluar dari ChatGPT menjawab Anda akan memiliki untuk block itu terlalu, yang pemeriksa daftar secara terpisah di bawah "Langsung retrieval & jawaban citation."
  • Di sana tidak ada terpisah AI Overviews perayap, dan Google tidak offer penuh AI-Overviews-hanya opt-keluar yang mempertahankan halaman jika tidak tidak berubah di Pencarian. Memblokir Googlebot prevents perayapan tetapi tidak oleh dirinya sendiri jaminan yang diketahui URL disappears dari Pencarian. Snippet kontrol juga affect ordinary Pencarian snippets. Google-Extended secara terpisah kontrol Gemini/Vertex pelatihan dan grounding, tidak Pencarian atau AI Overviews.
  • tidak enforce anything. Beberapa perayap di bawah adalah reported untuk abaikan ini (flagged ⚠). Untuk sebenarnya hentikan
  • perayap adalah split menjadi Langsung retrieval & jawaban citation (bot yang ambil

Pertanyaan umum

Apakah memblokir GPTBot mencegah ChatGPT mengutip situs saya?

Tidak dengan sendirinya. GPTBot adalah perayap pelatihan OpenAI—memblokirnya mencegah konten Anda digunakan untuk pelatihan sistem AI mendatang, tetapi tidak menghentikan perayap pengambilan langsung yang mengambil halaman untuk menjawab pertanyaan dan mengutip sumber. Perayap tersebut adalah OAI-SearchBot (untuk hasil penelusuran dan kutipan ChatGPT) serta ChatGPT-User (ketika pengguna mengikuti tautan, sebuah halaman diambil). Agar tidak muncul dalam jawaban ChatGPT, Anda juga harus memblokir keduanya; pemeriksa mencantumkannya secara terpisah di bawah “Pengambilan langsung dan kutipan jawaban”.

Bisakah saya menolak Google AI Overviews dengan robots.txt?

Tidak ada perayap AI Overviews terpisah, dan Google tidak menawarkan pilihan keluar yang hanya berlaku untuk AI Overviews sambil membiarkan halaman tetap tidak berubah dalam Penelusuran. Memblokir Googlebot mencegah perayapan, tetapi tidak dengan sendirinya menjamin bahwa URL yang sudah diketahui akan hilang dari Penelusuran. Kontrol cuplikan juga memengaruhi cuplikan Penelusuran biasa. Google-Extended mengatur pelatihan dan pembumian Gemini/Vertex secara terpisah, bukan Penelusuran atau AI Overviews.

Apakah robots.txt benar-benar menghentikan perayap AI?

robots.txt bersifat anjuran, bukan kunci. Berkas ini memberi tahu perayap yang kooperatif tentang preferensi Anda, tetapi tidak menegakkannya. Pengelola yang mematuhi aturan biasanya menghormatinya, tetapi beberapa perayap dilaporkan mengabaikannya—pemeriksa menandai mereka dengan label “⚠ mengabaikan robots”. Untuk benar-benar menghentikan perayap, blokir aksesnya di CDN atau WAF, lalu verifikasi bahwa permintaan itu asli berdasarkan IP, bukan hanya mempercayai teks agen-pengguna.

Mengapa perayap ditampilkan sebagai “tidak dapat diverifikasi”?

Label “dapat diverifikasi” atau “tidak dapat diverifikasi” menunjukkan apakah pengelola menerbitkan cara untuk memeriksa klaim tentang perayap—berupa rentang IP terkini atau DNS balik dengan konfirmasi maju (FCrDNS)—yang dicocokkan dengan daftar Bot Verifier. Agen-pengguna saja selalu dapat dipalsukan. Anthropic kini menerbitkan daftar IP perayap resmi di claude.com/crawling/bots.json, sehingga lalu lintas Claude dapat diperiksa kecocokannya dengan rentang yang diterbitkan; cara ini berbeda dari konfirmasi DNS balik.

Apakah berkas llms.txt mengubah kesimpulan apa pun?

Tidak. llms.txt adalah konvensi komunitas yang diusulkan, dan tidak ada perayap AI besar yang diketahui membacanya. Karena itu, keberadaan atau ketiadaannya tidak memengaruhi apakah perayap diizinkan atau diblokir. Pemeriksa melaporkan keberadaan llms.txt di domain hanya sebagai informasi; semua keputusan akses ditentukan oleh robots.txt.

Langkah berikutnyaGenerator robots.txt — generate the corrected version. Panduan tersedia dalam bahasa Inggris.