Penyemak Crawler AI Percuma

Semak sama ada laman web anda menyekat crawler AI seperti GPTBot, ClaudeBot, dan Google-Extended. Kami akan menganalisis robots.txt, meta tag, dan pengepala anda dengan segera.

Tiada pendaftaran diperlukanImbasan segeraKeputusan segera

Apakah itu Crawler AI?

Crawler AI ialah bot web yang digunakan oleh syarikat seperti OpenAI, Anthropic, dan Google untuk mengindeks kandungan untuk model AI mereka. Apabila crawler ini disekat, jenama anda menjadi tidak kelihatan kepada pembantu AI β€” mereka tidak boleh memetik apa yang mereka tidak boleh baca.

Mengapa robots.txt Penting

  • Mengawal bot mana yang boleh mengakses kandungan laman anda
  • Menyekat crawler AI ialah punca #1 kepada ketidakkelihatan AI
  • Banyak laman menyekat bot AI tanpa sedar dengan peraturan wildcard

Apa Yang Kami Semak

  • Peraturan robots.txt untuk 11 user agent perangkak AI
  • Tag meta robots (noindex, noai, noimageai)
  • Pengepala HTTP X-Robots-Tag

Soalan Lazim

Perangkak AI ialah bot yang digunakan syarikat AI untuk mengambil halaman web β€” sesetengahnya untuk melatih model, sesetengahnya untuk membina indeks di sebalik jawapan pembantu AI, dan sesetengahnya untuk membuka pautan sebaik sahaja pengguna bertanya. Jika robots.txt anda menyekat yang menjawab, kandungan anda tidak akan muncul dalam jawapan ChatGPT, Claude, Gemini atau Perplexity, sebaik mana pun ia ditulis. Itulah sebab paling lazim sesuatu jenama tiada dalam jawapan AI.

Fail robots.txt anda mengawal bot mana yang boleh mengakses laman web anda. Banyak laman menyekat crawler AI seperti GPTBot, ClaudeBot, dan Google-Extended tanpa sedar, sama ada melalui peraturan Disallow khusus atau blok wildcard yang luas. Ini bermakna pembantu AI tidak boleh membaca kandungan anda dan tidak akan pernah memetik atau mengesyorkan jenama anda.

Sebelas user agent kesemuanya. OpenAI: GPTBot (latihan), OAI-SearchBot (indeks carian ChatGPT) dan ChatGPT-User (permintaan yang dicetuskan pengguna). Anthropic: ClaudeBot (latihan), Claude-SearchBot (pengindeksan carian), Claude-User (permintaan pengguna), serta token lama anthropic-ai yang masih terdapat dalam fail lama. Selain itu Google-Extended (grounding dan latihan Gemini), PerplexityBot, Bytespider (ByteDance) dan CCBot (Common Crawl). Semuanya dikawal secara berasingan, jadi anda boleh membenarkan yang memetik anda dan menyekat yang melatih model daripada kandungan anda.

Selain daripada robots.txt, halaman boleh mengehadkan akses crawler melalui tag <meta name="robots"> dalam HTML dan pengepala HTTP X-Robots-Tag. Arahan seperti noindex, nofollow, noai, dan noimageai memberitahu crawler untuk tidak mengindeks atau menggunakan kandungan anda. Alat kami menyemak ketiga-tiga lapisan kawalan akses crawler.

Ya. Penyemak crawler AI GeoVector sepenuhnya percuma tanpa pendaftaran diperlukan. Anda boleh mengimbas mana-mana URL dan mendapat keputusan segera yang menunjukkan status crawler AI robots.txt anda, tag meta robots, dan pengepala X-Robots-Tag. Untuk audit seluruh laman yang lebih mendalam dan pemantauan berterusan, GeoVector menawarkan pelan premium.

Perangkak AI yang disemak alat ini

Sebelas user agent, dikumpulkan mengikut pengendali. Perkara pentingnya ialah semuanya bebas antara satu sama lain: membenarkan enjin jawapan sambil menyekat perangkak latihan ialah konfigurasi yang disokong, bukan percanggahan.

CrawlerOperatorUsed forIf you disallow it
GPTBotOpenAICrawling content that may be used to train OpenAI foundation models.Your pages are excluded from that training data.
OAI-SearchBotOpenAIBuilding the index behind ChatGPT's search answers.You drop out of ChatGPT search answers, though you can still appear as a navigational link.
ChatGPT-UserOpenAIFetching a page when a ChatGPT user or tool opens a link.ChatGPT can't open your pages on request during a conversation.
ClaudeBotAnthropicCollecting web content that may contribute to model training.Future material is signalled as out of scope for training.
Claude-SearchBotAnthropicIndexing pages to improve Claude's search results.Your content stops being indexed for Claude search.
Claude-UserAnthropicRetrieving a page when a Claude user asks about it.Claude can't pull your content into a user-directed answer.
anthropic-aiAnthropicA legacy token that still appears in older robots.txt files; Anthropic no longer lists it among its active agents.No effect on the three current agents. Harmless to leave in place.
Google-ExtendedGoogleControlling whether your content is used for Gemini grounding and training.You are removed from Gemini grounding. Google Search crawling, indexing, and ranking are unaffected.
PerplexityBotPerplexityIndexing pages so Perplexity can surface and cite them.Perplexity stops citing your pages.
BytespiderByteDanceCrawling for ByteDance's models and products.Your content is excluded from ByteDance's collection.
CCBotCommon CrawlBuilding the open Common Crawl corpus that many model builders train on.You are excluded from a dataset used well beyond any single vendor.

Tiga corak robots.txt

Salin yang sepadan dengan dasar anda. robots.txt terletak di akar setiap hos, dan setiap subdomain memerlukan failnya sendiri.

Terbuka kepada enjin jawapan
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://example.com/sitemap.xml
Boleh menjawab, tidak boleh melatih
# Answer questions about us
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# But do not train on us
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Pembahagian inilah yang sebenarnya dikehendaki kebanyakan pasukan apabila bahagian undang-undang mahu keluar daripada latihan manakala pemasaran mahu dipetik. Ia hanya berkesan apabila pengendali memisahkan kedua-dua peranan itu: OpenAI, Anthropic dan Google memisahkannya. PerplexityBot dan CCBot tidak, jadi bagi kedua-duanya ia hanya pilihan ya atau tidak.

Corak yang menyekat segalanya secara senyap
User-agent: *
Disallow: /

User-agent: GPTBot
Allow: /

Di bawah RFC 9309, sesebuah perangkak mematuhi hanya kumpulan paling khusus yang sepadan dengan namanya sendiri dan mengabaikan semua kumpulan lain. Jadi GPTBot di sini membaca kumpulannya sahaja dan dibenarkan, manakala setiap perangkak tanpa kumpulan bernama β€” termasuk OAI-SearchBot dan Claude-SearchBot β€” jatuh ke dalam kumpulan kad liar dan disekat. Fail robots.txt pelayan ujian yang terbawa ke pengeluaran gagal tepat dengan cara ini.

Kawalan peringkat halaman: meta robots dan X-Robots-Tag

robots.txt menentukan sama ada halaman boleh diambil. Kedua-dua ini pula menentukan apa yang boleh dilakukan selepas ia diambil β€” sebab itulah sesebuah halaman boleh dirangkak sepenuhnya tetapi masih tidak ditunjukkan.

Dalam head HTML
<meta name="robots" content="noindex, nofollow">
Sebagai pengepala respons HTTP, untuk PDF dan fail bukan HTML
X-Robots-Tag: noindex

Anda juga akan terjumpa noai dan noimageai. Kedua-duanya berasal daripada platform hos imej dan bukan sebahagian daripada mana-mana spesifikasi; tiada satu pun perangkak di atas mendokumenkan sokongan untuknya. Kami melaporkannya kerana ia merakam niat anda, bukan kerana ia menyekat apa-apa.

Sumber dan spesifikasi

Semua kandungan di halaman ini disemak terhadap dokumentasi utama di bawah. Apabila vendor mengubah sesuatu peraturan, di situlah ia muncul dahulu.

Disemak terakhir pada . Kami menyemak semula halaman ini terhadap spesifikasi asal setiap kali vendor mengemas kininya.

Penyemak Crawler AI Percuma | GeoVector