무료 AI 크롤러 체커

웹사이트가 GPTBot, ClaudeBot, Google-Extended 같은 AI 크롤러를 차단하는지 확인하세요. robots.txt, 메타 태그, 헤더를 즉시 분석해 드립니다.

가입 불필요즉시 스캔즉시 결과 제공

AI 크롤러란 무엇인가요?

AI 크롤러는 OpenAI, Anthropic, Google 같은 회사들이 자사 AI 모델을 위해 콘텐츠를 인덱싱하는 데 사용하는 웹 봇입니다. 이러한 크롤러가 차단되면 귀사 브랜드는 AI 어시스턴트에게 보이지 않게 됩니다 — 읽을 수 없는 것을 인용할 수는 없으니까요.

robots.txt가 중요한 이유

  • 어떤 봇이 사이트 콘텐츠에 접근할 수 있는지 제어합니다
  • AI 크롤러를 차단하는 것은 AI 비가시성의 #1 원인입니다
  • 많은 사이트가 와일드카드 규칙으로 자기도 모르게 AI 봇을 차단합니다

확인 항목

  • AI 크롤러 user agent 11개에 대한 robots.txt 규칙
  • Meta robots 태그 (noindex, noai, noimageai)
  • X-Robots-Tag HTTP 헤더

자주 묻는 질문

AI 크롤러는 AI 기업이 웹 페이지를 가져올 때 쓰는 봇입니다. 모델 학습에 쓰이는 것, 어시스턴트 답변 뒤의 색인을 만드는 것, 사용자가 묻는 순간 링크를 여는 것이 각각 따로 있습니다. robots.txt가 답변을 담당하는 쪽을 막고 있으면 콘텐츠가 아무리 좋아도 ChatGPT, Claude, Gemini, Perplexity의 답변에 나타나지 않습니다. 브랜드가 AI 답변에서 빠지는 가장 흔한 이유입니다.

robots.txt 파일은 어떤 봇이 웹사이트에 접근할 수 있는지 제어합니다. 많은 사이트가 특정 Disallow 규칙이나 광범위한 와일드카드 차단을 통해 GPTBot, ClaudeBot, Google-Extended 같은 AI 크롤러를 자기도 모르게 차단합니다. 이는 AI 어시스턴트가 귀하의 콘텐츠를 읽지 못하고, 따라서 귀사 브랜드를 인용하거나 추천하지 않는다는 것을 의미합니다.

모두 11개의 user agent입니다. OpenAI: GPTBot(학습), OAI-SearchBot(ChatGPT 검색 색인), ChatGPT-User(사용자가 유발한 요청). Anthropic: ClaudeBot(학습), Claude-SearchBot(검색 색인), Claude-User(사용자가 유발한 요청), 그리고 오래된 파일에 남아 있는 레거시 토큰 anthropic-ai. 여기에 Google-Extended(Gemini 그라운딩 및 학습), PerplexityBot, Bytespider(ByteDance), CCBot(Common Crawl)이 더해집니다. 각각 독립적으로 제어되므로 인용해 주는 쪽만 허용하고 학습에 쓰는 쪽은 막을 수 있습니다.

robots.txt 외에도, 페이지는 HTML의 <meta name="robots"> 태그와 X-Robots-Tag HTTP 헤더를 통해 크롤러 액세스를 제한할 수 있습니다. noindex, nofollow, noai, noimageai 같은 지시문은 크롤러에게 콘텐츠를 인덱싱하거나 사용하지 말라고 알려줍니다. 저희 도구는 크롤러 액세스 제어의 세 계층을 모두 확인합니다.

네. GeoVector의 AI 크롤러 체커는 가입 없이 완전 무료로 이용하실 수 있습니다. 아무 URL이나 스캔하여 robots.txt의 AI 크롤러 상태, meta robots 태그, X-Robots-Tag 헤더 결과를 즉시 받아보실 수 있습니다. 더 깊이 있는 사이트 전체 감사와 지속적인 모니터링을 원하신다면 GeoVector의 프리미엄 플랜을 이용하세요.

이 도구가 확인하는 AI 크롤러

운영사별로 묶은 user agent 11개입니다. 핵심은 이들이 서로 독립적이라는 점입니다. 답변 엔진은 허용하고 학습 크롤러는 막는 설정은 모순이 아니라 정식으로 지원되는 구성입니다.

CrawlerOperatorUsed forIf you disallow it
GPTBotOpenAICrawling content that may be used to train OpenAI foundation models.Your pages are excluded from that training data.
OAI-SearchBotOpenAIBuilding the index behind ChatGPT's search answers.You drop out of ChatGPT search answers, though you can still appear as a navigational link.
ChatGPT-UserOpenAIFetching a page when a ChatGPT user or tool opens a link.ChatGPT can't open your pages on request during a conversation.
ClaudeBotAnthropicCollecting web content that may contribute to model training.Future material is signalled as out of scope for training.
Claude-SearchBotAnthropicIndexing pages to improve Claude's search results.Your content stops being indexed for Claude search.
Claude-UserAnthropicRetrieving a page when a Claude user asks about it.Claude can't pull your content into a user-directed answer.
anthropic-aiAnthropicA legacy token that still appears in older robots.txt files; Anthropic no longer lists it among its active agents.No effect on the three current agents. Harmless to leave in place.
Google-ExtendedGoogleControlling whether your content is used for Gemini grounding and training.You are removed from Gemini grounding. Google Search crawling, indexing, and ranking are unaffected.
PerplexityBotPerplexityIndexing pages so Perplexity can surface and cite them.Perplexity stops citing your pages.
BytespiderByteDanceCrawling for ByteDance's models and products.Your content is excluded from ByteDance's collection.
CCBotCommon CrawlBuilding the open Common Crawl corpus that many model builders train on.You are excluded from a dataset used well beyond any single vendor.

robots.txt 세 가지 패턴

정책에 맞는 것을 복사해 쓰세요. robots.txt는 각 호스트의 루트에 있으며, 서브도메인마다 별도의 파일이 필요합니다.

답변 엔진에 전면 개방
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

User-agent: PerplexityBot
Allow: /

Sitemap: https://example.com/sitemap.xml
답변은 허용, 학습은 거부
# Answer questions about us
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# But do not train on us
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

법무는 학습 거부를, 마케팅은 인용을 원할 때 대부분의 팀이 실제로 원하는 구성이 이 분리입니다. 다만 운영사가 두 역할을 구분해 둔 경우에만 동작합니다. OpenAI, Anthropic, Google은 구분합니다. PerplexityBot과 CCBot은 구분하지 않으므로 전체를 허용하거나 막는 양자택일입니다.

조용히 전부를 막는 패턴
User-agent: *
Disallow: /

User-agent: GPTBot
Allow: /

RFC 9309에 따르면 크롤러는 자기 이름과 일치하는 가장 구체적인 그룹만 따르고 나머지 그룹은 모두 무시합니다. 그래서 여기서 GPTBot은 자기 그룹만 읽고 허용됩니다. 반면 전용 그룹이 없는 크롤러는 — OAI-SearchBot과 Claude-SearchBot을 포함해 — 와일드카드 그룹에 걸려 전부 차단됩니다. 스테이징용 robots.txt가 출시 후에도 남아 있으면 정확히 이렇게 실패합니다.

페이지 단위 제어: meta robots와 X-Robots-Tag

robots.txt는 페이지를 가져가도 되는지를, 이 둘은 가져간 뒤 무엇을 해도 되는지를 정합니다. 그래서 완벽히 크롤 가능한 페이지가 결과에서는 빠져 있을 수 있습니다.

HTML head 안에
<meta name="robots" content="noindex, nofollow">
HTTP 응답 헤더로. PDF 등 HTML이 아닌 파일용
X-Robots-Tag: noindex

noai와 noimageai도 보게 됩니다. 이미지 호스팅 플랫폼에서 나온 관행이며 어떤 명세에도 없고, 위에 나열한 크롤러 중 지원을 명시한 곳도 없습니다. 그럼에도 보고하는 이유는 차단 효과가 있어서가 아니라 의도를 기록해 두기 때문입니다.

출처 및 명세

이 페이지의 모든 내용은 아래 1차 문서에 맞춰 확인합니다. 벤더가 규칙을 바꾸면 가장 먼저 그곳에 반영됩니다.

최종 검토일: . 벤더가 명세를 갱신할 때마다 이 페이지를 원문과 대조해 다시 확인합니다.

무료 AI 크롤러 체커 | GeoVector