기술·구조

AI 검색봇이란? GPTBot·ClaudeBot·PerplexityBot 을 막을 때와 열 때 벌어지는 일

AI 검색봇(AI crawler)은 AI 서비스가 학습 데이터 수집이나 검색 답변 생성을 위해 웹페이지를 가져가는 크롤러다. 학습용과 검색용 봇의 구분표, robots.txt 허용·차단 예시, 차단 시 AI 답변에서 빠지는 결과, 서버 로그로 방문을 확인하는 법까지.

최종 수정 2026-09-15 · 약 3900자 · 연결 11개 · 어딧지 리서치

AI 검색봇이란 무엇인가

AI 검색봇(AI crawler, AI 크롤러)이란 생성형 AI 서비스가 웹페이지를 가져가기 위해 운영하는 자동 프로그램으로, 목적에 따라 ① 모델 학습용 데이터 수집, ② 검색 답변에 쓸 색인 구축, ③ 사용자의 요청으로 특정 페이지를 즉시 읽어 오는 것 세 가지로 나뉜다. 주요 AI 회사는 목적별로 봇 이름(User-agent)을 분리해 사이트 운영자가 따로 허용·차단할 수 있게 한다.

이 구분을 모르고 "AI 봇 전부 차단"을 걸면 학습에서 빠지는 대신 AI 검색 답변의 출처에서도 빠진다. 반대로 검색용 봇만 열어 두면 학습은 거부하면서 인용은 받을 수 있다. 사이트마다 원하는 조합이 다르므로 이름별로 판단해야 한다.

주요 AI 봇은 무엇이며 어떻게 구분하는가?

각 회사가 공개한 문서 기준으로 정리했다. 봇 이름과 역할은 바뀔 수 있으므로 원문 문서를 주기적으로 확인한다.

봇 이름(User-agent)운영용도차단하면
GPTBotOpenAI모델 학습용 수집학습 데이터에서 제외. ChatGPT 검색 인용과는 별개
OAI-SearchBotOpenAIChatGPT 검색 색인ChatGPT 검색 결과·출처에서 빠짐
ChatGPT-UserOpenAI사용자 요청 시 페이지 즉시 읽기사용자가 링크를 붙여 물어도 읽지 못함
ClaudeBotAnthropic모델 학습용 수집학습 데이터에서 제외
Claude-SearchBotAnthropic검색 답변용 색인Claude 의 검색 인용에서 빠짐
Claude-UserAnthropic사용자 요청 시 페이지 읽기사용자가 요청한 페이지를 읽지 못함
PerplexityBotPerplexity검색 색인Perplexity 답변·출처에서 빠짐
Perplexity-UserPerplexity사용자 요청 시 페이지 읽기사용자가 요청한 페이지를 읽지 못함
Google-ExtendedGoogleGemini 학습·그라운딩 사용 여부 제어(토큰)구글 검색·AI 오버뷰 노출에는 영향 없음
GooglebotGoogle구글 검색 색인(AI 오버뷰 포함)구글 검색과 AI 오버뷰 모두에서 빠짐
BingbotMicrosoftBing 검색 색인(Copilot 답변에도 사용)Bing 검색·Copilot 인용에서 빠짐
CCBotCommon Crawl공개 웹 아카이브(여러 AI 학습에 활용)해당 아카이브 기반 학습에서 제외

핵심 원칙: 구글 AI 오버뷰는 Google-Extended 가 아니라 Googlebot 이 담당한다. Google-Extended 를 막아도 AI 오버뷰 노출은 그대로이고, Googlebot 을 막으면 검색 자체에서 사라진다.

robots.txt 는 어떻게 쓰는가?

robots.txt 는 사이트 루트(https://www.example.com/robots.txt)에 두는 텍스트 파일이며, User-agent 별로 Allow/Disallow 규칙을 적는다. 우리 회사 사이트에서 흔히 쓰는 세 가지 조합이다.

  • [A] 검색·인용은 허용, 학습만 거부 — 가장 흔한 사업자 선택: User-agent: GPTBot / Disallow: / … User-agent: ClaudeBot / Disallow: / … User-agent: Google-Extended / Disallow: / … User-agent: CCBot / Disallow: / … (OAI-SearchBot·Claude-SearchBot·PerplexityBot·Googlebot·Bingbot 은 규칙을 두지 않아 기본 허용)
  • [B] 전부 허용 — AI 노출을 최우선으로: 아무 AI 봇 규칙도 두지 않는다. 다만 관리자·검색결과·장바구니 경로는 모든 봇에 Disallow.
  • [C] 일부 경로만 제한 — 가격표·다운로드 자료는 학습 거부, 소개·FAQ 는 허용: User-agent: GPTBot / Disallow: /downloads/ / Allow: / 처럼 경로 단위로.
  • 문법 주의: User-agent 그룹마다 빈 줄로 구분, Disallow: (값 없음)은 "모두 허용", Disallow: / 는 "모두 차단". 대소문자·오타(GPTbot 등)는 무시되어 규칙이 적용되지 않는다.
  • robots.txt 는 "요청"이다. 주요 AI 회사 봇은 준수한다고 밝혔지만, 무명 스크래퍼는 무시할 수 있다. 이런 경우는 서버·CDN 의 방화벽 규칙으로 막는다.

AI 봇을 차단하면 무엇이 빠지는가?

차단 대상즉시 나타나는 결과흔한 오해
OAI-SearchBotChatGPT 검색 답변의 출처 목록에서 우리 사이트가 사라짐GPTBot 만 막으면 되는 줄 알고 함께 막는 경우
PerplexityBotPerplexity 답변에서 인용 중단학습용 봇으로 오해
Googlebot(전체 또는 핵심 경로)구글 검색·AI 오버뷰·디스커버 모두에서 사라짐AI 오버뷰만 빼려다 검색까지 잃음
Google-ExtendedGemini 학습·그라운딩에서만 제외AI 오버뷰가 빠질 것으로 오해
ChatGPT-User·Claude-User고객이 우리 URL 을 AI 에 붙여 물어도 "읽을 수 없다"고 답함검색 인용과 무관한 것으로 오해
모든 봇 Disallow: /검색·AI 전부에서 사라짐(사이트 리뉴얼 후 남는 대표적 사고)개발 서버 설정이 운영에 그대로 배포됨

어딧지 무료 점검은 robots.txt 를 읽어 학습용·검색용 봇별 허용 상태를 표로 보여 주고, 검색용 봇이 막혀 있으면 AI 인용에서 빠질 수 있다고 표시한다.

AI 봇이 실제로 다녀갔는지는 어떻게 확인하는가?

  • 서버 접근 로그: User-agent 문자열에 GPTBot·OAI-SearchBot·ClaudeBot·PerplexityBot 등이 포함된 요청을 필터한다. 어떤 URL 을 얼마나 자주 가져갔는지 볼 수 있다.
  • CDN·호스팅 분석: 봇 트래픽을 분류해 보여 주는 대시보드가 있으면 AI 봇 항목을 확인한다.
  • 위장 확인: User-agent 는 누구나 흉내 낼 수 있다. OpenAI·Anthropic·Perplexity·Google 은 자사 봇의 IP 대역 또는 역DNS 확인 방법을 문서로 공개하므로, 의심되면 대조한다.
  • AI 유입 확인: 웹 분석 도구에서 referrer 가 chatgpt.com·perplexity.ai 등인 세션을 따로 본다. 인용은 되지만 클릭이 없는 경우와 구분할 수 있다.
  • 서치콘솔: 구글 봇의 크롤링 통계는 서치콘솔 설정 › 크롤링 통계에서 본다. AI 오버뷰 클릭은 실적 보고서에 검색 트래픽으로 합산된다.

차단·허용 정책은 어떻게 정하는가?

판단 기준은 하나다. "우리 콘텐츠가 AI 답변에 인용되는 것이 사업에 이익인가, 아니면 콘텐츠 자체가 상품이라 무단 사용이 손해인가." 서비스업·제조업·병원·학원처럼 "찾아오게 하는 것"이 목적인 회사는 검색용 봇을 여는 편이 유리하고(GEO의 첫 단계), 유료 콘텐츠·데이터가 상품인 회사는 경로별로 제한한다.

어느 쪽이든 학습용과 검색용을 구분해 적고, 분기마다 각 회사 문서에서 봇 이름 변경을 확인하며, 리뉴얼·이전 후에는 robots.txt 가 운영 값인지 반드시 확인한다. llms.txt 는 크롤러가 막히면 읽히지 않으므로 보조 수단일 뿐이다.

자주 묻는 질문

GPTBot 을 막으면 ChatGPT 에서 우리 회사가 안 나오나요?

아닙니다. GPTBot 은 학습용이고 ChatGPT 검색 인용은 OAI-SearchBot 이 담당합니다. 학습만 거부하고 인용은 받으려면 GPTBot 만 Disallow 하고 OAI-SearchBot 은 열어 두면 됩니다.

Google-Extended 를 막으면 AI 오버뷰에서 빠지나요?

아닙니다. Google-Extended 는 Gemini 학습·그라운딩 사용 여부만 제어하며, 구글 검색과 AI 오버뷰는 Googlebot 이 담당합니다. AI 오버뷰에서 발췌를 제한하려면 nosnippet·max-snippet 같은 메타 태그를 씁니다(피처드 스니펫에도 같은 태그가 적용됩니다).

robots.txt 로 막으면 AI 회사가 정말 안 가져가나요?

주요 AI 회사는 자사 봇이 robots.txt 를 준수한다고 문서로 밝혔습니다. 다만 무명 스크래퍼는 무시할 수 있어, 그런 경우는 서버·CDN 방화벽으로 막아야 합니다.

AI 봇 트래픽이 서버에 부담을 주면 어떻게 하나요?

전면 차단 대신 Crawl-delay(일부 봇만 지원)나 이미지·다운로드 경로 제한, CDN 의 속도 제한을 먼저 검토하세요. 검색용 봇까지 막으면 AI 인용을 잃습니다.

참고 자료

  1. OpenAI — 크롤러 안내(GPTBot·OAI-SearchBot·ChatGPT-User)
  2. Perplexity — 크롤러 안내(PerplexityBot·Perplexity-User)
  3. Google Search Central — Google 크롤러 개요(Googlebot·Google-Extended)
  4. Google Search Central — robots.txt 작성 방법