AI 검색봇이란? GPTBot·ClaudeBot·PerplexityBot 을 막을 때와 열 때 벌어지는 일
AI 검색봇(AI crawler)은 AI 서비스가 학습 데이터 수집이나 검색 답변 생성을 위해 웹페이지를 가져가는 크롤러다. 학습용과 검색용 봇의 구분표, robots.txt 허용·차단 예시, 차단 시 AI 답변에서 빠지는 결과, 서버 로그로 방문을 확인하는 법까지.
AI 검색봇이란 무엇인가
AI 검색봇(AI crawler, AI 크롤러)이란 생성형 AI 서비스가 웹페이지를 가져가기 위해 운영하는 자동 프로그램으로, 목적에 따라 ① 모델 학습용 데이터 수집, ② 검색 답변에 쓸 색인 구축, ③ 사용자의 요청으로 특정 페이지를 즉시 읽어 오는 것 세 가지로 나뉜다. 주요 AI 회사는 목적별로 봇 이름(User-agent)을 분리해 사이트 운영자가 따로 허용·차단할 수 있게 한다.
이 구분을 모르고 "AI 봇 전부 차단"을 걸면 학습에서 빠지는 대신 AI 검색 답변의 출처에서도 빠진다. 반대로 검색용 봇만 열어 두면 학습은 거부하면서 인용은 받을 수 있다. 사이트마다 원하는 조합이 다르므로 이름별로 판단해야 한다.
주요 AI 봇은 무엇이며 어떻게 구분하는가?
각 회사가 공개한 문서 기준으로 정리했다. 봇 이름과 역할은 바뀔 수 있으므로 원문 문서를 주기적으로 확인한다.
| 봇 이름(User-agent) | 운영 | 용도 | 차단하면 |
|---|---|---|---|
| GPTBot | OpenAI | 모델 학습용 수집 | 학습 데이터에서 제외. ChatGPT 검색 인용과는 별개 |
| OAI-SearchBot | OpenAI | ChatGPT 검색 색인 | ChatGPT 검색 결과·출처에서 빠짐 |
| ChatGPT-User | OpenAI | 사용자 요청 시 페이지 즉시 읽기 | 사용자가 링크를 붙여 물어도 읽지 못함 |
| ClaudeBot | Anthropic | 모델 학습용 수집 | 학습 데이터에서 제외 |
| Claude-SearchBot | Anthropic | 검색 답변용 색인 | Claude 의 검색 인용에서 빠짐 |
| Claude-User | Anthropic | 사용자 요청 시 페이지 읽기 | 사용자가 요청한 페이지를 읽지 못함 |
| PerplexityBot | Perplexity | 검색 색인 | Perplexity 답변·출처에서 빠짐 |
| Perplexity-User | Perplexity | 사용자 요청 시 페이지 읽기 | 사용자가 요청한 페이지를 읽지 못함 |
| Google-Extended | Gemini 학습·그라운딩 사용 여부 제어(토큰) | 구글 검색·AI 오버뷰 노출에는 영향 없음 | |
| Googlebot | 구글 검색 색인(AI 오버뷰 포함) | 구글 검색과 AI 오버뷰 모두에서 빠짐 | |
| Bingbot | Microsoft | Bing 검색 색인(Copilot 답변에도 사용) | Bing 검색·Copilot 인용에서 빠짐 |
| CCBot | Common Crawl | 공개 웹 아카이브(여러 AI 학습에 활용) | 해당 아카이브 기반 학습에서 제외 |
핵심 원칙: 구글 AI 오버뷰는 Google-Extended 가 아니라 Googlebot 이 담당한다. Google-Extended 를 막아도 AI 오버뷰 노출은 그대로이고, Googlebot 을 막으면 검색 자체에서 사라진다.
robots.txt 는 어떻게 쓰는가?
robots.txt 는 사이트 루트(https://www.example.com/robots.txt)에 두는 텍스트 파일이며, User-agent 별로 Allow/Disallow 규칙을 적는다. 우리 회사 사이트에서 흔히 쓰는 세 가지 조합이다.
- [A] 검색·인용은 허용, 학습만 거부 — 가장 흔한 사업자 선택: User-agent: GPTBot / Disallow: / … User-agent: ClaudeBot / Disallow: / … User-agent: Google-Extended / Disallow: / … User-agent: CCBot / Disallow: / … (OAI-SearchBot·Claude-SearchBot·PerplexityBot·Googlebot·Bingbot 은 규칙을 두지 않아 기본 허용)
- [B] 전부 허용 — AI 노출을 최우선으로: 아무 AI 봇 규칙도 두지 않는다. 다만 관리자·검색결과·장바구니 경로는 모든 봇에 Disallow.
- [C] 일부 경로만 제한 — 가격표·다운로드 자료는 학습 거부, 소개·FAQ 는 허용: User-agent: GPTBot / Disallow: /downloads/ / Allow: / 처럼 경로 단위로.
- 문법 주의: User-agent 그룹마다 빈 줄로 구분, Disallow: (값 없음)은 "모두 허용", Disallow: / 는 "모두 차단". 대소문자·오타(GPTbot 등)는 무시되어 규칙이 적용되지 않는다.
- robots.txt 는 "요청"이다. 주요 AI 회사 봇은 준수한다고 밝혔지만, 무명 스크래퍼는 무시할 수 있다. 이런 경우는 서버·CDN 의 방화벽 규칙으로 막는다.
AI 봇을 차단하면 무엇이 빠지는가?
| 차단 대상 | 즉시 나타나는 결과 | 흔한 오해 |
|---|---|---|
| OAI-SearchBot | ChatGPT 검색 답변의 출처 목록에서 우리 사이트가 사라짐 | GPTBot 만 막으면 되는 줄 알고 함께 막는 경우 |
| PerplexityBot | Perplexity 답변에서 인용 중단 | 학습용 봇으로 오해 |
| Googlebot(전체 또는 핵심 경로) | 구글 검색·AI 오버뷰·디스커버 모두에서 사라짐 | AI 오버뷰만 빼려다 검색까지 잃음 |
| Google-Extended | Gemini 학습·그라운딩에서만 제외 | AI 오버뷰가 빠질 것으로 오해 |
| ChatGPT-User·Claude-User | 고객이 우리 URL 을 AI 에 붙여 물어도 "읽을 수 없다"고 답함 | 검색 인용과 무관한 것으로 오해 |
| 모든 봇 Disallow: / | 검색·AI 전부에서 사라짐(사이트 리뉴얼 후 남는 대표적 사고) | 개발 서버 설정이 운영에 그대로 배포됨 |
어딧지 무료 점검은 robots.txt 를 읽어 학습용·검색용 봇별 허용 상태를 표로 보여 주고, 검색용 봇이 막혀 있으면 AI 인용에서 빠질 수 있다고 표시한다.
AI 봇이 실제로 다녀갔는지는 어떻게 확인하는가?
- 서버 접근 로그: User-agent 문자열에 GPTBot·OAI-SearchBot·ClaudeBot·PerplexityBot 등이 포함된 요청을 필터한다. 어떤 URL 을 얼마나 자주 가져갔는지 볼 수 있다.
- CDN·호스팅 분석: 봇 트래픽을 분류해 보여 주는 대시보드가 있으면 AI 봇 항목을 확인한다.
- 위장 확인: User-agent 는 누구나 흉내 낼 수 있다. OpenAI·Anthropic·Perplexity·Google 은 자사 봇의 IP 대역 또는 역DNS 확인 방법을 문서로 공개하므로, 의심되면 대조한다.
- AI 유입 확인: 웹 분석 도구에서 referrer 가 chatgpt.com·perplexity.ai 등인 세션을 따로 본다. 인용은 되지만 클릭이 없는 경우와 구분할 수 있다.
- 서치콘솔: 구글 봇의 크롤링 통계는 서치콘솔 설정 › 크롤링 통계에서 본다. AI 오버뷰 클릭은 실적 보고서에 검색 트래픽으로 합산된다.
차단·허용 정책은 어떻게 정하는가?
판단 기준은 하나다. "우리 콘텐츠가 AI 답변에 인용되는 것이 사업에 이익인가, 아니면 콘텐츠 자체가 상품이라 무단 사용이 손해인가." 서비스업·제조업·병원·학원처럼 "찾아오게 하는 것"이 목적인 회사는 검색용 봇을 여는 편이 유리하고(GEO의 첫 단계), 유료 콘텐츠·데이터가 상품인 회사는 경로별로 제한한다.
어느 쪽이든 학습용과 검색용을 구분해 적고, 분기마다 각 회사 문서에서 봇 이름 변경을 확인하며, 리뉴얼·이전 후에는 robots.txt 가 운영 값인지 반드시 확인한다. llms.txt 는 크롤러가 막히면 읽히지 않으므로 보조 수단일 뿐이다.
자주 묻는 질문
GPTBot 을 막으면 ChatGPT 에서 우리 회사가 안 나오나요?
아닙니다. GPTBot 은 학습용이고 ChatGPT 검색 인용은 OAI-SearchBot 이 담당합니다. 학습만 거부하고 인용은 받으려면 GPTBot 만 Disallow 하고 OAI-SearchBot 은 열어 두면 됩니다.
Google-Extended 를 막으면 AI 오버뷰에서 빠지나요?
아닙니다. Google-Extended 는 Gemini 학습·그라운딩 사용 여부만 제어하며, 구글 검색과 AI 오버뷰는 Googlebot 이 담당합니다. AI 오버뷰에서 발췌를 제한하려면 nosnippet·max-snippet 같은 메타 태그를 씁니다(피처드 스니펫에도 같은 태그가 적용됩니다).
robots.txt 로 막으면 AI 회사가 정말 안 가져가나요?
주요 AI 회사는 자사 봇이 robots.txt 를 준수한다고 문서로 밝혔습니다. 다만 무명 스크래퍼는 무시할 수 있어, 그런 경우는 서버·CDN 방화벽으로 막아야 합니다.
AI 봇 트래픽이 서버에 부담을 주면 어떻게 하나요?
전면 차단 대신 Crawl-delay(일부 봇만 지원)나 이미지·다운로드 경로 제한, CDN 의 속도 제한을 먼저 검토하세요. 검색용 봇까지 막으면 AI 인용을 잃습니다.
연결된 문서
이 글이 참조하는 문서 6편 · 이 글을 참조하는 문서 8편 · 관련 용어 4편
- AI 인용AI 인용(citation)은 ChatGPT·Perplexity·구글 AI 오버뷰·네이버 AI 브리핑 같은 생성형 검색이 답을…이 글이 참조 · 이 글을 참조
- GEO(생성형 엔진 최적화)GEO(Generative Engine Optimization, 생성형 엔진 최적화)는 ChatGPT·Perplexity·구글…이 글이 참조 · 이 글을 참조 · 관련 용어
- 구조화 데이터(JSON-LD)구조화 데이터(structured data)는 schema.org 어휘를 JSON-LD 형식으로 페이지에 넣어 "이 페이지는 …관련 용어
- 구글 AI 오버뷰구글 AI 오버뷰(AI Overviews)는 구글 검색 결과 상단에 생성형 AI 가 여러 웹페이지를 종합해 답을 요약하고 출처…이 글이 참조 · 이 글을 참조
- AEO(답변 엔진 최적화)AEO(Answer Engine Optimization, 답변 엔진 최적화)는 사용자의 질문에 검색엔진·AI 가 그대로 가져다…이 글을 참조
- 네이버 AI 브리핑네이버 AI 브리핑은 네이버 통합검색 상단에 검색어에 대한 답을 생성형 AI 가 요약해 보여 주는 블록이다. 출처 구성(블로그…관련 용어
- llms.txtllms.txt 는 사이트 루트에 두는 마크다운 파일로, AI(LLM)가 사이트의 핵심 내용과 중요한 페이지 목록을 빠르게 파…이 글이 참조 · 이 글을 참조 · 관련 용어
- robots.txtrobots.txt 는 사이트 루트에 두는 텍스트 파일로, 크롤러(User-agent)별로 접근을 허용·차단할 경로를 적는 규…이 글이 참조 · 이 글을 참조
- 코어 웹 바이탈코어 웹 바이탈(Core Web Vitals)은 구글이 실제 사용자 환경에서 페이지 경험을 재는 세 지표 LCP(로딩)·INP…이 글을 참조
- 피처드 스니펫피처드 스니펫(featured snippet, 추천 스니펫)은 구글이 검색어에 대한 답을 특정 페이지의 문단·목록·표에서 발췌…이 글이 참조
- 캐노니컬(표준 URL)캐노니컬(canonical, 표준 URL)은 같은 내용이 여러 주소(파라미터·www 유무·http/https·모바일 주소 등)…이 글을 참조