기술·구조

robots.txt 란? 검색봇과 AI 봇에게 "어디를 긁지 말라"고 알리는 사이트 루트의 규칙 파일

robots.txt 는 사이트 루트에 두는 텍스트 파일로, 크롤러(User-agent)별로 접근을 허용·차단할 경로를 적는 규칙이다. 문법, 흔한 사고(전체 차단·오타), 검색봇과 AI 봇의 구분, 색인 제외(noindex)와의 차이, 확인 방법까지.

최종 수정 2026-09-15 · 약 1800자 · 연결 7개 · 어딧지 리서치

robots.txt 란 무엇인가

robots.txt 란 웹사이트 루트(https://www.example.com/robots.txt)에 두는 텍스트 파일로, 크롤러 이름(User-agent)별로 가져가도 되는 경로(Allow)와 가져가지 말아야 할 경로(Disallow)를 적어 두는 규칙이다. 2022년 RFC 9309 로 표준화됐으며 구글·네이버·주요 AI 회사의 봇이 준수한다고 밝혔다.

역할은 "크롤링 제한"이지 "검색 결과에서 숨기기"가 아니다. 차단된 페이지도 다른 곳에서 링크되면 URL 만 색인될 수 있다. 검색 결과에서 빼려면 noindex 메타 태그를 쓰고, 그 페이지는 robots.txt 로 막지 말아야 봇이 noindex 를 읽는다.

문법은 어떻게 되는가?

  • User-agent: 규칙을 적용할 봇 이름. * 는 모든 봇. 그룹마다 빈 줄로 구분.
  • Disallow: 막을 경로. 값이 비어 있으면 "모두 허용", / 이면 "모두 차단".
  • Allow: 막힌 경로 안에서 예외로 열 경로(구글·네이버 지원).
  • Sitemap: 사이트맵 절대 주소. 여러 줄 가능.
  • 경로는 대소문자를 구분하고, * 와 $ 와일드카드를 쓸 수 있다. 봇 이름 오타(GPTbot 등)는 무시돼 규칙이 적용되지 않는다.

우리 회사 사이트의 기본 예시는 무엇인가?

가상의 "우리 회사" 사이트에서 관리자·검색결과·장바구니만 막고 나머지는 모두 여는 최소 구성이다.

  • User-agent: *
  • Disallow: /admin/
  • Disallow: /search
  • Disallow: /cart/
  • Sitemap: https://www.example.com/sitemap.xml

검색봇과 AI 봇은 어떻게 구분해 적는가?

검색 색인용 봇(Googlebot·Bingbot·네이버 Yeti)과 AI 학습용 봇(GPTBot·ClaudeBot 등), AI 검색용 봇(OAI-SearchBot·PerplexityBot 등)은 이름이 다르다. "AI 봇 전부 차단"을 걸면 AI 인용에서도 빠지므로, 학습만 거부하고 검색·인용은 받으려면 이름별로 나눠 적는다. 봇 이름표와 조합 예시는 AI 검색봇 항목에 있다.

흔한 사고는 무엇인가?

사고원인결과
User-agent: * / Disallow: / 가 운영에 배포개발 서버 설정을 그대로 배포검색·AI 전부에서 사이트가 사라짐
CSS·JS 경로 차단오래된 관행렌더링 실패로 페이지 평가·코어 웹 바이탈 측정 모두 실패
noindex 대상 페이지를 robots.txt 로 차단역할 혼동noindex 를 읽지 못해 URL 이 색인에 남음
봇 이름 오타·대소문자문서 미확인규칙 미적용
llms.txt 만 두고 봇은 차단두 파일 역할 혼동llms.txt 도 읽히지 않음

robots.txt 는 어떻게 확인하는가?

브라우저에서 /robots.txt 를 직접 열어 운영 값인지 본다. 구글 서치콘솔의 robots.txt 보고서에서 구글이 마지막으로 읽은 버전과 오류를 확인하고, 네이버 서치어드바이저에서도 robots.txt 검증을 제공한다. 리뉴얼·이전 직후에는 반드시 다시 확인한다. 어딧지 무료 점검은 robots.txt 를 읽어 검색봇·AI 봇별 허용 상태를 표로 보여 준다.

자주 묻는 질문

robots.txt 로 막으면 검색 결과에서 사라지나요?

반드시 그렇지는 않습니다. 크롤링만 막히므로 다른 곳에서 링크되면 URL 이 색인될 수 있습니다. 검색 결과에서 빼려면 noindex 를 쓰고 그 페이지는 막지 마세요.

robots.txt 가 없으면 문제가 되나요?

없으면 모든 봇이 모든 경로를 가져갈 수 있습니다. 문제는 아니지만, 관리자·검색결과 경로 제한과 사이트맵 안내를 위해 두는 편이 좋습니다.

AI 봇만 막고 검색봇은 열 수 있나요?

가능합니다. 봇 이름별로 그룹을 나눠 적으면 됩니다. 다만 AI 검색용 봇까지 막으면 AI 답변의 출처에서 빠집니다.

robots.txt 를 무시하는 봇은 어떻게 막나요?

robots.txt 는 요청일 뿐이므로, 무시하는 스크래퍼는 서버·CDN 의 방화벽·속도 제한으로 막습니다.

참고 자료

  1. Google Search Central — robots.txt 소개
  2. Google Search Central — robots.txt 작성 방법
  3. RFC 9309 — Robots Exclusion Protocol
  4. 네이버 서치어드바이저 — 웹마스터 가이드