robots.txt 란? 검색봇과 AI 봇에게 "어디를 긁지 말라"고 알리는 사이트 루트의 규칙 파일
robots.txt 는 사이트 루트에 두는 텍스트 파일로, 크롤러(User-agent)별로 접근을 허용·차단할 경로를 적는 규칙이다. 문법, 흔한 사고(전체 차단·오타), 검색봇과 AI 봇의 구분, 색인 제외(noindex)와의 차이, 확인 방법까지.
robots.txt 란 무엇인가
robots.txt 란 웹사이트 루트(https://www.example.com/robots.txt)에 두는 텍스트 파일로, 크롤러 이름(User-agent)별로 가져가도 되는 경로(Allow)와 가져가지 말아야 할 경로(Disallow)를 적어 두는 규칙이다. 2022년 RFC 9309 로 표준화됐으며 구글·네이버·주요 AI 회사의 봇이 준수한다고 밝혔다.
역할은 "크롤링 제한"이지 "검색 결과에서 숨기기"가 아니다. 차단된 페이지도 다른 곳에서 링크되면 URL 만 색인될 수 있다. 검색 결과에서 빼려면 noindex 메타 태그를 쓰고, 그 페이지는 robots.txt 로 막지 말아야 봇이 noindex 를 읽는다.
문법은 어떻게 되는가?
- User-agent: 규칙을 적용할 봇 이름. * 는 모든 봇. 그룹마다 빈 줄로 구분.
- Disallow: 막을 경로. 값이 비어 있으면 "모두 허용", / 이면 "모두 차단".
- Allow: 막힌 경로 안에서 예외로 열 경로(구글·네이버 지원).
- Sitemap: 사이트맵 절대 주소. 여러 줄 가능.
- 경로는 대소문자를 구분하고, * 와 $ 와일드카드를 쓸 수 있다. 봇 이름 오타(GPTbot 등)는 무시돼 규칙이 적용되지 않는다.
우리 회사 사이트의 기본 예시는 무엇인가?
가상의 "우리 회사" 사이트에서 관리자·검색결과·장바구니만 막고 나머지는 모두 여는 최소 구성이다.
- User-agent: *
- Disallow: /admin/
- Disallow: /search
- Disallow: /cart/
- Sitemap: https://www.example.com/sitemap.xml
검색봇과 AI 봇은 어떻게 구분해 적는가?
검색 색인용 봇(Googlebot·Bingbot·네이버 Yeti)과 AI 학습용 봇(GPTBot·ClaudeBot 등), AI 검색용 봇(OAI-SearchBot·PerplexityBot 등)은 이름이 다르다. "AI 봇 전부 차단"을 걸면 AI 인용에서도 빠지므로, 학습만 거부하고 검색·인용은 받으려면 이름별로 나눠 적는다. 봇 이름표와 조합 예시는 AI 검색봇 항목에 있다.
흔한 사고는 무엇인가?
robots.txt 는 어떻게 확인하는가?
브라우저에서 /robots.txt 를 직접 열어 운영 값인지 본다. 구글 서치콘솔의 robots.txt 보고서에서 구글이 마지막으로 읽은 버전과 오류를 확인하고, 네이버 서치어드바이저에서도 robots.txt 검증을 제공한다. 리뉴얼·이전 직후에는 반드시 다시 확인한다. 어딧지 무료 점검은 robots.txt 를 읽어 검색봇·AI 봇별 허용 상태를 표로 보여 준다.
자주 묻는 질문
robots.txt 로 막으면 검색 결과에서 사라지나요?
반드시 그렇지는 않습니다. 크롤링만 막히므로 다른 곳에서 링크되면 URL 이 색인될 수 있습니다. 검색 결과에서 빼려면 noindex 를 쓰고 그 페이지는 막지 마세요.
robots.txt 가 없으면 문제가 되나요?
없으면 모든 봇이 모든 경로를 가져갈 수 있습니다. 문제는 아니지만, 관리자·검색결과 경로 제한과 사이트맵 안내를 위해 두는 편이 좋습니다.
AI 봇만 막고 검색봇은 열 수 있나요?
가능합니다. 봇 이름별로 그룹을 나눠 적으면 됩니다. 다만 AI 검색용 봇까지 막으면 AI 답변의 출처에서 빠집니다.
robots.txt 를 무시하는 봇은 어떻게 막나요?
robots.txt 는 요청일 뿐이므로, 무시하는 스크래퍼는 서버·CDN 의 방화벽·속도 제한으로 막습니다.
연결된 문서
이 글이 참조하는 문서 4편 · 이 글을 참조하는 문서 7편 · 관련 용어 4편
- AI 인용AI 인용(citation)은 ChatGPT·Perplexity·구글 AI 오버뷰·네이버 AI 브리핑 같은 생성형 검색이 답을…이 글이 참조 · 이 글을 참조
- GEO(생성형 엔진 최적화)GEO(Generative Engine Optimization, 생성형 엔진 최적화)는 ChatGPT·Perplexity·구글…이 글을 참조
- AI 검색봇(AI 크롤러)AI 검색봇(AI crawler)은 AI 서비스가 학습 데이터 수집이나 검색 답변 생성을 위해 웹페이지를 가져가는 크롤러다. …이 글이 참조 · 이 글을 참조 · 관련 용어
- 네이버 AI 브리핑네이버 AI 브리핑은 네이버 통합검색 상단에 검색어에 대한 답을 생성형 AI 가 요약해 보여 주는 블록이다. 출처 구성(블로그…이 글을 참조
- llms.txtllms.txt 는 사이트 루트에 두는 마크다운 파일로, AI(LLM)가 사이트의 핵심 내용과 중요한 페이지 목록을 빠르게 파…이 글이 참조 · 이 글을 참조 · 관련 용어
- 코어 웹 바이탈코어 웹 바이탈(Core Web Vitals)은 구글이 실제 사용자 환경에서 페이지 경험을 재는 세 지표 LCP(로딩)·INP…이 글이 참조 · 이 글을 참조 · 관련 용어
- 캐노니컬(표준 URL)캐노니컬(canonical, 표준 URL)은 같은 내용이 여러 주소(파라미터·www 유무·http/https·모바일 주소 등)…이 글을 참조 · 관련 용어