Robots.txt 생성기

robots.txt 규칙 생성기

여러 줄의 Allow / Disallow / Sitemap를 지원하여 표준 형식을 자동으로 어셈블합니다.

규칙 구성
생성된 결과

GeekFormat 온라인 Robots.txt 생성기는 시각적 양식을 통해 User-agent, Allow/Disallow 규칙, Sitemap 선언, Host 지시어를 구성하여 Robots Exclusion Protocol 표준을 준수하는 robots.txt 파일을 실시간으로 생성합니다. 페이지를 열면 예시 기본값이 표시되며 필드를 수정하면 생성 결과가 즉시 미리보기되고, 한 번의 클릭으로 복사하여 웹사이트 루트 디렉토리에 배포할 수 있습니다. 모든 작업은 브라우저 로컬에서 실행되며 구성 데이터는 어떤 서버에도 업로드되지 않습니다.

관련 추천

Robots.txt와 크롤러 배제 프로토콜에 관하여

robots.txt는 웹사이트가 검색 엔진 크롤러와 통신하는 가장 기본적인 방법 중 하나로, 정식 명칭은 Robots Exclusion Protocol(크롤러 배제 프로토콜, 약어 REP)입니다. 이는 웹사이트 루트 디렉토리에 배치되는 일반 텍스트 파일로, 간단한 지시어를 사용하여 규약을 준수하는 검색 엔진 크롤러에 웹사이트의 어느 부분을 크롤링해도 되고 어느 부분을 크롤링하지 않기를 원하는지 알려줍니다. robots.txt는 1994년 Martijn Koster가 처음 제안했으며 약 30년의 개발을 거쳐 2022년 IETF에 의해 RFC 9309로 공식 표준화되었습니다.

robots.txt의 기본 구조는 하나 이상의 규칙 그룹(Group)으로 구성됩니다. 각 규칙 그룹은 하나 이상의 User-agent 줄로 시작하여 규칙이 적용될 크롤러를 지정하고(*는 모든 크롤러를 나타냅니다); 그 뒤에 여러 개의 Allow 및 Disallow 줄이 따라와 각각 크롤링을 허용 및 금지할 경로 접두사를 지정합니다; 파일 끝에는 Sitemap, Host 등 비그룹 수준 지시어를 추가할 수 있습니다. 각 규칙 그룹 사이는 빈 줄로 구분됩니다. 일반적인 robots.txt에는 다음이 포함됩니다: User-agent 선언 → Allow/Disallow 경로 규칙 → (선택 사항) 추가 User-agent 그룹 → Sitemap 선언 → Host 지시어.

User-agent 필드는 규칙이 적용될 크롤러 이름을 지정합니다. 일반적인 검색 엔진 크롤러 이름에는 다음이 포함됩니다: Googlebot(Google 검색), Bingbot(Bing 검색), Baiduspider(바이두 검색), YandexBot(Yandex 검색), DuckDuckBot(DuckDuckGo 검색), Twitterbot(Twitter/X 카드 가져오기), facebookexternalhit(Facebook 링크 미리보기), GPTBot(OpenAI GPT 크롤러), Bytespider(바이트댄스/진르터우탸오 검색) 등. User-agent: *를 와일드카드로 사용하여 개별적으로 일치하지 않는 모든 크롤러에 일치시킵니다.

Allow 및 Disallow 지시어는 접두사 일치(Prefix Matching) 원칙을 사용합니다: URL 경로가 지정된 값으로 시작하는 한 규칙이 일치합니다. 예를 들어 Disallow: /admin은 /admin, /admin/, /admin/login.html, /administrator 등 /admin으로 시작하는 모든 경로를 차단합니다. /admin/ 디렉토리에만 정확히 일치시키고 싶다면 Disallow: /admin/(끝에 슬래시 추가)로 작성하세요. RFC 9309 표준에 따르면 Allow와 Disallow가 모두 일치할 때 경로가 더 긴 규칙이 우선하며; 길이가 같을 때는 Allow가 우선합니다. 이는 더 구체적인 규칙일수록 우선순위가 높다는 것을 의미합니다.

Sitemap 지시어는 검색 엔진에 사이트맵 위치를 알려주어 크롤러가 웹사이트 페이지를 더 효율적으로 발견하고 인덱싱할 수 있도록 돕습니다. Sitemap 줄은 모든 규칙 그룹 뒤(또는 파일 끝)에 배치해야 하며 URL은 완전한 절대 주소(http:// 또는 https:// 포함)여야 합니다. 하나의 robots.txt에 여러 Sitemap을 선언할 수 있으며 각각 독립된 줄에 작성합니다. 대규모 사이트는 일반적으로 여러 Sitemap(콘텐츠 유형, 업데이트 빈도별 분류)으로 분할하고 Sitemap 인덱스 파일로 통합 관리합니다.

Host 지시어는 Yandex가 제안한 비표준이지만 널리 사용되는 지시어로, 사이트의 선호 도메인(기본 미러)을 지정하기 위한 것입니다. 예를 들어 example.com과 www.example.com이 모두 존재할 때 Host: example.com은 검색 엔진에 example.com을 선호하도록 알려줍니다. 참고: Google은 Host 지시어를 사용하지 않는다고 밝혔으며 선호 도메인은 Google Search Console에서 설정해야 합니다; Bing도 명시적으로 지원하지 않습니다. Host 지시어는 Sitemap 뒤에 배치해야 하며 한 번만 나타날 수 있습니다.

robots.txt를 올바르게 구성하는 것은 SEO에 중요한 의미가 있습니다: 첫째, 크롤러가 무의미한 페이지(검색 결과 페이지, 필터링된 페이지, 중복 콘텐츠 페이지 등)에서 크롤링 예산을 낭비하는 것을 방지하여 크롤러가 가치 있는 콘텐츠를 더 효율적으로 크롤링할 수 있도록 합니다; 둘째, 비공개이거나 가치가 낮은 페이지(관리자 페이지, 테스트 페이지, 인쇄 페이지 등)가 인덱싱되는 것을 방지합니다; 셋째, Sitemap을 통해 크롤러를 새 페이지로 능동적으로 안내합니다. 그러나 주의할 점: robots.txt는 신사협정이며 실제 보안 조치를 대체할 수 없습니다; Disallow된 URL이라도 외부 링크가 있으면 검색 결과에 URL이 표시될 수 있습니다(콘텐츠는 크롤링되지 않음); 크롤링을 완전히 금지하면 오히려 사이트 전체 가중치 평가에 영향을 미칠 수 있습니다.

robots.txt의 일반적인 오류에는 다음이 포함됩니다: ①경로 작성 오류(Disallow: admin처럼 시작 슬래시가 누락된 경우, /admin으로 작성해야 함); ②정규식 사용(표준 REP는 정규식을 지원하지 않으며 Googlebot만 제한적인 와일드카드 *와 $를 지원); ③JS/CSS 파일 크롤링 금지(Google이 페이지를 렌더링하지 못하게 함); ④Disallow: /(사이트 전체 금지, 이는 치명적인 오류로 사이트가 전혀 인덱싱되지 않게 함); ⑤파일 인코딩 문제(UTF-8 인코딩이어야 함); ⑥루트 디렉토리가 아닌 하위 디렉토리에 배치; ⑦파일 권한으로 인한 접근 불가(200 OK 상태 코드를 반환해야 함). 생성 후 Google Search Console의 robots.txt 테스트 도구나 본 플랫폼의 robots.txt 검사 도구를 사용하여 검증하는 것을 권장합니다.

사용 사례

  • 신규 사이트 런칭 전에 기본 robots.txt를 구성하여 크롤링을 허용/금지할 경로 범위를 명확히 하고 검색 엔진이 올바르게 크롤링하도록 안내
  • 사이트 리뉴얼 후 Disallow 규칙을 업데이트하여 이전 디렉토리가 계속 크롤링되어 SEO 가중치 분배에 영향을 미치는 것을 방지
  • 여러 Sitemap 주소 선언을 추가하여 검색 엔진이 사이트 전체 페이지 구조를 더 빨리 발견하도록 돕고 인덱싱 효율 향상
  • 백엔드 관리 디렉토리(/admin), 테스트 환경, 비공개 디렉토리가 크롤러에 인덱싱되는 것을 차단하여 보안 위험 감소
  • Host 지시어를 설정하여 사이트의 선호 도메인(www 포함 또는 제외)을 지정하고 중복 콘텐츠 문제 감소
  • 서로 다른 검색 엔진 크롤러(Googlebot, Bingbot, Baiduspider 등)에 대해 독립적인 크롤링 규칙 구성
  • 유지보수 중인 디렉토리에 대한 크롤러 접근을 일시적으로 금지하고 사이트 업데이트가 완료되면 크롤링 재개
  • 올바른 형식의 robots.txt 파일을 생성하여 수기 작성 형식 오류로 인한 검색 엔진 구문 분석 실패 방지
  • 여러 Sitemap(기사 sitemap, 제품 sitemap, 이미지 sitemap 등)을 구성하여 사이트 전체 콘텐츠 유형을 커버
  • 프론트엔드 개발에서 robots.txt 규칙 구성 시연, 크롤러 프로토콜 표준 형식 교육 시연
  • robots.txt 검사 도구와 함께 사용하여 생성된 규칙이 예상과 일치하는지 확인하고 중요 페이지를 실수로 차단하는 것 방지
  • robots.txt 템플릿을 빠르게 생성하고 다운로드하여 실제 사이트 상황에 맞게 미세 조정한 후 배포

이용 방법

  1. User-agent 입력 상자에서 대상 크롤러를 지정하세요(기본값 *는 모든 검색 엔진 크롤러를 나타냅니다)
  2. Allow 영역에 크롤링을 허용할 경로를 입력하세요(줄당 하나의 규칙, 예: /, /blog/)
  3. Disallow 영역에 크롤링을 금지할 경로를 입력하세요(줄당 하나의 규칙, 예: /admin, /private)
  4. Sitemap 영역에 XML 사이트맵 주소를 추가하고(여러 줄 지원) Host 영역에 선호 도메인을 입력하세요
  5. 오른쪽 미리보기 영역에 생성된 robots.txt 내용이 실시간으로 표시되므로, 내용이 올바르다고 확인되면 복사 버튼을 클릭하여 배포하세요

주요 기능

  • 다중 규칙 독립 구성: User-agent, Allow, Disallow, Sitemap, Host가 각각 별도의 입력 영역으로 분리되어 규칙이 섞이지 않고 분류가 명확합니다
  • 실시간 미리보기 생성: 규칙을 수정하면 robots.txt 내용이 즉시 업데이트되어 생성 버튼을 수동으로 클릭할 필요가 없으며 보이는 그대로 결과를 얻을 수 있습니다
  • 기본 폴백 규칙: Allow와 Disallow가 모두 비어 있으면 자동으로 Allow: /를 출력하여 빈 파일로 인한 크롤러의 불확실한 동작을 방지합니다
  • 다중 Sitemap 지원: Sitemap 영역은 여러 줄 입력을 지원하며 각 URL이 독립적인 Sitemap 선언 줄로 출력되어 다중 Sitemap 사이트에 적합합니다
  • 한 번의 클릭으로 복사하여 배포: 결과를 한 번의 클릭으로 클립보드에 복사할 수 있어 웹사이트 루트 디렉토리에 직접 붙여넣어 배포하기에 편리합니다
  • 기본 예시 미리 채우기: 페이지를 열면 기본 예시 구성(User-agent: *, Allow: /, Disallow: /admin /private, Sitemap, Host)이 표시되어 초보자도 참고하여 직접 수정할 수 있습니다
  • 표준 형식 출력: Robots Exclusion Protocol 사양을 엄격히 준수하여 User-agent 줄을 먼저, 규칙 줄을 그 다음에, Sitemap/Host를 끝에 배치하여 모든 검색 엔진과 호환됩니다
  • 스마트 경로 처리: 각 줄의 앞뒤 공백을 자동으로 트림하고 빈 줄을 필터링하여 불필요한 공백으로 인한 규칙 무효화를 방지합니다
  • 분할 창 반응형 레이아웃: PC에서는 좌우 분할 창(구성/미리보기), 모바일에서는 상하로 배치되어 데스크톱과 휴대폰 모두에서 사용하기 편리합니다
  • 고정폭 글꼴 미리보기: 미리보기 영역은 고정폭 글꼴로 생성 결과를 표시하여 robots.txt 형식이 깔끔하고 명확하게 보입니다
  • Host 지시어 지원: 선호하는 Host 도메인을 구성할 수 있어(Yandex 등의 검색 엔진 지원) 도메인 간 중복 콘텐츠 문제를 줄입니다
  • 브라우저에서 완전히 로컬 실행: 모든 구성 및 생성 작업은 브라우저 로컬 JavaScript에서 완료되며 데이터가 서버로 전송되지 않습니다
  • 의존성 제로 즉시 사용: 페이지를 열면 바로 사용할 수 있으며 회원가입이나 로그인, 소프트웨어 설치가 필요하지 않습니다
  • 검사 도구와 연동: 관련 링크에서 robots.txt 검사 도구로 바로 이동하여 생성 후 즉시 규칙이 올바른지 확인할 수 있습니다

자주 묻는 질문

robots.txt는 무엇을 위한 것인가요? 왜 웹사이트에 이 파일이 필요한가요?

robots.txt는 웹사이트 루트 디렉토리에 배치되는 일반 텍스트 파일로, 검색 엔진 크롤러(Googlebot, Bingbot, Baiduspider 등)에 어떤 경로를 크롤링해도 되고 어떤 경로에 대한 접근을 금지할지 알려주는 역할을 합니다. 이는 Robots Exclusion Protocol(크롤러 배제 프로토콜)의 구현 방식이며 사이트 크롤링 관리 및 SEO 기본 설정의 핵심 파일입니다. 필수는 아니지만 거의 모든 정식 웹사이트가 크롤러 동작을 안내하기 위해 robots.txt를 구성합니다.

robots.txt 파일은 어디에 배치해야 하나요?

robots.txt는 웹사이트의 루트 디렉토리에 배치해야 하며 http://귀하의도메인/robots.txt를 통해 직접 접근할 수 있어야 합니다(예: https://example.com/robots.txt). 하위 디렉토리(/blog/robots.txt 등)에 배치하면 무효이므로 주의하세요. 크롤러는 루트 디렉토리에서만 이 파일을 찾습니다. 파일 이름은 모두 소문자인 robots.txt여야 하며 Robots.txt나 ROBOTS.TXT는 안 됩니다.

Allow와 Disallow가 모두 비어 있으면 어떤 내용이 생성되나요?

Allow와 Disallow가 모두 입력되지 않은 경우, 생성기는 폴백 규칙으로 자동으로 Allow: /를 출력하여 사이트 전체 크롤링을 허용합니다. 이를 통해 빈 파일이나 User-agent 줄만 있는 불완전한 robots.txt가 생성되는 것을 방지하여 규칙이 불명확하여 크롤러가 불확실한 동작을 하는 것을 막습니다.

여러 Sitemap 주소를 구성할 수 있나요?

네. Sitemap 영역은 여러 줄 입력을 지원하며 각 URL은 독립적인 Sitemap 선언 줄로 출력됩니다. 예를 들어 대규모 사이트는 일반적으로 여러 개의 sitemap 파일(기사 sitemap, 제품 sitemap, 이미지 sitemap 등)을 가지고 있으며 전체 Sitemap URL(http:// 또는 https://를 포함한 완전한 절대 경로여야 함)을 줄당 하나씩 입력할 수 있습니다.

Host 지시어의 역할은 무엇인가요? 모든 검색 엔진이 지원하나요?

Host 지시어는 사이트의 선호 도메인(example.com 또는 www.example.com 등)을 지정하기 위한 것으로, 검색 엔진이 기본 도메인을 인식하고 www 버전과 비-www 버전 간의 중복 콘텐츠 문제를 줄이는 데 도움을 줍니다. 현재 Host 지시어는 주로 Yandex 등의 검색 엔진이 지원하며, Google은 Host 지시어를 직접 사용하지 않고 Google Search Console에서 선호 도메인을 설정합니다. 구성하는 것을 권장하지만 이것에만 의존하지는 마세요.

User-agent: *는 무슨 뜻인가요? 특정 크롤러에 대해 규칙을 구성하려면 어떻게 해야 하나요?

User-agent: *는 규칙이 모든 크롤러에 적용됨을 의미합니다(별표는 와일드카드입니다). 특정 검색 엔진에 대해 독립적인 규칙을 구성해야 하는 경우 User-agent를 구체적인 크롤러 이름(Googlebot(구글), Bingbot(빙), Baiduspider(바이두), Twitterbot(트위터/X) 등)으로 설정할 수 있습니다. 여러 User-agent 그룹을 구성할 수 있으며 각 그룹 사이는 빈 줄로 구분합니다.

robots.txt가 민감한 디렉토리를 접근으로부터 정말 보호할 수 있나요?

아니요. robots.txt는 신사협정에 불과하며 규약을 준수하는 검색 엔진 크롤러는 규칙을 따르지만 악성 크롤러나 해커 스캐너는 이를 완전히 무시할 수 있습니다. 정말 민감한 콘텐츠(관리자 비밀번호, 사용자 프라이버시 데이터 등)를 보호하기 위해 robots.txt에 의존하지 마세요. 민감한 디렉토리에는 서버 측 인증(비밀번호 보호, IP 화이트리스트) 등 실제 보안 조치를 사용해야 합니다. robots.txt의 역할은 규약을 준수하는 크롤러를 안내하는 것이지 보안 보호가 아닙니다.

Disallow 규칙의 경로 일치 규칙은 무엇인가요?

Disallow 규칙은 접두사 일치(Prefix Matching)를 사용합니다: Disallow: /admin은 /admin, /admin/, /admin/login.html, /administrator 등 /admin으로 시작하는 모든 경로에 일치합니다. /admin/ 디렉토리 아래의 내용에만 일치시키고 싶다면 Disallow: /admin/(끝에 슬래시 추가)로 작성하세요. Disallow: (빈 값)는 어떤 경로도 금지하지 않음(즉, 모두 허용)을 의미합니다. 규칙은 대소문자를 구분하므로 주의하세요.

생성된 robots.txt를 웹사이트에 배포하려면 어떻게 해야 하나요?

복사 버튼을 클릭하여 생성 내용을 클립보드에 복사한 다음, 서버에 robots.txt라는 이름의 일반 텍스트 파일을 만들어 내용을 붙여넣고 파일을 웹사이트 루트 디렉토리(보통 web root, public_html, www 또는 dist 디렉토리)에 업로드하세요. 배포 후 https://귀하의도메인/robots.txt에 접속하여 내용이 표시되는지 확인할 수 있습니다. 또한 Google Search Console의 robots.txt 테스트 도구를 사용하여 규칙을 검증할 수도 있습니다.

robots.txt를 변경한 후 얼마나 지나야 효과가 발생하나요?

검색 엔진 크롤러가 다음에 사이트를 방문할 때 robots.txt 파일을 다시 가져오며 보통 몇 시간에서 며칠 이내에 효과가 발생합니다. 검색 엔진이 가능한 한 빨리 업데이트를 발견하기를 원한다면 Google Search Console이나 Bing Webmaster Tools에서 robots.txt 업데이트 요청을 제출할 수 있습니다. 참고: 이미 인덱싱된 페이지는 Disallow되더라도 일정 기간 검색 결과에 남아 있을 수 있습니다. 완전히 제거하려면 noindex 태그나 URL 제거 도구를 함께 사용해야 합니다.

Allow와 Disallow가 충돌할 때 어느 쪽이 우선하나요?

RFC 9309(Robots Exclusion Protocol 공식 표준)에 따르면 Allow와 Disallow 규칙의 경로 길이가 같을 때는 Allow가 Disallow보다 우선하며; 경로 길이가 다를 때는 더 긴 경로에 일치하는 규칙이 우선합니다. 예를 들어 Allow: /blog와 Disallow: /blog/가 충돌할 때 /blog/post.html에 접근하면 Disallow(경로가 더 긴 /blog/ > /blog)에 일치하고 /blog 자체에 접근하면 Allow에 일치합니다. 간단히 말해 더 구체적인 규칙일수록 우선순위가 높습니다.

robots.txt에 주석을 추가할 수 있나요?

네, #으로 시작하는 줄은 주석 줄이며 크롤러는 # 뒤의 내용을 무시합니다. 주석은 단독 줄에 작성할 수도 있고 규칙 줄 끝(# 뒤)에 작성할 수도 있습니다. 예: # Block admin area 또는 Disallow: /admin # admin panel. 적절하게 주석을 추가하면 자신과 팀원이 각 규칙의 역할을 이해하는 데 도움이 됩니다.

Sitemap URL은 절대 경로여야 하나요?

네, Sitemap 지시어는 완전한 절대 URL(프로토콜과 도메인 포함)을 사용해야 합니다(예: Sitemap: https://example.com/sitemap.xml). 크롤러가 다른 도메인(example.com과 www.example.com 등)에서 사이트에 접근할 수 있으므로 상대 경로(/sitemap.xml 등)는 사용할 수 없습니다. 상대 경로를 사용하면 크롤러가 올바른 주소를 확인할 수 없게 됩니다.

구성 데이터가 서버에 업로드되나요?

전혀 그렇지 않습니다. robots.txt의 모든 구성 및 생성 작업은 브라우저 로컬에서 JavaScript를 통해 완료되며 입력한 경로, 도메인 등의 구성 데이터는 외부 서버로 전송되지 않습니다. 페이지가 로드되면 기본 기능은 오프라인에서도 사용할 수 있으며 페이지를 닫으면 데이터가 자동으로 삭제되어 기록이 남지 않습니다.

생성된 robots.txt는 어떤 웹사이트에서도 사용할 수 있나요?

네, 생성기는 표준 Robots Exclusion Protocol 형식의 일반 텍스트 파일을 출력하므로 모든 웹 서버(Nginx, Apache, IIS, Caddy 등) 및 모든 사이트 구축 플랫폼(WordPress, Shopify, Next.js, Django, Rails 등)에 적합합니다. 웹사이트 루트 디렉토리에 배포하고 공개적으로 접근 가능하도록 설정하기만 하면 사용할 수 있습니다.

문제 해결

생성된 파일에 접근하면 404 오류가 반환되나요?

robots.txt 파일이 웹사이트 루트 디렉토리(하위 디렉토리 아님)에 업로드되었는지, 파일 이름이 모두 소문자인 robots.txt인지, 파일 권한이 공개 읽기 가능으로 설정되어 있는지(보통 644 권한으로 충분함) 확인하세요. 업로드 후 브라우저에서 https://귀하의도메인/robots.txt에 직접 접속하여 내용이 표시되는지 확인하세요. 서버마다 루트 디렉토리 위치는 다릅니다: Nginx/Apache는 보통 /var/www/html/ 또는 /usr/share/nginx/html/이고 Vercel/Netlify는 보통 public/ 디렉토리입니다.

Disallow 규칙이 적용되지 않고 페이지가 여전히 인덱싱되나요?

가능한 원인: ①크롤러가 아직 robots.txt를 다시 가져오지 않음(며칠 기다리거나 Search Console에서 업데이트 제출); ②경로 접두사 일치가 올바르지 않음(Disallow: admin처럼 /가 누락됨, Disallow: /admin/로 작성해야 함); ③Disallow를 추가하기 전에 페이지가 이미 인덱싱됨(이미 인덱싱된 페이지는 자동으로 제거되지 않음); ④악성 크롤러가 robots.txt를 준수하지 않음; ⑤Allow 규칙 충돌로 Disallow가 덮어씌워짐(경로가 더 길 때 Allow 우선). 인덱스에서 완전히 제거하려면 noindex 태그를 사용하세요.

Google Search Console이 robots.txt가 페이지를 차단하고 있다고 보고하나요?

이것은 보통 중요한 페이지가 실수로 Disallow되었음을 의미합니다. robots.txt에 과도하게 광범위한 Disallow 규칙(Disallow: /나 Disallow: /*? 등)이 있는지 확인하고 CSS/JS 파일이 차단되지 않았는지 확인하세요(Google은 페이지를 렌더링하기 위해 이러한 파일을 크롤링해야 함). Search Console의 robots.txt 테스트 도구를 사용하여 특정 URL을 입력하고 어떤 규칙이 차단하는지 테스트하세요.

실수로 Disallow: /를 설정하여 사이트 전체 크롤링이 금지되었나요?

즉시 해당 규칙을 제거하거나 수정하여 robots.txt를 Allow: /로 변경하거나 Disallow: / 줄을 삭제하고 업데이트된 파일을 서버에 업로드하세요. 그런 다음 Google Search Console에서 robots.txt 업데이트 요청을 제출하고 sitemap을 제출하여 재크롤링을 가속화하세요. 이미 인덱스에서 제거된 페이지가 재인덱싱되는 데는 며칠에서 몇 주가 소요될 수 있습니다.

용어집

robots.txt
웹사이트 루트 디렉토리에 배치되는 일반 텍스트 파일로, Robots Exclusion Protocol을 따라 규약을 준수하는 검색 엔진 크롤러에 어떤 경로의 크롤링을 허용/금지할지 알려주는 역할을 합니다.
Robots Exclusion Protocol (REP)
크롤러 배제 프로토콜. 1994년에 제안되었고 2022년에 RFC 9309로 표준화되었으며, 웹사이트와 크롤러 간에 크롤링 규칙을 통신하는 사실상의 표준입니다.
User-agent
규칙 그룹의 시작 필드로, 뒤따르는 Allow/Disallow 규칙이 적용될 크롤러 이름을 지정합니다. * 와일드카드는 모든 크롤러에 일치합니다.
Disallow
크롤링 금지 지시어. 크롤러가 접근하기를 원하지 않는 경로 접두사를 지정합니다. 예를 들어 Disallow: /admin은 /admin으로 시작하는 모든 경로의 크롤링을 금지합니다.
Allow
크롤링 허용 지시어. 크롤러 접근을 명시적으로 허용하는 경로를 지정합니다. Disallow된 상위 경로 아래의 특정 하위 경로를 개방할 때 사용합니다.
Sitemap
사이트맵 선언 지시어. 검색 엔진에 웹사이트 XML 사이트맵의 전체 URL을 알려주어 크롤러가 사이트 전체 페이지를 효율적으로 발견하고 인덱싱할 수 있도록 돕습니다.
Host
선호 도메인 지시어. 사이트의 기본 도메인(example.com과 www.example.com 중 하나 등)을 지정합니다. Yandex가 지원하며 Google은 Search Console에서 설정합니다.
Crawler/Bot/Spider
크롤러/스파이더/봇. 검색 엔진이 웹페이지에 자동으로 접속하여 콘텐츠를 수집하는 자동화 프로그램으로 Googlebot, Bingbot, Baiduspider 등이 있습니다.
Googlebot
Google 검색 엔진의 웹 크롤러로, Google 인덱싱 및 순위 지정을 위해 웹 콘텐츠를 가져오는 역할을 하며 가장 흔한 검색 엔진 크롤러 중 하나입니다.
Crawl Budget
크롤링 예산/할당량. 검색 엔진이 각 웹사이트에 할당하는 크롤링 빈도와 페이지 수 상한입니다. robots.txt를 올바르게 구성하면 크롤링 할당량 낭비를 피할 수 있습니다.
Prefix Matching
접두사 일치 규칙. robots.txt의 경로 일치 방식입니다. URL 경로가 규칙 값으로 시작하면 일치가 성공하며 규칙이 길수록 우선순위가 높습니다.
noindex
HTML meta 태그 또는 HTTP 헤더 지시어(X-Robots-Tag: noindex). 검색 엔진에 해당 페이지를 검색 인덱스에 포함하지 않도록 알려줍니다. robots.txt Disallow와 달리 noindex는 인덱스에서 제거하는 더 신뢰할 수 있는 방법입니다.

일반적인 검색 엔진 크롤러 User-agent 이름

특정 크롤러에 대한 규칙을 구성할 때 사용하는 User-agent 이름:

크롤러 이름소유 검색 엔진용도
*모든 크롤러와일드카드, 개별적으로 구성되지 않은 모든 크롤러에 일치
GooglebotGoogleGoogle 검색 웹 크롤링 크롤러
BingbotBing/마이크로소프트Bing 검색 웹 크롤링 크롤러
Baiduspider바이두바이두 검색 웹 크롤링 크롤러
YandexBotYandexYandex 검색 웹 크롤링 크롤러
GPTBotOpenAIChatGPT 학습 데이터 크롤링 크롤러
TwitterbotX/TwitterX 플랫폼 링크 카드 미리보기 크롤러
facebookexternalhitFacebookFacebook 링크 미리보기 크롤러

자주 사용하는 robots.txt 규칙 예시

다양한 사이트 시나리오에서의 일반적인 규칙 구성:

규칙효과
Disallow: /admin//admin/ 디렉토리 아래의 모든 콘텐츠 크롤링 금지
Disallow: /*?쿼리 매개변수가 있는 URL 크롤링 금지(Googlebot은 와일드카드 * 지원)
Disallow: /search사이트 내 검색 결과 페이지 크롤링 금지
Allow: /public//public/ 디렉토리 크롤링을 명시적으로 허용
Disallow: /⚠️ 사이트 전체 크롤링 금지(치명적인 오류, 신중하게 사용하세요!)
Allow: /사이트 전체 모든 콘텐츠 크롤링 허용

robots.txt 표준 지시어 빠른 참조

RFC 9309에서 정의한 표준 지시어 및 사용법:

지시어범위형식 예시설명
User-agent그룹 시작User-agent: *규칙이 적용될 크롤러 이름 지정
Disallow그룹 내Disallow: /admin크롤링을 금지할 경로 접두사
Allow그룹 내Allow: /public크롤링을 허용할 경로 접두사
Sitemap비그룹 수준Sitemap: https://example.com/sitemap.xml사이트맵 위치 선언(절대 URL)
#임의의 위치# This is a comment주석 줄, 크롤러가 무시

Privacy & Security

이 Robots.txt 생성기의 모든 작업은 완전히 귀하의 브라우저 로컬에서 완료됩니다: User-agent, 경로 규칙, Sitemap, Host 등의 구성 입력은 모두 브라우저 메모리 내에서 JavaScript를 통해 실시간으로 robots.txt 텍스트로 조립되며 네트워크를 통해 어떤 서버로도 전송되지 않습니다. 페이지가 로드되면 바로 사용할 수 있으며 Cookie 추적을 사용하지 않고 어떤 사용자 데이터도 수집하지 않습니다. 페이지를 닫거나 새로고침하면 모든 구성 내용이 자동으로 삭제되며 브라우저에 영구 저장되지 않습니다.

Authoritative References