핵심 요약: 크롤링 차단과 색인 제외는 다릅니다
robots.txt는 검색엔진 크롤러가 사이트의 특정 URL이나 경로에 접근하는 방식을 안내하는 파일입니다. 반면 noindex는 페이지를 검색 결과에 표시하지 말라는 지시입니다. 구글SEO에서 가장 중요한 원칙은 ‘검색 결과에서 숨기려면 noindex, 불필요한 크롤링을 줄이려면 robots.txt’를 우선 검토하는 것입니다.
다만 robots.txt는 강제 보안 장치가 아닙니다. URL 자체가 외부 링크나 사이트맵 등으로 발견되면, 페이지 내용을 수집하지 못한 상태에서도 URL 정보가 검색 결과에 일부 나타날 가능성이 있습니다. 민감한 정보 보호 목적이라면 로그인 인증, 서버 접근 제한, 파일 삭제 등을 사용해야 합니다.
robots.txt는 언제 사용해야 하나요?
robots.txt는 검색 가치가 낮고 크롤링 자원을 불필요하게 사용하는 영역을 관리할 때 적합합니다. 예를 들어 관리자 경로, 내부 검색 결과 URL, 필터·정렬 조합으로 끝없이 생성되는 URL, 테스트용 디렉터리, 특정 크롤러가 접근할 필요 없는 리소스 경로 등이 대상이 될 수 있습니다.
예를 들어 /search/ 아래의 내부 검색 결과가 대량 생성된다면 robots.txt에서 해당 경로의 크롤링을 제한할 수 있습니다. 그러나 이미 검색 결과에 노출된 페이지를 빠르게 제외하려는 목적에는 적합하지 않습니다. 해당 페이지를 막기 전에 noindex를 확인할 수 있어야 하기 때문입니다.
또한 CSS, JavaScript, 이미지 같은 렌더링에 필요한 핵심 리소스를 무분별하게 차단하면 구글이 페이지를 정상적으로 이해하기 어려울 수 있습니다. 홈페이지상위 노출을 위한 SEO최적화 과정에서는 차단 대상이 실제로 검색 품질에 영향을 주지 않는지 먼저 진단해야 합니다.
noindex는 언제 사용해야 하나요?
noindex는 페이지가 크롤링되어도 검색 결과에는 나타나지 않아야 할 때 사용합니다. 대표적인 예는 회원 전용 페이지, 장바구니·주문 완료 페이지, 중복 또는 매우 유사한 페이지, 품질이 낮은 태그·필터 페이지, 감사 페이지, 제한적으로 운영하는 랜딩페이지입니다.
HTML 문서에는 meta robots 태그로 noindex를 넣을 수 있고, PDF 등 HTML이 아닌 파일에는 HTTP 헤더의 X-Robots-Tag: noindex를 사용할 수 있습니다. noindex가 적용된 페이지는 구글이 페이지를 방문해 지시를 읽어야 색인 제외 처리를 할 수 있습니다. 따라서 해당 URL을 robots.txt로 동시에 차단하면 구글이 noindex를 확인하지 못해 의도대로 처리되지 않을 수 있습니다.
robots.txt와 noindex를 함께 쓰면 안 되나요?
같은 URL에 두 설정을 동시에 적용하는 것은 일반적으로 권장하지 않습니다. 특히 ‘검색 결과에서 제거’가 목표라면 robots.txt 차단을 먼저 해제하거나 적용하지 않고, 페이지가 접근 가능한 상태에서 noindex를 제공해야 합니다. 이후 구글이 재크롤링하면 색인 제외가 진행됩니다.
반대로 페이지가 검색에 노출될 필요도 없고 크롤링도 원하지 않는 경우라도, 먼저 noindex로 색인 제외 여부를 확인한 뒤 장기적인 크롤링 관리 방식을 결정하는 편이 안전합니다. 삭제된 페이지라면 404 또는 410 HTTP 상태 코드를 반환하는 방법이 더 적절할 수 있습니다. 다른 페이지로 명확히 대체되었다면 관련성이 높은 URL로 301 리디렉션을 고려합니다.
기술 SEO 점검 방법
구글 서치 콘솔의 URL 검사 도구로 해당 URL이 색인되었는지, robots.txt에 의해 차단되었는지, noindex가 감지되었는지 확인하세요. 페이지 소스에서는 meta robots 설정을, 서버 응답 헤더에서는 X-Robots-Tag 설정을 점검합니다. 또한 XML 사이트맵에는 색인시키려는 대표 URL만 포함하는 것이 좋습니다.
구글마케팅이나 구글홍보를 위해 광고 랜딩페이지를 운영할 때도 동일한 기준이 적용됩니다. 광고 전용 페이지가 유기 검색 유입을 받을 가치가 있다면 품질, 콘텐츠, 전환 정보 등을 보완해 색인을 허용할 수 있습니다. 반대로 기간 한정·중복 캠페인 페이지라면 noindex 적용 여부를 검토하세요. 광고 노출과 자연 검색 노출은 별개이므로, noindex가 구글 광고 게재 자체를 막는 것은 아닙니다.
자주 묻는 질문
robots.txt만 설정하면 구글 검색 결과에서 사라지나요?
아닙니다. robots.txt는 크롤링 제한 지시이며 색인 삭제 명령이 아닙니다. 검색 결과 제외가 목적이면 페이지가 크롤링 가능한 상태에서 noindex를 제공하거나, 페이지 삭제 시 404·410 상태 코드를 반환해야 합니다.
noindex 페이지는 robots.txt에서 차단해야 하나요?
보통은 아닙니다. 구글이 noindex 지시를 읽으려면 페이지에 접근할 수 있어야 합니다. 동일 URL을 robots.txt로 차단하면 noindex 확인이 어려워질 수 있습니다.
중복 페이지에는 noindex와 canonical 중 무엇을 써야 하나요?
유사한 페이지 중 하나를 대표 페이지로 통합하려면 canonical이 적합합니다. 해당 페이지 자체를 검색 결과에 전혀 노출하지 않으려면 noindex를 사용합니다. 두 지시를 충돌하게 사용하지 말고 페이지의 목적에 맞춰 선택해야 합니다.
관리자 페이지를 robots.txt로 막으면 안전한가요?
안전하지 않습니다. robots.txt 내용은 공개적으로 확인할 수 있으며 접근 권한을 제어하지 않습니다. 관리자 페이지와 개인정보 영역은 로그인, 권한 관리, 서버 수준의 접근 제한으로 보호해야 합니다.
noindex 적용 후 언제 검색 결과에서 사라지나요?
구글이 해당 URL을 다시 크롤링하고 noindex를 처리한 뒤 반영됩니다. 기간은 사이트의 크롤링 빈도와 URL 상태에 따라 달라집니다. 서치 콘솔 URL 검사로 설정을 확인하고, 긴급 삭제가 필요한 경우 삭제 도구를 보조적으로 사용할 수 있습니다.