[웹 기술/SEO] 검색엔진 크롤링 제어: Robots.txt 및 Canonical 태그 실무
Robots.txt와 noindex의 올바른 조합
검색엔진 크롤러가 사이트에 접근할 때 가장 먼저 열어보는 파일이 Robots.txt입니다. 여기서 Disallow 지시어를 쓰면 특정 폴더에 봇이 접근하지 못하도록 막을 수 있습니다.
테크니컬 SEO 세팅 시 가장 흔하게 범하는 실수는 '크롤링 차단(Disallow)'과 '색인 차단(noindex 메타 태그)'을 동시에 걸어두는 것입니다. Robots.txt로 봇의 출입 자체를 막아버리면, 페이지 헤더에 심어둔 noindex 태그를 봇이 읽을 수조차 없게 됩니다. 이 상태에서 외부 백링크가 걸리면 크롤링은 안 됐는데 검색 결과에 주소만 덩그러니 노출되는 기현상이 발생하죠. 따라서 검색 결과에서 확실하게 지우고 싶은 페이지라면, 오히려 Robots.txt에서는 접근을 허용해 두고 개별 페이지 내부에 noindex 태그를 삽입해 봇이 직접 읽고 색인을 포기하도록 유도해야 합니다.
중복 문서와 Canonical 태그 정규화
하나의 콘텐츠가 여러 개의 URL로 접속되는 환경은 검색엔진 최적화에서 상당히 불리합니다. 쇼핑몰에서 상품을 '가격순' 등으로 정렬할 때 URL 끝에 '?sort=price' 같은 파라미터가 붙는 경우가 대표적입니다. 구글 봇은 이를 완전히 다른 문서로 인식해 중복 콘텐츠(Duplicate Content) 페널티를 줄 수 있습니다.
이런 중복 문서 이슈를 해결하는 문법이 Canonical 태그입니다. 파라미터로 인해 파생된 URL들의 HTML 헤더에 원본 주소를 가리키는 `rel="canonical"` 태그를 심어두면, 검색엔진은 쪼개진 페이지들의 랭킹 신호를 원본 URL 하나로 통합하여 평가하게 됩니다.
사이트맵(Sitemap) 연계
효율적인 크롤링 제어는 결국 봇의 동선을 낭비 없이 설계하는 과정입니다. noindex와 Canonical 태그로 문서의 기준점과 노출 여부를 확실히 정리한 뒤, 유효한 표준 URL들만 모아 XML 사이트맵을 구성해 제출하는 것이 트래픽 누수를 막는 테크니컬 SEO의 기본 흐름입니다.

댓글 없음:
댓글 쓰기