#6 Weekly Paper _robots.txt

Heidi J.·2026년 3월 31일

Weekly_Paper

목록 보기
17/37
post-thumbnail

Q2) robots.txt 파일이란 무엇이며, 웹 스크래핑 시 왜 중요한가요?

1. robots.txt?

  • 웹사이트가 크롤러(봇)에게 주는 접근 규칙 안내 파일
  • "여기는 들어와도 되고, 여기는 들어오지 마세요"라고 알려주는 웹사이트의 이용 가이드
  • 사이트 주소 뒤에 아래와 같이 붙이면 확인 가능:
https://example.com/robots.txt

2. robots.txt가 중요한 이유 ⭐⭐⭐

1) 법적/윤리적 문제 방지

  • robots.txt는 법은 아니지만, 웹사이트 운영자의 "이용 정책"임
  • 무시하고 크롤링하면:
    • 서비스 이용 약관 위반 가능
    • IP 차단
    • 법적 문제까지 갈 수도 있음

2) 서버 부담 방지

  • 웹사이트 입장에서는, 크롤러가 너무 많이 요청하면
    • 서버 과부하
    • 서비스 장애 발생 가능
      -> robots.txt는 이를 방지하기 위한 장치임

3) 크롤링 전략 설계에 도움
robots.txt를 보면:

  • 어떤 페이지가 중요한지
  • 어떤 페이지는 막혀있는지
  • 크롤링 가능한 범위
    -> 데이터 수집 설계 방향을 잡을 수 있음

3. robots.txt는 어떻게 생겼을까?

User-agent: *
Disallow: /admin/
Allow: /public/
  • User-agent: *: 모든 크롤러에게 적용
  • Disallow: /admin/: /admin 경로는 접근 금지
  • Allow: /public/: /public은 접근 허용

4. 스크래핑할 때 활용하는 방법

1) robots.txt 먼저 확인
2) 허용된 경로인지 체크
3) 요청 속도 조절 (sleep 등)
4) 필요한 데이터만 최소한으로 수집

robots.txt는 웹사이트가 크롤러에게 허용/금지 범위를 알려주는 규칙 파일이며,
웹 스크래핑 시 반드시 확인해야 하는 기본적인 윤리 기준이다

😎

profile
꼬꼬마 데분가😎

0개의 댓글