
Q2) robots.txt 파일이란 무엇이며, 웹 스크래핑 시 왜 중요한가요?
https://example.com/robots.txt
1) 법적/윤리적 문제 방지
2) 서버 부담 방지
3) 크롤링 전략 설계에 도움
robots.txt를 보면:
User-agent: *
Disallow: /admin/
Allow: /public/
User-agent: *: 모든 크롤러에게 적용Disallow: /admin/: /admin 경로는 접근 금지Allow: /public/: /public은 접근 허용1) robots.txt 먼저 확인
2) 허용된 경로인지 체크
3) 요청 속도 조절 (sleep 등)
4) 필요한 데이터만 최소한으로 수집
robots.txt는 웹사이트가 크롤러에게 허용/금지 범위를 알려주는 규칙 파일이며,
웹 스크래핑 시 반드시 확인해야 하는 기본적인 윤리 기준이다
😎