
웹크롤링 원리
1) selenium 라이브러리를 이용하여 웹 페이지 크롤링 지시
2) selenium은 지정된 web driver을 실행하여 웹 페이지를 실행
3) web driver는 실행된 웹 페이지를 html 소스코드 형태로 데이터를 가져옴
4) BeuatifulSoup을 이용하여 가져온 데이터에서 원하는 데이터(태그, 속성)를 추출
selenium 라이브러리
: 웹 브라우저 프로그램(웹 드라이버)를 이용하여 웹페이지를 열고, 지정한 태그를 찾아서 데이터를 수집함
: 라이브러리 설치 - !pip install selenium
: 웹 브라우저와 브라우저 프로그램이 설치되어 있어야 함
📌크롬 브라우저 프로그램(웹 드라이버)
https://sites.google.com/a/chromium.org/chromedriver/downloads
BeautifulSoup
: 이전 포스팅 참고
https://velog.io/@uniquess/Python-%EC%9B%B9%ED%81%AC%EB%A1%A4%EB%A7%81-BeautifulSoup-%ED%99%9C%EC%9A%A9
검색 작업 처리 순서
1) selenium 웹 페이지 열기
2) 팝업창 닫기
: [닫기] 버튼의 xpath로 요소를 찾아서 .click()
: selenium.find_element_by_xpath()
3) 검색창 선택 및 검색어 입력
: 검색창 id로 요소를 찾고,
: 해당 요소에 검색어를 보냄
: selenium.find_element_by_id()
: 요소.send_keys(검샋어)
4) [검색] 버튼 클릭 / enter
: 위의 방식을 참고하여 검색 버튼을 클릭하거나
: 검색창에 enter 입력하여 검색 효과를 줌
: selenium.find_element_by_xpath()
: 요소.send_keys('\n')