[Python] 웹크롤링 - 환경설정 및 검색어 자동 실행

uniquess·2021년 4월 23일
post-thumbnail

웹크롤링 환경설정

  1. 웹크롤링 원리

    1) selenium 라이브러리를 이용하여 웹 페이지 크롤링 지시
    2) selenium은 지정된 web driver을 실행하여 웹 페이지를 실행
    3) web driver는 실행된 웹 페이지를 html 소스코드 형태로 데이터를 가져옴
    4) BeuatifulSoup을 이용하여 가져온 데이터에서 원하는 데이터(태그, 속성)를 추출

  2. selenium 라이브러리
    : 웹 브라우저 프로그램(웹 드라이버)를 이용하여 웹페이지를 열고, 지정한 태그를 찾아서 데이터를 수집함
    : 라이브러리 설치 - !pip install selenium
    : 웹 브라우저와 브라우저 프로그램이 설치되어 있어야 함

    📌크롬 브라우저 프로그램(웹 드라이버)
    https://sites.google.com/a/chromium.org/chromedriver/downloads

  3. BeautifulSoup
    : 이전 포스팅 참고
    https://velog.io/@uniquess/Python-%EC%9B%B9%ED%81%AC%EB%A1%A4%EB%A7%81-BeautifulSoup-%ED%99%9C%EC%9A%A9

검색 자동 실행

이용 페이지 : https://korean.visitkorea.or.kr/main/main.do#home

  • 검색 작업 처리 순서

    1) selenium 웹 페이지 열기

    2) 팝업창 닫기
    : [닫기] 버튼의 xpath로 요소를 찾아서 .click()
    : selenium.find_element_by_xpath()

    3) 검색창 선택 및 검색어 입력
    : 검색창 id로 요소를 찾고,
    : 해당 요소에 검색어를 보냄
    : selenium.find_element_by_id()
    : 요소.send_keys(검샋어)

    4) [검색] 버튼 클릭 / enter
    : 위의 방식을 참고하여 검색 버튼을 클릭하거나
    : 검색창에 enter 입력하여 검색 효과를 줌
    : selenium.find_element_by_xpath()
    : 요소.send_keys('\n')

profile
끄적끄적 개발일기

0개의 댓글