로컬 분산 ETL (하둡, 스파크 ,카프카) 실황 - 0일차

gnswp21·2024년 5월 17일
post-thumbnail

로컬 분산 ETL (하둡, 스파크 ,카프카)을 구현하는 프로젝트를 진행해보려고 합니다. 5일간 진행하는 미니 프로젝트입니다.

깃헙: https://github.com/gnswp21/base-distributed-etl

기능

  • 하둡, 스파크, 카프카로 이루어진 데이터 ETL
    • 전처리해서 저장
      • 고가용성 구성
    • 시각화 일단 스파크로
    • 요청한 데이터 카프카로 전송
    • 어디서 데이터 가져오지? 크롤링 기능

기간

5/18 하루 4시간씩

  • 5/18
  • 5/19
  • 5/20
  • 5/21
  • 5/22

프로젝트 목적

  1. 빅데이터로 데이터 레이크, 데이터 마켓 구성
  2. 아직 숙달되지 못한 기술들의 숙달
    • 카프카 클러스터 브로커
    • 스파크 분산데이터 처리 by scala?
    • 시각화 - elasticsearch?

데이터 후보

네이버 웹툰 데이터
webtoon-data.csv

  • 데이터양이 부족하다! 다른 데이터셋도 찾아봐야겠지만, 데이터셋 자체는 이 프로젝트에서 중요한 문제는 아니므로 마지막에 수정하자.

0개의 댓글