
여태까지 온프레미스 기반 DataLake를(Airflow->Hadoop&Spark) 운영해왔고, AWS 생태계로 영역을 확장하고자 본 수강을 듣게 되었다.
마침 회사에서도 AWS기반 데이터 파이프라인으로 구현할 예정이고 사전에 개인 프로젝트로 강좌를 따라가면서 구축을 해볼 생각이다.
본 포스팅에서는 실습 과정과 내용을 공유할 예정이다.


AWS에서 파이프라인을 구축하면서 아래와 같이 비용 효율적으로 구축하는 것이 가능하다.

아래 아키텍처로 구성하기 위해서는 사전 실습 준비가 필요하다.

Key pair 생성

IAM 및 Access key 생성

SG(Security Group) 생성하기



여기서 막힘.. E2C를 Medium 자원 이상으로 띄우기 위해서는 유료 플랜으로의 업그레이드가 필요하다.. (바로 돈은 안나가니 진행했다.)
휴.. 성공!!

5.SSH 클라이언트 접속까지 해보기

ssh로 ec2에 git 설치
*강좌 관련 github (https://github.com/njkwon/fc-storydata/blob/main/script/%EC%8B%A4%EC%8A%B5%EC%A4%80%EB%B9%84.txt)

실습관련 소스코드를 ec2에 clone
git clone -b main --single-branch https://github.com/njkwon/fc-storydata/

오류!! (s3생성 정책이 없어서 부여하였다..)

드디어 생성 완료...(버킷 이름도 고유의 이름으로 바꿨다.)



내용이 너무 많아서 다음 글에서는 EC2에서 Kafka 실습하는 것을 해볼 예정이자.