AWS 데이터 파이프라인 구축 (1.환경셋팅)

SH.KIM·2026년 8월 15일
post-thumbnail

여태까지 온프레미스 기반 DataLake를(Airflow->Hadoop&Spark) 운영해왔고, AWS 생태계로 영역을 확장하고자 본 수강을 듣게 되었다.
마침 회사에서도 AWS기반 데이터 파이프라인으로 구현할 예정이고 사전에 개인 프로젝트로 강좌를 따라가면서 구축을 해볼 생각이다.
본 포스팅에서는 실습 과정과 내용을 공유할 예정이다.


AWS에서 파이프라인을 구축하면서 아래와 같이 비용 효율적으로 구축하는 것이 가능하다.


AWS기반 실습 준비

아래 아키텍처로 구성하기 위해서는 사전 실습 준비가 필요하다.

  1. Key pair 생성

  2. IAM 및 Access key 생성

  3. SG(Security Group) 생성하기

  1. 드디어 EC2 띄우기!!!

여기서 막힘.. E2C를 Medium 자원 이상으로 띄우기 위해서는 유료 플랜으로의 업그레이드가 필요하다.. (바로 돈은 안나가니 진행했다.)

휴.. 성공!!

5.SSH 클라이언트 접속까지 해보기

  1. ssh로 ec2에 git 설치
    *강좌 관련 github (https://github.com/njkwon/fc-storydata/blob/main/script/%EC%8B%A4%EC%8A%B5%EC%A4%80%EB%B9%84.txt)

  2. 실습관련 소스코드를 ec2에 clone
    git clone -b main --single-branch https://github.com/njkwon/fc-storydata/

  1. s3 버킷 만들기
    S3를 통해 데이터를 다운로드를 받을 저장공간을 확보한다.

오류!! (s3생성 정책이 없어서 부여하였다..)

드디어 생성 완료...(버킷 이름도 고유의 이름으로 바꿨다.)

  1. git sync
    $ aws s3 sync . s3://$bucketname --exclude '.git/*' 명령어로 싱크한다.
    이후 aws 콘솔에서 확인한다.
    아래와 같이 싱크 한게 보인다!!

내용이 너무 많아서 다음 글에서는 EC2에서 Kafka 실습하는 것을 해볼 예정이자.

profile
개인화 어시스턴트 플랫폼 (assistberry.com) 호스트

0개의 댓글