AWS Cloud Practitioner Essentials - Module 8: AI/ML 및 데이터 분석

choi·2026년 7월 23일

AWS Cloud Practitioner

목록 보기
8/9
post-thumbnail

Module 8: AI/ML 및 데이터 분석

AI 및 기계 학습 소개

  • 인공 지능(AI)과 기계 학습(ML)의 개념 체계

    • 인공 지능 (Artificial Intelligence, AI)
      • 정의
        • 인간의 지적 능력(인간과 유사한 태스크 수행)을 시뮬레이션하고 구현하는 지능형 컴퓨터 시스템 개발에 중점을 둔 광범위한 학문 및 기술 분야
      • 특징/이점
        • 단순 규칙 이행을 넘어 구체적인 맥락 이해, 이미지 인식, 자연어 처리, 의사결정 등 인간 수준의 작업을 수행함
    • 기계 학습 (Machine Learning, ML)
      • 정의
        • 명시적인 프로그래밍 명령을 일일이 작성하지 않아도, 방대한 데이터로부터 학습하여 복잡한 태스크를 스스로 수행하도록 시스템을 훈련하는 AI의 하위 분야
      • 특징/이점
        • 과거 데이터에 숨겨진 복잡한 패턴을 발견하여 새로운 상황에 대한 예측 및 조치를 스스로 도출함
  • 기존 프로그래밍 방식 vs 기계 학습(ML) 방식 비교

    • 기존 프로그래밍 (Rule-based Programming)
      • 작동 메커니즘: 개발자가 사전 정의된 고정 규칙(If-Then) 및 정적 관계를 명시적으로 코딩함
      • 예시 (커피숍 주문 시스템): "캐러멜 라떼 구매 이력 고객 -> 덴마크 치즈 추천" 규칙을 하드코딩함
      • 한계: 개별 고객의 성향이나 상황 변화, 제품 특성을 유연하게 반영하지 못함
    • 기계 학습 (ML-based Pattern Recognition)
      • 작동 메커니즘: 방대한 수의 과거 판매 및 고객 반응 데이터를 분석하여 숨겨진 패턴을 추출하고 모델을 생성함
      • 예시: 명시적 규칙 없이도 고객의 구체적 구매 패턴과 취향을 종합 판단하여 정교하고 개인화된 음식/메뉴를 자동 추천함
      • 이점: 고객 만족도 향상 및 매출 증대를 동시에 달성 (고객과 매장의 윈윈 효과)
  • 기계 학습(ML)의 핵심 동작 메커니즘

    • 훈련 (Training)
      • 방대한 과거 데이터(판매 기록, 소셜 미디어 게시물, 센서 측정값, 고객 피드백 등)를 입력하여 데이터 내 숨겨진 패턴과 상관관계를 찾아내고 ML 모델을 생성하는 과정
    • 추론 (Inference)
      • 훈련된 ML 모델에 새로운 데이터(실시간 고객 입력 등)를 적용하여 학습한 패턴을 바탕으로 예측이나 최종 결정을 내리는 과정
  • 비즈니스 혁신을 위한 AI/ML 주요 사용 사례

    • 개인화 추천 엔진 (Personalization Engine)
      • 고객별 개별 취향과 행동 양식을 반영한 실시간 맞춤형 상품 추천 (커피-음식 조합 등)
    • 대화형 AI 키오스크 (자연어 처리, NLP 기반)
      • 자연어 처리(NLP)를 통해 고객의 음성 주문을 실시간 이해하고 결제 시스템에 입력
      • 고정 규칙이 아닌 실시간 대화 흐름에 맞춰 에스프레소 샷 추가나 시즌 신메뉴 제안 등 능동적 질문 수행
    • 소셜 미디어 트렌드 분석 및 미래 수요 예측
      • 현지 소셜 미디어 트렌드 데이터와 과거 판매 실적 데이터를 결합 분석
      • 다음 주 인기 음료 예측, 신메뉴 레시피 아이디어 자동 생성, 원두 구매량 및 미래 매장 수요 예측
  • AWS의 AI/ML 서비스 생태계 및 데이터의 중요성

    • AWS AI/ML 서비스 채택 이점
      • 처음부터 인프라와 알고리즘을 구축하는 시간/비용을 절감하고, 온디맨드 방식으로 AI를 신속 도입 가능
      • Amazon SageMaker AI: 맞춤형 ML 모델의 생성, 훈련, 배포를 종합 지원하는 완전관리형 도구
      • 사전 구축된 AI 서비스 (Pre-built AI Services): 언어 번역, 이미지 인식 등 일반적인 태스크를 위한 즉시 활용 가능한 서비스 제공
    • 올바른 데이터 수집 및 정제의 필수성
      • AI/ML 모델은 판매 기록, 소셜 미디어, 센서 데이터 등 다양한 출처의 훈련 데이터에 의존함
      • 데이터 수집, 정제(Cleaning), 가공 프로세스가 미흡할 경우 AI 예측 정확도가 보장될 수 없으므로 체계적인 데이터 관리가 필수적임
  • 기존 프로그래밍 vs 기계 학습(ML) 비교 요약표

비교 항목기존 프로그래밍 (Rule-based)기계 학습 (ML-based)
작동 원리명시적으로 코딩된 규칙(If-Then) 실행과거 데이터 훈련을 통한 패턴 자동 학습
유연성고정 규칙으로 인해 상황 변화에 유연성 부족새 데이터(추론) 입력 시 실시간 맞춤 결과 도출
개발 방식사람(개발자)이 관계 및 조건문을 일일이 정의데이터 입력 -> 훈련(Training) -> 모델 생성 -> 추론
적합한 분야정형적이고 단순한 예외 처리 업무개인화 추천, NLP 대화, 수요 예측, 패턴 인식

AWS 기반 AI/ML

AWS 기반 ai/ml

  • 산업계에서의 다양한 ML 비즈니스 해결 과제

    • 전자 상거래 및 운영 최적화
      • Amazon.com의 개인화 추천 엔진 구축 및 물류 주문 처리 센터(Fulfillment Center) 작업 최적화
    • 추세 예측 (Trend Prediction)
      • 주식 시장 동향 파악, 미래 주가 예측, 원자재 및 상품 가격 변동성 추정
    • 지능형 의사결정 및 자동 라우팅 (Automated Decision Making)
      • 콜센터 대화형 음성 프롬프트(IVR) 요청을 분석하여 발신 고객을 최적 부서로 자동 라우팅
    • 이상 현상 탐지 (Anomaly Detection)
      • 온라인 뱅킹 및 금융 거래 시스템에서 부정 결제, 이상 거래, 사기 행위(Fraud) 실시간 감지
  • AWS AI/ML 3-티어 솔루션 스택 (3-Tier Stack)

    • 티어 1: AI 서비스 (AWS AI Services)
      • 정의
        • 개발자가 기계 학습 전문 지식 없이도 API 호출만으로 특정 비즈니스 기능을 즉시 사용할 수 있도록 사전 훈련(Pre-trained)되어 제공되는 완전관리형 서비스 계층
      • 대표 서비스 및 특징
        • Amazon Polly: 텍스트를 자연스러운 음성으로 변환 (Text-to-Speech)
        • Amazon Comprehend: 텍스트 문맥 분석, 키워드 추출 및 감정 분석 (Sentiment Analysis)
    • 티어 2: ML 서비스 (AWS ML Services)
      • 정의
        • 기업 고유의 비즈니스 데이터를 기반으로 맞춤형 ML 모델을 직접 제작할 때 사용하는 완전관리형 플랫폼 계층
      • 대표 서비스: Amazon SageMaker AI
        • 완전관리형 인프라, 도구, 워크플로를 제공하여 자체 ML 모델을 구축(Build), 훈련(Train), 배포(Deploy)
        • 단일 통합 환경 내에서 모델 훈련 실험 추적, 데이터 시각화, 모델 디버깅 및 모니터링을 포괄적으로 수행
    • 티어 3: ML 프레임워크 및 인프라 (ML Frameworks & Infrastructure)
      • 정의
        • 고도로 전문화된 딥러닝/ML 솔루션 구축을 위해 널리 사용되는 오픈소스 프레임워크와 목적별 하드웨어를 직접 제어하는 딥 커스텀 계층
      • 주요 구성 요소
        • 널리 사용되는 ML 프레임워크 (PyTorch, TensorFlow 등)와 통합되는 목적별 가속 칩셋 (Purpose-built Chips) 활용
        • ML 워크로드에 특화된 전용 Amazon EC2 가속 인스턴스 환경에서 모델 호스팅 및 훈련 수행
  • AWS AI/ML 3-티어 솔루션 스택 비교 요약표

구분 계층주요 대상 / 제어 수준핵심 메커니즘대표 서비스 및 구성 요소
티어 1: AI 서비스일반 개발자 (ML 지식 불필요)미리 훈련된 사전 구축 모델 API 온디맨드 호출Comprehend, Polly, Transcribe, Translate, Kendra, Rekognition, Textract, Lex, Personalize
티어 2: ML 서비스데이터 사이언티스트 & ML 엔지니어완전관리형 환경에서 커스텀 모델 구축/훈련/배포Amazon SageMaker AI (실험 추적, 디버깅, MLOps 지원)
티어 3: 프레임워크 & 인프라전문 ML 연구원 & 딥러닝 전문가프레임워크 및 전용 칩셋/인프라 직접 제어PyTorch, TensorFlow, MXNet, ML 전용 EC2 가속 인스턴스, EMR, ECS

AWS AI/ML 솔루션 (3-Tier 상세)

  • 티어 1: 사전 구축된 AWS AI 서비스 (Pre-built AI Services)

    • 언어 서비스 (Language Services)
      • Amazon Comprehend
        • 정의: 자연어 처리(NLP)를 사용하여 문서 내 핵심 문구, 언어, 감정(Sentiment) 등 핵심 인사이트를 자동 추출하는 서비스
        • 주요 사용 사례: 콘텐츠 자동 분류, 고객 감정 분석, 규정 준수(Compliance) 모니터링
      • Amazon Polly
        • 정의: 텍스트를 실제와 같은 다국어, 다양한 성별 및 억양의 자연스러운 음성으로 변환(Text-to-Speech, TTS)하는 서비스
        • 주요 사용 사례: 시각 장애인을 위한 가상 어시스턴트, e-러닝 애플리케이션, 음성 접근성(Accessibility) 개선
      • Amazon Transcribe
        • 정의: 음성을 다국어 텍스트로 자동 변환(Speech-to-Text, STT)하며, 화자 식별, 사용자 지정 어휘, 실시간 트랜스크립션을 제공하는 서비스
        • 주요 사용 사례: 고객 콜센터 통화 내용 트랜스크립션, 비디오 자동 자막 생성, 미디어 콘텐츠용 메타데이터 추출
      • Amazon Translate
        • 정의: 여러 언어 간의 실시간 및 배치(Batch) 텍스트 번역을 지원하는 신경망 기계 번역 서비스
        • 주요 사용 사례: 다국어 문서 번역, 글로벌 애플리케이션 다국어 연동
    • 컴퓨터 비전 및 검색 서비스 (Computer Vision & Search Services)
      • Amazon Kendra
        • 정의: 자연어 처리(NLP)를 사용하여 대량의 엔터프라이즈 콘텐츠 내에서 쿼리 문맥을 이해하고 정확한 답변을 도출하는 지능형 검색 서비스
        • 주요 사용 사례: 사내 지식 기반 지능형 검색, 챗봇 검색 연동, 애플리케이션 내부 검색 통합
      • Amazon Rekognition
        • 정의: Amazon S3에 저장된 이미지 및 동영상 내의 물체, 사람, 텍스트, 장면, 활동을 식별 및 분석하는 컴퓨터 비전 서비스
        • 주요 사용 사례: 부적절한 콘텐츠 자동 조정(Moderation), 사용자 자격 증명/얼굴 확인, 미디어 분석, 홈 오토메이션
      • Amazon Textract
        • 정의: 단순 OCR을 넘어 문서, 양식, 표(Table) 내의 타이핑 텍스트 및 손글씨(Handwriting) 텍스트를 자동 감지하고 추출하는 서비스
        • 주요 사용 사례: 금융, 의료, 정부 기관의 각종 문서/서식/양식 텍스트 자동 추출 및 프로세스 신속화
    • 대화형 AI 및 개인화 서비스 (Conversational AI & Personalization Services)
      • Amazon Lex
        • 정의: 자연어 이해(NLU) 및 자동 음성 인식(ASR) 기술을 활용해 음성 및 텍스트 대화형 인터페이스(챗봇)를 구축하는 서비스
        • 주요 사용 사례: 가상 어시스턴트, FAQ 자연어 검색, 애플리케이션 대화형 봇
      • Amazon Personalize
        • 정의: 과거 사용자 행동 데이터를 기반으로 고객 맞춤형 권장 사항(추천)을 제공하는 지능형 추천 엔진 서비스
        • 주요 사용 사례: 맞춤형 미디어 스트리밍 추천, 전자 상거래 제품 추천, 실시간 인기 상승 항목 추천
  • 티어 2: ML 서비스 (Amazon SageMaker AI)

    • Amazon SageMaker AI의 개념
      • 인프라 관리 부담 없이 자체 ML 모델을 구축(Build), 훈련(Train), 배포(Deploy)할 수 있도록 단일 IDE 및 사전 훈련된 수백 개의 모델을 제공하는 완전관리형 ML 플랫폼
    • SageMaker AI의 3대 핵심 이점
      • 다양한 ML 도구 선택 (Flexible Tools): 데이터 사이언티스트용 IDE부터 비즈니스 분석가용 노코드(No-Code) 인터페이스까지 다양한 페르소나별 도구 제공
      • 완전관리형 인프라 (Fully Managed Infrastructure): 비용 효율적이고 고성능 인프라를 AWS가 자동 분산 관리하여 개발자가 모델 개발에만 집중하도록 지원
      • 반복 가능한 ML 워크플로 (Repeatable MLOps): 전사적 MLOps 관행 및 거버넌스를 자동화·표준화하여 시스템 투명성과 감사(Audit) 기능을 제공
  • 티어 3: ML 프레임워크 및 인프라 (Frameworks & Infrastructure)

    • 개요
      • ML 훈련 프로세스를 완전하게 제어해야 하는 고도의 기술적 조직을 위한 딥 커스텀 하드웨어 및 소프트웨어 계층
    • 핵심 구성 요소
      • ML 프레임워크 (ML Frameworks): PyTorch, Apache MXNet, TensorFlow 등 사전 구축 및 최적화된 딥러닝 라이브러리 및 도구 전면 지원
      • AWS ML 인프라 (ML Infrastructure): ML에 최적화된 Amazon EC2 가속 인스턴스(GPU/전용 칩셋), Amazon EMR, Amazon ECS 등 고성능·고유연성 워크로드 환경 제공
  • 티어 1 사전 구축 AWS AI 서비스 요약표

서비스 명칭분류 범주주 기능 및 메커니즘핵심 사용 사례
Amazon Comprehend언어 서비스NLP 기반 문맥/감정 분석 및 핵심 문구 추출콘텐츠 분류, 고객 감정 분석, 규정 준수
Amazon Polly언어 서비스텍스트를 자연스러운 다국어 음성으로 변환 (TTS)가상 어시스턴트, e-러닝, 접근성 개선
Amazon Transcribe언어 서비스음성을 다국어 텍스트로 변환 (STT), 화자 식별콜센터 통화 트랜스크립션, 자동 자막
Amazon Translate언어 서비스실시간 및 배치 신경망 다국어 텍스트 번역다국어 문서 번역, 글로벌 앱 통합
Amazon Kendra비전/검색 서비스NLP 기반 엔터프라이즈 문맥 이해 지능형 검색지능형 사내 검색, 챗봇 연동
Amazon Rekognition비전/검색 서비스이미지/동영상 내 물체, 사람, 얼굴, 텍스트 분석콘텐츠 조정, 자격 증명 확인, 미디어 분석
Amazon Textract비전/검색 서비스문서, 양식, 표 내의 인쇄/손글씨 텍스트 자동 추출금융/의료/정부 양식 서류 자동화
Amazon Lex대화/개인화 서비스NLU & ASR 기반 음성/텍스트 대화형 챗봇 구축가상 어시스턴트, FAQ 봇
Amazon Personalize대화/개인화 서비스과거 행동 데이터 기반 실시간 맞춤형 추천 엔진맞춤 스트리밍, 제품 추천, 인기 항목 추천

AWS 기반 생성형 AI 소개

  • AI - ML - 딥러닝 - 생성형 AI 계층 구조
    • 딥러닝 (Deep Learning, DL)
      • 정의
        • 인간의 뇌 신경망을 모방한 인공 뉴런(수학적 함수 계층)을 사용하여 다차원 정보 및 복잡한 패턴을 훈련하는 기계 학습(ML)의 하위 분야
      • 특징/이점
        • 인공 뉴런의 각 계층이 이전 계층의 정보를 요약·전달하는 방식으로 컴퓨터 비전, 자연어 처리(NLP) 등 고도의 복잡한 문제를 해결함
    • 생성형 AI (Generative AI)
      • 정의
        • 사전 훈련된 초대형 파운데이션 모델(FM)을 기반으로 대화, 스토리, 이미지, 동영상, 음악, 코드 등 새로운 콘텐츠와 아이디어를 창작하는 딥러닝의 고도화된 한 종류
      • 핵심 기반: 파운데이션 모델 (Foundation Models, FM)
        • 방대한 데이터 컬렉션을 활용해 사전 훈련된 초대형 기계 학습 모델
        • 단일 태스크만 수행하는 기존 ML 모델과 달리, 하나의 사전 훈련된 FM으로 여러 다중 태스크(Multi-Task)를 유연하게 수행할 수 있음
      • 대규모 언어 모델 (Large Language Models, LLM)
        • 인간의 언어 작동 원리를 학습하기 위해 방대한 양의 텍스트 데이터로 훈련된 대표적인 파운데이션 모델 유형

AWS 생성형 AI 솔루션

  • Amazon SageMaker JumpStart

    • 정의
      • 컴퓨터 비전, NLP, 테이블 형식 데이터 등 다양한 영역의 사전 구축 ML 솔루션 라이브러리를 보유하여 모델 구축, 훈련, 배포 프로세스를 신속 가속화하는 SageMaker AI 내 기계 학습 허브
    • 핵심 기능 및 특징
      • 클릭 몇 번만으로 사전 훈련된 모델을 즉시 배포할 수 있으며, 분야별 자체 데이터를 활용해 특정 사용 사례에 맞게 모델을 미세 조정(Fine-Tuning) 가능함
    • 일반적인 3대 사용 사례
      • 신속한 ML 모델 배포 (Fast Model Deployment): 깊은 ML 전문 지식이 없어도 사전 훈련된 모델을 즉시 신속하게 배포함
      • 미세 조정된 사용자 지정 솔루션 (Fine-Tuned Customization): 도메인 특화 데이터를 활용해 사전 훈련된 파운데이션 모델(FM)을 미세 조정함
      • ML 실험 및 프로토타입 (ML Experiments & Prototypes): 특정 솔루션 접근 방식을 결정하기 전 여러 파운데이션 모델의 성능을 상호 비교·검증함
  • Amazon Bedrock

    • 정의
      • 인프라 관리 없이 단일 통합 API를 통해 Amazon 자체 FM 및 주요 AI 스타트업(Claude, Stable Diffusion 등)의 고성능 파운데이션 모델에 액세스할 수 있도록 설계된 완전관리형 서비스
    • 핵심 기능 및 특징
      • FM 모델들을 신속하게 실험하고, 비공개(Private) 데이터로 안전하게 미세 조정하여 AWS 애플리케이션에 원활하게 통합할 수 있음
    • 일반적인 3대 사용 사례
      • 엔터프라이즈급 생성형 AI (Enterprise-Grade GenAI): 엔터프라이즈급 보안, 개인정보 보호 기능, 높은 확장성을 바탕으로 프로덕션에 즉시 사용할 수 있는 생성형 AI 앱 구축
      • 다중 모달 콘텐츠 생성 (Multimodal Content Generation): 텍스트 및 이미지 등 여러 가지 미디어 콘텐츠 유형을 동시에 창작할 수 있는 애플리케이션 개발
      • 고급 대화형 AI (Advanced Conversational AI): 기업 사내 데이터 리포지토리에 연결하여 높은 정확도의 답변을 제공하는 지능형 대화 에이전트 개발
  • Amazon Q 제품군 (Amazon Q Business & Developer)

    • 정의
      • 기업의 비즈니스 프로세스를 간소화하고 의사 결정을 가속화하며 직원의 업무 생산성을 획기적으로 향상시키는 대화형 생성형 AI 어시스턴트
    • Amazon Q Business
      • 정의: 회사의 내부 정보 리포지토리 및 공통 시스템에 대한 보안 연결을 통해 긴급한 질의에 답변하고 업무 조치를 수행하는 비즈니스 어시스턴트
      • 주요 사용 사례: 사내 정보 요청 답변, 자동화된 워크플로 실행, 내부 인사이트 추출 및 보고서 생성
    • Amazon Q Developer
      • 정의: C#, Java, JavaScript, Python, TypeScript 등 다양한 코딩 언어로 개발을 가속화할 수 있도록 전체 함수 및 논리적 코드 블록 단위 추천 코드를 생성하는 전문 개발 어시스턴트
      • 주요 사용 사례: 코드 생성 속도 향상, 코드 수명 주기 내 안정성 및 보안성 강화, 자동화된 코드 검토(Code Review) 수행
  • AWS 생성형 AI 주요 솔루션 비교 요약표

솔루션 명칭서비스 성격 / 제공 방식주요 기술 / 메커니즘핵심 이점 및 대표 사용 사례
Amazon SageMaker JumpStartSageMaker 내 ML 모델 허브사전 구축 모델 카탈로그, 클릭 배포, 커스텀 미세 조정신속 배포, 분야별 데이터 미세 조정, FM 실험 및 프로토타입
Amazon Bedrock완전관리형 통합 FM API 서비스단일 API로 Claude, Stable Diffusion, Amazon FM 등 제공엔터프라이즈 보안/개인정보 보호 AI, 다중 모달 콘텐츠, 대화 에이전트
Amazon Q Business엔터프라이즈 대화형 AI 어시스턴트사내 정보 리포지토리 보안 연결 및 통합 답변 도출사내 정보 요청, 자동화 워크플로, 비즈니스 인사이트 추출
Amazon Q Developer개발자 전용 AI 생성 어시스턴트IDE 통합, C#, Java, JS, Python, TS 함수/코드 블록 추천코드 생성 가속, 코드 보안/안정성 강화, 자동 코드 검토

데이터 분석

데이터 분석 소개

  • 전통적 데이터 분석 (Data Analytics)의 개념 및 필요성

    • 정의
      • 분석가가 원시 과거(Historical) 데이터를 수집, 변환, 처리하여 의사 결정에 필요한 중요한 인사이트와 추세를 도출해 내는 전통적 분석 과정
    • AI/ML과의 관계 및 차이점
      • 공통점: AI/ML과 전통적 데이터 분석 모두 정제되고 액세스 가능한 대용량 데이터를 필수 기반으로 사용함
      • 소규모 데이터세트에서의 경제성: 데이터 규모가 소형인 경우 데이터 분석 방식이 AI/ML 모델 구축에 비해 비용과 처리 속도 측면에서 훨씬 효율적이고 경제적임
      • 설명 가능성(Explainability) 및 정밀성: 규제 기관 승인이나 통계적 가설 검증 등 판단 근거를 논리적으로 명확히 입증해야 하는 영역에서 필수적임
    • 대표적인 실제 사용 사례 (3가지)
      • 금융 분야 대출 심사 설명: 대출 회사가 고객에게 대출/융자 결정의 판단 이유를 투명하게 설명
      • 의학 연구 임상시험 분석: 의학 연구자가 가설 검증(Hypothesis Testing) 등 전통 통계 방법으로 임상 시험 데이터 분석
      • 보험사 위험 평가 모델 투명성 확보: 규제 기관의 요건을 충족하고 승인을 얻기 위해 위험 평가(Risk Assessment) 모델의 정당성 증명
  • 데이터 통합 저장소 및 파이프라인 개념

    • 데이터 레이크 (Data Lake)
      • 정의: 기업 내 다양한 시스템과 형식을 가진 모든 정형/비정형 원시(Raw) 데이터를 단일 위치에 대규모로 통합 적재하는 거대한 중앙 저장소 (예: Amazon S3)
    • ETL / ELT 파이프라인 (Data Pipeline)
      • 정의: 여러 출처에 흩어져 있는 데이터를 수집, 변환, 로드하여 분석 도구 및 AI 알고리즘이 소비할 수 있는 형태로 자동 처리하는 조립 라인(Assembly Line) 성격의 파이프라인
      • ETL (Extract - Transform - Load)
        • 1. 추출 (Extract): 다양한 소스 시스템에서 원시 데이터 수집
        • 2. 변환 (Transform): 다운스트림 분석 도구가 사용할 수 있는 일관된 형태로 정제 및 가공
        • 3. 로드 (Load): 데이터 웨어하우스(Amazon Redshift)나 분석 플랫폼 대상 시스템에 적재
      • ELT (Extract - Load - Transform)
        • 원시 데이터를 먼저 대상 시스템에 수집 및 로드(Load)한 후, 필요에 따라 다운스트림에서 변환(Transform)하는 방식
      • ETL 불필요 (Zero-ETL) 환경: 데이터가 이미 사용 가능한 일관된 표준 형식으로 대상 위치에 존재하는 경우 변환 과정 없이 즉시 활용
  • AWS 데이터 분석 서비스 통합 생태계 (Data Analytics Ecosystem)

    • 데이터 파이프라인 단계별 핵심 서비스군
      • 데이터 수집 (Ingestion): Amazon Kinesis, AWS Glue
      • 스토리지 & 데이터 레이크 (Storage & Data Lake): Amazon S3 (데이터 레이크), Amazon Redshift (데이터 웨어하우스)
      • 데이터 처리 및 연산 (Processing): Amazon EMR (대규모 분산 클러스터 처리)
      • 시각화 및 비즈니스 인텔리전스 (Visualization & BI): Amazon QuickSight
    • 동일 데이터세트 기반의 다중 팀 활용 사례 (Single Dataset, Multiple Uses)
      • Amazon S3 데이터 레이크에 원시 데이터세트를 통합 수집한 후:
        • 마케팅/경영진 팀: Amazon QuickSight를 통해 비즈니스 인텔리전스(BI) 대시보드 시각화 및 인사이트 분석 수행
        • 데이터 사이언스 팀: Amazon SageMaker AI를 통해 동일한 S3 데이터세트를 직접 참조하여 ML 모델 훈련 수행
  • ETL 파이프라인 방식 및 AWS 데이터 분석 서비스 요약표

구분 / 서비스역할 및 메커니즘특징 및 적용 시기대표 서비스
ETL 패턴추출(Extract) -> 변환(Transform) -> 적재(Load)데이터를 대상 시스템 적재 전 정제·가공하여 일관된 형식 변환AWS Glue
ELT 패턴추출(Extract) -> 적재(Load) -> 변환(Transform)데이터를 먼저 원시 적재 후 요구사항에 맞춰 실시간 변환Amazon Redshift
데이터 수집 & 파이프라인스트리밍 및 배치 데이터 수집 / 자동화 파이프라인데이터 수집 및 ETL 흐름 조립 라인 자동화Amazon Kinesis, AWS Glue
스토리지 & 레이크거대한 단일 통합 원시 데이터 중앙 저장소모든 비정형/정형 데이터 무제한 저장Amazon S3, Amazon Redshift
데이터 처리 & BI대규모 분산 빅데이터 처리 및 BI 시각화대용량 분산 연산 및 경영 진단 시각화 리포트Amazon EMR, Amazon QuickSight

AWS 기반 데이터 파이프라인

  • 데이터 파이프라인 (Data Pipeline)의 개념 및 목적

    • 정의
      • 데이터 소스에서 대상 스토리지 및 분석 시스템으로 데이터를 수집, 카탈로그화, 변환, 전달하는 전 과정을 자동화하는 데이터 조립 라인(Assembly Line)
    • 핵심 이점
      • 프로세스 간소화를 통해 수동 데이터 처리 개입을 최소화하고 데이터 오류 발생율을 절감함
  • 데이터 파이프라인 5단계 아키텍처 및 핵심 AWS 서비스군

    • 1단계: 데이터 수집 서비스 (Data Ingestion)
      • 수집 방식 구분: 지연시간 없는 즉시 처리를 위한 실시간 수집 vs 지연시간이 허용되는 정기 지연 처리를 위한 배치 수집
      • Amazon Kinesis Data Streams
        • 정의: 애플리케이션, 센서, 라이브 스트림에서 테라바이트(TB) 규모의 데이터를 실시간으로 수집하는 서버리스 스트리밍 서비스
        • 주요 특징: 자동 프로비저닝 및 오토스케일링 지원, 다수의 애플리케이션이 동일 스트림 데이터를 동시에 소비 가능 (예: 금융사의 실시간 주식 시장 시세 수집 및 즉각 거래 판단)
      • Amazon Data Firehose
        • 정의: 수집된 스트리밍 데이터를 몇 초 내(Near Real-time)로 데이터 레이크, 데이터 웨어하우스, 분석 서비스로 자동 로드하는 완전관리형 스트리밍 ETL 서비스
        • 주요 특징: 데이터 캡처 후 목적지 자동 로드 (예: IoT 스마트 홈 디바이스 로그 수집 및 장기 보관용 데이터 레이크 적재)
    • 2단계: 데이터 스토리지 서비스 (Data Storage)
      • Amazon S3 (Data Lake)
        • 정의: 방대한 양의 정형/비정형 원시 데이터를 거의 무제한으로 유연하게 저장할 수 있는 표준 객체 스토리지 데이터 레이크 솔루션
        • 주요 특징: 데이터 증감에 따라 크기가 자동 조정되는 높은 탄력성과 데이터 유연성 제공
      • Amazon Redshift (Data Warehouse)
        • 정의: 페타바이트(PB) 규모의 정형 및 반정형 데이터를 저장하고 비즈니스 인텔리전스(BI)에 최적화된 완전관리형 데이터 웨어하우스
        • 주요 특징: 열 형식(Columnar) 스토리지 및 대규모 병렬 처리(MPP) 지원, 비용 효율적 종량제 쿼리 분석 수행
    • 3단계: 데이터 카탈로그화 서비스 (Data Cataloging)
      • 메타데이터 관리의 필요성: 데이터의 찍힌 장소/시간 정보처럼 조직 데이터세트에 대한 메타데이터 인벤토리를 생성하여 데이터 탐색 효율화
      • AWS Glue 데이터 카탈로그 (AWS Glue Data Catalog)
        • 정의: 확장 가능한 중앙 집중식 관리형 메타데이터 리포지토리
        • 주요 특징: 다양한 데이터 스토어 및 분석 서비스 간 메타데이터를 전달하고 중앙 관제하여 파이프라인 검색 성능 향상
    • 4단계: 데이터 처리 및 변환 서비스 (Data Processing)
      • AWS Glue
        • 정의: 데이터 분석을 바로 시작할 수 있도록 데이터를 정제 및 변환하는 완전관리형 서버리스 ETL 서비스
        • 주요 특징: Visual ETL 작업 생성, 코드 없이 스크립트 작성(No-Code), Glue 데이터 카탈로그 연동 메타데이터 기반 자동 변환 지원
      • Amazon EMR
        • 정의: Apache Spark, Apache Hadoop, Apache Hive 등 널리 사용되는 오픈소스 빅데이터 프레임워크를 활용하는 대규모 분산 데이터 처리 서비스
        • 주요 특징: 인프라 프로비저닝, 클러스터 관리, 오토스케일링을 자동 처리하며, 빅데이터 전문 지식과 사용자 지정 커스텀 구성이 필요한 조직에 적합
    • 5단계: 데이터 분석 및 시각화 서비스 (Data Analytics & Visualization)
      • Amazon Athena
        • 정의: 표준 SQL문으로 Amazon S3 또는 하이브리드/멀티클라우드 환경의 다양한 데이터 소스(관계형, 비관계형, 객체)를 직접 쿼리 분석하는 완전관리형 서버리스 서비스
        • 주요 특징: 별도 DB 인프라 구축이나 ETL 없이 S3 데이터를 직접 조회하며, 실행한 쿼리 스캔 용량에 대해서만 과금
      • Amazon Redshift (고성능 분석 엔진)
        • 정의: 대규모 데이터세트에 대해 빈도가 높은 고성능 OLAP SQL 쿼리를 대규모 병렬 구조로 처리하는 데이터 웨어하우스
      • Amazon QuickSight
        • 정의: 다양한 데이터 소스에서 대화형 BI 대시보드 및 리포트를 빠르게 생성하는 클라우드 네이티브 비즈니스 인텔리전스 서비스
        • 주요 특징: Amazon Q 자연어 쿼리(NLQ)가 통합되어 사용자가 자연어로 질의하여 몇 초 내 유용한 인사이트를 구축, 발견, 공유 가능
      • Amazon OpenSearch Service
        • 정의: 비즈니스 및 운영 데이터를 실시간으로 검색, 모니터링, 분석하는 오픈소스 검색 엔진 관리형 서비스
        • 주요 특징: 애플리케이션 모니터링, 로그 분석, 시스템 관찰성(Observability), 웹사이트 검색 및 실시간 시각화 대시보드 제공
  • AWS 데이터 파이프라인 5단계 핵심 서비스 요약표

파이프라인 단계대표 역할 및 기능지원 방식 / 특성대표 AWS 서비스
1. 수집 (Ingestion)소스에서 스토리지를 데이터 수집/이동실시간 스트리밍 / 준실시간 ETL 전달Amazon Kinesis Data Streams, Amazon Data Firehose
2. 스토리지 (Storage)데이터 중앙 통합 보관객체 기반 데이터 레이크 / 정형 데이터 웨어하우스Amazon S3, Amazon Redshift
3. 카탈로그화 (Cataloging)데이터 메타데이터 중앙 인벤토리 관리메타데이터 자동 추출 및 통합 관리AWS Glue Data Catalog
4. 처리/변환 (Processing)데이터 정제, 가공 및 변환 (ETL)서버리스 Visual ETL / 오픈소스 빅데이터 클러스터AWS Glue, Amazon EMR
5. 분석/시각화 (Analytics & BI)SQL 쿼리 분석 및 대시보드 시각화서버리스 SQL 쿼리, BI 대시보드, 실시간 로그 검색Amazon Athena, Amazon Redshift, QuickSight, OpenSearch

실제 환경에서의 클라우드

데이터 분석 및 AI/ML

  • 실무 비즈니스 시나리오: 전자 상거래 앱의 실시간 데이터 분석 및 추천 ML 모델 파이프라인

    • 비즈니스 목표: 앱 사용자 행동 및 과거 구매 데이터를 수집·가공하여, 데이터 과학자의 임시(Ad-hoc) 분석과 ML 엔지니어의 추천 ML 모델 지속 훈련을 동일 데이터세트로 자동화함
  • 엔드투엔드 데이터 파이프라인 8단계 흐름 (End-to-End Workflow)

    • 1단계: 개인화 추천 제공 (ML Inference)
      • 전자 상거래 앱이 훈련된 ML 모델을 사용하여 고객에게 실시간 맞춤형 제품 권장 사항(추천)을 제공함
    • 2단계: 트랜잭션 데이터 저장 (Amazon DynamoDB)
      • 애플리케이션을 통해 수집된 과거 고객 구매 트랜잭션 데이터를 Amazon DynamoDB에 저장함
      • 기술적 한계: DynamoDB는 저지연 읽기/쓰기에는 최적이나, 전체 데이터를 스캔하여 ML 모델을 훈련하는 용도로는 부적합하여 데이터 레이크로의 이관이 필수적임
    • 3단계: 스트리밍 데이터 수집 및 집계 (Kinesis Data Streams & Data Firehose)
      • DynamoDB와 Firehose 간 직접 연동이 불가능하므로, 먼저 Amazon Kinesis Data Streams로 DynamoDB 데이터 변경 사항(CDC)을 스트리밍함
      • Amazon Data Firehose가 Kinesis Data Streams로부터 수집된 데이터를 수신하여 준실시간으로 집계 및 전달 준비함
    • 4단계: 데이터 변환 및 포맷팅 (AWS Lambda)
      • DynamoDB 소스 데이터는 JSON 형태이나, ML 엔지니어 및 데이터 과학자는 .csv 표준 포맷을 필요로 함
      • Data Firehose가 AWS Lambda 함수를 자동 간접 호출하여 JSON 소스 데이터를 .csv 포맷으로 실시간 변환 처리함
    • 5단계: 중앙 데이터 레이크 통합 적재 (Amazon S3)
      • 변환이 완료된 .csv 데이터를 중앙 데이터 레이크인 Amazon S3 버킷에 저장하여 복수의 데이터 소비팀이 동시 활용할 수 있도록 전달함
    • 6단계: 데이터 카탈로그화 및 메타데이터 정의 (AWS Glue Data Catalog)
      • AWS Glue 데이터 카탈로그를 메타데이터 리포지토리로 사용하여 S3에 저장된 .csv 데이터의 스키마 및 물리적 위치를 설명하는 카탈로그 테이블을 정의함
    • 7단계: 임시 SQL 데이터 분석 (Amazon Athena)
      • 데이터 과학팀은 S3 밖으로 데이터를 별도 이동하지 않고, Glue 데이터 카탈로그의 스키마 정보를 참조하여 Amazon Athena를 통해 표준 SQL 쿼리를 실행해 비즈니스 인사이트를 도출함
    • 8단계: ML 모델 지속 훈련 (Amazon SageMaker AI)
      • ML 엔지니어링팀은 Amazon SageMaker AI를 통해 S3 데이터 레이크에서 최신 데이터를 직접 읽어와 개인화 추천 ML 모델의 새 버전을 지속적으로 훈련(Re-training)함
  • 실제 환경에서의 데이터 분석 & AI/ML 서비스 연동 가이드표

단계 / 서비스주요 데이터 형식 / 상태서비스 간 연동 역할 및 목적
1~2. 앱 & DynamoDB트랜잭션 JSON 데이터지연 시간이 짧은 과거 앱 트랜잭션 데이터 1차 적재
3. Kinesis & Firehose스트리밍 변경 데이터 (CDC)DynamoDB 변경 사항을 Kinesis로 스트리밍 후 Firehose로 준실시간 집계
4. AWS LambdaJSON -> .csv 포맷 변환Firehose 연동을 통해 ML/분석 전용 포맷(.csv)으로 동적 데이터 변환
5. Amazon S3.csv 파일 (데이터 레이크)다양한 부서/팀에서 공동 활용할 중앙 데이터 레이크에 최종 적재
6. AWS Glue Data Catalog스키마 & 위치 메타데이터S3에 저장된 데이터의 스키마 구조를 자동 정의하는 카탈로그 생성
7. Amazon Athena표준 SQL 쿼리 결과Glue 카탈로그를 활용해 S3 데이터를 이동 없이 직접 SQL 임시 분석
8. Amazon SageMaker AI최신 훈련 데이터세트S3에서 최신 데이터를 직접 읽어 개인화 추천 ML 모델 최신 버전 훈련
profile
Builder, Sweeper

0개의 댓글