
인공 지능(AI)과 기계 학습(ML)의 개념 체계
기존 프로그래밍 방식 vs 기계 학습(ML) 방식 비교
기계 학습(ML)의 핵심 동작 메커니즘
비즈니스 혁신을 위한 AI/ML 주요 사용 사례
AWS의 AI/ML 서비스 생태계 및 데이터의 중요성
기존 프로그래밍 vs 기계 학습(ML) 비교 요약표
| 비교 항목 | 기존 프로그래밍 (Rule-based) | 기계 학습 (ML-based) |
|---|---|---|
| 작동 원리 | 명시적으로 코딩된 규칙(If-Then) 실행 | 과거 데이터 훈련을 통한 패턴 자동 학습 |
| 유연성 | 고정 규칙으로 인해 상황 변화에 유연성 부족 | 새 데이터(추론) 입력 시 실시간 맞춤 결과 도출 |
| 개발 방식 | 사람(개발자)이 관계 및 조건문을 일일이 정의 | 데이터 입력 -> 훈련(Training) -> 모델 생성 -> 추론 |
| 적합한 분야 | 정형적이고 단순한 예외 처리 업무 | 개인화 추천, NLP 대화, 수요 예측, 패턴 인식 |
산업계에서의 다양한 ML 비즈니스 해결 과제
AWS AI/ML 3-티어 솔루션 스택 (3-Tier Stack)
AWS AI/ML 3-티어 솔루션 스택 비교 요약표
| 구분 계층 | 주요 대상 / 제어 수준 | 핵심 메커니즘 | 대표 서비스 및 구성 요소 |
|---|---|---|---|
| 티어 1: AI 서비스 | 일반 개발자 (ML 지식 불필요) | 미리 훈련된 사전 구축 모델 API 온디맨드 호출 | Comprehend, Polly, Transcribe, Translate, Kendra, Rekognition, Textract, Lex, Personalize |
| 티어 2: ML 서비스 | 데이터 사이언티스트 & ML 엔지니어 | 완전관리형 환경에서 커스텀 모델 구축/훈련/배포 | Amazon SageMaker AI (실험 추적, 디버깅, MLOps 지원) |
| 티어 3: 프레임워크 & 인프라 | 전문 ML 연구원 & 딥러닝 전문가 | 프레임워크 및 전용 칩셋/인프라 직접 제어 | PyTorch, TensorFlow, MXNet, ML 전용 EC2 가속 인스턴스, EMR, ECS |
티어 1: 사전 구축된 AWS AI 서비스 (Pre-built AI Services)
티어 2: ML 서비스 (Amazon SageMaker AI)
티어 3: ML 프레임워크 및 인프라 (Frameworks & Infrastructure)
티어 1 사전 구축 AWS AI 서비스 요약표
| 서비스 명칭 | 분류 범주 | 주 기능 및 메커니즘 | 핵심 사용 사례 |
|---|---|---|---|
| Amazon Comprehend | 언어 서비스 | NLP 기반 문맥/감정 분석 및 핵심 문구 추출 | 콘텐츠 분류, 고객 감정 분석, 규정 준수 |
| Amazon Polly | 언어 서비스 | 텍스트를 자연스러운 다국어 음성으로 변환 (TTS) | 가상 어시스턴트, e-러닝, 접근성 개선 |
| Amazon Transcribe | 언어 서비스 | 음성을 다국어 텍스트로 변환 (STT), 화자 식별 | 콜센터 통화 트랜스크립션, 자동 자막 |
| Amazon Translate | 언어 서비스 | 실시간 및 배치 신경망 다국어 텍스트 번역 | 다국어 문서 번역, 글로벌 앱 통합 |
| Amazon Kendra | 비전/검색 서비스 | NLP 기반 엔터프라이즈 문맥 이해 지능형 검색 | 지능형 사내 검색, 챗봇 연동 |
| Amazon Rekognition | 비전/검색 서비스 | 이미지/동영상 내 물체, 사람, 얼굴, 텍스트 분석 | 콘텐츠 조정, 자격 증명 확인, 미디어 분석 |
| Amazon Textract | 비전/검색 서비스 | 문서, 양식, 표 내의 인쇄/손글씨 텍스트 자동 추출 | 금융/의료/정부 양식 서류 자동화 |
| Amazon Lex | 대화/개인화 서비스 | NLU & ASR 기반 음성/텍스트 대화형 챗봇 구축 | 가상 어시스턴트, FAQ 봇 |
| Amazon Personalize | 대화/개인화 서비스 | 과거 행동 데이터 기반 실시간 맞춤형 추천 엔진 | 맞춤 스트리밍, 제품 추천, 인기 항목 추천 |
Amazon SageMaker JumpStart
Amazon Bedrock
Amazon Q 제품군 (Amazon Q Business & Developer)
AWS 생성형 AI 주요 솔루션 비교 요약표
| 솔루션 명칭 | 서비스 성격 / 제공 방식 | 주요 기술 / 메커니즘 | 핵심 이점 및 대표 사용 사례 |
|---|---|---|---|
| Amazon SageMaker JumpStart | SageMaker 내 ML 모델 허브 | 사전 구축 모델 카탈로그, 클릭 배포, 커스텀 미세 조정 | 신속 배포, 분야별 데이터 미세 조정, FM 실험 및 프로토타입 |
| Amazon Bedrock | 완전관리형 통합 FM API 서비스 | 단일 API로 Claude, Stable Diffusion, Amazon FM 등 제공 | 엔터프라이즈 보안/개인정보 보호 AI, 다중 모달 콘텐츠, 대화 에이전트 |
| Amazon Q Business | 엔터프라이즈 대화형 AI 어시스턴트 | 사내 정보 리포지토리 보안 연결 및 통합 답변 도출 | 사내 정보 요청, 자동화 워크플로, 비즈니스 인사이트 추출 |
| Amazon Q Developer | 개발자 전용 AI 생성 어시스턴트 | IDE 통합, C#, Java, JS, Python, TS 함수/코드 블록 추천 | 코드 생성 가속, 코드 보안/안정성 강화, 자동 코드 검토 |
전통적 데이터 분석 (Data Analytics)의 개념 및 필요성
데이터 통합 저장소 및 파이프라인 개념
1. 추출 (Extract): 다양한 소스 시스템에서 원시 데이터 수집2. 변환 (Transform): 다운스트림 분석 도구가 사용할 수 있는 일관된 형태로 정제 및 가공3. 로드 (Load): 데이터 웨어하우스(Amazon Redshift)나 분석 플랫폼 대상 시스템에 적재AWS 데이터 분석 서비스 통합 생태계 (Data Analytics Ecosystem)
ETL 파이프라인 방식 및 AWS 데이터 분석 서비스 요약표
| 구분 / 서비스 | 역할 및 메커니즘 | 특징 및 적용 시기 | 대표 서비스 |
|---|---|---|---|
| ETL 패턴 | 추출(Extract) -> 변환(Transform) -> 적재(Load) | 데이터를 대상 시스템 적재 전 정제·가공하여 일관된 형식 변환 | AWS Glue |
| ELT 패턴 | 추출(Extract) -> 적재(Load) -> 변환(Transform) | 데이터를 먼저 원시 적재 후 요구사항에 맞춰 실시간 변환 | Amazon Redshift |
| 데이터 수집 & 파이프라인 | 스트리밍 및 배치 데이터 수집 / 자동화 파이프라인 | 데이터 수집 및 ETL 흐름 조립 라인 자동화 | Amazon Kinesis, AWS Glue |
| 스토리지 & 레이크 | 거대한 단일 통합 원시 데이터 중앙 저장소 | 모든 비정형/정형 데이터 무제한 저장 | Amazon S3, Amazon Redshift |
| 데이터 처리 & BI | 대규모 분산 빅데이터 처리 및 BI 시각화 | 대용량 분산 연산 및 경영 진단 시각화 리포트 | Amazon EMR, Amazon QuickSight |
데이터 파이프라인 (Data Pipeline)의 개념 및 목적
데이터 파이프라인 5단계 아키텍처 및 핵심 AWS 서비스군
AWS 데이터 파이프라인 5단계 핵심 서비스 요약표
| 파이프라인 단계 | 대표 역할 및 기능 | 지원 방식 / 특성 | 대표 AWS 서비스 |
|---|---|---|---|
| 1. 수집 (Ingestion) | 소스에서 스토리지를 데이터 수집/이동 | 실시간 스트리밍 / 준실시간 ETL 전달 | Amazon Kinesis Data Streams, Amazon Data Firehose |
| 2. 스토리지 (Storage) | 데이터 중앙 통합 보관 | 객체 기반 데이터 레이크 / 정형 데이터 웨어하우스 | Amazon S3, Amazon Redshift |
| 3. 카탈로그화 (Cataloging) | 데이터 메타데이터 중앙 인벤토리 관리 | 메타데이터 자동 추출 및 통합 관리 | AWS Glue Data Catalog |
| 4. 처리/변환 (Processing) | 데이터 정제, 가공 및 변환 (ETL) | 서버리스 Visual ETL / 오픈소스 빅데이터 클러스터 | AWS Glue, Amazon EMR |
| 5. 분석/시각화 (Analytics & BI) | SQL 쿼리 분석 및 대시보드 시각화 | 서버리스 SQL 쿼리, BI 대시보드, 실시간 로그 검색 | Amazon Athena, Amazon Redshift, QuickSight, OpenSearch |
실무 비즈니스 시나리오: 전자 상거래 앱의 실시간 데이터 분석 및 추천 ML 모델 파이프라인
엔드투엔드 데이터 파이프라인 8단계 흐름 (End-to-End Workflow)
.csv 표준 포맷을 필요로 함.csv 포맷으로 실시간 변환 처리함.csv 데이터를 중앙 데이터 레이크인 Amazon S3 버킷에 저장하여 복수의 데이터 소비팀이 동시 활용할 수 있도록 전달함.csv 데이터의 스키마 및 물리적 위치를 설명하는 카탈로그 테이블을 정의함실제 환경에서의 데이터 분석 & AI/ML 서비스 연동 가이드표
| 단계 / 서비스 | 주요 데이터 형식 / 상태 | 서비스 간 연동 역할 및 목적 |
|---|---|---|
| 1~2. 앱 & DynamoDB | 트랜잭션 JSON 데이터 | 지연 시간이 짧은 과거 앱 트랜잭션 데이터 1차 적재 |
| 3. Kinesis & Firehose | 스트리밍 변경 데이터 (CDC) | DynamoDB 변경 사항을 Kinesis로 스트리밍 후 Firehose로 준실시간 집계 |
| 4. AWS Lambda | JSON -> .csv 포맷 변환 | Firehose 연동을 통해 ML/분석 전용 포맷(.csv)으로 동적 데이터 변환 |
| 5. Amazon S3 | .csv 파일 (데이터 레이크) | 다양한 부서/팀에서 공동 활용할 중앙 데이터 레이크에 최종 적재 |
| 6. AWS Glue Data Catalog | 스키마 & 위치 메타데이터 | S3에 저장된 데이터의 스키마 구조를 자동 정의하는 카탈로그 생성 |
| 7. Amazon Athena | 표준 SQL 쿼리 결과 | Glue 카탈로그를 활용해 S3 데이터를 이동 없이 직접 SQL 임시 분석 |
| 8. Amazon SageMaker AI | 최신 훈련 데이터세트 | S3에서 최신 데이터를 직접 읽어 개인화 추천 ML 모델 최신 버전 훈련 |