LG U+ Why Not SW CAMP 6기 7월 3주차 회고

LG U+ Why Not SW CAMP 6기

목록 보기
12/14
post-thumbnail

7월 3주차 진행 사항

7/14(월) - 수업 : 클라우드 기반 데이터 처리/저장/관리 기술
7/15(화) - 수업 : 클라우드 기반 데이터 처리/저장/관리 기술
7/16(수) - 수업 : 클라우드 기반 데이터 처리/저장/관리 기술
7/17(목) - 특강 : Cloud 개론, 자연어 처리, AI개론/AI인프라
7/18(금) - 특강 : 기업 데이터 플랫폼의 이해 및 클라우드 활용, 기업 데이터 업무 및 실무 사례


1️⃣ 이번 주 돌아보기

이번 주차에는 lasticsearch, Logstash, Kibana와 Hadoop, HiveSQL, Presto의 기초 개념에 대한 학습과 LG U+ 현직자 특강이 있었다.


2️⃣ 새로 알게된 & 성장한 부분

ELK Stack 구성의 흐름

  • ElasticSearch: 검색 색인을 위한 저장소이자 분석 대상
  • Logstash: 다양한 소스(MariaDB 등)로부터 데이터를 수집, 정제, 전달
  • Kibana: ElasticSearch에 저장된 데이터를 시각화하고 대시보드를 구성

Hadoop & HiveSQL, Presto 기초 개념

  • Hadoop은 분산 저장(HDFS)과 분산 처리(MapReduce)의 대표 프레임워크
  • HiveSQL은 Hadoop에서 SQL처럼 데이터를 조회할 수 있도록 도와주는 쿼리 인터페이스
  • Presto는 Hive보다 훨씬 빠른 쿼리 처리 성능을 제공하는 대화형 분산 SQL 엔진
    Hive는 배치용, Presto는 인터랙티브 분석용으로 구분해 사용

마이크로서비스 기반 클라우드 구조

  • Data Fabric으로 이기종 데이터 소스를 통합하고
  • Lambda로 서버리스 이미지 처리, Glue + Redshift로 데이터 수집 및 분석
  • 실시간 데이터 분석 흐름도 학습 (ex. API → S3 → Lambda → 분석 툴)

분석 설계 및 추천 시스템 설계 이해

  • Binning, Class Imbalance 대응, Precision 기반 모델 평가
  • 파일럿 테스트 설계 흐름: 가설 설정 → 실험 단위 정의 → 실행 및 평가
  • 추천 시나리오에 맞는 알고리즘 매핑 전략 학습 (MF, CF, Neural-CF 등)

3️⃣ 보완해야할 부분

ELK Stack: "써보긴 했지만 아직 잘 모르겠다"

  • ElasticSearch, Kibana, Logstash 각각은 실행해봤고 설정 파일도 작성해봤지만
    이 세 가지가 어떻게 연결되어 작동하는지에 대한 흐름이 명확하지 않았다.
  • 특히 Logstash에서 MariaDB를 연동하는 과정에서 오류가 발생했는데,
    드라이버 설치, 포트 설정, 인증 등 디테일을 수정해봐도 여전히 정상 연동은 되지 않았다.
  • 단순한 실습은 가능했지만, 구조적 이해가 부족하다 보니 문제를 스스로 해결하기 어려웠다.

Hadoop & Hive 관련 실습 미진

  • HiveSQL과 Presto의 쿼리 구조는 이론적으로는 이해했지만, 직접 데이터를 가지고 실습해보지는 못했다.
  • MapReduce가 왜 느리고 복잡한지, Presto는 어떤 방식으로 속도를 높이는지 등
    개념적 배경은 알지만 실제 성능 비교나 데이터 처리 실습은 부족한 상태다.
  • Hadoop 기반 처리 구조 전체가 아직은 막연하고 거리감 있는 느낌이다.

8분석 설계 실전 적용 훈련 필요

  • BANT-C, Precision 기반 평가지표 설정, 파일럿 테스트 설계 등 실무 흐름을 개념적으로는 익혔지만, 구체적으로 내 프로젝트에 적용해본 경험은 아직 부족하다.

4️⃣ 다음 주 계획

다음 주부터 3차 프로젝트가 시작된다. 추가로 해커톤 지원 발표가 수요일에 나는데, 붙었으면 좋겠고, 9월까지 빡쎈 일정이 될거같다.


0개의 댓글