비지니스 인텔리전스 중간총정리

홍준표·2025년 10월 12일

서론

4차 산업 혁명의 기반 구성요소 : AI + 빅데이터

머신러닝에는 여러 가지 데이터 분석기술이 포함되는데 특시, 데이터를 분석하는데 특화된 분석 기법과 방법론을 총칭해'데이터 애널리틱스(Data Analytics)'라고 한다.

데이터 애널리틱스 기법의 종류와 절차

  • 감독학습 기법 : 분석 대상 데이터에 분석을 감독할 요소가 있는것으로 일반적으로 종속변수가 존재하는경우
  • 무감독학습(비지도학습) : 데이터간 유사도 추적하는 경우, 감독요소(종속변수) 불필요

데이터 애널리틱스의 과업

  • 분류 : 감독학습 과업, 감독의 역할을 하는 요인이 이산형
    ex) 신용 상태의 정상/불량 판별

  • 회귀 : 감독학습 과업, 감독의 역할을 하는 요인이 연속형 수치값
    회귀를 통해 만들어진 모형을 회귀모형이라 함
    ex) 내년도 전기 수요양 예측

  • 군집화 : 무감독학습
    ex) 마케팅에서 유사한 고객을 그룹으로 분리해, 그룹 특성의 따른 차별화된 마케팅 전략 사용

  • 차원축소 : 데이터의 특성을 단순화하기위해 주성분 분석
    정보의 유실은 최소화 하면서도 정대적인 양이나 차원을 축소하는 것을 목표로 한다.

  • 동시출현분석 : 동시에 발생할 가능성이 높은 이벤트를 찾는 과업
    ex) 장바구니 분석

  • 프로파일링 : 현상에 대한 기술 또는 설명을 위해 데이터의 공통된 속성 값을 도출하는 과정

데이터 전처리

데이터 분석 시

표본추출->데이터 탐색-> 데이터 변환->데이터 모델링->모형 평가 과정

을 거침

표본추출

  • 모집단(Population)으로 부터 표본(Sample)을 반드는 과정

  • 샘플의 최소치 : Delmaster and Hancock의 연구의 따르면 최소 6 x 클래수 수 x 속성수
    ex)클래스 수 2, 속성 10개일 경우 최소 120개의 샘플 데이터 필요

  • 통계의 Sampling이 모집단의 분포와 유사한 것을 추구하는 것과 달리, 머신러닝은 모델 수립에 최적화된 Sampling 수행 필요(분류 문제에서 불균형 데이터 셋일 경우 샘플링 주의)
    ex)
    높은 빈도의 클래스는 낮은 비중으로 샘플링(Under-sampling)
    낮은 빈도의 클래스는 높은 비중으로 샘플링(Over-sampling/Up-Sampling)

AI studio에서 표본 추출

  • Sample오퍼레이터 사용

    size 만큼 샘플을 뽑고, 동일한 결과를 얻고 싶으면 seed 설정
  • Balanced data
  • Stratified
  • SMOTE (over-samping)
    등 여러 옵션 사용 가능

데이터 탐색

ExampleSet에서 Visualizations 에서 시각화 선택 할 수 있음
너무 많은 변수는 시각화 의미가 없을 수 있음.

데이터 전처리

종속변수, 독립변수의 NULL 이있으면 Filter Examples 오퍼레이터를 사용해 NULL이 포함된 튜플을 없애거나 평균값으로 대체 할 수있음.

명목형 데이터의 수치형으로 변경

One-Hot Encoding Operator, Numerical to Binomial 오퍼레이터 사용.

회귀분석

감독학습, 연속형데이터의 종속 변수를 예측 하는 기법

잔차 제곱의 합이 최소인 추세선을 회귀선을 선택한다.
y = a + bx
y는 종속변수의 예측 값, a는 절편, b는 회귀계수, x는 설명요인

회귀변수의 성능 평가는 R^2값 이용(1에 가까울 수록 성능 굿)

회귀분석 실습

  • 오퍼레이터, 어떻게 연락되는지 숙지할 것
  1. Split Data -> 학습, 평가용 데이터 분할
  2. Linear Regression -> 회귀모형 만들기
  3. Apply Model -> R^2값 알아내기(모델 성능)

의사결정나무

분류분석 기법, 동질적인 개체를 찾아가는 것을 목표로 함

  • 정보이득을 크게하는 분류 기준 택하기!

분류 기준을 너무 많이 만들어 매우 작은 집단이 만ㄴ들어지는 "과적합"하면 안댐!

의사결정나무 실습


오퍼레이터, 어떻게 연결되는지 숙지 할 것!

장바구니 분석

연관규칙분석
연관성 판단기준 : 지지도(Support), 신뢰도(Confidence), 향상도(Lift)

  • 지지도 : 전체 확률 중 두 사건이 동시에 일어날 확률
  • 신뢰도 : 사건1이 있어났을때 사건2가 일어날 확률
  • 향상도 : 그냥 사건2가 일어났을때 보다 사건 1이 일어났을떄 사건2가 일어날 증가분

장바구니 분석 실습

시장세분화분석

군집분석, K평균군집분석알고리즘을 이용

실습

  • Normalize : 속성의 단위는 다양하기에 정규화 수행

  • Clustering : 군집화하는 거임


  • ClusterModelVisualizerOObject : 클러스터 결과 시각화


특정 클러스터의 결과 보기


각 클러스터의 결과값 한번에 보기

작성중........

profile
공학자

1개의 댓글

comment-user-thumbnail
2025년 12월 4일

한달이 넘게 작성중인 것으로 보아 아주 엄청난 것을 작성중이신 거 같은데 아주 기대가 됩니다!🫥

답글 달기