AI데이터엔지니어 부트캠프 <핀테커스> 9주차 - (1) 최신 AI 기술 개요 및 용어 정리

Lidit·2023년 10월 23일

빅데이터의 이해

데이터의 유형

  • 정성적(qualitative)
  • 정량적(quantitative)

빅데이터의 정의

  • 3V : 양(Volume), 다양성(Variety), 속도(Velocity)
    • 4V: 3V + 가치(Value)

인공지능의 이해

인공지능의 개념

인공지능

  • 1950년대 등장한 개념으로, 인공적으로 만들어진 지능
  • 컴퓨터 과학에서는 인공지능 연구를 '지능적 에이전트'에 대한 연구로 정의
    • 지능적 에이전트: 주변 환경을 인식하고 주어진 목표를 이루기 위해 최적의 액션을 수행하는 기기

머신러닝

  • 데이터를 기반으로 학습해 스스로 발전할 수 있는 방법으로 인공 지능을 구현하기 위한 방법 중 하나

딥러닝

  • 머신러닝의 여러 알고리즘 중 하나
  • 사람의 뇌를 모방한 인공신경망의 가장 발전된 알고리즘

인공지능의 역사

초기 인공지능

심볼릭 AI

  • 명시적인 규칙을 충분히 갖고 있는 프로그램을 만들면 인간 수준의 인공지능을 만들 수 있을 것으로 예상
  • 1950년대부터 1960년대 까지 지배적인 패러다임 이었음
  • 심볼릭 AI는 규칙이 명료한 논리적인 문제를 푸는 데에는 적합하지만, 복잡한 문제는 풀기 어려움

전문가 시스템

  • 1980년대에 등장한 새로운 체계
  • 인간의 지식을 컴퓨터가 사용하기 좋은 형태로 만들어서 널리 활용하려는 의도를 갖고 탄생
  • 방대한 규칙을 사람이 일일이 만들기 어려움. 새로운 정보 추가하기도 어려워 인공지능에 대한 회의감으로 이어짐

머신러닝

  • 초기 인공지능 연구는 지능적 에이전트를 만들기 위해 사람이 만든 논리를 컴퓨터에 프로그래밍 하는 방식이어서 한계
  • 기호논리학에 기반한 추론이 아닌 학습에 기반을 둔 머신러닝을 통해 인공지능을 구현하려는 시도가 시작
  • 머신러닝은 학습 기반으로 인공지능을 구현하려는 구체적인 방법

머신러닝의 개념

머신러닝의 종류

  • 지도학습: 입력으로 정답을 예측하는 학습방법(분류/회귀)
  • 비지도 학습: 입력에서 패턴을 추출하는 학습 방법(군집화)
  • 강화학습: 환경과 상호작용하는 학습 방법

머신러닝의 유형
지도학습

  • 주어진 데이터에 정답이 존재하는 경우 미지의 데이터에 대한 정답을 예측하는 학습방법

딥러닝과 머신러닝의 차이

  • 데이터 의존도
  • 하드웨어 의존도

금융 사기거래 케이스를 예시로 한 머신러닝의 활용

구분내용
기존 프로그래밍 방식의 해결 방안복잡한 금융 거래에서 발생한 수많은 변수에 대해 수십년간 발생한 다양한 시기 거래 조건을 감안하여 수천 수만 라인의 소스코드로 된 프로그램을 작 성하여 사기거래 적발 프로그램을 구축
효율 저하금융사기 전문가들은 경험적으로 프로그램 로직을 간파하고 풀어냄
환경 변화수시로 변화하는 금융환경, 정부정책, 소비자 성향 등에 맞추어 기존 로직 을 다시 수정하고 검증하는 작업을 거쳐야 함
머신러닝 해결방안데이터를 기반으로 통계적인 신뢰도를 강화하고 예측 오류를 최소화하기 위한 다양한 수학적 기법들을 적용해 데이터 내의 패턴을 스스로 인지하고 신뢰도 있는 예측 결과를 도출

머신러닝이 필요한 분야

구분내용
기존 솔루션으로는 많은 수동 조정과
규칙이 필요한 문제
하나의 머신 러닝 모델이 코드를 간단하게 만들고 전통적인 기법보다 더 효 과적으로 수행됨
전통적인 방법으로는 해결방법이
없는 복잡한 문제
가장 뛰어난 머신 러닝 방법으로는 해결 방법을 찾을 수 있음
유동적인 환경머신 러닝 시스템은 새로운 데이터에 적응이 가능
복잡한 문제와 대량의 데이터에서
통찰 얻기
문제가 정의 되지 않은 경우에도 데이터의 분석을 통한 문제의 발견과 통찰 을 얻을 수 있음

대표적인 머신 러닝 작업의 사례와 이를 위한 기술

활용 사례분석 기법
생산라인에서 제품 이미지를
분석해 자동으로 분류
• 이미지 분류 작업
• 합성곱 신경망 Convolutional Neural Network(CNN) 사용
뇌를 스캔하여 종양 진단• 시맨틱 분할작업
• 합성곱 신경망을 사용하여 이미지의 각 픽셀을 분류
자동으로 뉴스 기사를 분류• 자연어 처리 Natural Language Processing(NLP) 작업
• 텍스트 분류작업
• 순환 신경망 Recurrent Neural Network(RNN), 합성곱 신경망, 트랜스포머(Transformer) 사용
토론 포럼에서 부정적인 코멘트를 자동으로 구분• 텍스트 분류 작업
• 자연어 분류 활용
긴 문서를 자동으로 요약• 텍스트 요약
• 자연언어처리의 한 분야
챗봇 또는 개인 비서 만들기• 자연어 이해 Natural Language Understanding (NLU)와 질문-대답 Question-Answer 모듈을 포함한 자연어 처리 활용
다양한 성능 지표를 기반으로
회사의 내년도 수익을 예상
• 회귀 Regression 작업(결과 값 예측이 숫자로 표시됨)
• 선형회귀 Linear Regression, 다항회귀 Polynominal Regression, 회귀 SVM, 회귀 랜덤 포레스트 Random Forrest, 인공 신경망 Artificial Neural Network
• 지난 성능 지표를 사용할 경우 순환 신경망, 합성곱 신경망, 트랜스포머 사용
음성 명령에 작동하는 앱 제작• 음성인식 작업
• 순환신경망, 합성곱 신경망, 트랜스포머 사용
신용카드 부정거래 감지• 이상치 탐지 작업
구매이력을 기반으로 고객을
나누고 각 집합마다 다른 마케팅 전략 기획
• 군집 Clustering 작업
고차원의 데이터셋을 명확하고
의미있는 그래프로 표현
• 데이터 시각화 작업
• 차원 축소 Dimensionality Reduction 사용

지도학습과 비지도학습

  • 지도학습(Supervised Learning)
    • 명확한 목적 하에 데이터 분석을 실시하는것
    • 분류, 예측, 최적화를 통해 사용자의 주도 하에 분석을 실시하고 지식을 도출하는 것이 목적
    • 데이터 마이닝의 중심이 되는 학습방법 중, 자료가 입력 변수와 출력 변수로 주어지며 입력 변수와 출력 변수의 함수적 의존 관계를 자료로부터 추정함으로써 예측 모형을 얻을 때 사용되는 학습방법
    • ex) 시계열분석, 선형회귀분석, 군집화
  • 비지도 학습
    • 데이터 분석의 목적이 명확히 정의된 형태의 특정 필드 값을 구하는 것이 아니라 데이터 자체의 결합, 연관성, 유사성 등을 중심으로 데이터의 상태를 표현하는것
    • 데이터 마이닝의 중심이 되는 방법 중 자료의 출력변수가 없이 입력변수만 주어지는 경우
    • 입력 변수간의 상호관계나 입력 자료값간의 관계를 탐색적으로 분석할 때 사용되는 학습 방법
    • ex) 장바구니 분석, 군집분석, 기술 통계 및 프로파일링, 분류

지도학습에서 사용되는 알고리즘

  • 분류 (Classification)
    • 스팸 필터가 대표적인 예로 많은 메일 샘플과 소속 정보(스팸 메일인지 아닌지)호 훈련하며 새로운 메일이 들어왔을 때 훈련된 모델에 따라 스 팸 메일 혹은 일반 메일로 분류
  • 회귀 (Regression)
    • 예측변수(Prediction Variable)라 부르는 특성(Feature) (ex.주행거리, 연식, 브랜드 등)을 사용해 중고차 가격과 같은 타깃(Target) 수치를 예측하는 것
    • 시스템을 훈련하기 위해서 주행거리, 연식, 브랜드 등과 같은 예측변수 와 레이블(중고차 가격)이 포함된 중고차 훈련 데이터가 필요
  • 그밖의 중요한 알고리즘들
    • 최근접 이웃 Knearest Neighbors
    • 선형 회귀 Linear Regression
    • 로지스틱 회귀 Logistic Regression
    • 서포트 벡터 머신 Support Vector Machine (SVM)
    • 결정 트리Decision Tree와 랜덤 포레스트 Random Forrest
    • 신경망 Neural Network

머신러닝의 주요 과제

충분하지 않은 양의 훈련 데이터

  • 머신러닝의 학습에는 충분한 양의 학습데이터가 전제 되어야함
  • 음성인식과 같은 복잡한 문제의 해결을 위해서는 수백만개의 데이터가 필요한 경우도 있음
  • 데이터의 개수가 충분할 경우 알고리즘의 종류에 관계없이 유효한 결과를 산출해내는 경우가 많음

대표성 없는 훈련 데이터

  • 모델이 현실에 적용 가능한 일반화가 되려면 훈련 데이터가 현실 데이터를 잘 대표하고 있어야 함
  • 사례기반 학습과 모델 기반 학습에 공통적인 사항
  • 데이터가 전체의 대표성을 충분히 갖지 못했을 경우 모델의 예측력이 크게 떨어지는 경우가 발생

낮은 품질의 데이터

  • 훈련 데이터에 일정 비율 이상의 이상치, 잡음 등이 포함되어 있을 경우 시스템이 데이터에 내재된 패턴을 잘 찾아내지 못하게 됨
  • 훈련 데이터를 잘 정제하는 것이 필요
  • 일부 샘플이 명확하게 이상치인 경우 이상치 데이터를 무시하거나 수동으로 조정하는 과정을 거쳐서 훈련 데이터로 사용하는 것이 효과적
  • 일부 데이터가 결측치(Missing Value)인 경우 이 특성을 무시하고 훈련 데이터로 사용할 것인지 빠진 값을 특 정한 값(평균, 중간값 등) 으로 변경하여 사용할 것인지 결정해야 함

관련 없는 특성

  • 훈련 데이터에 관련 없는 특성이 많이 포함되어 있을 경우 모델이 정확한 예측을 해낼 수 없음
  • ex) 삶의 만족도를 예측하는 모델에 나라이름 특성을 사용하는 경우
    • 특성 선택 : 데이터가 가지고 있는 특성 중 훈련에 가장 도움이 되는 특성을 선택
    • 특성 추출 : 상관관계가 있는 특성들을 서로 결합하여 더 유용한 특성을 만들어냄 -> 차원 축소에 활용

0개의 댓글