머신러닝과 혁신

김하루·2023년 4월 6일

GCP digital Leader

목록 보기
7/12

소개

Volumn의 데이터와 Cloud 베이스의 올바른 툴 활용은 ML과 AI 사용에 기초가 된다.

기초를 설정하기 위해 ML 및 AI에 대한 정의부터 시작한다.

그 이후 기계 학습 모델의 효능에 영향을 미치는 몇 가지 중요한 데이터 품질 고려 사항을 다룰 것이다.

마지막으로 ML을 활용하여 비즈니스를 근본적으로 변화시킨 몇 가지 실제 사용 사례를 소개한다.

머신러닝이란?

ML를 이해하려면 비즈니스 데이터에 대해 이해를 먼저 해야한다.

분석가가 매일 보는 대시보드가 있나?
관리자가 매달 검토하는 보고서가 있나?

대시보드와 보고서는 모두 역방향 데이터의 예이다.
과거에 일어난 일에 대해서 분석을 하는 것이며 이것을 통해 메트릭을 계산하거나 추세를 식별하기 위해 진행한다.

그러나 비즈니스에서 가치를 창출하려면 미래를 봐야한다.

그렇다면 ML은 무엇일까?
ML을 이해하려면 먼저 AI를 정의해야 한다.

AI란 시각적 인식, 음석 인식, 의사 결정 또는 언어 간의 번역과 같이 일반적으로 인간 지능이 필요한 작업을 수행할 수 있는 모든 종류의 기계를 설명하는 광범위한 분야 또는 용어이다.

ML은 AI 분야의 특정 지점이다.(일부이다)
특히 ML은 명시적으로 프로그래밍 하지 않고도 데이터를 학습하고, 예측 또는 결정을 내릴 수 있는 프로그램을 의미한다.
이는 데이터를 분석하기 위해 알고리즘 또는 모델을 사용하여 수행된다.
이러한 알고리즘은 기록 데이터를 입력으로 사용하여 새로운 출력 값을 예측한다.

ML은 예측 통찰력을 도출하고 규모에 맞게 반복적인 결정을 내리기 위해 표준 알고리즘 또는 표준 모델을 사용하여 데이터를 분석하는 방법이다.
간단히 말하면 정답의 예를 컴퓨터에 제공하여 문제를 해결하는 방법을 컴퓨터에 가르치는 방법이다.

예를 들어 컴퓨터에 세금 신고 예시를 제공하여 예상 세금을 예측할 수 있다. 마찬가지로 날씨 패턴을 예측하는데도 도움이 된다.

좀 더 기술적으로 말하자면, 기계학습을 사용하여 모델이 이전에 본 적이 없는 과일이나 야채 사진에 정확하게 레이블을 지정하고 싶다고 가정해보자.
많은 과일 및 채소 이미지, 입력 데이터 및 올바른 레이블, 출력 데이터를 사용하여 ML 모델 또는 표준 알고리즘을 교육한다.

데이터 품질

이전 섹션에서 ML은 표준 알고리즘 또는 모델을 사용하여 데이터를 분석하는 방법이라고 배웠다.

이렇게 분석된 데이터는 예측 통찰력을 도출하고 반복적인 결정을 내리는데 도움이 된다.
이러한 데이터는 문제가 없는 대량의 데이터를 사용하면 더 효과적인데(과적합 문제가 있을수도..), 문제가 없는 것이 무엇인지에 대해 알아본다.

전통적인 소프트웨어 개발에서 버그는 예기치 않거나 바람직하지 않은 동작을 유발하는 코드의 실수이다.

ML에서는 알고리즘 구현에 버그가 있을 수 있지만, 데이터의 버그가 훨신 더 일반적이다.

예를 들자면, 당뇨병 걸린 사람을 예측을 할 때 있어, 걸린 사람인지 안걸린 사람인지 판별하는 것은 의사가 한다.
결국 해당 데이터에 대한 레이블링을 의사가 하는 것인데, 의사 주관이 들어가므로 데이터가 명확하지 않을 수 있고 이는 ML 모델 자체에 영향을 줄 수 있다.

그럼 데이터 품질을 향상시키려면 어떻게 해야할까?

아래와 같이 최고의 데이터에는 세 가지 특성이 있다.

커버력이 있다.

문제 도메인의 범위와 그것이 설명할 수 있는 모든 시나리오를 나타낸다.

예를 들면 빨간 차와 파란 차가 있다고 할 때 빨간 차에 대한 결함만 학습을 하면 파란 차에 대한 결함은 감지를 못할 수 있다.

깨끗하거나 일관적이다.

데이터 일관성이라고도 하며, ML 모델이 정확한 예측을 수행하는데 방해될 수 있는 항목을 포함하거나 제외하는 경우 데이터는 더럽거나 일관성이 없다고 본다.
이것은 우리가 이전에 이야기한 오류나 버그와 매우 유사하다.

불일치의 가장 일반적인 형태는 데이터 형식이다.
여러 문서의 데이터를 분석하려고 하고 각 문서의 데이터 포인트 중 하나가 타임스탬프라고 하자.
그렇다면 타임스탬프 데이터는 다 동일한 형태로 있어야 하며 그렇지 않으면 데이터가 더럽다고 간주한다.

앞서 말한 당뇨병 환자의 예시에서 데이터 레이블이 잘못 되어 있는 것도 더러운 데이터라고 할 수 있다.

완료되어 있다.

인간의 지식을 대체할 수 있는 세계에 대한 충분한 데이터의 가용성을 의미한다.
즉 데이터가 충분히 준비가 되어 있어야 한다.

Google Cloud에서의 AI와 ML

많은 사람들이 ML을 활용하려면 데이터 분석가, 데이터 엔지니어, ML 엔지니어로 구성된 강력한 기술팀이 필요하다고 생각한다.

그러나 ML은 그 어느 때보다 훨신 더 쉽게 접근이 가능하다.

위 사진과 같이 순서도를 고민하면 된다.

첫 번째로 훈련된 데이터를 가지고 있나?
없다면 Pre-trained APIs 중 일부를 사용하여 문제를 해결해야 한다.

자체 학습 데이터가 있을 경우,
ML을 빌드하기 위한 통합 관리형 플랫폼인 Vertex AI 서비스를 이용하면 된다.

만약 자체적인 개발을 통해 모델을 관리하지 않다면 AutoML을 이용하면 되며, 모델을 관리하고 있다면 Custom model tooling을 이용하면 된다.

Pre-trained APIs

자체 학습 데이터가 없는 경우 활용한다.
전문 데이터 사이언티스트는 없지만, 분석가와 개발자가 있는 경우 좋은 옵션이다.
가장 노력이 덜 들지만, 자유도는 떨어진다.

이미지, 동영상, 텍스트 분석과 같은 일반적인 작업을 위해 ML 모델에 대한 액세스를 제공하는 선행 학습된 API를 사용한다.

API는 가상 프라이빗 클라우드, 온프레미스 또는 Google Public 클라우드에 배포할 수 있으며 ML 전문 지식 수준에 관계없이 사용이 가능하다.

이러한 사전 학습된 API는 4가지로 볼 수 있다.
1) 시각
2) 언어
3) 대화
4) 구조화된 데이터

이를 더 잘 이해하기 위해서 사용자가 사진을 업로드하는 모바일 앱을 빌드하는 개발자라고 생각하자

앱은 이미지가 무엇인지 인식하고 작업에 안전하지 않은 이미지는 제외해야한다.
이 경우 Vision API를 활용할 수 있다.
Vision API는 Google 데이터를 사용하여 얼굴, 물체, 텍스트, 이미지, 감정까지 자동으로 감지하는 강력한 사전 학습된 기계 학습 모델을 제공한다.

Natural Language API는 사전 훈련된 또 다른 API이다.

웹 사이트에 매일 많은 메세지를 받는 연락처 양식이 있다고 가정하자.
이 데이터는 수동으로 처리, 분류 및 조치하기 어렵다.

NL API는 Google 데이터를 사용하여 감정과 텍스트에서 구문 항목을 발견하고, 텍스트를 사전 정의된 카테고리로 분류한다.

AutoML

데이터가 있을 경우 코드 없이 기계 학습 모델을 학습하고, 테스트 및 배포한다. 이것은 보다 맞춤화된 ML 모델을 생성하는데 약간의 시간과 노력을 투자하려는 기업에게 훌륭한 옵션이다.

Custom model tooling

Google Cloud에서 제공하는 다양한 제품군을 통해 직접 학습을 한다.

시간이나 비용이 들지 모르지만, 비즈니스에 가장 차별화되고 혁신적인 결과를 제공한다.

커뮤니티나 운영 효율성을 높이는 AI Solution 센터가 있다.

실제 고객 사례

네 가지의 일반적인 비즈니스 사례를 보려고 한다.

1) 규칙 기반 시스템 교체

Google 검색을 예로 들자,

스포츠 팀인 giant를 검색한다고 하자.
캘리포니아의 농구팀인 giant를 보여줄지, 뉴욕의 미식축구 팀인 giant를 보여줄지 모른다.

몇 년 전의 검색 엔진은 수동으로 코딩된 규칙을 사용하여 사용자에게 표시할 스포츠 팀을 선택했다.

Query가 giant이고 사용자가 Bay 지역에 있을 경우 캘리포니아 농구팀을 보여주고, 지역이 뉴욕이면 미식축구팀을 보여줬다. 만약 해당 사항이 없다면, 그냥 거인에 대해서 결과를 보여줬다.

단순한 예지만 이걸 모든 상황(giant가 아닌 다른 검색어)에 대입해보자면 굉장히 많은 경우의 수가 생긴다.
이럴 경우 ML은 큰 도움이 된다.

사용자가 쿼리별로 어떤 검색 결과를 클릭했는지 알려주는 모든 데이터가 있다면 검색 결과의 순위를 예측하도록 머신 러닝 모델을 교육할 수 있다.

이것이 Google 검색 시스템의 시작 기반이였다.

2) 프로세스 자동화

대규모로 예측하고 반복적인 결정을 내리는 프로세스를 자동화 하는 것

3) 비정형 데이터 이해

이미지, 비디오 및 오디오 같이 비정형 데이터를 이해할 수 있음.

비슷한 정도 같은 것들을 비교할 수 있음.
(표절?)

4) 개인화된 고객 경험 생성

신문과 이메일의 차이 정도로 고객 경험을 만들 수 있다.
신문은 모든 사람에게 관심이 있는 것이며, 이메일은 개인화하여 관심이 있는 것을 안내한다.

대표적인 예시는 유튜브다.

0개의 댓글