빅데이터의 가치는 결국 어떤 인사이트를 발굴하여 어떻게 활용할 것인지에 달렸다.
빅데이터 가치 산정은 데이터 활용 방식, 가치 창출 방식, 분석 기술의 발전이라는 세 가지의 이유로 쉽지 않다.
[빅데이터 가치 산정이 어려운 이유]
데이터 활용 방식
빅데이터의 재사용이나 재조합, 다목적용 데이터 개발 등이 일반화되면서 특정 데이터를 누가, 언제, 어떻게, 어디서 활용하는지 알 수 없게 되었기 때문에 가치 선정이 어렵다.
가치 창출 방식
빅데이터는 기존에 없던 새로운 가치를 창출함에 따라 그 가치를 산정하기 어렵다.
분석 기술의 발전
데이터 분석 기술의 발전으로 가치 있는 데이터와 가치 없는 데이터의 경계를 나누기 어려워졌다. 오늘의 가치 없는 데이터가 내일은 가치 있는 데이터가 될 수도 있기 때문에 빅데이터의 가치 산정은 어렵다.
기업 : 빅데이터를 활용해 소비자의 행동을 분석하고, 시장 변동을 예측해 비즈니스 모델을 혁식하거나 신사업을 발굴
정부 : 빅데이터 활용 부문은 크게 환경 탐색, 상황 분석, 미래 대응으로 나눌 수 있음
개인 : 개인의 목적에 따라 빅데이터의 활용이 확산되면서 스마트라이프로 변환됨
[참고]
빅데이터 경영혁신의 4단계
1. 생산성 향상
2. 발견에 의한 문제 해결
3. 의사결정 향상
4. 새로운 고객가치와 비즈니스 창출
[참고]
미래의 빅데이터 활용에 필요한 3가지
데이터 : 모든 것의 데이터화
기술 : 진화하는 알고리즘, 인공지능
인력 : 데이터 사이언티스트, 알고리즈미스트
연관규칙 학습(Association rule learning)
어떤 변인 간에 주목할 만한 상관 관계가 있는지를 찾아내는 방법이다.
연관 규칙 학습은 연관분석 혹은 장바구니 분석으로도 불리며 고객이 구매한 물품들을 분석하여 품목 사이에 어떤 규칙이 있는지 찾아내는 분석 기법이다.
( ex : A를 구매한 사람이 B를 더 많이 사는가? 이것을 구매한 사람들은 많이 구매한 물품은? 장바구니 분석, 상품 추천 )
유형분석(Classification tree analysis)
새로운 사건이 속할 범주를 찾아내는 방법이다.
'이 사용자가 어떤 특성을 가진 집단에 속하는가?'와 같은 문제를 해결하는 방법이다.
( ex : 문서를 어떻게 분류할 것인가? 조직을 어떻게 여러 그룹으로 나눌 것인가? 온라인 수강생들의 특성을 반영하여 어떻게 분류할 것인가? )
유전 알고리즘(Genetic algorithms)
최적화가 필요한 문제의 해결책을 자연선택, 돌연변이 등과 같은 메커니즘을 통해 점진적으로 진화시켜 나가는 방법이다.
'최대의 시청률을 얻으려면 어떤 프로그램을 어떤 시간대에 방송해야 하는가?'와 같은 문제를 해결할 때 사용한다.
( ex : 최적화된 택배 차량 배치, 최고의 시청률을 내기위한 방송 프로그램 배치, 응급실에서 의사를 어떻게 배치하는 것이 가장 효율적인가? 연비가 좋은 자동차를 개발하기 위해 원자재와 엔지니어링을 어떻게 결합하는 것이 좋을까? )
기계학습=머신러닝(Machine learning)
컴퓨터가 데이터로부터 규칙을 찾고 이러한 규칙을 활용해 '예측'하는 데 초점을 둔 방법이다.
'기존 시청 기록을 바탕으로 시청자가 보유한 영화 중 어떤 영화를 가장 보고 싶어 할까?'와 같은 문제를 해결할 때 사용한다.
( ex : 유튜브 및 넷플리긋의 미디어 추천 시스템, 스팸메일 필터링, 질병 진단 예측 )
회기분석(Regression analysis)
독립변수를 조작하면서 종속변수가 어떻게 변하는지를 보며 수치형으로 이루어진 두 변인 관계를 파악하는 방법이다.
'구매자의 나이가 구매 차량의 타입에 어떤 영향을 미치는가?' 와 같은 문제를 해결할 때 사용한다.
( ex : 사용자의 만족도가 충성도에 어떤 영향을 미치는가? 이웃들과 그 규모가 집값에 어떤 영향을 미치는가? 상품가격은 매출에 어떤 영향을 미치는가? )
감정분석(Sentiment analysis)
특정 주제에 대해 말하거나 글을 쓴 사람의 감정을 분석하는 방법이다.
비정형 데이터 마이닝의 대표적인 기법 중 하나로, 덱스트 파일로부터 단어를 추출하고 추출된 단어의 긍정, 부정을 선별하여 글을 쓴 사람의 감정을 분석하는 분석 방법이다.
'새로운 환불 정책에 대한 고객의 평가는 어떤가?'와 같은 문제를 해결할 때 사용한다.
( ex : 호텔에서 고객의 후기를 분석하여 고객의 니즈를 찾아낸다. 제품의 사용기에 나타난 고객의 감정은 어떠한가? )
소셜 네트워크 분석(SNA; Social Network Analysis)
사회 관계망 분석으로도 불리며, SNS같은 온라인 공간에서 유저 사이의 팔로워, 팔로잉 관계를 분석하여 영향력이 있는 사람을 찾아내어 기업의 효율적인 마케팅이나 범죄 수사에서 공범을 찾는 등 다양한 분야에서 활용될 수 있다.
오피니언 리더, 즉 영향력 있는 사람을 찾아낼 수 있으며, 고객 간 소셜 관계를 파악할 수 있다.
( ex : 도시계획 및 지리학 분야에서 SNA를 활용하여 도시공간분석에 이용, 특정인과 다른 사람이 몇 촌 정도의 관계인가? 이 사람이 어느 정도 영향력 있는 '인플루언서'인가? )
[Tip] 소셜 네트워크 분석요소 : 연결 중심성, 근접 중심성, 매개 중심성, 아이겐벡터 중심성
사생활 침해
개인의 사생활 침해 위협을 넘어 사회, 경제적 위협으로 변형될 수 있다.
익명화 기술이 발전되고 있으나, 아직도 충분하지 않으며, 정보가 오용될 때 위협의 크기는 막대하다.
책임 원칙 훼손
빅데이터 기반 분석과 예측 기술이 발전하면서 정확도가 증가한 만큼, 분석 대상이 되는 사람들이 예측 알고리즘의 희생양이 될 가능성도 높아졌다.
빅데이터 시스템에 의해 부당하게 피해 보는 상황을 최소화할 장치 마련이 필요하다.
데이터 오용
데이터 과신 혹은 잘못된 지표의 사용으로 인한 잘못된 인사이트를 얻어 비즈니스에 적용할 경우 직접 손실이 발생할 수 있다.
빅데이터 시스템에 의해 부당하게 피해 보는 상황을 최소화할 장치 마련이 필요하다.
사생활 침해의 통제 방안 -> '동의'에서 '책임'으로
개인정보 제공자의 '동의'를 통해 해결하기보다 개인정보 사용자의 '책임'으로 해결한다는 방안이다.
책임 원칙 훼손의 통제 방안 -> 결과 기반 책임 원칙 고수
특정인의 '성향'에 따라 처벌하는 것이 아닌 '행동 결과'를 보고 처벌한다.
범죄를 저지를 것이라 예상되더라도 현 시점에서 아무런 범죄가 발생하지 않았으므로 어떠한 조치도 취할 수 없다는 것이다.
알고리즘 접근 허용
데이터가 어떻게 사용되어 어떠한 이유로 피해자가 발생하게 되었는지 데이터 활용 로직인 알고리즘을 살펴봄으로써 피해자를 구제할 수 있따.
최근에는 알고리즘을 이해하고 해석함으로써 사전에 피해자를 방지하고 구제하는 전문인력인 알고리즈미스트가 부상하고 있다.
[빅테이터 위기 요인과 통제 방안]
사생활 침해 -> 동의에서 책임으로
책임 원칙 훼손-> 결과 기반 책임 원칙 고수
데이터 오용 -> 알고리즘 접근 허용