Implicit Feedback 종합 리서치 리포트

김동준·2025년 12월 2일

Recommend System

목록 보기
4/14

Implicit Feedback 종합 리서치 리포트

1. 개요 및 정의

Implicit feedback은 사용자의 선호도가 명시적으로 제공되는 것이 아니라 사용자와 아이템의 상호작용을 통해 추론되는 데이터를 의미합니다. 클릭, 페이지 조회, 구매 이력, 콘텐츠 시청 시간과 같은 행동들이 대표적인 implicit feedback이며, 이는 사용자가 추가적인 행동을 취할 필요가 없어 대규모로 수집하기 용이합니다.

Explicit vs Implicit Feedback 비교:

Explicit Feedback은 사용자가 특정 척도로 아이템에 명시적으로 평점을 부여하는 것이며, Implicit Feedback은 사용자가 시간에 따른 특정 개념에 따라 아이템과 상호작용함으로써 아이템의 관련성에 대한 정보를 암묵적으로 제공하는 것입니다. Implicit feedback 데이터가 explicit feedback 데이터보다 자연적으로 풍부하게 존재한다는 점이 implicit feedback을 다룰 수 있는 알고리즘의 중요성을 뒷받침합니다.

2. 주요 특징 및 과제

핵심 특징:

  • 실제 시나리오에서 대부분의 피드백은 명시적이지 않고 암묵적이며, 클릭, 시청 시간, 구매 등을 자동으로 추적하여 수집이 매우 용이합니다
  • 주요 과제는 이러한 신호를 정확하게 해석하는 것인데, 아이템을 조회했다고 해서 사용자가 그것을 좋아한다는 의미는 아닐 수 있어 해석이 모호할 수 있습니다

주요 과제:

  1. Negative 샘플의 부재: Implicit 데이터에서 상호작용하지 않은 아이템이 반드시 사용자가 싫어하는 것을 의미하지는 않습니다. 사용자가 어떤 제품을 싫어하는지에 대한 실질적인 증거가 부족합니다.

  2. 해석의 모호성: 관찰되지 않은 사용자-아이템 상호작용은 사용자가 아이템을 보지 못했거나 보았지만 좋아하지 않았기 때문일 수 있습니다.

  3. 데이터 불균형: 사용자는 일반적으로 실제 시스템의 방대한 아이템 수에 비해 소수의 아이템과만 상호작용하므로, 신뢰할 수 있는 negative 데이터가 부족하여 implicit feedback 데이터로부터 추천 시스템을 학습하는 것이 매우 어렵습니다.

3. 주요 알고리즘

3.1 Alternating Least Squares (ALS)

ALS 알고리즘은 희소 데이터셋에서 잘 확장되기 때문에 implicit feedback 행렬 분해에 인기가 있습니다. ALS는 고객-아이템 희소 행렬을 사용하여 모델을 학습하며, 행렬의 유형을 double로 설정하여 ALS 함수가 제대로 실행되도록 해야 합니다.

핵심 특징:

  • Matrix Factorization 기반
  • 희소 데이터셋에 효과적
  • 확장성이 뛰어남
  • 멀티스레드 학습 루틴을 가지며, Cython과 OpenMP를 사용하여 모든 가용 CPU 코어에서 병렬로 모델을 학습합니다

3.2 Bayesian Personalized Ranking (BPR)

BPR은 implicit feedback으로부터의 개인화된 랭킹을 위한 최대 사후 추정기로부터 도출된 일반적인 최적화 기준을 제시합니다. BPR 접근법의 핵심 전략은 사용자가 소비한 아이템보다 소비하지 않은 아이템에 대해 일반적으로 더 강한 선호도를 가진다고 가정하는 것입니다.

핵심 개념:

  • Pairwise learning 접근법
  • LearnBPR 알고리즘을 제안하며, 이는 부트스트랩 샘플링을 사용한 확률적 경사 하강법에 기반합니다
  • BPR 모델은 맞춤형 CUDA 커널을 가지고 있어 호환 가능한 GPU에서 학습이 가능합니다

3.3 Neural Collaborative Filtering (NCF)

NCF는 implicit feedback을 기반으로 추천의 핵심 문제인 협업 필터링을 다루기 위해 신경망 기반 기술을 개발합니다. 사용자와 아이템 특징 간의 상호작용을 모델링할 때, 내적을 데이터로부터 임의의 함수를 학습할 수 있는 신경망 아키텍처로 대체합니다.

아키텍처:

  • NeuMF는 두 개의 하위 네트워크를 융합하며, GMF는 행렬 분해의 일반적인 신경망 버전으로 사용자와 아이템 잠재 요인의 요소별 곱을 입력으로 합니다
  • Generalized Matrix Factorization (GMF)와 Multi-Layer Perceptron (MLP) 결합
  • 더 깊은 신경망 레이어를 사용하는 것이 더 나은 추천 성능을 제공한다는 실증적 증거가 있습니다

4. Negative Sampling 전략

Implicit feedback 데이터를 다룰 때 negative sampling은 매우 중요합니다.

주요 전략:

  1. Random Sampling: 모든 진정한 긍정 인스턴스에 대해, 사용자가 상호작용하지 않은 인스턴스를 선택하기 위해 특정 알고리즘을 사용하여 negative 샘플을 도출할 수 있습니다

  2. Popularity-based Sampling: 인기도 기반 샘플링은 일반적인 작업을 다루는 데 특히 유용할 수 있습니다

  3. Hard Negative Sampling: 큰 예측 점수를 가진 negative 인스턴스가 모델 학습에 중요하지만 일반적으로 희귀하며, 왜곡된 분포를 따릅니다

과제:

  • 학습 및 테스트 정확도가 높더라도 실제 성능으로 이어지지 않을 수 있으므로, negative 샘플이 positive 샘플만큼 효과적으로 데이터 분포를 나타내는 것이 중요합니다
  • 이러한 방법들은 일반적으로 훈련을 위해 높은 그래디언트를 가진 hard negative 샘플을 유지하는 데 초점을 맞춰 false negative 샘플이 우선적으로 선택되게 하여 과적합과 모델의 일반화 성능 저하를 초래할 수 있습니다

5. 평가 지표

Implicit feedback 시스템을 평가하기 위한 주요 지표들:

Ranking 기반 지표:

  1. Precision@K: 상위 K개 추천 아이템 중 사용자의 테스트 데이터에 존재하는 아이템의 비율입니다

  2. Recall@K: 사용자에게 관련된 모든 아이템 중 상위 K개 추천에서 검색된 비율

  3. NDCG@K (Normalized Discounted Cumulative Gain): 테스트 세트에 추천 아이템의 존재뿐만 아니라 신뢰도 점수도 고려하며, 아이템의 상위 K 리스트에서의 순위에 따라 이 점수를 할인하는 랭킹 지표입니다

  4. MAP@K (Mean Average Precision): 서로 다른 recall 수준에서의 precision을 계산하여 precision, recall, rank를 살펴보는 개념적 지표입니다

  5. Hit Rate: 상위 K개 추천 아이템 중 적어도 하나가 테스트 데이터에 있었는지를 나타냅니다

  6. MRR (Mean Reciprocal Rank): 사용자는 상위에 랭크된 결과를 클릭하거나 참여할 가능성이 더 높으므로, MRR은 이러한 랭킹 역학을 더 잘 포착합니다

평가 시 고려사항:

  • Implicit feedback 데이터의 경우, ground truth에 순위가 없으므로 Recall@K나 Precision@K와 같이 내재된 순서를 가정하지 않는 지표가 더 의미 있습니다
  • NDCG는 binary, integer 또는 실수 형태의 관련성 점수를 아이템에 할당할 수 있는 모든 경우에 사용할 수 있습니다

6. 실무 적용 사례

산업 적용 사례:

  • Amazon에서 소비자 구매의 35%, Netflix 시청의 75%가 추천 엔진 기반 제품 추천으로부터 발생합니다
  • 2017년 Spotify에서 청취된 트랙의 31%가 Spotify의 추천 시스템에 의해 생성된 개인화된 플레이리스트에서 비롯되었습니다
  • 여행 및 관광 산업의 주요 기업과 협력하여 negative sampling을 성공적으로 적용했으며, 해당 모델은 고객에게 여행 일정을 추천하고 여러 마케팅 채널에 배포됩니다

구현 도구:

  • Python의 implicit 패키지는 여러 다양한 인기 추천 알고리즘의 빠른 Python 구현을 제공하며, ALS, BPR, Item-Item Nearest Neighbour 모델을 포함합니다
  • Annoy, NMSLIB, Faiss와 같은 근사 최근접 이웃 라이브러리를 Implicit과 함께 사용하여 추천 속도를 높일 수 있습니다

7. 최신 연구 동향

성능 개선:

  • Implicit feedback은 인기 아이템에 대해 더 많은 데이터 볼륨을 초래할 수 있으며, 이는 인기 편향을 야기할 수 있습니다
  • Negative sampling은 implicit-feedback 기반 협업 필터링에서 중요한 역할을 하며, 감독 학습을 안내하기 위한 negative 신호를 생성하는 데 방대한 레이블이 없는 데이터를 활용합니다

미래 방향:

  • Deep Learning 기반 접근법의 지속적인 발전
  • Federated Learning을 활용한 프라이버시 보호 추천
  • Multi-modal 데이터를 통합한 hybrid 접근법
  • 편향 제거 및 공정성 향상

8. 결론

Implicit feedback은 현대 추천 시스템의 핵심 데이터 소스이며, 수집의 용이성과 풍부함으로 인해 실무에서 널리 활용됩니다. ALS, BPR, NCF와 같은 알고리즘들이 각각의 장점을 가지고 있으며, negative sampling 전략과 적절한 평가 지표의 선택이 시스템 성능에 중요한 영향을 미칩니다. 딥러닝의 발전과 함께 더욱 정교한 모델들이 계속 개발되고 있으며, 편향 제거와 공정성 향상이 주요 연구 과제로 부상하고 있습니다.

profile
Story Engineer

0개의 댓글