Implicit feedback은 사용자의 선호도가 명시적으로 제공되는 것이 아니라 사용자와 아이템의 상호작용을 통해 추론되는 데이터를 의미합니다. 클릭, 페이지 조회, 구매 이력, 콘텐츠 시청 시간과 같은 행동들이 대표적인 implicit feedback이며, 이는 사용자가 추가적인 행동을 취할 필요가 없어 대규모로 수집하기 용이합니다.
Explicit vs Implicit Feedback 비교:
Explicit Feedback은 사용자가 특정 척도로 아이템에 명시적으로 평점을 부여하는 것이며, Implicit Feedback은 사용자가 시간에 따른 특정 개념에 따라 아이템과 상호작용함으로써 아이템의 관련성에 대한 정보를 암묵적으로 제공하는 것입니다. Implicit feedback 데이터가 explicit feedback 데이터보다 자연적으로 풍부하게 존재한다는 점이 implicit feedback을 다룰 수 있는 알고리즘의 중요성을 뒷받침합니다.
핵심 특징:
주요 과제:
Negative 샘플의 부재: Implicit 데이터에서 상호작용하지 않은 아이템이 반드시 사용자가 싫어하는 것을 의미하지는 않습니다. 사용자가 어떤 제품을 싫어하는지에 대한 실질적인 증거가 부족합니다.
해석의 모호성: 관찰되지 않은 사용자-아이템 상호작용은 사용자가 아이템을 보지 못했거나 보았지만 좋아하지 않았기 때문일 수 있습니다.
데이터 불균형: 사용자는 일반적으로 실제 시스템의 방대한 아이템 수에 비해 소수의 아이템과만 상호작용하므로, 신뢰할 수 있는 negative 데이터가 부족하여 implicit feedback 데이터로부터 추천 시스템을 학습하는 것이 매우 어렵습니다.
ALS 알고리즘은 희소 데이터셋에서 잘 확장되기 때문에 implicit feedback 행렬 분해에 인기가 있습니다. ALS는 고객-아이템 희소 행렬을 사용하여 모델을 학습하며, 행렬의 유형을 double로 설정하여 ALS 함수가 제대로 실행되도록 해야 합니다.
핵심 특징:
BPR은 implicit feedback으로부터의 개인화된 랭킹을 위한 최대 사후 추정기로부터 도출된 일반적인 최적화 기준을 제시합니다. BPR 접근법의 핵심 전략은 사용자가 소비한 아이템보다 소비하지 않은 아이템에 대해 일반적으로 더 강한 선호도를 가진다고 가정하는 것입니다.
핵심 개념:
NCF는 implicit feedback을 기반으로 추천의 핵심 문제인 협업 필터링을 다루기 위해 신경망 기반 기술을 개발합니다. 사용자와 아이템 특징 간의 상호작용을 모델링할 때, 내적을 데이터로부터 임의의 함수를 학습할 수 있는 신경망 아키텍처로 대체합니다.
아키텍처:
Implicit feedback 데이터를 다룰 때 negative sampling은 매우 중요합니다.
주요 전략:
Random Sampling: 모든 진정한 긍정 인스턴스에 대해, 사용자가 상호작용하지 않은 인스턴스를 선택하기 위해 특정 알고리즘을 사용하여 negative 샘플을 도출할 수 있습니다
Popularity-based Sampling: 인기도 기반 샘플링은 일반적인 작업을 다루는 데 특히 유용할 수 있습니다
Hard Negative Sampling: 큰 예측 점수를 가진 negative 인스턴스가 모델 학습에 중요하지만 일반적으로 희귀하며, 왜곡된 분포를 따릅니다
과제:
Implicit feedback 시스템을 평가하기 위한 주요 지표들:
Ranking 기반 지표:
Precision@K: 상위 K개 추천 아이템 중 사용자의 테스트 데이터에 존재하는 아이템의 비율입니다
Recall@K: 사용자에게 관련된 모든 아이템 중 상위 K개 추천에서 검색된 비율
NDCG@K (Normalized Discounted Cumulative Gain): 테스트 세트에 추천 아이템의 존재뿐만 아니라 신뢰도 점수도 고려하며, 아이템의 상위 K 리스트에서의 순위에 따라 이 점수를 할인하는 랭킹 지표입니다
MAP@K (Mean Average Precision): 서로 다른 recall 수준에서의 precision을 계산하여 precision, recall, rank를 살펴보는 개념적 지표입니다
Hit Rate: 상위 K개 추천 아이템 중 적어도 하나가 테스트 데이터에 있었는지를 나타냅니다
MRR (Mean Reciprocal Rank): 사용자는 상위에 랭크된 결과를 클릭하거나 참여할 가능성이 더 높으므로, MRR은 이러한 랭킹 역학을 더 잘 포착합니다
평가 시 고려사항:
산업 적용 사례:
구현 도구:
성능 개선:
미래 방향:
Implicit feedback은 현대 추천 시스템의 핵심 데이터 소스이며, 수집의 용이성과 풍부함으로 인해 실무에서 널리 활용됩니다. ALS, BPR, NCF와 같은 알고리즘들이 각각의 장점을 가지고 있으며, negative sampling 전략과 적절한 평가 지표의 선택이 시스템 성능에 중요한 영향을 미칩니다. 딥러닝의 발전과 함께 더욱 정교한 모델들이 계속 개발되고 있으며, 편향 제거와 공정성 향상이 주요 연구 과제로 부상하고 있습니다.