
Zhen Yang, Ming Ding, Xu Zou, Jie Tang, Bin Xu, Chang Zhou, Hongxia Yang
그래프 기반 추천 시스템은 최근 빠르게 발전하고 있으며, 사용자-아이템 상호작용을 사용자-아이템 그래프로 모델링하고 그래프 신경망(Graph Neural Networks, GNN)을 활용하여 사용자 및 아이템의 임베딩을 학습합니다. 그래프 기반 추천의 근본적인 도전 과제는 사용자-아이템 그래프에서 관찰 가능한 양성 사용자-아이템 쌍만 존재한다는 점입니다. 네거티브 샘플링(Negative Sampling)은 이러한 단일 클래스 문제를 해결하는 핵심 기술로, 다양한 추천 방법에서 널리 사용됩니다. 하지만 이전 연구들은 네거티브 샘플링 분포 설계에만 초점을 맞췄을 뿐, 네거티브 샘플링 영역에 대해서는 충분히 고려하지 않았습니다.
본 연구에서는 네거티브 샘플링을 가이드하기 위해 세 영역 원칙(Three-Region Principle)을 제안합니다. 이 원칙은 중간 영역에서 더 많은 아이템을 네거티브로 샘플링하고, 인접 및 먼 영역에서의 샘플링은 줄여야 한다고 제안합니다. 이 원칙을 기반으로, 우리는 두 가지 샘플링 전략(양성 보조 샘플링 및 노출 보강 샘플링)을 결합하여 설계된 일반적인 네거티브 샘플링 방법 RecNS를 제시합니다. 기존의 그래프 데이터에서 존재하는 네거티브 아이템을 샘플링하는 대신, 이 두 전략을 임베딩 공간에서 병합하여 네거티브 아이템 임베딩을 생성합니다.
광범위한 실험을 통해 RecNS 방법이 모든 네거티브 샘플링 기준치를 초과하는 성능을 보여준다는 것을 증명했습니다. 예를 들어 Alibaba 데이터셋에서 Recall@20 측면에서 PinSage는 10.47%, NGCF는 6.02%, LightGCN은 8.20%의 향상을 보였습니다.
핵심 용어: 네거티브 샘플링, 세 영역 원칙, 임베딩 병합, 그래프 기반 추천
최근 몇 년간 추천 시스템 연구의 주요 관심사는 협업 필터링(Collaborative Filtering, CF)에서 그래프 기반 추천으로의 발전입니다 [1], [2], [3], [4], [5]. 그래프 기반 추천은 사용자-아이템 상호작용을 사용자-아이템 그래프로 모델링하며, 그래프 신경망(GNN)을 활용하여 사용자와 아이템의 임베딩 학습 과정에 구조적 정보를 통합합니다.
그래프 기반 추천의 핵심 목표는 고품질의 임베딩을 학습하고 학습된 임베딩을 통해 사용자-아이템 상호작용 가능성을 추정하는 것입니다. 이는 온라인 쇼핑, 소셜 네트워크, 광고 등 다양한 분야에서 널리 활용됩니다. GNN의 급속한 발전은 그래프 기반 추천의 부상을 이끄는 근본적인 원동력으로 작용하고 있습니다. 특히, 그래프 기반 추천은 차세대 추천 기술의 핵심이 될 가능성을 보이며, 웹 스케일 애플리케이션을 지원할 수 있는 유망한 기술로 평가받고 있습니다.
그러나 사용자-아이템 그래프에서 양성 쌍(positive pair)만 관찰 가능하며, 다른 아이템은 사용자와 연결되지 않은 상태로 관찰되지 않는 쌍으로 간주된다는 점에서 중요한 도전 과제가 있습니다. 이 문제를 해결하기 위해 네거티브 샘플링(Negative Sampling)이 중요한 기술로 자리잡았습니다.
네거티브 샘플링은 이전 연구들에서 널리 채택되었으며 [9], [10], [11], [12], 샘플링 전략은 전역적으로 관찰되지 않은 아이템 영역에서 소수의 네거티브 아이템만 선택하여 양성 아이템과 구별하는 모델을 훈련하는 데 사용되었습니다. 네거티브 샘플링은 훈련 과정을 가속화하고 계산 복잡도를 줄이며 대규모 그래프 기반 추천이 가능하게 합니다. 또한, 여러 연구 결과는 네거티브 아이템의 품질이 사용자/아이템 임베딩의 품질 및 추천 작업의 효율성에 영향을 미친다는 것을 보여줍니다 [8], [13].
그림 1. 임베딩 공간에서 양성 보조 샘플링과 노출 보강 샘플링을 병합하는 RecNS의 개요.
[14]에서는 유용한 표현 학습을 위해 어려운(hard) 네거티브 샘플의 상위 5%만 필요하며 충분하다는 것을 발견했습니다. 전통적으로, 네거티브 샘플링에 있어 가장 널리 사용되는 전략은 균일 분포(uniform distribution)를 사용하는 것입니다 [4], [15]. 네거티브 아이템의 품질을 향상시키기 위해, 여러 연구에서는 새로운 네거티브 샘플링 분포를 설계하려 시도해왔으며, 이는 현재 모델을 기반으로 어려운 네거티브 아이템(hard negative items)을 샘플링하는 방식입니다 [16], [17], [18]. 그래프 기반 추천에서 네거티브 샘플링 전략(예: MCNS [19] 및 PinSage [1])은 각각 자기대조(self-contrast) 근사 및 Metropolis-Hastings, 또는 PageRank 점수를 기반으로 네거티브 아이템을 샘플링합니다. 그러나 이와 같은 연구들은 그래프 신경망(GNN)의 정보 전파 메커니즘에서 샘플링 영역의 선택을 간과하고 네거티브 샘플링 분포 설계에만 초점을 맞추고 있습니다.
예를 들어, LightGCN [4]의 실험 결과는 레이어 수가 1에서 4로 증가할 때 대부분의 경우 레이어 2에서 성능이 정점을 찍은 후 감소하기 시작한다는 것을 보여줍니다. 이러한 결과에 대응하여, 저자들은 노드의 임베딩을 1차 및 2차 이웃과 함께 매끄럽게 처리하는 것이 매우 유용하지만, 더 높은 차수의 이웃을 사용할 경우 과도한 매끄러움(over-smoothing) 문제로 인해 성능이 저하된다고 주장합니다. 사실, 네트워크 레이어를 심화할 때 과도한 매끄러움 문제는 피할 수 없으나, 보다 효과적인 네거티브 샘플링 방법을 설계하여 추천 성능을 추가로 개선할 수 있습니다.
본 논문에서는 구조적 유사성에 따라 네거티브 아이템을 샘플링하기 위해 그래프 구조를 활용합니다. 사용자-아이템 그래프에서는 짧은 홉(hop)에 위치한 이웃들이 중심 노드와 더 높은 관련성을 가질 가능성이 높습니다. 이러한 짧은 홉 이웃들을 통한 정보 전파는 성능을 향상시킬 수 있으며, 중심 노드에 대해 더 긍정적인 정보를 전달할 가능성이 높습니다. 반면, 더 긴 홉 이웃들을 통한 정보 전파는 성능 저하를 초래하며, 이는 이웃의 정보가 추천 성능에 해로울 수 있음을 보여줍니다.
위와 같은 관찰을 바탕으로, 네거티브 아이템은 글로벌하게 관찰되지 않은 영역이 아닌 특정 영역에서 샘플링되어야 한다고 주장합니다. 따라서 본 연구에서는 중간 영역(intermediate region)에서 네거티브 아이템을 샘플링하기 위한 세 영역 원칙(Three-Region Principle)을 제안합니다. 이는 네거티브 샘플링에 있어 후보 네거티브 영역으로 고려해야 할 지역을 제시하는 원칙입니다. 이후, 우리는 후보 네거티브 영역에서 네거티브 아이템을 샘플링하기 위한 네거티브 샘플링 분포를 설계하는 RecNS 방법을 제안합니다.
본 논문의 주요 기여는 다음과 같습니다.
세 영역 원칙(Three-Region Principle): 기존의 글로벌하게 관찰되지 않은 아이템 영역에서 샘플링하는 대신, 중간 영역에서 네거티브 아이템을 샘플링하여 보다 유익한 후보 네거티브 아이템을 탐색하도록 가이드하는 원칙을 제안합니다.
RecNS 방법: 양성 보조 샘플링(positive-assisted sampling) 및 노출 보강 샘플링(exposure-augmented sampling)을 임베딩 공간에서 병합하여 최종 네거티브 아이템 임베딩을 생성하는 새로운 네거티브 샘플링 방법을 제안합니다. 이는 기존 그래프 기반 추천 모델에 손쉽게 통합할 수 있습니다.
광범위한 실험: 실험 결과는 RecNS가 기존 네거티브 샘플링 전략보다 우수하다는 것을 보여줍니다. PinSage, NGCF, LightGCN을 사용한 실험에서 각각 10.47%, 6.02%, 8.20%의 Recall@20 성능 향상을 보였습니다.
본 섹션에서는 SampledRec이라는 제안된 프레임워크를 자세히 설명합니다. 이후 SampledRec의 전체적인 과정을 검토합니다. SampledRec 프레임워크의 일반적인 흐름은 그림 2에 나와 있습니다.
그림 2. SampledRec 프레임워크의 일반적인 흐름.
SampledRec은 사용자와 아이템의 임베딩을 학습하기 위해 그래프 신경망 기반의 인코더 , 양성 샘플러 , 그리고 네거티브 샘플러 로 구성됩니다. 이는 각 사용자에 대해 양성 및 네거티브 아이템을 샘플링하며, 샘플링된 사용자-아이템 상호작용은 확률적 경사 하강법(SGD) 최적화를 통한 학습 데이터로 사용됩니다. 학습이 완료된 후, 추천 시스템은 특정 사용자를 위해 가장 큰 값을 가지는 상위 개 아이템을 추천합니다.
그래프 신경망 기반 인코더(GNN-based encoder)는 SampledRec에서 중요한 역할을 하며, 세 가지 모듈로 요약될 수 있습니다.
초기 아이템 및 사용자 임베딩 행렬 와 를 유지합니다. 여기서 과 은 각각 아이템 및 사용자 수를 나타내며, 는 임베딩 차원을 나타냅니다. 초기 임베딩 벡터 와 는 조회 연산(look-up operation)을 통해 생성됩니다. 직관적으로, 두 가지 유형의 집계 연산이 있습니다: 사용자 집계와 아이템 집계:
여기서 와 는 각각 중심 사용자 와 아이템 의 이웃을 나타내며, 와 는 사용자 와 아이템 의 집계된 임베딩입니다. 와 는 사용자 및 아이템 집계 함수입니다. 는 이웃 샘플러를 나타냅니다.
사용자와 아이템 간의 더 높은 차수의 상호작용을 캡처하기 위해, 여러 전파 레이어를 쌓아 임베딩을 레이어별로 전파합니다. 와 는 -번째 레이어에서 사용자 및 아이템 임베딩을 나타냅니다. -번째 레이어의 임베딩은 -번째 레이어에서 이웃의 임베딩과 자신의 임베딩에 따라 결정됩니다. 수학적으로, -번째 레이어의 사용자 임베딩 는 다음과 같이 정의됩니다:
여기서 는 업데이트 함수이며, 아이템 임베딩 벡터는 위에서 언급한 전파 모듈을 통해 동일한 방식으로 표현됩니다.
개의 레이어를 전파한 후, 사용자 와 아이템 에 대해 각 레이어의 표현 및 를 얻습니다. 이를 사용하여 최종 사용자 및 아이템 임베딩 와 를 다음과 같이 계산합니다:
여기서 는 융합 함수(fusion function)를 나타냅니다. 최종적으로, 일반적으로 사용되는 내적(inner product)을 통해 사용자의 특정 아이템에 대한 선호도를 다음과 같이 추정합니다:
대규모 그래프에서 GNN을 적용하려면 중심 노드에 대한 이웃을 샘플링해야 합니다. GCN(Graph Convolutional Network)은 모든 이웃을 집계에 사용하며, PinSage는 고정된 크기의 이웃을 샘플링합니다. FastGCN [20]은 각 합성 계층에서 이웃을 샘플링할 것을 제안하며, AS-GCN [21]은 적응적 층별 이웃 샘플링 방법을 제안합니다. 이웃 샘플링은 원본 그래프 정보 전파와 계산 효율성의 균형을 맞추는 데 중요한 기술입니다.
SampledRec에서 사용자-아이템 그래프의 엣지는 양성 사용자-아이템 상호작용으로 가정할 수 있습니다. 따라서 양성 사용자-아이템 상호작용 집합 는 다음과 같이 정의됩니다:
여기서 는 사용자 집합, 는 아이템 집합을 나타내며, 쌍은 사용자-아이템 그래프에서 연결된 엣지를 나타냅니다.
SampledRec에서는 네거티브 샘플러 를 사용하여 네거티브 아이템 을 샘플링합니다. 네거티브 샘플링은 오랜 연구 역사를 가지고 있지만, 대부분의 연구는 네거티브 샘플링 분포 설계에 초점을 맞추며 네거티브 샘플링 영역의 선택은 간과해왔습니다.
SampledRec에서는 GNN 기반 인코더의 매개변수를 최적화하기 위해 힌지 손실(Hinge Loss)을 사용합니다. 이 손실 함수는 한 쌍의 손실(one-pair loss)을 기반으로 정의됩니다. 여기서는 기존 힌지 손실을 -쌍 손실로 확장하여 확장된 힌지 손실(Augmented Hinge Loss)을 정의하고, 그래프 기반 추천의 성능을 강화합니다. 특정 사용자 와 해당 양성 아이템 에 대해 개의 네거티브 아이템 을 샘플링하여 다음의 확장된 힌지 손실을 최적화합니다:
여기서:
이 섹션에서는 먼저 네거티브 샘플링 문제를 소개하고 그래프 기반 추천에서의 네거티브 샘플링을 분석합니다. 이후 세 영역 원칙(Three-Region Principle)을 제안하여 네거티브 샘플링을 가이드하며, 영역 구분 기준을 제공합니다. 마지막으로, 제안된 세 영역 원칙에 대해 논의합니다.
확장된 힌지 손실 함수 (식 5)에서 볼 수 있듯이, 네거티브 샘플링은 모델 학습에서 중요한 역할을 합니다. 이는 모델이 양성 및 네거티브 상호작용을 구별할 적절한 경계를 학습할 수 있도록 도와줍니다. 구체적으로, 네거티브 샘플러 은 설계된 분포 에서 네거티브 아이템을 샘플링하며, 양성에 가까운(즉, 어려운 네거티브 아이템) 네거티브는 추천 모델의 성능을 크게 향상시킬 수 있습니다.
여러 연구에서는 추천 시스템의 성능을 개선하기 위해 더 복잡한 네거티브 샘플링 분포 을 설계하려는 시도가 이루어졌습니다 [16], [19], [22], [23], [24]. 하지만 초기 연구들은 실제 그래프 데이터에서 추정 분산을 줄이는 데 초점을 맞췄으며, 네거티브 샘플링 영역 선택은 충분히 탐구되지 않았습니다. 본 연구에서는 네거티브 샘플링을 위한 적절한 영역 선택을 탐구합니다.
반복적인 GNN은 사용자-아이템 그래프에서 정보를 레이어별로 전파하여 사용자와 아이템의 임베딩을 생성하는 아이디어입니다. 레이어 수는 성능에 큰 영향을 미치며, 이는 여러 연구 결과에서 확인되었습니다 [4], [15].
짧은 홉(Hop):
1~3홉의 이웃은 양성 선호도를 나타내며, 그래프 기반 추천의 성능을 향상시킵니다. 이는 사회적 영향 이론(Social Influence Theory) [25], [26]에 의해 설명될 수 있습니다. 이 이론에 따르면, 소셜 네트워크에서 사용자는 서로에게 영향을 미쳐 비슷한 선호도를 가지게 됩니다. 마찬가지로, 동일한 아이템과 상호작용한 사용자들은 동일한 커뮤니티에 속하며 동일한 선호도를 가질 가능성이 높습니다.
긴 홉(Hop):
반면, 4홉 이상의 이웃은 네거티브 선호도를 나타내며, 이는 추천 성능을 저하시킬 수 있습니다. 따라서, 네거티브 샘플링 영역은 반복적인 GNN의 전파 메커니즘에 따라 분리되어야 합니다.
최근 연구 [19]에서는 그래프 표현 학습의 네거티브 샘플링에 대한 기대 위험(Expected Risk)을 다음과 같이 이론적으로 증명했습니다:
여기서:
위 식은 네거티브 샘플링 분포 가 양성 분포 와 양의 상관 관계를 가지되, 부분적으로() 비례해야 함을 시사합니다. 따라서 네거티브 샘플링 전략은 GNN의 전파 메커니즘과 기대 위험을 모두 충족해야 합니다.
그래프 기반 추천 작업에서 GNN의 전파 메커니즘 특성을 고려하여, 우리는 사용자 와 관련된 네거티브 샘플링을 위한 세 영역 원칙(Three-Region Principle)을 제안합니다. 이 원칙에 따라 아이템을 세 가지 영역으로 나눌 수 있습니다(그림 3 참조).
인접 영역의 아이템은 그래프 기반 추천에서 중심 사용자 를 위해 특징 정보를 전파하는 데 주로 사용됩니다. 따라서 이 영역의 아이템은 사용자의 양성 선호도를 나타내며 네거티브로 샘플링되지 않아야 합니다. 또한, 식 (6)에 따르면 을 유지해야 하며, 이는 최적 값을 보장합니다. 요약하면, 인접 영역의 아이템은 일반적으로 네거티브 샘플링에서 제외되며, 과도한 샘플링은 의미가 없습니다.
중간 영역의 아이템은 인접 아이템과 달리, 양성에 가까운 하드(hard) 네거티브 아이템으로 간주됩니다. 이 영역의 아이템은 모델 학습에 더 많은 정보를 제공할 수 있습니다. 중간 영역의 아이템은 중심 사용자 에서 약간 떨어져 있으며, 이들을 인접 아이템으로 간주하고 정보 전파에 활용하면 성능이 저하되거나 약간만 향상될 수 있습니다. 또한, 중간 영역의 아이템을 중심 노드로 전파하면 노드 크기가 기하급수적으로 증가하여 메모리 소비가 커질 수 있습니다. 따라서 중간 영역의 아이템은 네거티브 샘플로 충분히 샘플링되어야 합니다.
먼 영역의 아이템은 값이 작고, 일반적으로 중심 사용자와의 관련성이 거의 없는 아이템입니다. 사용자는 일반적으로 이 영역의 아이템과 상호작용하지 않으므로 또는 값이 작습니다. 추천 시스템에서는 주로 값이 큰 상위 개의 아이템에 관심을 갖기 때문에, 먼 영역의 아이템은 과도한 네거티브 샘플링이 무의미합니다. 결과적으로, 먼 영역의 아이템은 적게 샘플링되어야 합니다.
세 영역 원칙에 따라, 사용자 와 하위 그래프(subgraph)를 기반으로 모든 아이템을 세 영역으로 나누기 위한 분리 기준을 제안합니다(그림 3 참조). 구체적으로, 사용자 와 하위 그래프의 구조를 활용하여 계층적 너비 우선 탐색(Layer-wise Breadth-First Search, LBFS) 알고리즘을 통해 개별화된 아이템 집합을 생성합니다.
이러한 구조적 분리 기준은 사용자별로 개인화된 영역을 생성하며, 사용자-아이템 그래프의 구조를 반영하여 다양성과 개성을 나타냅니다. 중간 영역은 네거티브 샘플링에 결정적인 역할을 하기 때문에, 중간 아이템 생성에 초점을 맞추고 있습니다. 본 논문에서는 네거티브 샘플링이 글로벌 영역이 아닌 중간 영역에서 이루어져야 한다고 주장하며, 이 원칙은 이후 5.5 심화 연구 섹션에서 검증됩니다.
LBFS 알고리즘의 구체적인 과정은 아래 알고리즘 1에 설명되어 있으며, BFS를 사용하는 하위 알고리즘은 알고리즘 2에 나와 있습니다.
입력: 사용자-아이템 그래프 , -홉
출력: 중간 영역
hop_num = 0, queue = [u]입력: 사용자-아이템 그래프 ,
출력: 계층별 노드 집합
temp = queue.pop(0)nodes = G[temp]nodes를 에 추가위에서 설명한 바와 같이, 세 영역 원칙은 네거티브 샘플링을 가이드하기 위한 일반적인 원칙으로 작용합니다. 글로벌하게 관찰되지 않은 아이템과 비교했을 때, 중간 영역의 아이템은 모델 학습에 더 유익한 후보 네거티브 아이템을 제공합니다. 세 영역 원칙은 비중간 아이템의 간섭을 제거하고, 중간 영역에서 정확하게 후보 네거티브 아이템을 샘플링할 수 있습니다. 요약하자면, 세 영역 원칙은 네거티브 샘플링을 위한 일반적인 원칙으로, 기존 네거티브 샘플링 전략에 글로벌 영역 대신 중간 영역을 대체하여 적용할 수 있습니다.
이 섹션에서는 제안된 네거티브 샘플링 방법인 RecNS를 설명합니다. RecNS는 기존 그래프 기반 추천 모델에 직접 통합할 수 있는 일반적인 네거티브 샘플링 방법입니다. RecNS는 네거티브 샘플링을 위해 두 가지 전략을 설계합니다: 양성 보조 샘플링(Positive-Assisted Sampling, RecNS-O)과 노출 보강 샘플링(Exposure-Augmented Sampling, RecNS-W). 이 두 샘플링 전략을 병합하여 최종 네거티브 아이템 임베딩을 생성합니다. RecNS의 학습 흐름은 알고리즘 3에 나와 있습니다.
어려운 네거티브 아이템을 얻기 위해, 양성 아이템의 도움을 받아 네거티브 샘플링을 수행하는 양성 보조 샘플링 전략을 제안합니다. 구체적으로, 주어진 사용자 와 해당 양성 아이템 에 대해, 네거티브 샘플링 분포는 사용자 뿐만 아니라 아이템 에 의해서도 결정됩니다 [16], [19], [23]. 사용자 의 관점에서 샘플링된 네거티브 아이템 은 의 네거티브 선호도를 반영합니다. 한편, 네거티브 아이템은 양성 및 네거티브 아이템을 구별할 충분한 분별력을 가져야 합니다 [24].
양성 아이템 정보를 네거티브 샘플링에 통합한다는 아이디어를 도입합니다. 먼저, 세 영역 원칙에 따라 생성된 중간 영역 에서 개의 후보 네거티브 아이템을 선택하여 후보 집합 를 형성합니다. 은 그래프 데이터의 전체 아이템 수보다 훨씬 작습니다. 이후, 내적(inner product) 점수를 사용하여 양성 분포를 근사화하고, 추정된 네거티브 분포 에서 후보 아이템 집합 의 네거티브 아이템을 선택합니다.
네거티브 분포 은 양성 분포 와 비례 관계를 가지며, 이는 MCNS [19]에서 도출된 결과입니다. 양성 보조 샘플링 분포는 다음과 같이 계산됩니다:
여기서:
는 하이퍼파라미터로 수동으로 튜닝할 수 있으며, 섹션 5.3 파라미터 분석에서 의 적합한 분포 선택을 논의합니다(예: 균일 분포 및 가우시안 분포).
요약하자면, 양성 보조 샘플링은 양성 정보를 네거티브 샘플링에 통합하여 결정적인 경계를 학습할 수 있도록 합니다. 확장된 힌지 손실(augmented hinge loss)을 사용하여 그래프 기반 추천 모델의 매개변수를 최적화하며, 개의 네거티브 아이템은 양성 보조 샘플링 분포 에서 샘플링됩니다. 이 개의 네거티브 아이템은 샘플링된 네거티브 집합 을 형성합니다.
우리는 노출 정보를 활용하여 네거티브 아이템을 샘플링하는 노출 보강 샘플링(RecNS-W) 전략을 제안합니다. E-commerce 플랫폼은 사용자가 추천받은 아이템이 노출되었는지 여부에 대한 정보를 수집할 수 있습니다. 이러한 노출 정보는 사용자의 네거티브 선호도를 설명하는 풍부한 정보를 포함하고 있습니다.
노출되었으나 상호작용하지 않은 아이템(즉, 노출된 아이템)은 사용자의 글로벌 미관찰 아이템과 비교했을 때, 더 강한 네거티브 특성을 반영합니다. 또한, 노출 정보는 잘못된 네거티브 문제(false negative problem)를 완화하는 데 도움이 될 수 있습니다. 일부 연구는 노출된 아이템이 더 많은 네거티브 속성을 가지고 있기 때문에, 이들을 네거티브 샘플로 사용하는 것이 유리하다고 제안합니다. 하지만, 노출된 아이템 자체가 심각한 편향을 가질 가능성이 있기 때문에, 단순히 이들을 샘플링하는 것은 최적의 성능을 보장하지 못할 수 있습니다 [28].
구체적으로, 사용자 와 해당 노출된 아이템 집합 에 대해 다음 과정을 수행합니다:
노출 보강 샘플링은 다음과 같이 구현됩니다:
여기서:
는 샘플링된 하드 네거티브 아이템을 활용하여 노출 아이템의 내적 점수를 수정하는 데 사용됩니다. 의 설계 목표는 노출된 아이템 중 후보 하드 네거티브 아이템에 속하는 아이템을 우선적으로 선택하도록 만드는 것입니다. 이로 인해 노출된 아이템 자체에서 발생할 수 있는 샘플링 편향 문제를 보정할 수 있습니다.
는 다음과 같이 정의됩니다:
여기서 는 중간 영역에서 선택된 후보 아이템 집합입니다. 의 크기는 에 속한 노출 아이템의 수에 따라 결정됩니다.
RecNS에서 네거티브 아이템은 앞서 설명한 두 가지 샘플링 전략(양성 보조 샘플링 및 노출 보강 샘플링)을 기반으로 합니다. 이제 이 두 샘플링 전략을 결합하는 방법을 소개합니다.
본질적으로 그래프 기반 추천의 핵심 아이디어는 사용자-아이템 그래프에서 임베딩을 반복적으로 전파하는 것입니다. 따라서, 이 샘플링 전략들을 임베딩 공간에서 병합(merging in embedding space)합니다. 병합 연산은 다음과 같이 구현됩니다:
여기서:
병합 연산 는 추가적인 매개변수를 필요로 하지 않으며, GNN 기반 인코더에서 직접 얻은 임베딩을 병합합니다. 병합 연산은 다음과 같이 정의됩니다:
여기서 는 네거티브 아이템의 수를 나타냅니다. 이는 매개변수를 추가하지 않는 비파라메트릭 병합 과정입니다.
RecNS는 그래프 기반 추천 모델에 플러그인 형태로 적용 가능한 범용적인 네거티브 샘플링 방법입니다. 양성 보조 샘플링은 네거티브 아이템의 품질을 향상시키며, 이는 다양한 그래프 기반 추천 모델에 널리 적용될 수 있습니다. 또한, 노출 보강 샘플링은 E-commerce 플랫폼에서 수집 가능한 노출 정보를 활용하여 네거티브 샘플링을 개선합니다.
기존 네거티브 샘플링 방법은 사용자-아이템 그래프에서 단일 아이템을 샘플링하는 반면, RecNS는 양성 보조 샘플링과 노출 보강 샘플링 간 네거티브 임베딩을 병합합니다. 이러한 방법은 두 가지 후보 네거티브 아이템을 실제로 결합하여 네거티브 샘플의 품질을 향상시킵니다. 또한, 병합 연산은 다중 네거티브 샘플의 임베딩을 결합하여 복합 임베딩(compound embedding)으로 활용할 수 있는 새로운 방법을 제공합니다.
RecNS의 계산 복잡도는 두 부분으로 나뉩니다.
양성 보조 샘플링(Positive-Assisted Sampling):
노출 보강 샘플링(Exposure-Augmented Sampling):
따라서, 노출 보강 샘플링의 총 계산 복잡도는 입니다.
결론적으로, RecNS의 전체 시간 복잡도는 로 표현할 수 있습니다.
일반적으로 네거티브 샘플링은 두 가지 요소에 따라 달라집니다:
1. 그래프 구조(반복적인 GNN의 전파 메커니즘)
2. 분산 이론(Variance Theory)
세 영역 원칙(Three-Region Principle)은 네거티브 샘플링 영역을 선택하기 위한 일반적인 가이드라인으로 작용합니다. 반면, RecNS는 후보 네거티브 아이템 집합에서 효율적으로 네거티브 아이템을 샘플링하기 위한 범용적인 네거티브 샘플링 방법입니다. 세 영역 원칙은 정보성이 높은 후보 네거티브 아이템 집합을 제공하고, RecNS는 이 집합에서 네거티브 아이템을 샘플링할 수 있는 효율적인 샘플링 분포를 제공합니다.
RecNS의 효과와 적응성을 입증하기 위해, 두 개의 데이터셋과 세 가지 대표적인 그래프 기반 추천 모델(PinSage, NGCF, LightGCN)을 대상으로 광범위한 실험을 수행했습니다. 이후 다양한 파라미터 분석을 수행했으며, 심층 연구를 통해 RecNS가 우수한 네거티브 샘플링 성능을 가지는 이유를 설명합니다.
RecNS는 다음 두 데이터셋에서 평가되었습니다:
아래 표는 데이터셋의 통계를 요약한 것입니다.
| 데이터셋 | 사용자 수 | 아이템 수 | 엣지 수 | 노출 수 | 밀도 |
|---|---|---|---|---|---|
| Zhihu | 16,015 | 44,175 | 3,284,734 | 3,796,551 | 0.00418 |
| Alibaba | 434,442 | 227,410 | 7,104,657 | 10,868,570 | 0.00006 |
RecNS는 세 가지 널리 사용되는 Top-K 평가 지표로 평가되었습니다:
1. Recall
2. NDCG (Normalized Discounted Cumulative Gain)
3. HR (Hit Rate)
는 20으로 설정되었습니다. 모든 테스트 사용자에 대해 평균 지표를 보고하며, 사용자가 상호작용하지 않은 모든 아이템을 대상으로 지표를 계산합니다. 또한, 효율적인 유사성 검색을 위해 Faiss 라이브러리(빠른 내적 계산을 지원)를 사용했습니다.
RecNS의 적응성을 확인하기 위해, 세 가지 일반적인 그래프 기반 추천 모델을 실험에 사용했습니다.
PinSage [1]:
NGCF [15]:
LightGCN [4]:
모든 네거티브 샘플링 전략에 대한 성능 비교 결과는 아래 표 2에 요약되어 있습니다. 표에서는 가장 우수한 기준선(밑줄)과 RecNS(굵게 표시된 값)의 결과를 강조했습니다. 전반적으로, RecNS는 모든 데이터셋과 평가 지표에서 뚜렷한 성능 향상을 가져왔습니다. RecNS의 적응성을 입증하기 위해, PinSage, NGCF, LightGCN이라는 세 가지 대표적인 그래프 기반 추천 모델에 RecNS를 적용했습니다. 표 2의 결과를 통해 다음과 같은 관찰이 가능합니다:
RecNS의 우수성
RecNS는 세 가지 GNN 기반 모델(PinSage, NGCF, LightGCN)에서 모든 기준선 대비 일관되게 우수한 성능을 보였습니다. 구체적으로, RecNS는 Zhihu와 Alibaba 데이터셋에서 각각 8.28%, 10.47%의 Recall@20 성능 향상을 PinSage 인코더에서 달성했습니다. 이러한 향상은 다음 요인들에 기인합니다:
기준선 전략의 성능
SRNS의 중요성
SRNS는 세 가지 GNN 기반 모델에서 다른 기준선 전략보다 우수한 성능을 보였습니다. 이는 잘못된 네거티브 문제(false negative problem)가 중요한 요소임을 보여줍니다. SRNS는 높은 분산(variance)을 가진 아이템을 네거티브로 샘플링하여 참된 네거티브(true negative)를 효율적으로 샘플링합니다. 그러나 RecNS는 SRNS를 능가하는 성능을 보여줬으며, 이는 RecNS가 노출 정보를 활용하여 잘못된 네거티브 문제를 완화하고, 세 영역 원칙을 적용하여 더 유익한 후보 네거티브를 제공했기 때문입니다.
노출 정보와 통합된 세 가지 네거티브 샘플링 방법(ExpNS, MixedNS, RNS-AS)과 RecNS를 비교한 결과는 표 3에 요약되어 있습니다. 결과를 통해 다음과 같은 관찰이 가능합니다:
ExpNS의 한계
ExpNS는 노출된 아이템만을 네거티브로 샘플링하는 전략으로, 가장 낮은 추천 성능을 보였습니다. 이는 노출된 아이템의 출처를 명확히 알 수 없으며, 사용자가 단순히 무시했거나 실제로 싫어하는 아이템일 가능성이 있기 때문입니다.
MixedNS와 RNS-AS의 개선
MixedNS는 노출 아이템과 글로벌 미관찰 아이템 간의 샘플링 가중치 를 조정하며, RNS-AS는 노출 데이터와 적대적 학습(adversarial learning)을 결합하여 더 나은 성능을 보였습니다.
RecNS의 우수성
RecNS는 노출 보강 샘플링 전략을 통해 노출 정보를 네거티브 샘플링에 통합합니다. 자체 증폭 계수(self-amplified factor)를 도입하여 노출 아이템의 영향을 증폭시키고, 가장 높은 내적 점수를 가진 노출 네거티브 아이템을 샘플링합니다. 또한, RecNS는 양성 보조 샘플링과 노출 보강 샘플링을 임베딩 공간에서 병합하여 네거티브 아이템 품질을 더욱 향상시킵니다.
| 모델 | Zhihu (Recall@20) | Alibaba (Recall@20) |
|---|---|---|
| PinSage+ExpNS | 0.30 | 0.35 |
| PinSage+MixedNS | 2.09 | 2.79 |
| PinSage+RNS-AS | 2.98 | 3.52 |
| PinSage+RecNS | 3.53 | 4.01 |
세 영역 원칙에서 영역을 구분하는 기준인 -홉의 선택이 RecNS 성능에 미치는 영향을 분석하기 위해 실험을 수행했습니다. -홉 값을 로 설정하여 다양한 중간 영역을 생성하고, Zhihu 및 Alibaba 데이터셋에서 실험을 진행했습니다. 실험 결과는 아래 표 4에 요약되어 있습니다.
| 모델 | Zhihu (-홉) | Alibaba (-홉) |
|---|---|---|
| PinSage | 3.53 () | 4.01 () |
| NGCF | 4.42 () | 4.58 () |
| LightGCN | 4.91 () | 6.86 () |
결론:
1. Zhihu 데이터셋에서는 에서 최상의 성능을 보였으며, Alibaba 데이터셋에서는 에서 최상의 성능을 보였습니다. 이는 데이터셋의 밀도 차이에 기인한 결과로 보입니다. 밀도가 높은 데이터셋에서는 짧은 전파 경로가 효과적이며, 밀도가 낮은 데이터셋에서는 더 긴 전파 경로가 성능 향상에 기여합니다.
2. -홉 값의 선택은 데이터셋 밀도에 따라 조정해야 하며, 일반적으로 밀도가 높은 데이터셋에는 , 밀도가 낮은 데이터셋에는 를 권장합니다.
전파 레이어 수 이 RecNS의 성능에 미치는 영향을 분석하기 위해 로 설정하여 NGCF와 LightGCN 모델에서 실험을 수행했습니다. 실험 결과는 아래 표 5에 요약되어 있습니다.
| 모델 | Zhihu (Recall@20) | Alibaba (Recall@20) |
|---|---|---|
| NGCF () | 4.26 | 3.97 |
| NGCF () | 4.42 | 4.58 |
| LightGCN () | 4.56 | 4.41 |
| LightGCN () | 4.91 | 6.86 |
결론:
1. 레이어 수가 1에서 3으로 증가하면 성능이 개선되며, 대부분의 경우 에서 최고 성능을 보입니다.
2. 에서는 성능이 다시 감소하며, 이는 GNN에서 과도한 전파로 인한 과도 매끄러움 문제(over-smoothing)로 설명할 수 있습니다. 이는 높은 차수의 이웃 정보가 노드의 임베딩을 과도하게 평탄화시켜 성능을 저하시키는 현상입니다.
확장된 힌지 손실(augmented hinge loss)을 통해 네거티브 아이템 수 가 RecNS 성능에 미치는 영향을 분석했습니다. 로 설정하여 PinSage+RecNS 모델에서 실험을 수행했으며, 결과는 아래 그림 4에 요약되어 있습니다.
결론:
1. 초기에는 를 증가시킴에 따라 성능이 개선되며, 에서 최적의 성능에 도달했습니다.
2. 일 때는 성능이 약간 감소했으며, 이는 추가 샘플링이 모델의 학습 목적에 불필요한 편향을 추가했기 때문입니다.
3. 는 추천 성능과 훈련 시간을 균형 있게 유지할 수 있는 최적의 값으로 확인되었습니다.
양성 보조 샘플링에서 사용자와 양성 아이템 간의 영향을 조정하는 보조 계수 의 분포에 따른 성능을 분석했습니다. 를 가우시안 분포(, )와 균일 분포(, )로 설정하고, PinSage+RecNS 모델에서 실험을 수행했습니다.
결론:
RecNS의 성능에 중요한 세 가지 하이퍼파라미터(마진 , 임베딩 차원 , 후보 아이템 수 )의 영향을 분석했습니다. Zhihu 데이터셋에서 실험 결과는 아래 그림 6에 요약되어 있습니다.
결론:
1. 마진 : 일 때 성능이 향상되며, 에서 최적의 성능을 달성했습니다.
2. 임베딩 차원 : 이 성능과 시간 효율성 간의 균형을 유지하는 최적값으로 확인되었습니다.
3. 후보 아이템 수 : 이 추천 성능과 계산 비용을 균형 있게 유지하는 최적값으로 확인되었습니다.
RecNS는 세 영역 원칙(Three-Region Principle)에 기반합니다. 그러나 이 원칙이 실제로 네거티브 샘플링에 도움이 되는지 확인하기 위해 확장된 실험을 설계했습니다. 이 실험에서는 세 가지 다른 영역(중간 영역, 먼 영역, 글로벌 미관찰 영역)에서 각각 개의 후보 네거티브 아이템을 샘플링하는 세 가지 변형된 RecNS 전략(RecNS-Med, RecNS-Dis, RecNS-All)을 설계했습니다. 결과는 아래 그림 7에 요약되어 있습니다.
결론:
1. 먼 영역에서만 샘플링하는 경우(RecNS-Dis), 추천 성능이 급격히 저하되었습니다. 이는 먼 영역의 아이템이 추천 성능에 유의미한 기여를 하지 못함을 나타냅니다.
2. 글로벌 미관찰 영역에서 샘플링하는 경우(RecNS-All), 중간 영역과 먼 영역을 명확히 구분하지 못해 성능이 저하되었습니다.
3. 중간 영역에서 샘플링하는 경우(RecNS-Med), 가장 우수한 성능을 보였습니다. 이는 세 영역 원칙이 정보성이 높은 네거티브 후보를 제공한다는 것을 입증합니다.
양성 보조 샘플링이 네거티브 샘플링에 미치는 영향을 평가하기 위해 실험을 설계했습니다. 특정 사용자 에 대해, 현재 모델에서 가장 높은 내적 점수를 가진 가장 어려운 네거티브(hardest negative)를 샘플링했습니다. 이 실험에서는 양성 보조 샘플링을 비활성화한 RecNS 변형(RecNSw/o p-a)을 사용했습니다. 결과는 Zhihu 및 Alibaba 데이터셋에서 아래 그림 8에 요약되어 있습니다.
결론:
1. 가장 어려운 네거티브 아이템을 샘플링하면 추천 성능이 저하되었습니다. 이는 잘못된 네거티브(false negative) 문제가 발생했기 때문입니다.
2. 이전 연구 [1], [36]에서도 가장 어려운 네거티브 대신 큰 점수와 높은 분산(variance)을 가진 아이템을 샘플링하는 것이 추천 성능을 향상시키는 데 유리하다고 제안했습니다.
3. RecNS는 양성 보조 샘플링을 통해 양성과 네거티브 간의 경계를 보다 명확히 구분하며, 잘못된 네거티브 문제를 완화합니다.
노출 보강 샘플링의 효과를 검증하기 위해 두 가지 실험을 수행했습니다. 결과는 아래 그림 9에 요약되어 있습니다.
노출 보강 샘플링 비활성화(RecNSw/o e-a):
노출 보강 샘플링을 비활성화한 경우, 추천 성능이 감소했습니다. 이는 노출 정보를 활용함으로써 샘플링 편향을 줄이고, 참된 네거티브(true negative)를 샘플링할 수 있음을 보여줍니다.
노출된 네거티브 아이템 수의 영향:
Zhihu 데이터셋에서 PinSage 인코더를 사용하여, 샘플링된 노출 네거티브 아이템의 수를 로 설정해 실험을 수행했습니다. 결과는 노출된 네거티브 아이템의 수를 증가시켜도 성능이 개선되지 않음을 보여줍니다. 이는 노출된 아이템이 편향된 정보를 포함하고 있기 때문입니다. 따라서 RecNS는 자체 증폭 계수(self-amplified factor)를 통해 가장 정보성이 높은 노출 네거티브 아이템을 선택하도록 설계되었습니다.
그래프 기반 추천 시스템은 전자상거래 및 소셜 미디어와 같은 다양한 애플리케이션에서 핵심 기술로 주목받고 있습니다. 기존의 협업 필터링(collaborative filtering) 및 행렬 분해(matrix factorization) 방법은 웹 스케일 애플리케이션에는 적합하지 않았습니다. 하지만 딥러닝 기술의 발전으로 그래프 기반 모델이 추천 시스템에 활용되고 있습니다.
네거티브 샘플링은 추천 시스템에서 단일 클래스 문제를 해결하고 학습 속도를 가속화하기 위한 핵심 기술입니다. 기존의 네거티브 샘플링 방법은 다음과 같이 네 가지 범주로 나눌 수 있습니다:
정적 샘플러(Static Sampler):
어려운 네거티브 샘플러(Hard Negative Sampler):
GAN 기반 샘플러(GAN-based Sampler):
보조 정보 기반 샘플러(Auxiliary-based Sampler):
본 연구에서는 그래프 기반 추천에서의 네거티브 샘플링 문제를 다루며, 세 영역 원칙(Three-Region Principle)을 제안했습니다. 이 원칙은 중간 영역에서 더 많은 아이템을 네거티브로 샘플링하도록 가이드합니다. 또한, 우리는 RecNS라는 효과적인 네거티브 샘플링 방법을 제시했으며, 양성 보조 샘플링과 노출 보강 샘플링을 병합하여 최종 네거티브 임베딩을 생성합니다.
RecNS는 세 가지 대표적인 그래프 기반 추천 모델(PinSage, NGCF, LightGCN)에서 기존 네거티브 샘플링 전략을 대체하여 성능을 크게 향상시켰습니다. 추가적으로, RecNS는 광범위한 실험에서 다른 기존 방법들과 비교하여 우수한 성능을 보였습니다.