PERSONALIZED LANGUAGE MODELING FROM PERSONALIZED HUMAN FEEDBACK Xinyu Li*,1, Ruiyang Zhou3 , Zachary C. Lipton1 , and Liu Leqi∗,2,3 1Carnegie Mellon University 2Princeton Language and Intelligence 3University of Texas at Austin [Submitted on 6 Feb 2024 (v1), last revised 9 Dec 2024 (this version, v3)]
1 서론
LLM 개인화(personalization)는 사용자별 선호, 인구통계, 혹은 과거 행동 데이터에 따라 모델이 맞춤형 응답을 생성하도록 학습하는 것을 목표로 함. 이는 추천 시스템, 챗봇, 의료, 교육 등 다양한 응용에서 필수적.
하지만 기존의 RLHF는 인간 피드백으로 모델을 정렬시키는 일반적 방법이지만, 모든 인간의 선호가 동일 분포에서 나온다고 가정하기 때문에 개별 사용자의 선호 다양성을 반영하지 못함.
또한 기존의 RLHF-기반 개인화 연구들은 각 선호 차원마다 별도의 보상모델 또는 LLM을 학습해야 했고, 모든 사용자 선호 차원을 사전에 정의해야 했음.

제안: Personalized RLHF framework
연구코드: https://github.com/HumainLab/Personalized_RLHF
2 관련 연구
Reinforcement Learning from Human Feedback
RLHF는 RL policy로 LLM을 최적화해서 인간의 선호에 맞는 응답을 생성하는 방법. SFT- -> RM 학습 -> 정책 최적화(PPO, DPO)
기본 형태의 RLHF는 사용자 선호의 균일성(uniformity)을 암묵적으로 가정하므로, 사용자 간의 다양성을 간과하게 되고, 그 결과 사용자의 명시적 선호가 모델에 제공되지 않는 경우 특히 개인화된 콘텐츠를 생성하는 능력이 제한됨.
RLHF에 개인화를 도입하기 위해
서로 다른 선호 차원별로 별도의 보상 모델이나 LLM 정책 학습한 후 보상 가중치 조정
특정 선호 선택에 따라 여러 LLM을 결합
Prompt-based LLM Personalization
사용자가 과거에 생성한 콘텐츠를 소수의 예시(few-shot example)로 프롬프트에 포함시켜, LLM이 인컨텍스트 학습(in-context learning)을 통해 개인화된 콘텐츠를 생성하도록 하는 방식.
우리의 연구는 이러한 프롬프트 기반 개인화와 상호보완적. 프롬프트 기반 접근이 사용자가 작성한 텍스트나 선택 항목과 같은 사용자 생성 콘텐츠(user-generated content)를 활용하는 반면, 본 연구는 사용자로부터 수집된 비교 또는 순위 형태의 선호 데이터(preference data)를 이용해 LLM을 개인화함.
3 Vanilla RLHF
Vanilla RLHF via Reward Modeling
xi는 프롬프트, y(i,1)과 y(i,2)는 두 개의 생성 텍스트, y(i,1)이 더 선호됨.

보상모델은 최대우도(Bradley-Terry 모델로 학습. 여기서

임. 이후 LLM 정책은

으로 최적화. 여기서 KL은 Kullback-Leibler 발산을 의미하고, β > 0 는 패널티 강도를 조정하는 하이퍼파라미터.
Vanilla DPO
DPO로 재매개화하면

임. D는 식 (1)에서 주어진 선호 데이터.
3.1 개인화된 RLHF의 동기: 바닐러 RLHF의 사용자 선호에 대한 바람직하지 않은 가정
Assumption 3.1
바닐라 보상 모델링 및 DPO에서는 사용자 선호가 균일하다고 가정함.
이 가정은 사실성이나 안정성처럼 여러 사용자들 간에 공통적인 선호를 찾는 것이 목표일 때는 합리적. 그러나 생성 텍스트의 스타일과 같이 사용자 선호가 다양한 설정에서는 이 가정이 바람직하지 않음.
Lemma 3.2
바닐라 RLHF/DPO는 모든 사용자에 대해

라고 가정함. 여기서

는 동일한 프롬프트와 응답 쌍을 공유하는 샘플 인덱스들의 집합.
이는 r_vanilla의 근본적인 문제, 다수가 선호하는 응답을 모든 사용자가 선호한다고 가정하는 majority voting 체계를 유도. -> 소수의 선호는 무시됨.
Lemma 3.3
다수 집단의 비율이 증가함에 따라, 소수 집단의 편차는 P(u_majority)에 대해 단조 증가(monotonically increasing)함.
-> r_vanilla는 사용자 선호가 다양한 경우에는 적절하지 않음.
4. Learning from Personalized Human Feedback
개인화된 인간 피드백(또는 선호) 데이터셋

에서 u_i=(u_i^t,u_i^p)는 u_i^t: 사용자의 (선택적) 텍스트 정보(예: 인구통계, 선호 설명), u_i^p: 고유 사용자 식별자, 사용자 ID.
개인화된 LLM y~π_p (⋅|x,u)은 프롬프트 x와 사용자 사용자 정보 u를 입력받아 해당 사용자 u의 개인적 선호에 기반해 출력 생성.
텍스트 정보 없고 사용자 인덱스 알 수 없으면 LLM π_p는 비개인화된 응답 생성.
4.2 P-RLHF General Framework
개인화된 LLM을 개발하기 위한 일반적인 Personalized-RLHF(P-RLHF) 프레임워크 제시.
기본 LLM으로 π_SFT을 시작점으로 사용하고 학습 가능한 사용자 모델 f_p(사용자 정보 u=(u^t,u^p)로부터 사용자 임베딩(벡터 또는 텐서) e_u를 추출)를 추가한다. -> e_u=f_p (u)
4.3 P-RLHF User Models
P-RLHF는 명시적 선호와 암묵적 선호를 모두 포착하도록 설계. -> f_p=(f_p^ex,f_p^im)
f_p^ex: 명시적 사용자 모델, 텍스트 정보 u^t를 입력으로 받아 사용자의 명시적 임베딩 e_u^ex를 출력
LLM의 자연어 이해 능력을 활용해서 LLM이 제공하는 input embeddings를 그대로 사용.
f_p^im: 암묵적 사용자 모델, 피드백 데이터에서 추론된 선호를 반영하여 사용자 피드백에 기반한 임베딩 학습
텍스트 사용자 정보에 의존하지 않고 고유 사용 식별자 u^p를 직접 임베딩

으로 매핑. T_u는 사용자 토큰 길이로 암묵적 사용자 임베딩의 표현력을 제어하는 요인.
암묵적 모델의 예시
Uniform Preference
모든 사용자가 동일한 임베딩을 공유한다고 가정(바닐라 RLHF의 근본 가정)
Individualized Preference
암묵적 사용자 모델은 인덱스 0으로 지정된 새로운 사용자에 대해서 f_P^im (0)=e_0^im을 출력.
모든 i에 대해서는 f_P^im (i)=e_i^im=e_0^im+o_i로 정의, 여기서 o_i는 사용자별 offset 텐서. -> 공통 텐서 + 개인별 선호 편차를 더해서 개인화된 선호 표현
Cluster-based Preference
모든 i에 대해 f_P^im (i)=e_i^im=V⋅w_i로 정의.
V는 K개의 클러스터 중심을 포함하는 임베딩 테이블, K는 클러스터 개수. w_i는 각 사용자에 대한 가중치 벡터.
-> 저랭크 근사(low-rank qpproximation). 각 사용자별로 d차원 임베딩을 따로 갖는 대신 V_ind≈W_cluster V로 근사.
최종 사용자 모델은 명시적 모델과 암묵적 모델 결합 -> f_P (u)=concat(f_P^im (u^p ),f_P^ex (u^t ))

이렇게 결합된 임베딩은 LLM으로 전달되어 개인화된 응답 생성.
4.4 P-RLHF Learning Objective: Personalized DPO
개인화된 LLM π_P와 사용자 모델 f_P가 주어졌을 때 P-DPO 학습 목적식은

임.
β > 0는 π_P가 정책 π_SFT로부터 얼마나 이탈할 수 있는지를 제어하는 하이퍼파라미터
α ∈ [0, 1]은 두 손실 항의 균형을 조절
이 손실은 두 구성요소의 결합 형태
사용자 식별자 기반 손실(user-identifier-specific loss), 사용자 u^p에 의존하는 항
사용자 비식별 손실(user-agnostic loss), 모든 사용자 인덱스를 0으로 설정하여 공통 선호 기반으로 학습하는 항
5 Experiments
5.1 Generation with Conflicting Preferences
데이터셋: TL;DR
전체 주석자 중 70%를 무작위로 샘플링해서 긴 응답 선호하도록, 나머지 30%는 짧은 응답 선호하도록 설정. -> 상충(conflicting)되는 선호 갖도록 함.
충분한 데이터로 사용자 선호를 효과적으로 학습하기 위해, TL;DR 데이터셋의 학습 분할(train split)에서 주석 횟수가 가장 많은 상위 10명의 주석자를 학습에 포함시키고, 이들을 1부터 10까지의 ID로 표시. (데이터셋의 추가 세부사항은 부록 C.1)
GPT-J 6B SFT 모델 기반으로 α=0.5, T_u=10 설정으로 P-DPO 학습

평가용 데이터셋에서 무작위로 샘플링된 50개의 프롬프트를 기반으로, P-DPO로 미세조정된 개인화 LLM이 각 주석자별로 생성한 응답의 길이(단어 수 단위)를 측정한 결과.
개인화된 LLM은 다수 사용자(긴 응답을 선호하는 사용자)에 대해서는 현저히 긴 응답을 생성한 반면, 소수 사용자(짧은 응답을 선호하는 사용자)에 대해서는 텍스트 종료 토큰만을 생성(즉, 길이 0의 응답) 하여, 시뮬레이션된 선호에 대해 우리가 이론적으로 도출한 최적 행동(E1)을 그대로 재현.
특히, 학습 데이터에는 실제로 길이 0의 응답(빈 응답)이 존재하지 않았음에도 불구하고, LLM이 소수 사용자에 대해 이러한 응답을 생성했다는 점은 모델이 훈련 데이터의 분포를 넘어선 일반화 능력(extrapolation) 을 성공적으로 보여주었다는 것을 의미.
새로운 사용자에 대해서는 vanilla DPO와 유사한 수준.
-> P-DPO는 명시적 사용자 정보 없이도 피드백 데이터로부터 단일 차원의 사용자 선호(single-dimensional user preference) 를 정확히 포착할 수 있음.
5.2 Instruction Following under Different Preference Profiles
데이터셋: GPT-4 Alpaca의 지시문(instruction)에 대한 응답 쌍(pairwise response) 피드백을 포함하는 Personalized-Soups (P-SOUPS). 3가지 사전 정의된 선호 차원(쩐문성, 정보성, 스타일)에 따라 평가, 각 차원마다 두 선호(A/B)로 총 6개 선호 프로필 구성. 데이터셋의 세부 설명 및 전처리는 부록 D.

P-DPO로 학습된 개인화 LLM의 성능을 두 가지 비개인화(non-personalized) 기준 모델과 하나의 오라클(oracle) 모델과 비교.
P-DPO의 학습 및 평가 과정에서는 오직 지시문만 모델에 입력되며, 선호 프롬프트는 제공되지 않음 -> P-DPO는 오직 피드백 데이터로부터 사용자 선호 학습.
P-DPO는 Tulu-7B SFT 및 vanilla DPO 대비 평균 90% 승률, 일부 사용자에 대해서는 100% 승률.
오라클(ground-truth prompt 제공) 모델 대비 평균 70.24% 승률 -> 개별 사용자에 맞게 응답을 정렬시키는 강력한 능력을 지님.
5.3 Personalization on Real-World Preference Dataset with Large User Base
데이터셋: PRISM 데이터셋. 75개국 1,500명 참가자, 명시적 선호, 8,011개의 대화와 각 턴에 대한 세밀한 피드백 포함. 세부사항은 부록 E.1.
모델: Llama3-8B-Instruct
P-DPO의 두 가지 변형 실험. Individualized preference model, Cluster-based preference model(K=10, 100)
모델 평가는 GPT-4o가 주석한 쌍별 승률(pairwise win-rate)로 수행. 예시 프롬프트는 부록 E.2.

모든 P-DPO 모델이 vanilla DPO 모델을 능가하고 60% 이상의 승률. -> P-DPO가 텍스트 정보에 완전히 표현되지 않은 추가적인 암묵 신호를 성공적으로 학습함.
모든 P-DPO 모델이 PRISM 데이터셋의 선택된 응답(chosen responses) 보다 높은 승률을 기록했으나, vanilla DPO에 대한 승률보다는 약간 낮음.
클러스터 기반 모델이 가장 우수함. -> 대규모 사용자에게 효율적 저랭크 근사.
추가 실험: 암묵적 모델만 사용. K=10 기반 P-DPO(implicit-only)
20명 사용자 -> per-sample 51.32%, per-user 55%
70명 사용자 -> per-sample 65.38%, per-user 72.86%
-> 암묵적 사용자 모델이 개인화된 피드백 데이터로부터 직접 사용자 선호를 포착할 수 있으며, 훨씬 더 큰 사용자 집단에서도 견고하고 일반화 가능한(personalization-generalizable) 개인화 성능을 유지함.
계산 및 메모리 비용
전체 파라미터는 N=N_l+N_u
사용자 모델은 경량한 구조로 설계되어서 N_u≪N_l/10
기존 RLHF 기반 개인화 방법들은 여러 개의 LLM을 별도로 학습해야 해서 N=N_l×c이므로 비효율적임.
6 결론 (Conclusions)
개인화된 LLM을 구축하기 위해, P-RLHF (Personalized Reinforcement Learning from Human Feedback) 라는 새로운 프레임워크 제안.
경량 사용자 모델과 개인화 LLM을 공동 학습(jointly learn)하는 구조,
사용자 텍스트 정보가 존재하면 명시적 선호 활용, 없으면 피드백 데이터로부터 암묵적 선호를 직접 추론.
다양한 사용자 모델 설계를 통해 구조적 선호 가정을 포착하는 방법과 개인화 언어 모델링을 위한 새로운 학습 목적함수(P-DPO) 제안.
또한, 이 프레임워크는 다른 RLHF 변형(예: IPO)에도 일반적으로 적용 가능하며, 보상모델링 통합은 부록 F.2, 다양한 목적 확장은 F.3에서 논의.