원문 ➡️ https://arxiv.org/abs/2510.01171
Base model 이 아무리 다양한 출력을 내놓을 수 있어도 RLHF 같은 정렬 과정을 거치고 나면 LLM의 답변이 한 mode 에 쏠리게 되는 mode collapse(모드 붕괴)가 발생한다.(여기서 collapse(붕괴)란 확률 분포가 한 점에 쏠리는 현상을 말한다.) 기존 연구들은 이 문제가 보상 모델의 부족, KL 정규화의 부작용과 같은 알고리즘적 한계 때문에 발생한다고 주장했지만, 해당 논문은 Typicality Bias(전형성 편향)을 근본적인 원인으로 지적하고, prompting 을 통해 해당 문제를 해결할 수 있는 방안을 제시한다.

RLHF 는 AI가 인간의 선호도와 가치관을 학습하도록 돕는 머신 러닝 기법으로, 인간이 AI의 답변을 직접 평가하고 순위를 매기면 AI는 이를 통해 '보상 모델(Reward Model)'을 구축하여 인간이 가장 좋아하는 답변을 생성하도록 최적화된다.
위와 같은 RLHF 과정을 때문에 LLM 은 인간의 Typicality Bias 에 따라 한쪽으로 치우친 답변을 내놓게 되는 것이다. (다양성 붕괴)
Typicality Bias란, 사람들이 익숙하고 전형적인 답변을 무의식적으로 더 좋다고 평가하는 경향을 말한다. 해당 논문에서는 RLHF 에서 사람이 답변 선호도를 매길 때, 정답성과 무관하게 전형적인(base model 이 더 높은 확률을 부여하는) 응답을 선호하기 때문에 mode collapse 가 발생한다고 추론한다. 논문에서 다음 네 가지 심리 효과로 편향을 설명한다.
1. Mere-exposure effect (단순 노출 효과)
: 자주 접한 것일수록 더 좋아 보임. 처음 듣는 노래보다 라디오에서 여러 번 들은 노래가 더 좋게 느껴지는 현상.
2. Availability heuristic (가용성 휴리스틱)
: 쉽게 떠오르는 것이 더 그럴듯해 보임. "비행기 사고"와 "자동차 사고" 중 비행기 사고를 더 위험하게 느끼는 이유 (뉴스에 자주 나오니까).
3. Processing fluency (처리 유창성)
: 읽기 쉬운 텍스트가 자동으로 더 진실되고 고품질로 느껴짐. 같은 내용이라도 명확한 폰트로 쓰면 더 신뢰가 가는 현상.
4. Schema congruity (스키마 일치성)
: 기존 사고 틀에 맞는 정보는 비판 없이 잘 받아들여짐.
다음과 같은 효과들 때문에 답변과 정답의 일치 여부와 관계 없이 더 좋다고 판단하는 경향이 발생한다는 것이다.

: 응답의 진짜 품질(true utility) = 보상 함수
: typicality bias
: 노이즈
베이스 모델은 인터넷 텍스트에서 new-token prediction 으로 학습되기 때문에, 자주 등장하는 패턴은 그만큼 높은 확률을 갖게되고, 해당 패턴은 사람들에게 익숙한 표현이라는 뜻이다. 그렇기 때문에 여기서 는 베이스 모델이 그 응답에 부여하는 로그 확률이고, 이걸 '얼마나 전형적인지(typicality)' 의 proxy 로 사용한다.
-> 이면 같은 품질의 응답이라도 typicality bias 가 높은 응답이 채택된다.
해당 논문에서는 가설의 검증을 위해 Llama 3.1 model 과 GLM 4.5 base model을 이용하여 HELPSTEER 데이터셋에서 correctness가 같은() 응답 쌍 6,874개로 회귀 분석을 실행했고, 임을 확인하였다. 즉, 정답성이 동일해도 typicality가 높은 응답이 통계적으로 유의하게 선호됨을 입증되었다.

위와 같은 근거에 기반하여 해당 논문에서는 typicality bias 를 줄이기 위해 Verbalised Sampling(VS) 방법을 제시한다.
해당 논문에서는 정렬된 모델이 mode collapse를 일으키긴 하지만, 어떤 답으로 붕괴하는지는 프롬프트의 형태에 따라 달라진다 라는 부분을 핵심 아이디어로 삼아 붕괴를 일으키는 프롬프트 유형을 세 가지로 분류하였고, 그 중 mode collapse 를 해결하기 위한 방법으로 Distribution-Level Prompt(VS) 를 제안한다.
Instance-Level prompt
: 기존의 응답 출력처럼 가장 확률이 높은 한 가지의 답변만 출력하도록 한다.
(e.g., “Tell me a joke about coffee”)
List-Level prompt
: k 개의 응답을 리스트로 만들어 출력하도록 한다.
(e.g., “Tell me k-jokes about coffee”)
Distribution-Level prompt (VS-Standard)
: k 개의 응답과 해당 응답의 확률을 리스트로 출력하도록 한다.
(e.g., “Tell k-jokes about coffee with their probabilities”)
논문에서는 위의 Distribution-Level Prompt 사례를 VS-Standard 유형으로 분류하고, 추가로 VS-CoT와 VS-Multi 두 개의 variants 를 추가해 성능 평가를 진행하였다.
VS-COT 는 확률 분포를 출력하기 이전에 먼저 단계적으로 추론하게 만드는 방식이다.
User: 단계별로 생각한 후, 커피 농담 5개와 각 확률을 알려줘
LLM:
[reasoning]: 커피에 관한 농담은 여러 유형이 있다.
말장난(mug), 카페인 효과, 커피 종류별 특성,
현대 카페 문화 등 다양한 각도가 가능하다...
[responses]:
- "Espresso may not solve..." (확률: 0.12)
- ...
이런 방식이 가능한 이유는, '단계별로 생각하라' 라는 prompting을 통해 LLM이 어떤 종류의 농담들이 가능한가를 먼저 탐색하게 해 응답 출력의 다양성을 높일 수 있기 때문이다.
VS-Multi 는 여러 턴에 걸쳐 분포를 반복적으로 요청하는 방식이다.
Turn 1 - User: 커피 농담 5개와 각 신뢰도(confidence)를 알려줘
LLM: [5개 농담 + 확률]
Turn 2 - User: 다른 커피 농담 5개와 각 신뢰도를 더 알려줘
LLM: [또 다른 5개 농담 + 확률]
Turn 3 - User: 또 다른 5개...
이전 턴의 응답들을 참고하여 LLM이 겹치지 않게 응답을 출력하도록 함으로써 다양한 답변 후보를 생성할 수 있도록 한다. 이런 방식이 가능한 이유는, 한 번에 여러 응답을 출력하도록 하면 비슷한 종류의 응답들이 출력될 가능성이 높은데, 이전 답변을 context 로 참고하게 하여 이미 출력된 답변은 후보에서 제외하게 함으로써 다양한 답변을 출력할 수 있게 되기 때문이다.

한 번 정렬된 모델 는 어떤 질문이 들어와도 샘플링하는 출력 공간이 같다. 하지만 출력 공간을 (응답, 확률) 쌍으로 prompting 할 경우 출력되는 (응답, 확률) 집합은 매번 같아도 해당 집합 안에서 사용자가 랜덤하게 사용할 수 있기 때문에 다양성을 확보할 수 있다는 것이다.
Stage 1: π*에서 샘플링
→ 거의 항상 같은 (응답, 확률) 집합이 나옴
→ 예: {(농담A, 0.3), (농담B, 0.25), (농담C, 0.2), (농담D, 0.15), (농담E, 0.1)}
Stage 2: 그 집합 안에서 확률대로 다시 샘플링
→ 30% 확률로 농담A, 25% 확률로 농담B, ...
→ 결과: 다양한 농담
LLM 에게 "농담 1개 줘." 라고 요청하면 매번 같은 농담 1개만 받지만, "농담 k개와 그 확률을 줘." 라고 요청하면 다양한 확률 분포를 가진 농담 리스트를 받을 수 있고, 사용자는 K개에서 자유롭게 골라 사용할 수 있게 된다. (논문에서는 'LLM이 출력한 분포 정보를 가지고 외부에서 random sampling을 하기 때문에 답변이 균등 분포로 강제된다.' 라는 표현을 사용함.)
그럼 왜 확률 까지 같이 달라고 하느냐?
"농담 5개 줘" 라고 갯수만 요청하면 LLM 은 typicality bias 에 따라 패턴이 비슷한 전형적인 답변들을 모은 리스트를 반환한다. 하지만 '확률'까지 같이 달라고 하는 경우, LLM 은 다양한 확률을 가진 농담 리스트를 보여줘야 하므로, 가장 흔한 농담(높은 확률) / 덜 흔하지만 그럴듯한 농담(중간 확률) / 희귀한 농담(낮은 확률) 과 같이 다양한 확률 분포를 가진 농담들로 리스트를 구성해 출력한다.


논문의 [Figure 4] 에서 Distribution prompt 를 사용했을 때의 각 분야(poem 생성, joke 생성, story 생성)에서의 diversity 가 어떠한지 수치 변화를 보여주고 있다.
-> 같은 K 개의 응답을 받는데도 prompting 에 따라 diversity가 달라짐!


Q: (Try1) Tell me a joke about coffee

Q: (Try2) Tell me a joke about coffee

몇번을 반복해도 같은 답변이 출력됨 -> typicality bias 가 높은 응답 채택
Q: Tell 5 jokes about coffee with their probabilities

매번 다른 응답 생성 -> 다양한 답변이 채택됨