Author: Liwei Jiang, Yuanjun Chai, Margaret Li, Mickel Liu, Raymond Fok, Nouha Dziri, Yulia Tsvetkov, Maarten Sap, Alon Albalak, Yejin Choi
Affilation: University of Washington, Carnegie Mellon University, Allen Institute for Artificial Intelligence, Lila Sciences, Stanford University
Venue: NeurIPS 2025 D&B
Comment:
Date: October 2025
Paper Link: https://arxiv.org/abs/2510.22954
⭐️ Key Takeaways
1. 26,070개의 실제 개방형 질의와 17개 세부 범주의 분류 체계를 포함한 INFINITY-CHAT 데이터셋을 구축함으로써, 언어 모델의 출력 다양성과 다원적 정렬(pluralistic alignment)을 체계적으로 연구할 수 있는 최초의 대규모 자원을 마련했다.
2. 동일 모델 내의 반복적 생성뿐만 아니라 서로 다른 모델들조차 유사한 답변으로 수렴하는 '인공 집단의식(Artificial Hivemind)' 현상을 발견하여, 현재 언어 모델들이 실제 개방형 질의에 대해 심각한 생성적 동질화와 모드 붕괴 문제를 겪고 있음을 입증했다.
3. 기존 언어 모델, 보상 모델 및 LM 평가 모델들이 인간의 다양하고 주관적인 선호도 분포를 적절히 반영하지 못하고 있으며, 특히 인간이 동등하게 우수하다고 판단하는 여러 응답 사이에서 모델의 평가 보정(calibration) 능력이 크게 떨어진다는 사실을 확인했다.
대규모 언어 모델(LM)은 종종 다양하고 인간과 유사한 창의적인 콘텐츠를 생성하는 데 어려움을 겪으며, 유사한 결과물에 반복적으로 노출됨으로써 인간 사고의 장기적인 동질화에 대한 우려를 제기한다. 하지만 LM 출력 다양성을 평가하기 위한 확장 가능한 방법은 제한적으로 남아 있으며, 특히 무작위 숫자나 이름 생성과 같은 좁은 작업을 넘어서거나 단일 모델에서 반복적인 샘플링을 넘어서는 경우 더욱 그렇다. 이러한 격차를 해소하기 위해, 우리는 단일 정답이 없이 광범위하고 그럴듯한 답변을 허용하는 26K개의 다양하고 실제적인 개방형 사용자 질문으로 구성된 대규모 데이터셋인 INFINITY-CHAT을 소개한다. 우리는 LM에 제시되는 개방형 프롬프트의 전체 스펙트럼을 특성화하는 최초의 포괄적인 분류 체계를 소개하며, 이 분류 체계는 6개의 최상위 범주(예: 창의적인 콘텐츠 생성, 브레인스토밍 및 아이디어 구상)로 구성되며, 이는 다시 17개의 하위 범주로 세분된다. INFINITY-CHAT을 사용하여, 우리는 LM의 모드 붕괴에 대한 대규모 연구를 제시하며, LM의 개방형 생성에서 뚜렷한 인공 집단의식(Artificial Hivemind) 효과를 밝혀낸다. 이 효과는 (1) 단일 모델이 일관되게 유사한 응답을 생성하는 모델 내 반복, 그리고 더 나아가 (2) 서로 다른 모델이 놀라울 정도로 유사한 결과물을 생성하는 모델 간 동질성으로 특징지어진다. INFINITY-CHAT에는 또한 절대 평가 및 쌍별 선호도에 걸쳐 31,250개의 인간 주석이 포함되며, 예시당 25개의 독립적인 인간 주석이 제공된다. 이는 개방형 질문에 대한 집단적 및 개인별 인간 선호도를 연구할 수 있게 한다. 우리의 발견은 최첨단 LM, 보상 모델 및 LM 평가 모델이 비슷한 전반적인 품질을 유지함에도 불구하고, 서로 다른 개인적인 주석자 선호도를 유발하는 모델 생성물에 대한 인간 평가에 덜 잘 보정되어 있음을 보여준다. 전반적으로, INFINITY-CHAT은 LM에 대한 실제 개방형 질문을 체계적으로 연구하기 위한 최초의 대규모 리소스를 제시하며, 인공 집단의식이 제기하는 장기적인 AI 안전 위험을 완화하기 위한 향후 연구를 안내하는 중요한 통찰력을 드러낸다.

대규모 언어 모델(LM)은 현대 AI 시스템의 핵심 중추이지만, 정답(ground truth)이 없는 개방형 작업에서 기대되는 다양하고 인간과 유사한 창의성을 생성하는 데 종종 실패한다. 이러한 결함은 사용자들이 유사한 결과물에 반복적으로 노출됨에 따라 인간 사고의 장기적인 동질화에 대한 우려를 증폭시킨다. 앙상블 방법이나 모델 "군집"이 다양성을 향상하기 위해 제안되었지만, 실제 환경에서 다양성을 확장 가능하게 평가하는 방법은 여전히 부족하다. 기존 벤치마크는 종종 페르소나 생성, 키워드 기반 스토리텔링, 또는 무작위 숫자 생성과 같은 양식화된 작업을 목표로 하며, 시 또는 비유적 언어에 중점을 둔 좁게 정의된 테스트에 의존한다. 하지만 이러한 설정은 실제 사용자 상호 작용의 개방성과 다원성을 포착하지 못한다.
우리는 WildChat에서 채굴된 다양하고 자연적으로 발생하는 프롬프트를 포괄하는 26K개의 실제 개방형 질문으로 구성된 대규모 데이터셋인 INFINITY-CHAT을 소개한다. 이러한 질문들은 단일 정답 없이 광범위한 그럴듯한 답변을 허용한다. 우리는 나아가 자연스러운 챗봇-사용자 상호 작용에 기반을 둔 6개의 최상위 범주(예: 브레인스토밍 및 아이디어 구상, 그리고 투기적 및 가상 시나리오, 기술 개발과 같이 덜 탐구된 유형)와 17개의 하위 범주를 포함하는 최초의 포괄적인 LM 개방형 질문 분류 체계를 개발한다.
INFINITY-CHAT을 사용하여, 우리는 70개 이상의 공개 및 비공개 소스 LM(본 논문에서 25개가 상세히 설명됨)에 걸쳐 모델 내 및 모델 간 모드 붕괴를 체계적으로 연구한다. 우리는 뚜렷한 인공 집단의식(Artificial Hivemind) 효과를 발견한다. 이는 (1) 단일 모델이 반복적으로 유사한 결과물을 생성하는 모델 내 반복, 그리고 더 중요하게는 (2) 서로 다른 모델이 구문상의 사소한 변화만 가진 채 유사한 아이디어로 독립적으로 수렴하는 모델 간 동질성으로 특징지어진다. 후자는 모델 구성 요소들이 중복되는 정렬 및 훈련 사전 지식을 공유할 때 모델 앙상블이 진정한 다양성을 산출하지 못할 수 있다는 점을 경고한다.
생성 행동을 넘어, 우리는 또한 LM이 개방형 질문에 대한 비슷한 품질의 대안적 응답들을 평가하도록 보정되었는지 여부를 조사한다. 이 연구를 가능하게 하기 위해, 우리는 INFINITY-CHAT의 개별 모델 응답에 대해 31,250개의 인간 주석을 수집하는데, 여기에는 절대 품질 평점과 쌍별 선호도가 모두 포함되며, 질의-응답 쌍당 25명의 독립적인 주석자가 조밀하게 주석을 달았다. 우리의 결과는 최첨단 LM, 보상 모델 및 LM 기반 평가 모델이 비슷한 전반적인 품질에도 불구하고 주석자들 사이에서 서로 다른 개인별 선호도를 유발하는 응답에 대한 인간 평가와 관련하여 종종 오보정되어 있음을 보여준다. 이는 단일하고 합의된 품질 개념을 가정하는 경향이 있어 개방형 응답에서 발생하는 다양하고 다원적인 선호도를 간과하거나 보상하지 못하는 현재 모델링 파이프라인의 주요 한계를 드러낸다.
종합적으로, 우리의 연구는 LM 내 및 LM 간의 실제적인 개방성, 다양성 및 다원적 정렬을 평가하기 위한 포괄적인 프레임워크를 제시한다. 실제 질문, 질문 유형의 분류 체계, 그리고 조밀한 인간 주석을 통합함으로써, INFINITY-CHAT은 인공 집단의식 효과를 진단하고 인간의 창의성을 더욱 강화하는 더 안전하고, 더 표현력이 풍부하며, 더 유용한 LM 개발을 안내하는 데 유용한 리소스를 제공한다.

대부분의 기존 LM 정렬 데이터셋은 다양성보다는 응답의 정확성을 우선시하며, 동일한 프롬프트에 대해 여러 가지 구별되는 응답을 포함하는 경우가 드물다. 이는 종종 여러 개의 동등하게 유효한 답변을 허용하는 개방형 질의의 내재적 가변성을 간과한다. 이러한 격차는 사용자들은 실제로 언어 모델에 어떤 종류의 개방형 질의를 던지는가 하는 첫 번째 핵심 연구 질문을 제기한다.
Mining in-the-wild open-ended user queries. WildChat에서 사용자 입력을 필터링하고 다듬어 LM에 대한 실제 개방형 질의 데이터셋인 INFINITY-CHAT을 구축한다. GPT-4o는 37,426개의 고품질 단일 턴 GPT-4 질의(영어, 비유해성, 15~200자)를 추출하여, 각각이 의미 있는 정보를 찾는지, 인사 또는 모델에 대한 질문인지, 단일 또는 다중의 유효한 응답을 허용하는지 여부를 기준으로 분류한다. 모호한 질의는 명확성을 위해 수정된다. 그 결과, 다양하고 고품질의 LM 응답을 이끌어내는 26,070개의 개방형 질의와 8,817개의 폐쇄형 질의로 구성된 광범위한 컬렉션이 도출된다. 질의 채굴 과정의 전체 세부 사항은 §Appendix B.1에 제공된다.
Categorizing the diverse landscape of open-ended queries. 사용자들은 LM에 제기하는 개방형 질의 유형을 이해하기 위해, 우리는 세분화된 범주의 분류 체계를 개발한다. 이 분류 체계를 구축하기 위해 반자동 프로세스를 채택한다. 약 100개의 채굴된 질의에서 시작하여, 잠정적인 레이블을 수동으로 할당한 다음, 반복적으로 다듬고 계층적 구조로 그룹화한다. 그 결과는 Figure 2에 표시된 대로 6개의 최상위 범주와 17개의 세분화된 하위 범주를 포함한다. 다음으로, GPT-4o를 사용하여 전체 개방형 질의 세트에 대한 주석 프로세스를 확장한다. GPT-4o에게 각 사용자 질의에 기존 개방형 범주 중 하나 이상을 레이블로 지정하고, 시드 범주를 넘어서는 새로운 유형을 감지하도록 지시한다. 분류 체계 구축 과정의 전체 세부 사항은 §Appendix B.2에 제공된다.
Figure 2에서 볼 수 있듯이, 창의적인 콘텐츠 생성(Creative Content Generation)이 58.0%로 지배적이지만, 대체 글쓰기 장르(Alternative Writing Genres) 38.5%, 개념 설명(Concept Explanation) 23.6%, 기술 개발(Skill Development) 23.5%, 분석 및 해석 질문(Analytical & Interpretive Questions) 22.6%, 그리고 가상 시나리오(Hypothetical Scenarios) 22.2%와 같이 덜 탐구되었지만 인기 있는 여러 유형을 식별한다. 특히, 15.2%의 질의가 브레인스토밍 및 아이디어 구상(Brainstorming & Ideation)을 포함하며, 이는 사용자들이 직접적인 아이디어와 영감을 LM에 의존하고 있음을 강조한다. 또한 이는 지나치게 획일적인 AI 출력에 의해 유발되는 사고의 장기적인 동질화 위험에 대한 우려를 제기한다.

미리 정의된 범주 외에도, 314개의 새로운 범주를 식별한다. Figure 3는 "문화적(Cultural)", "분석(Analysis)", "윤리적(Ethical)", "역사적(Historical)", "미디어(Media)", 그리고 "유머(Humor)”와 같은 가장 두드러진 키워드의 워드 클라우드를 시각화하며, 이는 이전에 덜 탐구되었던 개방형 질의 범주의 차원을 강조한다. INFINITY-CHAT을 통해, 우리는 다양한 응답을 요구하는 실제 개방형 질의에 대한 최초의 포괄적인 분류 체계를 소개한다. 이 데이터셋은 LM이 다양하고 적절한 결과물을 생성하는 능력을 연구하고, LM의 다원적 정렬(pluralistic alignment)을 발전시키기 위한 풍부한 자원 역할을 한다.

INFINITY-CHAT에서 선별된 100개의 대표적인 개방형 질의(INFINITY-CHAT100으로 명명하며, 부록 §B.3에서 인간이 개방형임을 검증함)를 사용하여 언어 모델의 '인공 집단의식(Artificial Hivemind)'을 체계적으로 조사한다. 우리는 두 가지 측면에 집중한다: (1) 동일한 언어 모델이 다양한 결과물을 생성하지 못하는 모델 내 반복(intra-model repetition), 그리고 (2) 서로 다른 모델이 유사한 결과물을 생성하는 모델 간 동질성(inter-model homogeneity)이다. 이전 연구들(West et al. 및 Zhang et al.)은 소규모 또는 무작위 숫자/이름 생성과 같은 합성 작업에서 모델 내 반복을 탐구해 왔다. 이와 대조적으로, 우리는 70개 이상의 언어 모델을 대상으로 실제 개방형 질문에 대한 대규모 연구를 수행하여 모델 간 출력 수렴에 대한 최초의 체계적인 분석을 제공한다.
Intra-model repetition. 각 모델에 대해 INFINITY-CHAT100의 질의당 50개의 응답을 샘플링하고, 각 응답 풀 내에서 평균 쌍별 임베딩 유사도를 계산하여 다양한 유사도 범위에 해당하는 질의의 비율을 보고한다. 높은 무작위성을 가진 디코딩 파라미터(top-p = 0.9, t = 1.0)를 사용했음에도 불구하고, Figure 4에 나타난 것처럼 동일한 모델의 응답은 매우 반복적이며, 79%의 경우에서 평균 유사도가 0.8을 초과한다. 더 높은 온도는 일관성 없는 텍스트를 생성하는 경향이 있으므로, 이러한 결과는 가장 공격적인 샘플링 하에서도 LM이 개방형 질의에 대해 다양한 응답을 생성하는 데 여전히 실패함을 보여준다.

Nguyen et al.은 모델의 확신도에 따라 샘플링 임계값을 조정하여 생성 다양성을 높이는 동적 전략인 min-p 디코딩을 도입했다. 우리는 동일한 설정으로 min-p 디코딩을 평가하고 쌍별 문장 임베딩 유사도를 계산한다. Figure 5에 나타난 것처럼, min-p는 극단적인 반복(0.9 이상의 쌍 감소)을 줄여주지만, 여전히 응답 쌍의 81%가 0.7 이상의 유사도를 보이고 61.2%가 0.8을 초과하여 다양성 중심의 디코딩 하에서도 모드 붕괴(mode collapse)가 발생함을 드러낸다. 유망함에도 불구하고, min-p는 창의적인 작업에 더 적합하고 폐쇄형 작업에는 덜 효과적이기 때문에 널리 채택되지 않고 있다. 나아가 디코딩만으로 LM의 반복성을 해결하는 것은 사용자에게 적절한 전략을 선택해야 하는 부담을 지운다. 따라서 사용자 개입 없이도 출력 다양성을 견고하게 보존하기 위해서는 모델 훈련 단계에서 더 일반화 가능한 해결책이 필요하다. 모든 모델에 대한 전체 결과 분석은 부록 §C.2를 참조한다.

Inter-model homogeneity. 개별 모델이 유사한 콘텐츠를 반복적으로 생성할 뿐만 아니라, 서로 다른 크기와 계열의 모델들도 매우 반복적인 결과물을 생성하며 때로는 상당한 구절 중복을 공유한다. 서로 다른 모델 간 응답의 평균 쌍별 유사도는 71%에서 82% 사이이며, 일부 쌍은 이보다 현저히 높은 수치를 기록한다. 예를 들어, DeepSeek-V3와 qwen-max-2025-01-25는 0.82의 유사도를 공유하며, DeepSeek-V3와 gpt-4o-2024-11-20 간의 유사도는 0.81에 달한다. 흥미로운 점은 OpenAI의 GPT 모델들과 Qwen의 API 모델들이 자신의 모델 계열이 아닌 외부 모델들과도 더 높은 유사성을 갖는 경향이 있다는 것이다. 이러한 현상의 정확한 원인은 독점적인 훈련 세부 정보로 인해 알 수 없으나, 지역 간 공유된 데이터 파이프라인이나 합성 데이터로 인한 오염 등이 가능한 설명이 될 수 있다.
일반적인 경향을 넘어 인스턴스 수준에서 반복이 어떻게 발생하는지 분석한 결과, 선행 연구에서와 같이 동일 모델의 응답 내에서 축자적인(verbatim) 구절 중복이 관찰된다. 놀랍게도 이러한 중복은 출력 공간이 넓은 완전 개방형 질의에서도 서로 다른 모델 간에 널리 퍼져 있다. 예를 들어, 특정 아이폰 케이스 컬렉션 설명 질의에 대해 DeepSeek-V3와 gpt-4o-2024-11-20은 “Elevate your iPhone with our”, “sleek, without compromising”, “with bold, eye-catching”과 같이 겹치는 구절을 생성한다. 어떤 경우에는 서로 다른 모델이 완전히 동일한 응답을 출력하기도 한다. 성공과 부에 관한 소셜 미디어 모토 생성 질의에서 qwen-max-2025-01-25와 qwen-plus-2025-01-25는 모두 “Empower Your Journey: Unlock Success, Build Wealth, Transform Yourself.”라는 동일한 문장을 생성한다. 이러한 인스턴스 수준의 중복은 모델 간에 나타나는 인공 집단의식(Artificial Hivemind) 효과의 심각성을 입증한다.
반복은 표면적인 중복을 넘어 의미론적으로도 나타난다. 모델들은 서로 다른 어구를 사용하면서도 동일한 핵심 아이디어를 전달한다. "시간에 대한 비유를 작성하라"는 질의에 대해 분석한 결과, 25개 모델의 응답들은 단 두 개의 주요 클러스터로 수렴된다. 하나는 "시간은 강이다"라는 비유를 중심으로 한 지배적인 클러스터이고, 다른 하나는 "시간은 직조공이다"의 변형들을 중심으로 한 부차적인 클러스터이다. 이러한 추상적 개념의 수렴은 더욱 미묘한 형태로 존재하는 인공 집단의식의 깊이를 드러낸다.

모델 간 응답의 균일성을 정량화하기 위해, 서로 다른 모델의 출력이 어느 정도까지 서로 구별 불가능해지는지 조사한다. 고유한 25개 모델이 각각 50개의 출력을 생성할 때, 이론적으로는 단일 모델 내부보다 서로 다른 모델 간에 더 큰 다양성이 있어야 한다. 이를 측정하기 위해 질의별로 가장 유사한 출력 상위 N개를 식별하고 여기에 기여한 고유 모델의 수를 계산한 결과, 가장 유사한 응답들이 종종 여러 모델에서 비롯됨을 확인했다. 예를 들어, 상위 50개 응답 클러스터당 평균 약 8개의 고유 모델이 포함되어 있으며 일부 질의는 10개를 초과한다. 이는 별개의 모델들이 빈번하게 매우 유사한 콘텐츠를 생성하며, 때로는 모델 내 유사성보다 모델 간 유사성이 더 높게 나타나기도 함을 의미한다.

종합하자면, 본 연구는 서로 다른 모델들 사이에서 높은 구문적 반복이 존재한다는 강력한 증거를 제공한다. 비록 완전한 인과 분석은 본 연구의 범위를 벗어나지만, 이러한 발견은 이러한 반복이 사전 훈련 데이터, 정렬 프로세스, 암기, 오염 또는 일반화 중 어디에서 기인하는지 조사하는 향후 연구의 필요성을 시사한다.
LM의 생성적 동질성을 확인한 후, 이 절에서는 LM, 보상 모델 및 LM 평가 모델의 평가가 INFINITY-CHAT의 개방형 질의에 대한 다양한 응답에 대해 인간의 점수와 일치하도록 보정(calibrate)되었는지 조사한다.

인간은 품질이 유사한 개방형 질의의 대안적 응답들에 대해 서로 다른 선호도를 가질 수 있다. 모델이 이러한 다양성을 어떻게 처리하는지 연구하기 위해서는 인간의 분포적 선호도를 포착하는 조밀하게 주석된 데이터가 필요하다. HelpSteer3와 같은 기존 정렬 데이터셋은 대개 항목당 3명의 주석자만 참여하는 희소한 레이블만을 포함한다. 이를 해결하기 위해 우리는 응답 품질에 대한 절대적 평점(1~5점 척도)과 동일한 질의에 대한 두 응답 간의 쌍별 선호도 평점(강한/약한 선호도)을 모두 수집하며, 각각에 대해 광범위한 주석을 확보한다. 절대적 평점의 경우, INFINITY-CHAT100의 50개 프롬프트 각각에 대해 15개의 응답을 샘플링하고 (질의, 응답) 쌍당 25개의 평점을 수집하여 총 18,750개의 레이블을 얻는다. 쌍별 선호도 평점의 경우, 동일한 50개 프롬프트에 대해 10개의 응답 쌍을 샘플링하고 (질의, 응답 1, 응답 2) 세트당 25개의 주석을 모아 총 12,500개의 레이블을 수집한다. 이는 동일한 개방형 질의에 대한 대안적 응답들에 대해 조밀한 인간 평점을 제공하는 최초의 대규모 인간 주석 데이터셋으로, 인간의 개별적이고 집단적인 선호도 분포에 대한 세밀한 분석을 가능하게 한다. 인간 주석 과정에 대한 전체 세부 사항은 부록 §D.1에 제공된다.
Figure 7은 (질의, 응답 1, 응답 2) 세트당 25개의 인간 선호도 주석에 대한 샤논 엔트로피(Shannon entropy) 분포를 보여준다. 주석자들은 어떤 응답이 더 나은지에 대해 종종 의견이 일치하지 않으며, 그 결과 엔트로피는 높은 쪽으로 치우치는 경향이 있다. 오른쪽 막대그래프에서 볼 수 있듯이 레이블 분포는 예시마다 크게 다르며, 일부 응답 쌍은 모든 옵션에 대해 거의 균등한 지지를 보이는데 이는 개방형 질의의 대안적 응답들에 대해 주석자 간의 의견 불일치가 상당함을 나타낸다. Figure 9는 (질의, 응답) 쌍의 절대적 평점에 대한 인간 주석의 엔트로피에서도 유사한 경향을 보여준다.

우리는 개방형 질의에 대한 대안적 응답을 평가할 때 LM, 보상 모델, 그리고 LM 평가 모델이 인간의 평점과 얼마나 일치하는지 평가하는 것을 목표로 한다. 구체적으로, 모델이 생성한 세 가지 유형의 평점을 인간의 주석과 비교한다. LM 점수는 주어진 질의에 대한 응답의 퍼플렉시티(perplexity)로부터 도출된다. 보상 모델 점수는 표준화된 스칼라 보상 출력을 기반으로 한다. LM 평가 모델(LM judge)의 평점은 전반적인 품질 점수와 HHH 루브릭(도움이 됨, 무해함, 정직함)이라는 두 가지 평가 기준을 사용하는 표준 프롬프팅 프로토콜을 따른다. 56개의 최첨단 LM, (RewardBench 기준) 상위권에 있는 6개의 보상 모델, (GPT-4o 및 Prometheus 변형 모델을 포함한) 4개의 LM 평가 모델의 전체 목록과 평가 절차에 대한 세부 사항은 부록 §D.2를 참조한다.
우리는 (1) 동일한 개방형 질의에 대한 유사한 품질의 대안적 응답과 (2) 주석자 간의 불일치가 큰 응답에 대해 모델 등급이 인간의 판단과 어떻게 일치하는지 조사한다.
Motivation for comparing model scores to average human ratings. 우리의 동기는 정답이 없는 개방형 질의에 대한 응답을 평가하기 위해 훈련 과정에서 보상 모델(또는 LM 평가 모델)이 사용되는 방식에서 비롯된다. 주석자마다 서로 다른 답변을 선호할 수 있지만, 그들의 평균 등급은 종종 비슷하며, 이는 여러 응답이 개별적인 차이에도 불구하고 동등하게 높은 품질일 수 있음을 의미한다. 그러나 현재의 보상 모델은 이러한 동등성을 포착하지 못하고 서로 다른 점수를 부여함으로써, 인간이 집단적으로는 두 응답을 모두 유효하다고 간주함에도 불구하고 하위 모델이 한쪽 응답을 명확히 우수한 것으로 과대평가하게 만든다. 이를 해결하기 위해 우리는 예시당 25개의 인간 등급을 수집하여 다양한 선호도를 포착하고, 평균 점수를 사용하여 공유된 인간의 판단을 반영한다. 그 후 언어 모델(LM), 보상 모델 및 LM 평가 모델이 인간이 대체로 비슷하게 좋다고 간주하는 응답들에 대해 상관관계가 덜 신뢰성 있게 나타나는지 테스트한다.
Models show weaker alignment with human ratings for alternative responses of similar quality. 우리는 모델이 일반적으로 더 명확하게 차별화된 응답으로 훈련되기 때문에, 유사한 품질의 예시에서는 모델이 인간의 판단과 덜 일치할 것이라고 가설을 세운다.

절대 등급 설정의 경우, Tukey's fences를 사용하여 이상치를 걸러냄으로써 유사한 품질의 (질의, 응답) 쌍을 식별한다. 우리는 상수 를 0.5(공격적인 필터링)에서 3.0(보수적인 필터링)까지 0.5씩 증가시키며 변화시켜 유사성이 증가하는 하위 집합을 생성한다. 그런 다음 Figure 10 (a)에 나타난 것처럼 전체 세트와 필터링된 하위 집합에 대해 모델과 인간의 절대 등급 간의 피어슨 상관관계를 계산한다. 쌍별 선호도 등급 설정의 경우, 두 응답의 품질이 비슷하다고 평가한 주석자 수에 따라 예시의 순위를 매겨 유사한 품질의 (질의, 응답 1, 응답 2) 세트를 식별한다. Figure 11 (a)와 같이 상관관계를 계산한 결과, 인간 등급과 LM, 보상 모델 및 LM 평가 모델 등급 간의 상관관계는 절대 등급과 쌍별 선호도 등급 설정 모두에서 유사 품질 하위 집합에서 크게 떨어진다. 이러한 발견은 하위 집합 선택 방법과 관계없이 일관되게 유지되며, 이는 개방형 질의에 대한 동등한 고품질 응답들 사이의 미세한 차이를 더 잘 모델링할 필요가 있음을 강조한다.
Model judgments are less aligned where annotators disagree. 우리는 모델이 주로 인간의 합의가 높은 예시를 바탕으로 훈련되기 때문에, 주석자 간의 불일치가 큰 예시에서는 모델 등급이 인간의 판단에 덜 보정될 것이라고 가설을 세운다.
절대 등급 설정의 경우, 25개의 인간 레이블에 대한 샤논 엔트로피(Shannon entropy) 순위에 따라 하위 집합을 선택하여 불일치를 식별한다. Figure 10 (b)는 전체 세트와 이 하위 집합들 사이의 모델 및 인간 등급 간 피어슨 상관관계를 보여준다. 쌍별 선호도 등급 설정의 경우, 불일치 비율()을 사용하여 각 세트의 불일치 정도를 수량화한다.
결과적으로 주석자 간의 불일치가 큰 예시에서 인간 등급과의 상관관계가 모든 모델에 걸쳐 실질적으로 감소함을 보여준다. 이러한 발견은 광범위한 개방형 가능성을 더 잘 포착하기 위해 인간의 개별적인 불일치에 대한 더욱 정교한 모델링이 필요함을 시사한다.
The diversity collapse problem of LMs. 다양성 붕괴(Diversity collapse)는 LM이 다양한 결과물을 생성하지 못하는 현상으로, 이는 다원적 정렬 연구에 있어 중대한 과제이다. 선행 연구들은 합성 데이터 학습, LM 정렬, 그리고 학습 데이터의 다양성 부족 등을 다양성 붕괴를 일으키는 주요 요인으로 식별했다. 이러한 다양성 붕괴의 결과로는 창의성 감소, 소수 의견의 상실, 편향의 확산, 그리고 모델의 유용성 및 신뢰성 하락 등이 있다. 이에 대응하여 학습 코퍼스 다양화, 학습 알고리즘 수정, 대안적 디코딩 및 프롬프팅 전략 등이 완화 방법으로 제안되었다.
Measuring the creativity and divergent thinking of language models. 최근 LM의 창의성과 확산적 사고를 측정하려는 노력들은 주로 기존의 심리학적 테스트를 차용한다. Chen et al.은 모델에게 의미적으로 멀거나 관련 없는 단어를 생성하도록 요청하는 확산 연합 과제(DAT)를 활용한다. 이와 유사하게 대체 용도 테스트(AUT), 토런스 창의력 사고 검사(TTCT), 인간 평가, 그리고 LLM 평가 모델(LLM-as-a-judge) 등이 유창성, 독창성, 복잡성 및 효과적인 의미적 다양성을 평가하는 데 사용된다. 이러한 측정 능력에도 불구하고, 개별 출력물이 높은 창의성 점수를 받더라도 LLM이 생성한 창의적 콘텐츠는 동질화되는 경향이 있다. 우리는 대규모의 실제 개방형 사용자 질의와 포괄적인 분류 체계, 조밀한 인간 주석을 제공함으로써 모드 붕괴를 줄이기 위한 모델 학습과 평가를 개선하고자 한다.
Disagreement and pluralisitc alignment of language models. AI 가치 정렬 연구의 발전은 학습 프로세스 개선과 합성 및 인간 데이터셋 활용을 통해 LM의 유용성과 안전성을 실질적으로 향상시켰다. 그러나 획일적인 가치 표현(monolithic value representation)의 가능성이라는 중대한 과제가 여전히 남아 있다. 이와 대조적으로, 새롭게 부상하는 다원적 정렬(pluralistic alignment)은 AI가 광범위한 인구의 다양한 요구를 충족해야 함을 강조한다. 이러한 비전을 지원하기 위해 방법론, 벤치마크, 데이터 수집 전략 등에서 혁신이 이루어지고 있다. 또한 시스템 메시지를 통해 상호 작용하는 여러 LM을 활용하여 다양성을 높이는 방식이나, LLM이 보여주는 문화적 다양성을 정량화하고 개선하려는 노력도 병행되고 있다. 하지만 기존 다원적 정렬 작업의 상당수는 인구통계, 성격 스타일, 문화적 배경 등 미리 정의된 다양성 차원에 의존한다. 고정관념에 얽매이지 않고 개인의 특성에 진정으로 부합하는 모델을 만들기 위해서는 개인 수준의 정렬(individual-level alignment)이 필요하다.
본 연구는 자연적으로 발생하는 개방형 환경에서 언어 모델(LM)의 다양성을 평가하기 위해 설계된 대규모 리소스인 INFINITY-CHAT을 소개한다. 종합적인 분석을 통해, 우리는 현재 언어 모델들의 모델 내 반복(intra-model repetition)과 모델 간 동질성(inter-model homogeneity)을 모두 보여주는 '인공 집단의식(Artificial Hivemind)' 효과를 밝혀냈다. 다양한 프롬프트 분류 체계와 조밀한 인간 선호도 주석을 결합함으로써, INFINITY-CHAT은 생성형 AI의 모드 붕괴(mode collapse)를 진단하고 벤치마킹하며, 궁극적으로 이를 완화하기 위한 새로운 토대를 제공한다. 우리는 이 리소스가 모델 출력의 진정한 다양성을 촉진하고 인간 표현의 동질화를 방지하기 위한 향후 노력을 가속화하는 촉매제가 되기를 희망한다.