AURORA: ENHANCING SYNTHETIC POPULATION REALISM THROUGH RAG AND SALIENCE-AWARE OPINION MODELING 요약

문정현·2025년 12월 12일

논문

목록 보기
35/56

AURORA: ENHANCING SYNTHETIC POPULATION REALISM THROUGH RAG AND SALIENCE-AWARE OPINION MODELING Rebecca Marigliano1 and Kathleen M. Carley1 1Societal and Software Systems Department, Carnegie Mellon University, Pittsburgh, USA Proceedings of the 2025 Winter Simulation Conference E. Azar, A. Djanatliev, A. Harper, C. Kogler, V. Ramamohan, A. Anagnostou, and S. J. E. Taylor, eds.

1 서론

전통적인 에이전트 기반 모델(ABM)은 종종 단순한 규칙에 의존하고, 실제 인구의 인지적, 문화적, 감정적 복잡성 포착 실패함. -> RAG 발전으로 해결 가능할 것.

제안: AURORA(AI-Utilized Retrieval for Optimized Representation of Audiences). 다양하고 현실적인 합성 인구를 생성하기 위한 RAG 강화 ABM 프레임워크.

연구 질문:

  1. RQ1: 서로 다른 의견 모델링 전략(CGO와 PDS)은 국가, 커뮤니티, 페르소나 수준 전반에서 시뮬레이션된 의견의 현실성과 변동성에 어떤 영향을 미치는가?

  2. RQ2: LLM들은 심리적 특성과 감정 상태 생성에서 어느 정도 차이를 보이며, 이러한 차이는 합성 에이전트 구성에 어떤 영향을 미치는가?

  3. RQ3: 중요도 인식, RAG 기반 생성 파이프라인은 담론 구조와 이념적 패턴 내에서 합성 인구 행동의 정합성을 개선할 수 있는가?

2 관련 연구

2.1 언어 모델을 활용한 인간 행동 시뮬레이션

최근 연구들은 LLM을 사용해 사회적 행동을 시뮬레이션하는 방향을 탐구하고 있음.

이러한 접근법은 종종 맥락적 기반이 제한된 정적이고 동질적인 에이전트 행동에 의존함. 대부분은 시간적 업데이트, 중요도 조절, 혹은 실제 세계 데이터와의 통합 메커니즘이 부족. 오직 LLM 출력에만 기반한 시뮬레이션은 인식론적 획일성과 현실성 저하의 위험을 안고 있음.

2.2 검색 증강 생성(RAG)

RAG는 외부 지식 검색과 LLM을 결합해 사실적 기반성과 적응성을 향상시키는 방법.

행동 모델링에 RAG를 적용하는 데에는 검색된 콘텐츠를 심리적으로 일관된 에이전트 상태와 정렬하는 문제, 코퍼스 설계와 임베딩 전략에 대한 민감성, 그리고 중요도 인식이나 시간적으로 적응하는 검색이 전반적으로 부족하다는 과제가 남아 있음.

3 AURORA 모델 아키텍처

RAG 강화 ABM.

AURORA는 의미 벡터 표현, 검색 기법, LLM을 통합하여 정의된 커뮤니티 맥락 내에서 정교하고 현실적인 합성 페르소나를 생성함. -> 이 과정은 의미 데이터 임베딩, 커뮤니티 생성, 페르소나 생성, 그리고 동적 시뮬레이션이라는 구분된 단계들로 구성됨.

3.1 의미 벡터 데이터베이스와 RAG

ChromaDB로 구현된 고차원 의미 벡터 데이터베이스 사용. 국가별 문서, 사회 담론, 인구통계 데이터를 포함함.

질의 기반으로 임베딩 계산 및 코사인 유사도 이용해 상위 k개 벡터 검색.

3.2 커뮤니티 및 페르소나 생성과의 통합

RAG를 통해 선택되고 포맷된 이후 맥락은 LLM 프롬프트 템플릿에 직접 삽입됨. -> 출력은 자연스럽게 실제 세계 담론을 담음.

3.2.1 커뮤니티 형성과 중요도 할당

각 커뮤니티에 대해 오로라는 커뮤니티 이름과 국가를 기반으로 한 의미 질의(예: "community X in country Y") 구성. -> 벡터 데이터베이스에서 가장 관련성이 높은 상위 k개의 텍스트 세그먼트를 검색하는 데 사용. -> 검색된 텍스트는 프롬프트 템플릿에 삽입. -> 정보를 바탕으로 표준화된 출력 생성(커뮤니티 이름과 목적, 인구통계 구조(연령, 성별 분포 등), 정치적 성향(연속값 및 라벨), 그리고 중요도 점수가 부여된 토픽 목록) -> 생성된 출력은 시뮬레이션 환경의 Community 객체로 저장.

토픽 중요도 모델링. 핵심 토픽에 대해 맥락과 검색된 텍스트를 고려하여 LLM이 중요도 라벨 생성. -> 중요도 점수로 매핑 -> 페르소나 모델링 과정에 영향.

커뮤니티 조립. 합성 커뮤니티는 설정 파일에 정의된 커뮤니티 수와 범주에 따라 RAG+LLM 파이프라인을 반복적으로 호출함으로써 구성됨. -> 독립적으로 생성되어 모듈형 다양성과 확장성 확보. -> 페르소나 생성과 사회 시뮬레이션을 위한 기초 계층 형성.

3.2.2 감정 및 의견 상태를 포함한 페르소나 생성

커뮤니티 생성되고 오로라가 개별 합성 페르소나 구성함.

페르소나 생성 과정. 오로라가 커뮤니티 프로파일과 맥락 정보를 통합하는 표준화된 언어 모델 파이프라인을 사용해 페르소나 집합 합성. 각 페르소나는 고유하게 식별되며 관련 메타데이터와 함께 저장됨.

4 커뮤니티 수준 의견 모델링과 중요도 기반 토픽 정렬

오로라는 국가 수준, 커뮤니티 수준, 페르소나 수준의 의견을 계층적으로 정렬함으로써 이념적 입장 분포를 모델링. 핵심은 중요도 인식 다중 해상도 의견 생성 파이프라인(salience-aware, multi-resolution opinion generation pipeline).

합성 커뮤니티에 시뮬레이션 시나리오에 대한 의견 집합 할당. 토픽별 의견은 토픽 및 커뮤니티 특화 질의를 사용해 생성. -> 감정의 극성과 강도를 부호화한 의견 값과 해당 이슈가 커뮤니티에 얼마나 핵심적인지를 나타내는 중요도 값 출력.

4.1 중요도 가중 분포 기반 페르소나 의견 모델링

커뮤니티 수준의 의견과 중요도가 설정되면 오로라는 토픽 중요도로 조절된 확률적 분산을 도입해서 페르소나 수준의 의견을 샘플링함.

토픽이 중립적이거나 균형 잡힌 국가적 입장을 보일 경우: 정규분포

인구가 비대칭적 입장을 보이는 경우: 왜도 분포

강한 이념적 이중성과 양극화를 특징으로 하는 토픽의 경우: bimodal 분포

각 분포의 표준편차 σ는 토픽 중요도에 반비례.

σ_0 는 사전에 정의된 상한값, 일반적으로 0.5에서 1.5 사이. 중요도가 높은 토픽(예: 정체성 정치, 종교)은 커뮤니티 입장 주변으로 더 조밀한 군집을 형성하게 하고, 중요도가 낮은 토픽(예: 틈새 정책)은 더 큰 분산과 약한 정렬을 만듦.

4.2 커뮤니티에서 페르소나로: 중요도 유도 의견 합성

페르소나의 토픽에 대한 의견은 커뮤니티 의견, 토픽 중요도, 심리적으로 개연적인 노이즈를 결합해 생성.

핵심 이슈일수록 잡음 감소.

Clip 함수는 의견을 미리 정의된 범위(예: [−2, 2])로 제한하여 이념적 개연성을 유지하고 비현실적인 극단화 방지. 중요도가 높은 토픽일수록 더 큰 동조와 낮은 분산을 유도하는 제한된 신뢰 모델과 일치.

4.3 커뮤니티 수준 일관성과 이념적 현실성

세 단계의 의견 정렬 구조:

  1. 중요도가 낮은 이슈에 대한 국가 수준 기준선

  2. 중요한 토픽에 대한 커뮤니티 중심 의견 고정

  3. 의견 확산을 조절하는 중요도 스케일링

에이전트 기반 시뮬레이션과 실제 세계의 의견 군집 연구에서 지적된 과제인 커뮤니티 일관성을 유지하면서도 의미 있는 국가 내 이념적 변이를 허용하도록 설계됨.

학습 업데이트: 중요도가 높은 이슈는 변화에 대한 더 큰 저항을 보여 고착된 신념의 안정성을 포착, 중요도가 낮은 의견은 더 쉽게 적응하여 이론적 의견 확산 모델에서 설명되는 동적 반응성 반영.

5 성격 특성으로부터 초기 감정 상태 추론

각 에이전트의 초기 감정 상태를 그들의 성격 구성으로부터 직접 추론. -> Big Five. 각 특성 점수는 [0,1] 범위로 정규화.

5.1 특성과 감정의 이론적 매핑

5.2 LLM 기반 성격 추론 파이프라인

감정 초기화 과정:

  1. Text-to-Traits 단계에서는 구조화된 LLM 프롬프트를 통해 각 페르소나의 행동, 배경, 사회적 맥락에 대한 서술 유도 -> 이 출력은 파서로 처리되어 OCEAN 벡터 추론하는 데 사용.

  2. Trait-to-Emotion Mapping 단계에서는 이론적 매핑에 따라 각 감정이 빅파이브 성격 특성의 가중 선형 결합으로 계산 ->가중치는 심리학 문헌에 근거해 휴리스틱하게 도출, 모델에 직접 코드화.

  3. 정규화 단계에서는 최종 감정 점수를 [0,1] 범위로 클리핑하고, 음수 값은 0으로 절단.

5.3 계산 모델

핵심 성격 특성을 여덟 가지 기본 감정으로 매핑하는 각 계산식은 관련 성격 특성으로부터의 긍정적, 부정적 기여를 모두 반영. -> 가중치는 감정 합성 함수에 직접 인코딩되고, 각 페르소나의 빅파이브 점수가 추론된 이후 모든 페르소나에 대해 평가됨.

6 실험 설정

세 개 LLM, 세 가지 의견 모델링 전략 비교.

전략: 대만에 위치한 소셜 미디어 페르소나를 생성하고, 세 가지 주요 문화적, 지정학적 이슈에 대한 입장을 부여.

이슈: (1) “중국은 대만을 중국과 통일할 계획이다”, (2) “대만의 유엔 가입”, (3) “중국 설(춘절) 기념”

6.1 비교한 모델

실험 설정의 개요.

모델 A: 커뮤니티 유도 의견 할당(Community-Guided Opinion Assignment, CGO) – 의견은 커뮤니티 수준의 신념과 토픽 중요도를 반영하여 중간 수준(meso-level)의 다양성을 포착.

모델 B: 페르소나 차별화 전략(Persona-Differentiated Strategy, PDS) – 의견은 국가적 맥락, 커뮤니티 입장, 이념, 직업, 감정과 같은 페르소나별 특성에 의해 형성됨.

7 결과 및 논의

7.1 국가 수준 의견 비교

전체 합성 인구가 각 토픽에 어떻게 반응하는지에 대한 거시적 관점을 얻기 위해, 우리는 의견을 국가 수준에서 집계함.

세 가지 핵심 토픽과 세 가지 LLM에 대해 모든 커뮤니티의 평균 입장.

“중국은 대만을 중국과 통일할 계획이다”라는 이슈에 대해 gemini-2.0-flash와 gpt-4o-mini는 강하게 부정적인 의견, deepseek-chat은 눈에 띄게 덜 부정적인 반응을 보여 통일 문제에 대해 보다 온건한 입장 시사.

“대만의 유엔 가입”에 대해서는 모든 모델이 긍정적인 입장.

“중국 설(춘절) 기념”에 대해서는 gemini-2.0-flash와 deepseek-chat이 긍정적인 중간 지점 부근에 군집, gpt-4o-mini는 더 열성적인 반응.

7.2 커뮤니티 수준 의견 분포 비교

각 모델이 국가 하위 수준의 다양성을 어떻게 포착하는지를 평가하기 위해, 우리는 다섯 가지 커뮤니티 범주에 걸쳐 의견 출력 비교.

CGO 모델 하에서 각 커뮤니티별 평균 토픽 의견.

CGO 모델은 다층적 분석 수준 전반에 걸쳐 구조화된 다양성을 포착함으로써 현실적인 의견 역학을 생성하는 데 강한 역량을 보여줌. 커뮤니티 수준에서는 국가 평균에 가려지는 중간 수준(meso-level)의 이념적 변이 드러냄(예: 군 관련 그룹은 일관되게 중국과의 통일에 반대, 학생 그룹과 비즈니스 그룹은 보다 온건하거나 이질적인 견해). -> CGO가 국가 내부의 다양성을 보존하는 능력을 지니고 있음.

현실성은 CGO의 중요도 인식 샘플링 전략을 통해 강화. 중요도가 높은 토픽(예: “대만의 유엔 가입”)은 낮은 분산과 조밀하게 군집된 의견을 생성하여 커뮤니티 내부의 강한 정렬과 이념적 일관성을 반영, 중요도가 낮은 이슈(예: “중국 설”)는 더 넓은 의견 분산과 약한 감정 강도 만듦. -> 행동의 개연성 강화.

LLM 간의 상이한 해석적 경향은 상위 단계의 모델 설정이 하위 단계의 의견 행동을 어떻게 형성하는지 드러냄. gpt-4o-mini는 감정적 민감성이 높아 긍정·부정 감정을 모두 증폭시키는 더 양극화된 출력 생성, gemini-2.0-flash는 균형 잡히고 표현력이 있는 결과, deepseek-chat은 절제되거나 일관성이 떨어지는 출력 경향과 RAG 기반성 약함.

-> 구조적이고 개연적인 신념 및 감정 반응의 다양성으로 정의되는 현실성은 CGO 프레임워크에서 단지 달성 가능한 수준을 넘어 관측 가능한 특성임.

7.3 페르소나 수준 특성 및 감정 분포

합성 페르소나의 성격 특성과 감정에 대한 분석은 언어 모델 구현 간에 명확하고 통계적으로 유의미한 차이가 있음.

gpt-4o-mini는 개방성, 친화성, 외향성, 신뢰, 기쁨, 기대감이 높은 페르소나 생성 -> 높은 수준의 사회적 참여, 협력적 행동, 또는 뚜렷한 정서적 반응이 요구되는 시나리오와 잘 부합.

gemini-2.0-flash는 일관되게 더 높은 신경증성, 공포, 슬픔, 혐오를 보이는 페르소나 생성 -> 반응적 사회 역학, 위기 대응, 또는 양극화가 포함된 시뮬레이션에 적합.

deepseek-chat은 전반적으로 중간적인 위치를 차지하지만, 성실성, 외향성, 기쁨 점수가 가장 낮고 감정 반응이 비교적 억제되어 있음. -> 감정 강도가 의도적으로 억제된 무관심하거나 양가적이며 회의적인 인구를 시뮬레이션하는 데 이상적.

성격 특성과 감정 전반에 걸친 pairwise t-test 결과. 모든 모델 간에 통계적으로 p < 0.001 수준에서 유의미.

-> 시뮬레이션의 의도된 목표에 맞춰 LLM 선택을 정렬하는 것 중요. 시스템은 일반적이거나 동질적인 에이전트를 생성하는 대신, 확립된 이론과 일관된 감정 반응을 보이는 심리적으로 다양한 인구를 생성함.

상위 단계의 LLM 설정이 하위 단계의 페르소나 행동을 유의미하게 형성함. -> 시뮬레이션 요구사항에 기반한 전략적 모델 선택의 필요성.

8 결론

오로라는 인구통계적으로 기반이 있고, 심리적으로 다양하며, 맥락적으로 일관된 합성 인구를 생성하는 RAG 강화 에이전트 기반 모델링 프레임워크임.

RQ1: 의견 모델링 전략. 서로 다른 의견 모델링 전략은 에이전트 행동의 세분화 수준과 현실성에서 뚜렷한 차이를 만들어냄.

RQ2: LLM 간 심리적 다양성. 성격 및 감정 분포에 대한 분석은 언어 모델 간에 크고 통계적으로 유의미한 변이가 존재함.

RQ3: 중요도 인식, 맥락 기반 생성. 검색 증강 생성과 중요도 인식 의견 형성의 통합은 합성 에이전트 행동 간의 정합성을 유의미하게 개선.

9 한계 및 향후 연구

한계:

  1. 감정 상태와 의견은 페르소나 특성과 커뮤니티 중요도에 기반해 정적으로 초기화되며, 신념 업데이트나 정서적 전염과 같은 시간적 역학을 포함하지 않음.

  2. 모델 아키텍처, 정렬 튜닝, 학습 데이터에서 기인한 변이는 재현성 문제를 야기하며, 향후 업데이트나 API 변경 시 동일한 프롬프트에서도 다른 결과가 나올 수 있음.

향후 연구: 시간에 따른 신념 업데이트, 감정 전파하도록 확장. 다국어 페르소나 생성, 행동 데이터셋과의 정렬, 검색과 생성 과정에 문화적, 언어적 변이를 통합.

profile
이화여자대학교 인공지능융합 석사과정

0개의 댓글