Opportunities and risks of LLMs in survey research David Rothschild, James Brand, Hope Schroeder, Jenny Wang October 28, 2024, published at SSRN
초록
최근 대규모 언어 모델(LLMs)의 발전은 설문조사(survey) 연구에 파괴적인 기회와 근본적인 위험을 동시에 가져오고 있다. LLM의 콘텐츠 생성 및 요약 능력은 이미 학계와 실무에서의 설문조사와 market research를 포함한 사회과학 연구 공동체 전반에서 혁신을 이끌어왔다. 본 연구 노트에서는 LLM이 설문 작성, 테스트, 분석 및 보고를 지원할 수 있는 기회를 개괄한다. 실제 사례와 학문적 문헌에 근거하여, 우리는 설문 방법론과 설문 배포 도구에 관련된 도전 과제를 구분한다. 이러한 구분은 잠재적 기회를 활용하면서 위험을 최소화하기 위해 필수적이다. 더 나아가, 다양한 기술 발전이 연구자의 agency(the ability to take action or to choose what action to take) 정도에 어떤 영향을 미치는지 강조한다. 전반적으로 우리는 장기적으로 LLM 기반 도구가 연구자를 대체하기보다는 보조하여, 설문조사 산업이 확장될 수 있도록 할 것이라고 신중히 낙관한다.
서론
설문조사는 대상 집단으로부터 현실 세계의 정보를 수집하여 그들의 정서, 지식, 행동을 더 잘 이해하는 검증된 방법임. 시장 조사, 정치 연구에서 사용하고, 정부와 학계 모두 사용함.
2000년대 초반부터 2010년대 인터넷 기반 응답자의 점진적 수용이 있었음. 온라인 설문 도구는 설문조사당 응답자의 시간과 금전적 비용을 줄임. 설문조사를 실행하는 단계는 다음과 같다:
온라인 설문 플랫폼은 2단계에 영향을 주었지만, 나머지 단계에는 영향을 주지 않음. 여전히 고품질 결과를 위해 많은 시간, 노력, 비용이 필요하며, 편향과 오류에 취약함.
LLM의 등장은 설문 작성 과정을 근본적으로 재고할 기회를 제공함. ChatGPT 출시 이후 학계와 업계 모두 빠르게 도입했음. 초기에는 합성 응답 생성 능력 평가에 집중했으나, 일관성, 대표성, 실질적 문제로 한계가 존재함. 최근에는 데이터 정제, 설문 문항 작성, 비구조적 응답 분석 등 후반 단계 활용이 확산됨.
LLM은 조사 연구에 잠재적으로 유익한 기능을 가지고 있지만, 동시에 엄밀한 조사 연구에 활용될 때 복잡성을 초래할 수 있는 기능도 지님. LLM은 pre-training 된 모델임. 학습 데이터 내용은 대부분 알려지지 않았음. 학습 이후에 base 모델이 수정되는 과정을 거침. 이런 과정에는 instruction and safety-tuning과 같은 단계가 포함될 수 있음. 이후 일반 사용자에게 공개되는 웹 인터페이스, API, 혹은 공개 모델의 경우 사용자가 직접 모델을 호스팅할 수 있는 형태로 제공될 수 있음. 공개형 모델은 학습 데이터, 과정, 수정이 더 투명할 수 있음. RLHF를 통해 대화 능력을 향상시키는 것과 같은 파인튜닝은 LLM을 특정 목적에 적합하게 만듦. 파인튜닝은 부작용이 있을 수 있음. 모델이 안전상의 이유로 민감한 주제를 회피하도록 파인튜닝되면, 연구자가 민감한 주제에 대한 적절한 질문을 생성하지 못하거나, 반사회적(anti-social) 응답을 덜 생성하게 되어 연구 결과가 심각하게 왜곡될 수 있음.
본 노트에서는 LLM이 설문조사 연구 산업에 가져올 것으로 예상되는 변화(disruption)를 정리하기 위해 몇 가지 key 범주화를 사용함. 첫째, 우리는 그것들이 설문 파이프라인 내에서 어떤 위치를 차지하는지를 고려함. 둘째, 우리가 예상하는 영향이 단기적인지 장기적인지를 구분함. 단기적 변화는 이미 비교적 잘 이해되어 있고 즉시 활용할 준비가 된 경우를 의미함. 반대로 장기적 변화는 현재 구현을 막거나 지연시키는 주요한 장애물이 최소 하나 이상 존재하는 경우임. 이러한 장애물 중 일부는 LLM이 조사 과정에서 어떻게 기능할 수 있는가라는 방법론적 질문이며, 다른 장애물은 LLM을 설문 설계 및 배포 도구에 실제로 통합하는 실무적 문제를 반영함. 방법론적 우려에는 우리가 구성하는 설문 도구의 유형과 그 타당성에 대한 변화, 그리고 모델 자체가 우리의 설문 방법에 어떤 영향을 미칠 수 있는가 하는 질문이 포함됨.
설문 제작자가 사용하는 도구의 설계와 구현은 설문조사 연구가 대규모로 실제로 어떻게 수행되는지에 큰 영향을 미침. 설문 제작자는 서로 다른 필요와 목표를 가질 수 있으며, 따라서 LLM 기반 조사 도구는 이러한 다양한 집단을 다르게 지원할 수 있음(예: 숙련된 설문 전문가와 초보 설문 제작자, 정부 조사의 잘 확립된 설문지와 산업 분야의 속도와 효율성에 초점을 맞춘 설문지).
세 번째 핵심 범주화는 설문 제작자에게 부여되는 agency(주도권) 수준에 관한 것으로, 이는 연구자가 LLM과의 상호작용을 어떻게 설계하느냐에 따라 크게 달라짐. 이러한 설계 선택은 설문 제작자의 통제력뿐만 아니라 결과 분석에 대한 잠재적 파급 효과에도 중요한 함의를 가짐. LLM이 특정 목표를 따르도록 지시할 수는 있지만, 직접적인 인간 감독 없이 응답자와 상호작용하는 것은 새로운 위험을 초래하며, 이는 잠재적 이점과 함께 반드시 평가, 개선되거나(혹은 감수되거나) 해야함.
제품 설계 및 학문적 연구의 추세, 그리고 우리가 설문에서 LLM을 사용한 경험을 종합하여 볼 때, LLM은 인간 전문가를 보조하는 역할임. 우리는 LLM을 조사 방법 및 도구에 통합할 잠재적 기회를 개괄하고, 각 잠재적 활용이 설문 제작 과정에 주는 위험에 대한 문헌을 검토하며, 향후 연구에 권장되는 분야를 제안함. 각 단계에서 우리는 조사 연구 공동체가 LLM과 관련해 활발한 논의를 이어갈 수 있도록, 이미 알려진 것과 알려지지 않은 것을 정리해 미해결 질문으로 종합함.
설문 문항 편집(Editing survey questions)
설문 문항의 표현 방식은 응답 품질에 큰 영향을 미칠 수 있음 [1]. 설문 제작자는 모호한 표현을 사용하거나 질문이 어떻게 오해될 수 있는지를 고려하지 못할 수 있으며, 경험이 부족한 설문 제작자는 특히 이러한 설계 실수의 위험에 노출될 수 있음.
Tourangeau, Rips, 그리고 Rasinski (2000)는 설문 설계에 나타나는 7가지 주요 이해 문제를 제시했는데, 여기에는 문법적 모호성, 과도한 복잡성, 잘못된 전제, 모호한 개념, 모호한 수량 표현, 응답자가 익숙하지 않은 용어, 잘못된 추론이 포함됨 [7]. 개방형과 폐쇄형 질문도 각각 고유한 위험을 가지고 있음. Groves는 Sudman과 Bradburn (1982)을 인용하여 민감한 행동과 태도에 관한 질문을 구성할 때의 권고사항을 제공하는데, 여기에는 특정 응답으로 “유도”되는 문항을 피하고, 모호함을 피하며, 인지적 부담을 줄이라는 조언이 포함됨 [8].
LLM은 학생 글쓰기 과제에서, 파인튜닝 없이도 여러 평가 지표에서 숙련된 인간 편집자와 비슷한 수준의 피드백을 제공하는 것으로 나타남 [10, 11]. LLM이 과학 논문을 편집할 때 생성한 피드백이 유용하다는 사실도 확인함 [12]. 그러나 설문 문항 작성의 맥락은 추가적인 조사가 필요함.
일화로, 채팅 기반 인터페이스에서의 LLM 상호작용은 특별한 설문 관련 파인튜닝 없이도 설문 제작 과정에서 유용한 피드백을 제공할 수 있음을 보여줌. 올해 초, 우리 팀은 2024년 대통령 선거에 대한 이스라엘-가자 전쟁의 영향을 연구하고자 함.
Microsoft Copilot에 우리의 초기 질문 “당신은 조 바이든의 이스라엘-팔레스타인 분쟁 처리에 대해 찬성합니까?”에 대한 피드백을 요청했을 때, 바이든의 이-팔 정책에 대한 응답자의 친숙도를 측정하는 사전 질문을 넣을 것, 질문 내에 시간 프레임과 구체적 행동을 명시할 것, 그리고 승인 정도를 측정할 수 있는 척도를 추가할 것을 권장함. 모호함을 피하는 질문 작성 방안을 권고한 Schaeffer와 Dykema(2011)의 권장 사항과 일치함 [13].
채팅 기반 LLM과의 상호작용은 또한 설문 도구의 중요한 부분인 응답 선택지(wording of survey response choices)에 관한 유용한 피드백을 제공함. 우리는 응답자의 정치 토론 빈도를 측정했는데, 기존 뉴스 소비 추세와 우리의 결과 사이에 불일치가 발견됨. 우리의 응답 선택지(하루 여러 번, 매일, 한두 번, 전혀 안함)가 응답자들로 하여금 사회적으로 더 바람직하다고 여기는 정치 뉴스 소비 행동을 과장 보고(over-report)하게 만들었음. 이에 대해 GPT-4에 피드백을 요청함.
프롬프트: 지난주에 친구 및 가족과 정치에 대해 얼마나 자주 이야기했습니까?”라는 설문 질문의 응답 선택지를 어떻게 개선할 수 있을까요? 현재 선택지는 “하루 여러 번”, “매일”, “한두 번”, “전혀 안함”입니다. 우리는 예상보다 더 많은 응답자가 “매일”과 “한두 번”을 선택한 것을 발견했습니다.
GPT-4는 정치 토론에 불규칙적으로 참여하는 빈도를 암시하는 선택지를 포함하도록 응답 선택지를 다시 작성할 것을 제안했다: 하루 여러 번, 하루 한 번, 주에 여러 번, 몇 차례, 불규칙적/가끔, 전혀 안 함. 개선된 응답 선택지를 사용한 이후의 파일럿 테스트에서는 응답 분포가 기존 뉴스 소비 추세 데이터와 더 가깝게 일치함.
이러한 사례들은 연구자가 주도권을 유지한 상태에서, 채팅 기반 상호작용의 형태로 LLM이 설문 문항 작성 과정에 대화형 피드백을 제공할 수 있는 잠재력을 보여줌. 경험이 부족한 설문 제작자와 많은 설문 제작자 모두에게 유용할 수 있음.
LLM이 의미를 유지하면서 텍스트를 paraphrase하거나 rephrase 할 수 있는 능력도 충분히 탐구되지 않음 [17]. 설문 문항이 표현 방식과 어휘에 민감하다는 점을 고려할 때, LLM은 동일한 질문의 다양한 문구를 생성하여 후속 테스트에 활용할 수 있음. 또한 이러한 채팅 기반 편집은 문항 하나하나에 국한되지 않고, 전체 설문을 대상으로 수행될 수 있어, 숙련된 연구자조차 간과할 수 있는 문제(예: 문항 간 상호작용)를 탐구할 수 있음.
알려지지 않은 위험도 있음. LLM은 학습 데이터에 의존하는데, 설문 문항 작성, 응답 선택지 공식화, 설계 관련 문헌이 포함되어 있을 수도 있고 아닐 수도 있음. Off-the-shlef LLM에서 제공되는 설문 작성이나 문항 재구성에 대한 피드백은 일관되지 않을 수 있음. 응답은 훈련 데이터에 무엇이 포함되어 있느냐에 따라 설문 작성 문헌의 특정 이론에 더 자주 기울어질 수 있음. 만약 LLM이 반복적으로 동일한 편집 조언을 제공한다면, 설문 응답 품질이 개선될 수도 있지만, 획일화가 나타날 수도 있음 [18, 19]. 반면에, LLM은 최적 문항을 탐구하고 수렴하는 과정을 보완하는 데에도 활용될 수 있음.
향후 연구 질문(Future Research Questions)
• 방법(Method): 범용 및 오픈소스 LLM은 설문 설계를 어떤 수준까지 알고 있는가? (예: 측정 및 명세 편향 사례에 대한 정보) 그리고 이 지식을 활용해 고품질의 설문 문항과 응답 선택지를 설계하는 데 보완할 수 있는가?
• 도구(Tools): LLM은 채팅 기반 인터페이스나 기존 플랫폼을 통해 설문 설계에 대화형 피드백을 제공할 수 있는가? 설문 작성 도구가 피드백, 제안, 편집을 제공함으로써 초보자들이 알려진 모범 사례에 따라 잘 구성된 설문을 만들도록 지원할 수 있는 방법은 무엇인가? 설문 작성 도구가 기존의 패러다임과 기본값으로 단순히 획일화하는 대신, 흥미롭거나 생산적인 대안을 고려하도록 설계될 수 있는 방법은 무엇인가?
질문 생성(Question generation)
인간이 작성한 문항에 대한 피드백 제공뿐만 아니라, LLM 자체를 활용해 질문을 생성하는 것은 설문 작성 단계에서 LLM의 분명한 활용 사례임. LLM은 이미 교육 분야에서 객관식 문제를 작성하는 능력을 보여준 바 있지만 [20], 설문 문항 생성을 위해 활용된 사례는 아직 체계적으로 특성화되지 않았음. 또한 LLM 기반 설문 문항 작성은 연구 목표와 얼마나 잘 일치하는지, 설문 제작자에게 어느 정도의 주도권과 지원을 제공하는지, 그리고 연구 방법론에 어떤 영향을 미칠 수 있는지에 따라 다양한 방식으로 운영화될 수 있음.
좋은 설문 문항을 작성하는 것은 연구 질문을 다루면서 흔한 함정을 피해야 하므로 수개월까지 시간이 들 수 있음. 시의성이 중요한 설문 배포 상황이나, 한 번에 다수의 독창적인 설문 문항이 필요한 상황(예: 대규모 제품군이나 콘텐츠를 위한 경우)에서는 설문 방법을 대규모로 확장하기 어려운 경우가 많았음. Question templates은 연구자의 목표를 중심에 두면서도 효율성을 높이는 데 활용될 수 있지만, 문항과 응답 선택지 생성 모두 실제 배포 전에 반드시 철저히 검증되어야 함.
우리가 초기로 수행한 실험 중 하나는 동일한 속보 뉴스가 서로 다른 미국 정당에 속한 소비자들에게 어떻게 다르게 받아들여지는지를 이해하려는 것이었음. 우리는 LLM과 특정 템플릿 형식을 사용해 각 기사마다 독창적인 단일 여론조사 질문과 응답 선택지를 생성했으며, Civic Science의 여론조사 게시 시스템을 통해 이를 배포했음. “이 기사([주제])에서 저자가 제시한 요점 중 한 달 뒤에도 기억할 가능성이 높은 것은 무엇입니까?” 우리는 GPT-4의 검증된 뉴스 요약 기능 [21]을 활용해 기사에서 4개의 핵심 요점을 추출했고, 이를 응답 선택지로 사용하여 지정된 형식에 따라 질문을 생성하도록 함. 수백 명의 참가자를 대상으로 한 인간 피험자 평가 결과, 참가자들은 GPT가 생성한 요약 선택지를 기사 요약의 표준 요점들과 유사한 충실성과 사실성을 지녔다고 평가했으며, 이는 우리가 해당 방법을 사용하는 정당성을 뒷받침함. 비록 인간 검토 과정을 유지했지만, 템플릿 기반 생성은 설문 배포까지 걸리는 시간을 크게 줄였고, 이를 통해 기사가 바이럴된 직후, 관심이 빠르게 줄어들기 전에 가능한 많은 온라인 응답자로부터 데이터를 수집할 수 있었음.

설문 업계의 주요 기업인 Qualtrics와 Pollfish는 자사 플랫폼에 LLM 기반 질문 생성 기능을 직접 도입함. 예를 들어, 사용자가 Pollfish에서 설문 목표를 입력하면, 플랫폼은 LLM을 사용해 사용자가 알고자 하는 바에 기반해 문항을 생성함. 이후 사용자가 자동 생성된 문항을 편집할 수 있어 초안을 시작하는 장벽을 낮춰줌. 앵커링 효과에 주의해야 함. 또한 LLM은 프롬프트에 매우 민감하다는 방대한 증거가 있으며 [25], 이는 설문 문항 생성에서 반드시 탐구해야 할 또 다른 측면임.
도구가 개발될 때, 그것이 개별 문항을 확장하는 것이든 전체 설문을 만드는 것이든 간에, 개발자들은 연구자를 대체하려 하기보다는 연구자의 주도권(agency)과 보조(augmentation)를 높여 불필요한 위험을 줄이는 단순한 기능을 고려하기를 바람 [26]. 일부 LLM 기반 데이터 분석 플랫폼은 이러한 원칙을 염두에 두고, 연구자 주도권을 촉진하기 위해 선택적(opt-in) 제안 기능을 구축하고 있음 [29].
향후 연구 질문(Future Research Questions)
• 방법(Method): LLM은 특히 설문 목표나 작업 템플릿이 충분히 명확히 규정되지 않았을 때, 어떤 종류의 질문을 생성하는가? 질문과 응답을 생성할 때 LLM이 학습 데이터에 의해 어떤 경향성을 가지며, 이것이 설문에 어떤 영향을 미칠 수 있는가? 주제 도메인이나 질문 유형에 따라 질문 생성 성능은 어떻게 달라지는가? LLM 기반 도구가 도입할 수 있는 변동성과 함께, 앵커링의 영향을 어떻게 고려해야 하는가?
• 도구(Tools): 설문 도구가 연구자의 목표나 템플릿에 맞춰 문항을 생성하도록 설계될 수 있는가? 설문 도구가 질문 생성의 브레인스토밍 단계를 지원하면서도, 설계에 부정적이거나 바람직하지 않은 영향을 최소화하도록 설계될 수 있는가?
LLM 기반 에이전트가 운영하는 대화형 설문 (Interactive surveys with LLM-based agents)
이번 절에서는 LLM이 개방형 질문과 대화를 통해 더 깊은 상호작용을 포함하는, 더 흥미로운 설문 경험을 창출할 가능성을 탐구함. 전통적인 설문이 사전에 정의된 흐름과 고정된 문항 형식에 의존하는 반면, LLM은 응답자의 대답에 따라 후속 질문을 생성하며 잠재적으로 유익한 피드백을 더 깊이 탐색하는 방식으로 동적으로 적응할 수 있음.
보다 복잡한 상호작용을 고려하기 전에, LLM은 개방형 설문 질문의 핵심 과제 중 일부를 극복하는 데 도움을 줄 수 있다: 응답 데이터의 코딩(coding)과 정량화(quantifying). 개방형 질문 응답을 인간이 라벨링하는 것은 비용이 많이 들고, 라벨러 간의 일관성이 크게 달라질 수 있음. 이러한 개방형 설문 응답을 유용한 지표로 전환하는 것은 인간이나 모델 모두에게 어려운 작업인데, 이 어려움은 풍부한 통찰의 원천이 되게 하는 이질성(heterogeneity) 때문임. LLM은 이 문제와 관련된 텍스트 분석 방법을 빠르게 변화시키고 있음. TopicGPT, GoalEx, TNT-LLM, LLooM은 모두 LLM을 활용해 미디어나 연구 질문별 주제, 분류체계, 주제별 통찰을 생성하는 방법을 제안함 [30, 31, 32, 33]. 이들은 전통적인 latent dirichlet allocation(LDA) [34]보다 더 많은 유연성을 제공하지만, LDA와 달리 그들의 편향과 방법론적 타당성에 대한 위험은 덜 연구되어 있음. 요약하면, LLM 기반 분석의 강건성, 재현성, 효과성을 반드시 적절한 비교 대안(다른 모델링 기법, 인간, 혹은 아무것도 없음)과 함께 고려해야 함. LLM은 인간과 비교하면 비용 효율적 확장성 때문에 유리하며, 다른 모델과 비교하면 강건성과 유연성 때문에 유리함. 개방형 응답을 읽고 분류하는 비용이 너무 높아서 많은 연구 프로젝트에서는 아예 분석되지 않음. LLM을 사용할 때 여전히 인간의 개입은 필수적임. 특히 다양한 방법론적 질문이 여전히 답변되지 않은 상황에서, 작업이 목표에 맞게 진행되도록 보장하기 위해 인간이 관여해야 함.
검색증강생성(Retrieval-augmented generation, RAG) 시스템은 데이터를 이해, 검색, 분석하는 새로운 방식을 가능하게 함. 이는 단순히 설문 파이프라인의 분석 단계(3단계)뿐만 아니라 결과 보고 단계(4단계)까지 교란(disrupt)함. RAG는 LLM과 데이터 검색 시스템을 결합하여, 자연어로 데이터 검색 요청을 가능하게 함으로써 일부 설문 데이터 분석을 더 쉽게 만듦 [35, 36].
현재 문헌에서 “상호작용성(interactiveness)”을 설명할 때, 조사 연구자들은 종종 분기 논리(branching logic)나 실시간 피드백을 통해 동적 참여를 촉진하는 설문을 의미함. 분기 또는 조건부 논리는 관련 있는 질문만 표시하거나, 서로 다른 응답자에게 고유한 질문 경로를 제공하는 데 사용됨. 이 접근법은 문제를 더 작은 구성 요소로 분해하면 응답 정확성이 높아지고, 척도 질문(rating scale question)에 대한 응답의 타당성과 신뢰성이 개선될 수 있다는 아이디어에 기반함 [38, 37]. 분기 논리 외에도, 기존 문헌은 설문을 시각적으로 표현하여 참여도를 높이고 데이터 품질을 향상시키는 방식을 종종 논의함 [39, 40]. 또는, 응답자가 속도를 늦추고 더 신중한 답변을 제공하도록 주의를 환기하는 체크나 프롬프트를 추가할 수 있는 설계에 대해 논의함 [41, 42]. 이러한 설문 설계에서는 설문 제작자가 언제 어떻게 이러한 도구를 사용할지를 결정하면서 상호작용에 대한 완전한 통제권을 유지함.
지난 몇 년 동안 인간-컴퓨터 상호작용(HCI) 연구 공동체는 챗봇(chatbot)을 활용한 설문조사 가능성을 탐구해왔음. 이러한 도구들은 참가자 참여도를 크게 높이고 더 높은 품질의 응답을 이끌어낼 수 있음이 입증되었음 [43]. 초기 HCI 연구에서는 동일한 질문을 사용해 웹 기반 인터페이스와 채팅 기반 인터페이스를 비교하며, 설문 도구가 응답 품질에 어떤 영향을 미치는지를 분석했음 [44]. 예를 들어, AI 챗봇은 적극적 경청(active listening) 기술을 모방해 응답자가 더 많은 정보를 담은 개방형 응답을 제공하도록 유도할 수 있음 [45].
AI 챗봇이 한 가지 접근 방식이라면, LLM은 챗 인터페이스를 넘어 새로운 가능성을 열었음. 응답자들은 보통 개방형 질문에 짧고 질이 들쭉날쭉한 답변을 주는 경향이 있는데, LLM 기반 시스템은 저품질 응답을 감지하고 필요하다면 적절한 후속 질문을 할 수 있음. 채팅, 음성 등 다양한 방식으로 진행할 수 있음. Vocieform이나 Outset과 같은 기업에서 이미 지원하고 있음.
잠재적 이점은 분명하지만, 그에 상응하는 위험과 많은 미해결 연구 질문들도 존재함. 주도권 관점에서 볼 때, 정적인 설문 작성에서 LLM을 활용해 동적으로 설문을 생성하는 방식으로의 전환은 설문 제작자가 질문 흐름에 대해 가지는 통제 수준에 영향을 줌. 이 변화는 도구에 대한 감독 문제와, AI가 응답자의 답변을 유도하는 데 따르는 윤리적 함의를 제기함. 또한 LLM 대화가 실제로 어떻게 전개될지는 여전히 많은 미지수가 존재함. 참가자 측면에서의 잠재적 위험에는 LLM이 응답자를 착취(exploit)하거나, 피로감을 유발하거나, 관계를 깨뜨리는 불안한 질문을 던질 가능성이 포함됨. 이러한 위험을 줄이기 위해, 설문 제작자는 LLM 기반 문항과 표준 온라인 설문 프레임워크를 혼합하는 방식을 고려해야 함. 우리는 대화형 모달리티의 유연성과 실행 가능한 응답 확보 능력 간의 균형을 반드시 유지해야 함.
향후 연구 질문(Future Research Questions)
• 방법(Method): LLM을 텍스트 분석에 엄밀하게 활용하여 개방형 설문 문항으로부터 어떻게 통찰을 도출할 수 있는가? LLM의 학습 데이터는 동적 설문 생성에서 어떤 성능에 영향을 미치며, 특히 특정 주제, 문화, 관습에 대한 지식 분포가 고르지 않아 발생하는 성능 변동에 어떻게 작용하는가? 대화형 설문의 설계 명세는 연구자의 목표와 어떻게 정렬되며, LLM의 유연성과 전통 설문 문항의 경직성 사이의 균형은 어떻게 맞출 수 있는가? 참가자들이 LLM 기반 대화형 설문에서 착취, 후회할 만한 발언(disclosure), 피로감과 같은 잠재적 위험으로부터 어떻게 보호될 수 있는가?
• 도구(Tools): 대화형 설문 도구는 설문 목표에 따라 관심 집단, 특히 소외된 집단(underrepresented groups)의 참여와 응답을 어떻게 늘릴 수 있는가? 위험하거나, 불쾌하거나, 생산적이지 못한 질문의 가능성을 최소화하기 위해 어떤 가드레일(guardrails)이 도구에 내장되어야 하는가?
파일럿 테스트(Pilot testing)
LLM 기반 합성 응답 데이터는 연구자들이 시간, 비용, 개인정보 보호 문제의 제약을 덜 받으면서 데이터셋을 생성할 수 있도록 해줌 [46]. 점점 더 강력한 LLM이 등장함에 따라, 연구자들은 설문에서 인구통계학적 하위 집단을 모방하는 능력을 연구했고 [3], 이를 시장 조사 도구로 탐구했으며 [4], 행동경제학 실험에 적용하기도 함 [47].
몇몇 연구들은 합성 응답 사용의 근본적인 인식론적(epistemic) 및 표현적 위험(representational risk)에 주목했음 [48]. 합성 응답은 실제 설문조사에서 접근 가능한 인간 관점의 다양성을 정확히 반영하지 못하고, 오히려 편향을 증폭시킬 수 있음. Hartmann 등은 ChatGPT(GPT-3.5)에서 좌파 자유주의적(left-libertarian) 편향을 발견했으며, Santurkar 등은 OpenAI와 AI21 Labs의 여러 기본 모델과 인간 피드백 기반 모델에서 표현된 견해가 상당히 왜곡되어 있음을 확인했음 [49, 50].
Wright 등은 LLM의 입장이 프롬프트에 포함된 인구통계학적 특징에 매우 민감하다는 것을 보여줌 [52]. 소외 집단(marginalized groups)이 LLM 시뮬레이션에서 단순화된 caricatures로 표현되거나 [53], 소수 집단을 대표하기보다는 외부 집단의 전형적인 모방으로 잘못 묘사되는 경우가 잦음을 발견함 [5]. 이는 LLM의 편향을 보정하기 위한 “페르소나(persona)” 기반 시뮬레이션의 능력에 의문을 제기함. 합성 데이터가 다양한 분야에서 가설 검증에 타당한지를 확립하려면 더 많은 연구가 필요하나, 합성 데이터를 설문 파일럿 테스트에 사용하는 것은 괜찮다고 봄.
LLM은 이미 현 상태에서도 파일럿 테스트를 가능하게 함. 파일럿 테스트는 논의가 적지만 설문 개발에서 매우 중요한 측면임 [54]. 파일럿 테스트는 설문 제작자가 특정 인구 집단을 대표하는 LLM 페르소나를 활용해 문항에 응답하도록 하는 방식을 포함할 수 있음(예: 연구자가 10개의 주요 목표 집단을 설정하고, 합성 응답을 조회하여 각 집단이 설문에 어떻게 반응할지를 추정하는 방식). 이는 합성 데이터를 생성하고, 데이터 수집 이전에 분석을 준비, 테스트하는 데 사용될 수 있으며(이는 성공적인 분석에 결정적임. 종종 필요한 변수를 놓치거나 잘못 지정하기 쉽기 때문), 어떤 하위 집단을 과표집할지 고려하는 데에도 도움이 될 수 있음(즉, LLM이 흥미로울 수 있다고 판단하는 집단이나, 과거 설문과 비교했을 때 성능이 떨어지는 집단을 탐색할 가치가 있을 수 있음).
어떤 면에서 우리는 이 맥락에서 LLM을 근본적으로 새로운 패러다임이 아니라, 기존의 추정(estimation), 모델링(modeling), 보간/대체(imputation) 전략의 확장으로 봄. 일반적으로, 설문 모델링은 어떤 형태로든 외삽(extrapolation)을 필요로 하는 경우가 많음. LLM이 기존 방법보다 더 유연하거나 더 자신 있게 외삽할 수 있도록 해주는가, 그리고 인간 응답자로부터 수집한 데이터와 어떻게 가장 잘 결합할 수 있는가?
장기적으로는, 인간 응답자가 여전히 설문에서 중요하겠지만, 합성 응답과 인간 응답의 경계는 이동할 것임. 가격 실험이나 반복적이고 고도로 상관된 과제와 같은 영역에서는 이러한 하이브리드 응답이 조직이 반응을 테스트하는 데 도움을 줄 수 있다고 기대됨. 시간이 지나면서, 이러한 설문은 적은 수의 인간 응답자만으로도 목표 집단을 정확히 예측할 수 있게 될 것이며, 이는 전체적으로 더 많은 설문을 수행하도록 촉진할 수 있음.
향후 연구 질문(Future Research Questions)
• 방법(Method): 합성 응답의 정확도를 어떻게 개선할 수 있을까? 여러 모델의 출력을 결합해 더 다양한 LLM 집단을 만들고, 균질성(homogeneity) 위험을 줄일 수 있을까? 이는 추가 설문 데이터로 파인튜닝된 모델보다 더 효과적일까, 덜 효과적일까? LLM은 베이지안 모델의 사전 분포(prior)를 개선하는 데 도움이 되는 기준 분포(baseline distribution)를 설정할 수 있을까? 이러한 방법에서 나타나는 표현적 피해(representational harms)와 편향을, 실제 인간 응답을 모델과 섞어 사용하는 적절한 반복 과정(iterative process)을 통해 통제할 수 있을까?
• 도구(Tools): 설문 연구자가 합성 응답을 파일럿 테스트에 쉽게 사용할 수 있도록 하면서(질문을 더 효율적으로 만들고, 목표 집단을 정하고, 분석 방법을 준비하는 데 도움), 동시에 연구자가 합성 응답을 본 조사에서 인간 응답자를 대체하는 데 오용하지 않도록 방지하는 도구를 만들 수 있을까?
논의
단기적 이점: 합성 응답에 대한 초기 탐색 이후, 우리는 단기적으로 설문 구상(survey ideation)과 데이터 분석에서 LLM을 활용할 유망한 기회를 확인함. 문항 편집과 심지어 문항 작성은 이미 업계에서 이용 가능한 도구를 통해 영향을 미치고 있음. 다만, 설문의 타당성을 훼손하지 않으면서 설문 제작자의 통제권을 유지하는 방법에 대한 의문은 남아있음. 비용을 절감하고, 개방형 질문, 자연어 기반 유연한 쿼리, 보고서 작성 개선 등 새로운 유형의 분석을 촉진할 수도 있음. 합성 응답자를 활용한 파일럿 테스트를 통해 효율적으로 사전 검증과 준비가 가능함.
장기적 이점: LLM 기반 동적(dynamic), 개방형 질문과 LLM 기반 라벨링(labeling)은 훨씬 더 큰 변화를 가져올 수 있으며, 비용 절감과 새로운 설문 시장 개척을 위해 더 많은 주도권이 모델로 넘어갈 수 있음. 우리는 채팅 기반 시스템이 혼합형(mixed-mode) 경험을 만들어, 설문이 새로운 규모와 영향을 갖게 될 것으로 예상함. LLM이 설문 제작자를 대체하기보다는 보조하고, 연구자를 대체하는 것이 아니라 강화하도록 하는 것이 바람직함.
폐쇄형 모델의 불투명성: 일반적으로 연구는 더 넓은 연구 공동체를 위해 오픈 모델을 평가, 개발, 개선하는 데 집중해야 함 [58]. 설문 데이터 모음으로 미세조정된 오픈 모델은 그 학습 데이터의 출처, 구조, 구성에서 불확실성이 적기 때문임.
플랫폼의 투명성 필요: 설문 회사와 플랫폼은 LLM 기반 도구의 사용 및 평가 방식에 대해 투명해야 함. 그래야 사용자가 제안 채택 여부에 대해 정보에 기반한 결정을 내릴 수 있고, 다른 이해관계자도 그 결정 과정을 이해할 수 있음.
인간 연구자는 여전히 survey 연구의 중심: 우리는 설문 연구 파이프라인의 0단계를 일부러 건너뛰었음. 즉, 연구자가 무엇을 알고 싶은지조차 불분명한 경우를 다루지 않음. 연구 의제가 명확히 설정되기 전, 설문 과정에 LLM을 개입시키는 것은 공식적으로 탐구하기 어렵고, 실행 위험이 클 수 있음.
인간 응답자는 여전히 survey 연구의 중심: LLM이 부주의하게 구현된다면, 설문 파이프라인에 오류가 도입되어 품질이 저하되거나, 다양한 집단을 조사하여 얻는 통찰이 획일화(homogenization)될 위험이 있음.