Using large language models to generate silicon samples in consumer and marketing research: Challenges, opportunities, and guidelines 요약

문정현·2025년 9월 19일

논문

목록 보기
14/56

Using large language models to generate silicon samples in consumer and marketing research: Challenges, opportunities, and guidelines Marko Sarstedt | Susanne J. Adler | Lea Rau | Bernd Schmitt

초록

소비자 연구자들은 GPT와 같은 대규모 언어 모델을 기반으로 한 실리콘 샘플과 인공적으로 생성된 데이터를 활용해 인간 응답자의 행동을 모방해야 할까? 본 논문에서는 실리콘 샘플과 인간 샘플 간의 결과 패턴을 비교한 최근 연구를 검토하며, 그 결과가 영역에 따라 상당히 다르게 나타난다는 점을 확인한다. 이러한 결과를 바탕으로 우리는 소비자 및 마케팅 연구에서 실리콘 샘플을 사용할 때의 구체적인 권고사항을 제시한다. 특히, 실리콘 샘플은 연구자가 후속 연구 설계 선택을 보완하기 위해 외부 정보를 수집하는 질적 사전검사(qualitative pretesting) 및 파일럿 연구와 같은 연구 과정의 초기 단계에서 유용할 가능성이 크다고 주장한다. 또한, 본 연구는 주요 연구(main studies)에서 실리콘 샘플을 사용할 때의 비판적 평가와 권고사항을 제공한다. 마지막으로, 실리콘 샘플 사용과 관련된 윤리적 쟁점들을 논의하고, 향후 연구 과제를 제시한다.

키워드
생성형 AI, GPT, 대규모 언어 모델, 실리콘 샘플, 합성 데이터셋

서론(Introduction)

GPT는 2022년 11월 ChatGPT를 통해 대중에게 공개됨. GPT는 방대한 텍스트 데이터베이스를 입력으로 사용하고, 자기 지도 언어 모델링 목표를 통해 모델을 학습하며, 인간 피드백을 통한 강화학습을 적용함(OpenAI, 2023). 이러한 절차 덕분에 LLM은 인간의 응답 행동을 모방할 수 있음(Jeon et al., 2023; Luo et al., 2022).
심리학자와 마케팅 연구자들은 LLM이 소비자 및 마케팅 연구에 어떤 영향을 미칠 수 있는지 고민하기 시작함(예: Peres et al., 2023). 마케팅 커뮤니케이션 개선, hyperpersonalization을 통해 우수한 고객 경험 제공, 전통적인 마케팅 연구 기능 향상, 학술적 실증 연구에서 인간을 LLM으로 대체함. 이러한 연구들은 LLM을 사용해 이른바 ‘실리콘 샘플’(synthetic datasets라고도 불림)을 생성하고, 인간 응답자를 모방하여 인간의 행동을 기술, 설명, 예측하는 데 활용함.

실리콘 샘플은 마케팅 실무에서도 등장하고 있음.

실리콘 샘플을 실제 경험적 연구에 사용해 인간 행동에 대한 통찰을 얻는 것이 타당할까? 인간 샘플을 실리콘 샘플로 대체하기 위한 필수 조건을 평가해옴. 여러 인지심리학 실험을 반복한 연구에서 Binz와 Schulz(2023)는 GPT가 인간과 유사한 편향(예: 프레이밍 효과)을 보인다고 발견함. Kirshner(2024)는 세계를 해석하는 방식(즉, 개인적 해석, construal)의 형성에서 GPT와 인간 샘플 간에 상당한 차이가 있음을 발견함. GPT는 목표 지향적이고 높은 수준의 해석(high construal level)과 관련된 특성에 더 큰 비중을 두었고, 수단 지향적이고 낮은 수준의 해석(low construal level)과 관련된 특성에는 덜 집중함.

근본적인 관점에서, 연구자들은 LLM을 인간 사고의 모델로 정당하게 사용할 수 있는지 의문을 제기함. LLM의 작동 원리는 인간 참가자의 감정과 추론 능력과는 상당히 다르기 때문임(e.g., Abdurahman et al., 2023; Demszky et al., 2023).

본 논문은 다양한 학문 분야에서 실리콘 샘플과 인간 샘플을 비교한 연구를 검토하고, 결과에서 관찰된 변동성의 원인을 논의함. 그 후 소비자 및 마케팅 연구에서 실리콘 샘플의 활용 가능성을 다룸. 질적 사전검사(qualitative pretesting) 및 파일럿 연구뿐만 아니라 양적 본 연구(quantitative main studies)에서의 사용을 평가함. 또한, 윤리적 관점을 보완적으로 논의하여 실리콘 샘플 사용에 대한 권고사항을 제시하고, 향후 연구 과제를 도출함. 마지막으로, 제안하는 LLM 사용 체크리스트를 통해 학자와 실무자가 프로젝트에서 실리콘 샘플을 적절히 위치시킬 수 있도록 도움.

2장: LLM을 활용한 인간 행동 모방 (USING LLMS TO MIMIC HUMAN BEHAVIOR)

이미 여러 연구(인간-컴퓨터 상호작용, 일반 심리학, 사회 심리학 등)에서 인간 샘플과 실리콘 샘플 간 비교가 이루어짐. 전체적으로 볼 때, 연구들은 실리콘 샘플이 인간의 반응을 모방하는 효과성에 대해 혼합된 결과를 보여줌.

LLM은 성격 특성과 관련된 과제(Caron & Srivastava, 2022), 프레이밍 효과(Chen et al., 2023), 정치적 태도와 정당 선호(Argyle et al., 2023)와 같은 결과를 재현함. 예를 들어, Caron과 Srivastava(2022)는 Reddit 사용자의 ‘빅파이브(Big Five)’ 성격 특성에 대해 조사하고, 이러한 사용자 맥락 데이터를 기반으로 LLM을 훈련시킴. 그 결과, LLM은 다양한 맥락에서 성격 지표를 안정적으로 모방할 수 있음을 보여줌.

반면, 많은 경우 연구자들은 소비자 행동을 특징짓는 것으로 알려진 효과들을 재현하지 못함. 보유 효과(endowment effect), 정신적 회계(mental accounting), 매몰 비용 오류(sunk cost fallacy) 등이 있음(Chen et al., 2023). Kahneman과 Tversky(1979)의 고전적 전망 이론(prospect theory) 실험을 재현하여 이익과 손실에 따른 위험 선호를 파악한 Chen et al.(2023)의 연구에서는, ChatGPT가 인간처럼 이익 상황에서는 위험 회피적, 손실 상황에서는 위험 추구적으로 행동하기보다는, 기대 수익 극대화에 초점을 맞추는 경향을 보임. Park et al.(2023)은 GPT-3.5를 사용해 심리학 주요 연구 결과를 대규모로 재현하는 프로젝트 Many Labs 2(Klein et al., 2018)에 포함된 14개 연구를 다시 실행함. 그 결과, 원래 연구의 결과를 재현할 수 있었던 것은 1/3 정도에 불과했음. Many Labs 2와 GPT 샘플 모두에서 재현된 연구들은 과제 지시문에서 직접적으로 제공된 정보를 일반화하거나 비교하는 데 기반한 경우였다. 그러나 GPT는 암묵적 연상(implicit associations)에서 비롯되는 효과는 재현하지 못함. 14개 연구 중 6개에서는, 연구자의 알고리즘 선택과 무관하게 GPT의 결과가 높은 결정성(determinacy)을 보였는데, 이는 GPT가 거의 변동 없이 매우 균일한 방식으로 정답을 제시하는 “정답 효과(correct answer effect)” 때문임.

이러한 혼합된 결과에 기여했을 가능성이 있는 두 가지 요인은 LLM의 작동 원리와 그것을 사용자가 어떻게 커스터마이즈 및 파라미터화하는지, 그리고 연구자가 어떤 LLM 버전을 사용했는지임. LLM은 The Pile과 같은 전례 없는 방대한 훈련 데이터에서 발견되는 단어 공동출현 패턴(word co-occurrence patterns)을 재현하도록 설계됨. 즉, 단어가 맥락에 상관없이 고정된 의미를 가진다고 가정하지 않음. 예측 오류는 신경망의 가중치와 편향 항목을 업데이트하는 기반(backpropagation)으로 작용하여, 모델 출력과 목표 텍스트 간 차이를 최소화함.

모든 통계 분석과 마찬가지로, 산출물의 품질은 훈련 데이터의 품질에 크게 의존함. LLM이 단순히 “훈련 데이터에서 흔히 등장했던 말을 앵무새처럼 되풀이하여 대화가 자연스럽게 들리도록 할 뿐”이며(Demszky et al., 2023, p.4), 실제로 그 출력이 누구의 경험과 의견을 반영하는지 불분명함. 이는 파인튜닝으로 해결 가능함. 그러나 파인튜닝한 LLM이 항상 인간의 응답 행동을 더 잘 모방한다는 것은 아님. “올바른 답”이 반드시 인간이 실제로 내릴 법한 응답과 같지 않기 때문임.

프롬프트 튜닝을 할 수 있음. 연구자들은 샘플 과제와 그 해답을 모델에 제시함(Demszky et al., 2023). 예를 들어, 서비스 품질의 선행 요인을 조사하는 연구자가 다음과 같은 예시를 제시할 수 있다: “다음은 서비스 품질에 대한 불만을 표현하는 고객의 예시입니다: ‘서비스 직원이 불친절했고 문제를 해결하려는 시도조차 하지 않았다.’” 중요한 점은 프롬프트 튜닝이 단일 샘플 과제(one-shot prompting)에 국한되지 않고, 여러 예시를 포함하는 few-shot prompting으로 확장될 수 있다는 것임.
훈련 데이터와 프롬프트 구조에 대한 결과의 민감성 외에도, LLM 사용자는 모델을 적용할 때 다양한 자유도를 가짐. Softmax temperature과 top-k 파라미터를 조절할 수 있음.

결과 변동성의 두 번째 원인은 연구자들이 사용하는 GPT 버전의 차이에 있음. 초기 버전은 인간과 유사한 직관적 사고(System 1) 및 관련된 인지적 오류를 보였지만, GPT-3.5 이상은 사고의 연쇄(chain-of-thought) 추론을 사용하여 체계적 사고(System 2)와 유사하게 작동함. GPT 버전을 직접 비교한 연구에서는 빅파이브(Big Five) 성격 특성과 관련된 차이도 나타남. 특히 외향성(extraversion)과 친화성(agreeableness)은 GPT-4가 GPT-3.5보다 인간 샘플과 더 크게 벗어남. 더 나아가 두 버전 모두 성실성(conscientiousness), 신경증(neuroticism), 개방성(openness)에서는 인간 점수를 잘 반영하지 못했지만, GPT-4가 GPT-3.5보다 더 나은 성능을 보임(Jiang et al., 2023).

3 | 실리콘 샘플 사용에 관한 권고 (RECOMMENDATIONS CONCERNING THE USE OF SILICON SAMPLES)

실리콘 샘플의 도전 과제와 기회를 고려할 때, 그것들은 연구 프로젝트에서 어디에 위치해야 할까? 또한 연구자들이 실리콘 샘플링을 수행할 때 따라야 할 현재의 지침은 무엇일까?

3.1 | 사전검사(pretesting)와 파일럿 연구(pilot studies)를 위한 실리콘 샘플 활용

연구자가 후속 설계 선택을 보완하기 위해 외부 정보를 수집하는 단계에서 GPT와 같은 LLM을 사용하는 것은 상당한 가능성을 지님. 그 목적은 본격적인 인간 대상 연구를 시작하기 전에 개입이 필요한 잠재적 오류를 연구자에게 미리 알리는 데 있음. 예컨대 척도 검증 단계에서 특정 문항의 문구가 적절한지 여부를 GPT에 물어볼 수 있음. 실례로, 우리는 GPT-4에게 다음 설문 항목의 적절성을 평가하도록 요청함: “나는 그 회사의 제품과 서비스에 만족한다.” 응답자는 1(“전혀 동의하지 않는다”)에서 7(“매우 동의한다”)까지 답해야 함. GPT-4는 이 항목이 이중 질문(double-barreled)이라는 점을 정확히 지적하고, 질문이 지나치게 일반적이라는 점을 강조하며, “[…] 특정 강점이나 개선 영역에 대한 통찰을 제공하지 않는다.” 라고 덧붙임. 두 번째 예에서, GPT-4는 “나는 이 서비스를 매우 자주 사용한다”라는 문항이 모호하다고 지적함. “한 사람이 ‘매우 자주’라고 여기는 빈도는 다른 사람에게는 덜 빈번한 것으로 간주될 수 있다.” 라며, 모호성이 응답 해석에 문제를 일으킬 수 있음을 보여줌.

GPT는 척도 개발 과정에서 측정 불변성(measurement invariance)의 일부 원인을 파악하는 데도 활용될 수 있음(Vandenberg & Lance, 2000). 이를 보여주기 위해 우리는 GPT-4에게 다음과 같은 질문을 던졌다: 서로 다른 문화권의 응답자들이 문화적 지능(cultural intelligence) 개념에 대해 다르게 반응할 것인가? 문화적 지능은 “새로운 문화적 맥락에 효과적으로 적응할 수 있는 개인의 역량”을 의미함. GPT-4는 실제로 그럴 가능성이 크다고 답함. 그 이유로 문화 규범과 가치의 차이, 다양성에 대한 노출 정도, 상호작용 맥락, 그리고 기타 여러 요인을 들었음(Appendix Figure A1). 이러한 출력은 문화적 지능 측정에서 측정 불변성을 확립하는 데 어려움이 따른다는 실증적 연구 결과(Schlägel & Sarstedt, 2016)와 일치함. 이 접근법은 다양한 배경을 지닌 실리콘 참가자 집합을 생성하여, 서로 다른 하위 표본(subsample) 구성원들이 문항 내용을 다르게 해석하는지를 파악하는 방식으로 확장될 수 있음.

우리는 DALL·E와 같은 텍스트-이미지 생성 모델을 활용하여 자극(stimuli)이나 시나리오(vignette)를 제작, 검증하는 것도 가치가 있다고 봄. 이때 연구자는 사전에 정의된 특성을 충족해야 함(예: 제품 구색 연구를 위한 제품 자극 생성). DALL·E 3에게 피험자의 미래 시간 관점(future time perspective)을 확장시키는 시각적 자극을 생성하도록 요청함. 미래 시간 관점은 개인이 자신의 남은 삶의 시간을 어떻게 인식하는지를 의미함. DALL·E 3는 해당 관점을 불러일으킬 수 있는 장면을 묘사했고, 이를 바탕으로 해당 이미지를 생성함(Figure 3). 연구자는 이후 프롬프트에 추가 정보를 넣어 연구 맥락에 맞게 이미지를 맞춤화(customize)할 수도 있음.

DALL·E 3는 시각적 자극의 적절성을 초기 검증하는 데에도 활용될 수 있음. Ton et al.(2023)의 연구, 즉 단순한 포장 디자인과 복잡한 포장 디자인이 소비자 행동에 미치는 영향을 토대로, 우리는 초콜릿 바 패키지의 두 가지 변형을 생성하고 이를 Figure 4에 제시된 프롬프트로 평가하도록 함. Ton et al.(2023)의 주의력 점검(attention check)을 차용하여 DALL·E 3에게 각 패키지의 복잡성을 1(“단순함”)에서 9(“복잡함”)까지의 척도로 평가하도록 요청함. 모델은 디자인 요소와 관련된 복잡성 차이를 식별했으며, 더 복잡한 디자인은 ‘더 풍부한 감각적 경험’을 제안한다고 설명함. 또한 모델은 이미지에 대한 설명과 함께 수치 평가도 제공함. 우리는 추가적인 복제 연구에서 이러한 평가를 다시 검증했으며, 이 과정에서 제시 순서 효과(order effect)도 함께 확인함. 설명 자체는 순서에 따라 크게 달라지지 않았지만, 수치 평가 값은 순서 효과에 민감했음(Park et al., 2023에서도 GPT에서 순서 효과가 관찰된 바 있음). 구체적으로, 더 복잡한 포장은 단순한 포장이 먼저 제시된 후에야 더 높은 복잡성 점수를 받음(Web Appendix Figure A2 참조).

DALL·E 3는 패키지 간의 차이점과 유사점을 설명하도록 요청했을 때(Figure 5), 시각적 복잡성과 관련된 잠재적 혼란 요인(confounds)을 드러내는 구체적 디자인 요소도 짚어냄. 예를 들어, 미니멀한 디자인은 더 고급스러운(upscale) 느낌으로 인식될 수 있으며, 이는 두 디자인 간에 프리미엄 지각(premium perception)의 차이를 야기할 수 있음. 복잡한 디자인은 더 높은 감각적 매력(sensory appeal)을 포함하기 때문에, 미니멀한 디자인에는 없는 감각적 심상(sensory imagery)과 감각적 기대(sensory expectations)를 불러일으킬 수 있음(Ton et al., 2023 참조). 따라서 연구의 구체적인 목적에 따라, 이러한 요인들은 결과의 타당성(validity)을 제한할 수 잇음.

종합하면, GPT-4와 DALL·E 3을 사전검사에 활용한 우리의 시도는 두 모델 모두 연구 자료를 생성하고 평가하는 데 도움을 줄 수 있음을 보여줌. 그러나 GPT와 같은 LLM은 할루시네이션 문제가 있어, 연구자는 반드시 이들을 보조적 정보원(informant)으로만 활용하고, 그 진술을 독립적으로 점검하고 검증해야 함. 예컨대, 연구 문항에 대한 질적 평가는 명백한 오류를 찾아내고 모호하거나 직관적이지 않은 문구를 식별하는 데 유용함. 또한 자극(stimuli) 간의 유사점과 차이점을 분석하면 잠재적 혼란 요인(confounds)이나 대안적 해석 가능성을 파악할 수 있음.

3.2 | 본 연구(main studies)에서의 실리콘 샘플 활용

양적 본 연구를 위한 데이터셋을 실리콘 샘플로 생성하는 것은 연구 과정 전반에서 일련의 도전과제를 수반하며, 연구자들은 산출물을 추가적으로 활용하기 전에 이러한 문제들을 해결해야 함(Table 1).

3.2.1 | 훈련 데이터가 연구 질문을 어느 정도 뒷받침할 수 있는지 비판적으로 평가하기

실리콘 샘플이 적절한 데이터 원천이 될 수 있는지는 훈련 데이터에 연구 질문과 관련된 정보가 포함되어 있는지에 크게 달려 있음(e.g., McCoy et al., 2023; Santurkar et al., 2023). 따라서 우리는 연구자들이 훈련 데이터가 일반적으로 연구 질문을 어느 정도 뒷받침할 수 있는지 비판적으로 평가할 것을 권장함. 가장 근본적인 도전 과제는 결과가 어떤 모집단에 일반화될 수 있는지 식별하는 것임. The Pile과 같은 훈련 데이터셋은 방대한 데이터의 단순 집합일 뿐, 명확히 정의된 모집단을 가지고 있지 않음. 모집단이 정의되지 않았으므로, 연구자들은 특정 타깃 집단에 특화된 결과를 얻기 위해 프롬프트를 더 구체적으로 작성해야 함(Argyle et al., 2023). 물론 이 과정은 해당 타깃 집단이 훈련 데이터에 충분히 반영되어 있다는 가정 하에서만 유효함. 그러나 이러한 접근의 효과성은 프롬프트 구조와 사용된 LLM의 종류에 크게 의존하며, 버전별로도 달라질 수 있음. 예를 들어, GPT-4는 표준화된 시험과 관련하여 GPT-3.5보다 훨씬 더 폭넓은 능력을 보여줌(OpenAI, 2023).

LLM을 단순히 훈련 데이터에 질의하는 용도로만 사용한다면, 아마도 의미 있는 결과를 얻지 못하고 변동성이 거의 없는 일반적인 응답(generic response)만 생성할 가능성이 큼(Park et al., 2023). 따라서 커스터마이징(customization) 접근법이 필요함. 여기에는 파인튜닝(fine-tuning)과 프롬프트 튜닝(prompt-tuning)이 포함되며, 특정 과제에서 LLM의 성능을 향상시키는 데 도움을 줌(Demszky et al., 2023). 또한 연구자들은 산출물(output)이 다양한 언어적 특징에 대해 얼마나 강건한지(robustness)를 평가하기 위해 프로빙(probing)을 활용해야 함(Manning et al., 2020). 이 과정은 먼저 연구 주제와 관련된 언어적 특징(예: 부정 표현, 1인칭 사용, 동의어 등)을 식별한 뒤, 이러한 특성을 바탕으로 입력을 변화시키고 그 영향이 결과에 어떻게 나타나는지를 분석하는 절차를 포함함.

예를 들어, 연구자들은 동사에 부정어가 포함된 경우와 포함되지 않은 경우만을 구분한 문장 쌍(예: “satisfied” vs. “not satisfied”)을 입력으로 생성할 수 있음. 이후 모델이 부정어가 포함된 문장과 포함되지 않은 문장에 대해 산출한 결과 차이를 분석함. 이 비교는 모델이 부정을 고려하여 예측하는지를 평가하고, 만약 그렇다면 어떤 벡터 요소가 부정과 가장 강하게 연관되는지를 확인하는 데 도움을 줌(Demszky et al., 2023). 우리가 포장 디자인에 대한 순서 효과(order effects)를 검증한 것(Appendix Figure A2 참조)도 또 다른 프로빙(probing)의 예시임. 이때 반드시 산출물을 점검하고, 예컨대 산출물이 의도한 형식을 따르는지(예: 여러 옵션 중 하나 선택, 짧은 텍스트 작성)를 확인해야 함.

모델을 커스터마이징할 때, 연구자들은 치료가 병보다 더 나빠질 수 있다(the cure could be worse than the disease)는 점을 명심해야 함. 즉, 개입이 전통적인 교란(confounding)보다 더 큰 편향을 도입할 수 있음(프롬프트 설계가 확증 편향을 유발할 수 있음). p-해킹은 여러 학문 분야에서 낮은 재현율의 주요 원인으로 간주됨(Ioannidis, 2005; Miller & Ulrich, 2022). 연구자들은 특정 수치 추정값에 집착하기보다는, 결과에 일정 수준의 변동성을 부여해 그럴듯한 결과 범위(plausible results)를 생성하는 접근을 고려해야 함. 그렇지 않으면 결과는 훈련 데이터의 특수성(idiosyncrasies)과 연구자의 자유도(degrees of freedom)를 반영할 뿐이며, 일반화 가능성이 떨어짐. 이 관점에서 일정한 변동성은 일반화된 결과를 확보하기 위해 필수적임.

3.2.3 | 인간 벤치마크 샘플 사용

우리는 연구자들이 항상 실리콘 샘플을 인간 샘플과 비교(benchmarking)할 것을 권장함. 따라서 연구자들은 인간 벤치마킹 연구를 수행할 때 간결한 연구 설계를 사용하거나, 이차 데이터(secondary data)를 활용하는 것이 좋음. 벤치마킹을 수행할 때는 서로 다른 실리콘 샘플(예: 서로 다른 LLM에서 나온 결과)을 비교해, 어떤 것이 인간 샘플과 가장 유사한지 확인해야 함. 그러나 특정 인간 샘플에 실리콘 샘플을 지나치게 맞추면(overfitting), 그 결과가 다른 인간 샘플에는 일반화되지 않는 문제가 생길 수 있으므로 주의가 필요함.

3.2.4 | 분석 절차의 정당화와 조정

연구자들은 실리콘 샘플이 기존의 표준 데이터 분석 절차에 도전 과제를 제기한다는 점도 인식해야 함. 예를 들어, 연구자들은 매우 큰 규모의 실리콘 샘플을 쉽게 생성할 수 있고, 이로 인해 표준오차(standard error)가 최소화되어 전통적인 추론 통계(inference testing)의 가치가 크게 줄어듦. 아주 큰 실리콘 샘플에서는 effect size의 해석이나 베이지안 데이터 분석을 하면 좋음. 그러나 훈련 데이터의 특성과 프롬프트 구조에 대한 결과의 민감성을 고려하면, 해당 추정치는 상당한 수준의 불확실성(uncertainty)을 수반할 가능성이 높음. 즉, 하나의 측정값이 광범위한 그럴듯한 값 범위(plausible values)와 일치할 수 있음(JCGM, 2012). 따라서 연구별, 측정별로 얻어지는 값이 크게 달라질 수 있음. 이러한 불확실성을 정량화하고 관리하는 것이 주요 도전 과제임.

3.2.5 | 재현성과 투명성 최적화

결과가 연구자의 자유도에 따라 민감하게 달라질 수 있으므로, 연구자들은 가능한 한 많은 정보를 기록할 것을 강력히 권장함(예: 프롬프트의 다양한 변형, 사용한 LLM 버전 등). 또한, 다른 연구자가 방법론을 재현하고 결과를 복제할 수 있도록 투명한 보고 관행을 지켜야 함.

3.2.6 | 권고사항

Table 2는 현재 실리콘 샘플링 연구 상황을 바탕으로 한 핵심 권고사항을 요약한 것임.

3.3 | 실리콘 샘플링의 윤리적 쟁점

심리학 및 마케팅 전반의 연구자들은 LLM 일반, 그리고 특히 실리콘 샘플 사용과 관련하여 제기되는 윤리적 쟁점들을 인식해야 함. 윤리적 문제란 특정 행동이 “옳다/그르다” 또는 “좋다/나쁘다”와 같은 도덕적 판단을 포함함. 응용윤리의 영역에서는 최근 기술윤리(ethics of technology), 특히 AI와 GPT 윤리가 사회-기술적 생태계의 일부로 부상하면서 새로운 철학적 탐구 분야로 자리 잡았음(Stahl et al., 2024; Stahl, 2022). GPT와 관련된 일반적인 윤리적 질문에는 프라이버시 문제, 저작권 문제, 허위정보 및 잘못된 정보(misinformation & disinformation), 훈련 데이터의 편향, 일자리 대체, 악의적 사용, 고정관념 강화, 사용자 개인의 책임, 규제 필요성 등이 포함되고, 대부분은 실리콘 샘플 사용에도 그대로 적용됨.

본 논문에서 논의된 주요 비용(cost) 중 하나는 정확성(타당성)의 부족임. 이는 실리콘 샘플을 대규모로 사용했을 때, 그것이 단순히 인간 텍스트를 앵무새처럼 반복하는 “silly samples”로 전락하거나, 더 나아가 겉보기에는 “새롭고” “흥미로운” 것처럼 보이지만 결국은 잘못된 연구 결과를 만들어내는 데 악용될 수 있다는 점임. 이와 관련하여, 훈련 데이터에서 잘 대표되는 분야(예: 제품 및 서비스 평가)는 실리콘 샘플을 기반으로 더 정확한 결과를 산출할 수 있는 반면, 덜 축적된 연구 분야(예: COVID-19 같은 위기에 대한 소비자 반응)는 정확도가 낮을 수 있음.

또 다른 비용은 편향(bias)의 잠재성임. 연구자들은 모델 훈련 데이터에 내재된 편향이 고정관념을 강화하거나 불공정한 재현으로 이어지지 않도록 이를 인식하고 완화해야 함. 일부 연구자들은 이를 “AI 식민주의(AI colonialism)”라고 부르는데, 이는 훈련 데이터가 비서구(non-Western) 문화를 불완전하고 잠재적으로 편향된 시각으로 그릴 수 있기 때문임(Hao, 2022). 소비자 및 마케팅과 관련된 최신 발전이나 새로운 정보를 충분히 고려하지 못하는 비용이 있음. 예컨대, 고객 참여(customer engagement)처럼 단기적 변화에 덜 영향을 받는 연구 주제(Hollebeek et al., 2024)는 정확히 연구될 수 있는 반면, COVID-19 팬데믹 같은 매우 최근의 현상(Imschloss & Schwemmle, 2023)에 관한 연구는 그렇지 않을 수 있음.

4 | 앞으로의 방향 (The Way Forward)

GPT와 같은 LLM이 합리적 행위자(rational agents)처럼 행동한다면, 그 결과는 소비자의 제한된 합리성(bounded rationality)을 설명하거나 예측하는 데 쉽게 활용될 수 없음. 위험 선호 차이, 시스템 1 처리와 같은 문제 외에도, GPT는 특히 개인 간 차이(interpersonal differences)를 거의 모방하지 못함. 그러나 LLM 분야는 빠르게 발전하고 있어, 나중에는 현재보다 인간 행동을 더 밀접하게 모방할 것이라 기대할 수 있음. 앞으로 연구자들은 LLM을 더 다양한 조건과 과제에서 평가할 뿐만 아니라, 인간의 의사결정과 행동과 비교해 LLM의 반응을 설명해야 함(Binz & Schulz, 2023; Dillion et al., 2023). 이를 통해 학문 연구에서 LLM을 건설적으로 활용할 수 있는 경로를 모색할 수 있음(Demszky et al., 2023; Susarla et al., 2023).

Park et al.(2023, p.24)은 “LLM과 인간은 근본적으로 다른 인지 체계이므로, 각각이 정보를 처리하는 신비로운 방식에서 본질적 차이가 존재한다는 점에서 이러한 행동 차이는 충분히 예견 가능했다”고 말함.

LLM 산출물과 인간 반응 행동을 비교하는 연구는 인간-LLM 간 (불)유사성을 파악하는 첫걸음이지만, 동시에 더 근본적인 질문을 제기함. 즉, 이러한 평가는 LLM의 메커니즘 이해를 돕는가, 아니면 LLM이 언제 그리고 어떻게 인간 행동을 반영하는지를 이해하는 데 기여하는가? 두 가지는 서로 다른 과제임. 특히 ‘올바른(correct)’ 반응이 무엇인지에 대한 이해는 LLM 개발자와 소비자 행동 연구자 사이에서 다를 수 있음.
컴퓨터 과학자에게 LLM이 “좋다”는 것은 문법적으로 정확하고, 일관되며, 자연스럽게 들리는 텍스트를 산출하고, 주어진 입력에 대해 객관적, 사실적으로 올바른 답을 제공할 때임(Demszky et al., 2023). 반면 소비자 및 마케팅 연구자에게 LLM의 응답이 “옳다”는 것은 그것이 실제 소비자 행동을 반영할 때임. 여기에는 행동 예측뿐만 아니라, 그 행동을 유발한 인간적 이유까지 반영하는 것이 포함됨. LLM에 인간적 요소를 불어넣는 것은 매우 어려운 과제이며, 장기적으로는 사실적으로 정확한 출력을 잘하는 모델과 인간 행동을 예측·설명할 수 있는 실리콘 샘플을 잘 생성하는 모델이 시장에서 구분될 것임.

연구자들은 실리콘 샘플링에 적합한 연구 영역을 성찰하고, 이에 상응하는 실증적 근거를 축적해야 한다. 이는 실리콘 샘플이 일반적으로 인간 샘플 및 실제 행동과 잘 일치하는 소비자·마케팅 연구 분야(또는 그렇지 않은 분야)를 식별하기 위한 것으로, 궁극적으로는 특정 연구 유형에서 인간 벤치마크를 대체하거나 불필요하게 만들기 위함임.
실리콘 샘플링은 소비자 및 마케팅 연구에서 현재 활용되는 데이터 수집 및 분석 절차와 근본적으로 다름. 따라서 연구자들은 윤리적·실용적 이유에서 실리콘 샘플링에 대한 새로운 가이드라인과 방법론을 개발해야 함. 특히, 인간 행동의 불완전성을 포함해 모방하는 경우 실리콘 샘플의 데이터 품질을 어떻게 정의할 것인가가 불분명함. 실리콘 샘플의 품질은 인간 데이터 패턴을 모방하는 능력으로만 정의해야 하는가? LLM에 “주의력(attention)” 점검 문항을 정의하여 부정확하거나 허위인 단일 실리콘 관찰을 식별하고 표본의 전반적 품질을 평가해야 하는가? 실리콘 샘플링은 표본이론(sampling theory)과 어떻게 정합성을 갖는가? 실리콘 샘플에서 이상치(outlier)는 무엇이며, 어떻게 식별할 수 있는가? 모델 파라미터(예: softmax temperature)와 파인튜닝은 실리콘 샘플 품질에 어떤 영향을 미치는가? 이러한 문제들은 연구자들이 표본 연구의 기본 원칙을 다시 생각하도록 요구함.

실리콘 샘플을 식별할 수 있는 방법을 개발하는 노력도 필요함. 실제 데이터에는 종종 이상치가 존재하지만, 연구자가 프롬프트에서 변수 범위를 정의한 실리콘 샘플에는 존재하지 않을 수 있음(Taloni et al., 2023).

앞으로는 소비자 연구자, 심리학자, 컴퓨터 과학자, 다른 분야 전문가들이 협력해, 단순한 파인튜닝과 프롬프트 튜닝을 넘어 인간과 유사한 반응과 상호작용을 최적화한 LLM을 개발해야 함.

5 | 결론 (Conclusion)

실리콘 샘플은 인간과 유사한 데이터를 빠르고 대규모로 제공할 수 있는 수단으로서 소비자 연구에 상당한 가능성을 지니고 있음. 현재 기준으로 LLM은 연구자가 후속 연구 단계를 설계하는 데 필요한 외부 피드백을 수집하는 맥락에서 유용할 수 있음. 이러한 상황에서 LLM의 결과는 연구자에게 우려를 불러일으킬 수 있으며, 프로젝트의 특정 측면을 재고하게 만들 수 있음. 하지만 많은 파괴적 혁신이 그렇듯, 오용 가능성은 현실임. 사기적 사용을 차치하더라도, 충분한 성찰 없이 또는 LLM이 설계되지 않은 과제에 활용될 경우, LLM은 소비자 및 마케팅 연구자들을 잘못된 방향으로 이끌 수 있음. 이는 이미 연구 결과의 재현 가능성(replicability) 부족과 경영 의사결정과의 관련성 결여 문제로 면밀히 검토되고 있는 학문 분야에 잠재적으로 치명적인 결과를 가져올 수 있음(Adler et al., 2023; Krefeld-Schwalb & Scheibehenne, 2023). 따라서, 실리콘 샘플이 지닌 막대한 잠재력이 조기 남용을 불러올 수 있다는 점을 인식하면서, 연구자들은 반드시 명심해야 함.

profile
이화여자대학교 인공지능융합 석사과정

0개의 댓글