[논문 리뷰] CollabStory: Multi-LLM Collaborative Story Generation and Authorship Analysis

최동민·2025년 3월 17일

Paper review

목록 보기
1/15

Introduction

Motivation

  • 생성형 대규모 언어 모델(LLM)은 현재 실생활에서 널리 사용되고 있으며 특히 글쓰기 작업에서 협업 도구로 활용되고 있다.
  • 지금까지는 주로 인간-LLM 협업에 초점이 맞춰져 있었다.
  • vLLM, LangChain, HuggingFace와 같은 unifying framework가 등장하면서 서로 다른 LLM들이 interoperable될 수 있게 되었다.
  • 이로 인해 LLM들이 인간의 개입 없이도 서로 협력하여 작업을 수행할 수 있는 가능성이 열렸다.
  • 특히 오픈소스 모델들은 이미 매월 10만 명 이상의 사용자가 활용하고 있어 이러한 협업이 즉시 가능한 상태다.

Novelty

  • 지금까지 자동화된 글쓰기 도구들은 인간 작가와의 협업 또는 단일 LLM과의 협업으로만 사용되었다.
  • 이 연구는 인간-LLM 협업을 넘어 여러 LLM이 함께 작업하는 다중 LLM 시나리오를 탐구한다.
  • 연구진은 최초로 LLM만으로 생성된 협업 스토리 데이터셋인 'CollabStory'를 생성했다.
  • 단일 저자(N=1)부터 다중 저자(최대 N=5)까지 다양한 시나리오를 분석했다.
  • 오픈소스 instruction-tuned LLM들을 사용하여 32,000개 이상의 스토리를 생성했다.

Research Significance

  • CollabStory는 여러 LLM의 사용을 식별하는 기술 개발을 촉진할 수 있는 최초의 자원이다.
  • 이는 plagiarism detection, credit assignment, 교육 환경에서의 academic integrity 유지, copyright infringement 문제 해결 등의 측면에서 중요하다.
  • 악의적 행위자가 여러 LLM의 텍스트를 한 문서에 조합하여 출처를 회피하고 허위 정보를 퍼뜨릴 가능성을 지적했다.

Methodology

1. CollabStory: Dataset Creation

Used LLM Models

  • 5개의 오픈소스 LLM을 사용
    1. Llama2 (Touvron et al., 2023)
    2. Olmo (Groeneveld et al., 2024)
    3. Gemma (Team et al., 2024)
    4. Mistral (Jiang et al., 2023)
    5. Orca (Mukherjee et al., 2023)

Dataset Design Goals

  • 서로 다른 출처(조직)의 LLM이 협업적으로 스토리라인을 작업하는 시나리오를 시뮬레이션
  • 한 LLM에서 다음 LLM으로 스토리 컨트롤을 넘기는 방식으로 진행
  • 데이터셋의 스토리는 저자/LLM 수에 따라 다양성을 가짐
    • 단일 LLM이 전체 작성 (N=1)
    • 2~5개의 LLM이 협업하여 작성 (N=2~5)

Prompt Sources

  • Reddit의 r/WritingPrompts 포럼에서 수집된 Writing Prompts(WP) 데이터셋 사용
  • Fan et al. (2018)이 수집한 데이터셋의 test split 활용
  • 데이터 정제 기준
    • 최소 800단어 이상의 인간 작성 스토리가 있는 프롬프트만 선택
    • 이는 프롬프트 자체가 더 긴 스토리라인을 제한하지 않도록 하기 위함
    • 테스트 세트의 평균 단어 수(675.75)보다 긴 스토리를 포함하기 위한 기준
    • 총 15,138개의 프롬프트-스토리 쌍 중 4,623개의 데이터 포인트 선택

Story Generation Method

  • 각 프롬프트에 대해
    1. 목표 기사 길이(800-900단어)를 저자 수(N)로 나누어 각 저자가 작성할 부분의 길이 계산
    2. 글쓰기 부담이 LLM 저자들 사이에 대략적으로 균등하게 분배되도록 함
    3. LLM authorship order의 다양한 permutation을 생성하여 모든 저자가 스토리의 임의 부분에 기여할 수 있도록 함
    4. 데이터셋이 LLM/저자와 스토리 섹션(예: 시작, 끝) 사이의 spurious correlation이 없도록 함

2. LLM Prompting

Prompt Templates

  • 각 N값에 대해 스토리 부분을 순차적으로 생성하기 위한 다양한 프롬프트 사용
  • 3가지 프롬프트 템플릿
    1. 시작 프롬프트: "You are a creative story writer. Write a story that starts with the prompt {starting prompt} in around {n} words. Do not add any instructions. Start the story as follows:"
    2. 중간 프롬프트: "Write {n} words to continue this storyline: {summary of story so far}. Continue from this sentence: {last sentence from previous part}"
    3. 마무리 프롬프트: "Write {n} words to conclude this storyline: {summary of story so far}. Do not add any instructions. Continue from this sentence: {last sentence from previous part}"

Prompt Improvements

  • 100개의 기사를 생성하고 검토하는 pilot study 진행
  • 첫 LLM은 원래 r/WritingPrompts 입력만 사용
  • 후속 부분에서는 더 긴 입력 프롬프트가 스토리 길이를 줄인다는 것을 발견
    • Falcon.ai summarizer를 사용하여 지금까지의 스토리를 80단어 미만으로 압축
    • LLM이 더 긴 시퀀스를 생성할 수 있도록 함
  • 부드러운 연속성을 위해 지금까지의 스토리에서 마지막 문장을 포함
  • 다른 섹션의 프롬프트는 스토리를 시작, 계속, 또는 결론짓는 지침에서만 차이가 있음

3. Post-processing and Filtering

  • Instruction-tuned LLM을 사용했지만 완벽하게 지시를 따르지는 않음
  • 목표 단어 수는 800-900단어였으나, 상한을 사용하여 각 LLM이 생성해야 하는 단어 수 계산
  • Pilot study에서 대부분의 LLM이 지시에서 목표 단어 수보다 적게 생성하는 경향을 발견
  • 적어도 한 부분이 50단어 미만인 모든 스토리를 필터링
  • 스토리에서 모든 여분의 공백과 드물게 지시사항의 반복을 제거

Dataset Analysis

Analysis Methods

  • TextDescriptives 라이브러리를 사용하여 다양한 지표 측정
    1. 단어 수(words)
    2. 문장 수(sentences)
    3. vocabulary richness
    4. percentage of stopwords
    5. readability scores
    6. entropy
    7. coherence scores
  • 창의성 측정을 위해 OCSAI(Open Creativity Scoring with Artificial Intelligence) 사용:
    • GPT-4로 fine-tuned된 인간 주석에 대한 텍스트 창의성 점수 제공
    • 인간 판단과의 높은 상관관계로 인해 semantic similarity에만 의존하는 다른 방법보다 더 신뢰할 수 있는 측정값
  • Wilcoxon signed-rank test(비모수적 방법) 사용:
    • 인간 작성 및 LLM 공동 작성 스토리 간의 텍스트 속성 차이 평가
    • 유의수준 p=0.05로 데이터의 비정규 분포 고려

Key Analysis Results

  1. Overall Quality Maintenance
    • 그림 2에서 보여주듯이, 대부분의 측정값에서 저자 수가 증가해도 품질에 유의미한 차이가 없음
    • 다중 LLM을 생성 설정에 도입해도 생성된 스토리의 품질을 저하시키지 않음
  2. Vocabulary Richness Differences
    • N∈[2, 3, 4]에서 vocabulary richness(type-token-ratio, TTR)에서만 인간 작성 스토리와 LLM 공동 작성 스토리 간에 통계적으로 유의미한 차이가 발견됨
    • 이는 열등한 성능으로 간주되어서는 안 됨
  3. Coherence and Creativity Interpretation
    • LLM 생성 스토리의 높은 coherence 점수는 LLM이 explicit logical flow와 sentence-level similarity를 강조하는 경향에서 비롯됨
    • 인간 스토리는 implicit connection, creative leap, 다양한 narrative structure 등 미묘한 storytelling 기법을 사용하는 경향이 있음
  4. Vocabulary Diversity Understanding
    • 인간 저자는 linguistic individuality 이론(Nini, 2023)에 따라 고유한 스타일과 인지적 선호도를 반영하는 선호 언어 단위 집합을 개발함
    • 스토리 작성 시 인간은 coherence, consistency 및 fluency를 유지하기 위해 제한된 어휘 세트를 사용하는 경향이 있음
    • AI 시스템은 더 넓고 덜 제한적인 lexicon을 활용함

Story Continuity Analysis

  • GPT-4o를 사용한 prompt-based evaluation:
    • 두 연속적인 스토리 부분이 잘 연결되는지 판단
    • 두 가지 유형의 스토리 부분 쌍
      1. "Correct" 또는 positive sample: 실제 다음 스토리 부분
      2. "Incorrect" 또는 negative sample: 다른 스토리 또는 같은 스토리에서 무작위로 선택된 부분(실제 연속 부분 아님)
  • 연속성 평가 결과
    1. 다른 스토리의 negative sample
      • Incorrect 부분이 이기는 경우가 0%
      • 예상된 결과로, 다른 스토리에 속하는 부분은 주제, 플롯 라인, 캐릭터 등이 다르기 때문에 불연속성 감지가 어렵지 않음
    2. 동일 스토리 내 negative sample
      • Incorrect 부분이 이기는 경우가 0%에서 9.67%로 증가
      • 두 후보 모두 유사한 평가(Neither Wins)가 30% 이상 증가
      • 'Neither Wins' 스토리 쌍의 85% 이상(166개 중 142개)이 두 후보 모두에 대해 연속적인 평가를 받음

Authorship Analysis

Four Main Tasks Analyzed

1. Task 1: Single vs Multi Author Detection

  • 목표: 스토리가 여러 저자에 의해 작성되었는지 판단
  • 결과: 저자 수(N)가 증가할수록 성능이 향상되었고, N=5일 때 가장 높은 성능을 보였다.

2. Task 2: Predict Number of Authors

  • 목표: 스토리 생성에 관여한 저자 수 예측
  • 결과: N=1인 경우는 상대적으로 쉽게 예측되었으나, 다중 저자 스토리에서는 BERT와 RoBERTa만이 다른 baseline보다 나은 성능을 보였다(F1 > 0.72).

3. Task 3: Authorship Verification

  • 목표: 두 연속 문장이 같은 저자에 의해 작성되었는지 예측
  • 결과: Transformer 기반 fine-tuned 방법이 이 태스크에서 우수한 성능을 보였다(F1 > 0.8).

4. Task 4: Authorship Attribution

  • 목표: 텍스트 기사의 정확한 저자 예측
  • 결과: N 값에 관계없이 attribution 성능이 낮았다(F1 0.6~0.75).

Comprehensive Analysis

  • 텍스트가 다중 저자인지 감지하는 것(태스크 1)과 두 연속 텍스트가 같은 저자의 작성인지 판단하는 것(태스크 3)은 상대적으로 쉬웠다.
  • 정확한 저자 수 예측(태스크 2)과 정확한 저자 식별(태스크 4)은 현재 기술로는 매우 어려운 과제로 밝혀졌다.

Conclusion

Research Achievements Summary

  • 'CollabStory'라는 최초의 LLM-LLM 협업 스토리 데이터셋을 제시했다.
  • LLM들이 sequential prompting을 통해 인간이 작성한 스토리와 비슷한 수준의 창의적인 스토리를 협업적으로 생성할 수 있음을 입증했다.
  • 다중 LLM authorship 관련 태스크 중 어떤 것이 가장 도전적인지 파악했다.

Reflections on LLM Writing Collaboration

  • LLM 지원 글쓰기의 발전은 authorship의 본질에 대한 근본적인 질문을 제기
    1. 이러한 상황에서 누가 진정한 창작의 원천인가?
    2. 관련된 모든 LLM에게 credit이 부여되어야 하는가?
    3. 프롬프트를 설계한 인간 개발자가 주요 저자로 인정받아야 하는가?
    4. 기여도에 따라 ownership이 달라져야 하는가?

Future Research Directions and Challenges

  • "Catch As Catch Can" 방법이 필요하다: 글 내에서 authorship이 변경되는 모든 지점을 찾고 각 segment를 특정 LLM에 귀속시킬 수 있어야 한다.
  • 더 많은 LLM이 접근하기 쉬워짐에 따라 두 가지 주요 위험이 존재
    • 악의적 행위자들이 다른 LLM의 텍스트를 결합하여 misinformation flaggers를 회피할 수 있다.
    • 학생들이 다른 LLM이 학술 논문의 다른 섹션을 작성하게 함으로써 credibility check를 우회할 수 있다.
profile
코리안코린이

0개의 댓글