[논문 리뷰] CollabStory: Multi-LLM Collaborative Story Generation and Authorship Analysis
Introduction
Motivation
- 생성형 대규모 언어 모델(LLM)은 현재 실생활에서 널리 사용되고 있으며 특히 글쓰기 작업에서 협업 도구로 활용되고 있다.
- 지금까지는 주로 인간-LLM 협업에 초점이 맞춰져 있었다.
- vLLM, LangChain, HuggingFace와 같은 unifying framework가 등장하면서 서로 다른 LLM들이 interoperable될 수 있게 되었다.
- 이로 인해 LLM들이 인간의 개입 없이도 서로 협력하여 작업을 수행할 수 있는 가능성이 열렸다.
- 특히 오픈소스 모델들은 이미 매월 10만 명 이상의 사용자가 활용하고 있어 이러한 협업이 즉시 가능한 상태다.
Novelty
- 지금까지 자동화된 글쓰기 도구들은 인간 작가와의 협업 또는 단일 LLM과의 협업으로만 사용되었다.
- 이 연구는 인간-LLM 협업을 넘어 여러 LLM이 함께 작업하는 다중 LLM 시나리오를 탐구한다.
- 연구진은 최초로 LLM만으로 생성된 협업 스토리 데이터셋인 'CollabStory'를 생성했다.
- 단일 저자(N=1)부터 다중 저자(최대 N=5)까지 다양한 시나리오를 분석했다.
- 오픈소스 instruction-tuned LLM들을 사용하여 32,000개 이상의 스토리를 생성했다.
Research Significance
- CollabStory는 여러 LLM의 사용을 식별하는 기술 개발을 촉진할 수 있는 최초의 자원이다.
- 이는 plagiarism detection, credit assignment, 교육 환경에서의 academic integrity 유지, copyright infringement 문제 해결 등의 측면에서 중요하다.
- 악의적 행위자가 여러 LLM의 텍스트를 한 문서에 조합하여 출처를 회피하고 허위 정보를 퍼뜨릴 가능성을 지적했다.
Methodology
1. CollabStory: Dataset Creation
Used LLM Models
- 5개의 오픈소스 LLM을 사용
- Llama2 (Touvron et al., 2023)
- Olmo (Groeneveld et al., 2024)
- Gemma (Team et al., 2024)
- Mistral (Jiang et al., 2023)
- Orca (Mukherjee et al., 2023)
Dataset Design Goals
- 서로 다른 출처(조직)의 LLM이 협업적으로 스토리라인을 작업하는 시나리오를 시뮬레이션
- 한 LLM에서 다음 LLM으로 스토리 컨트롤을 넘기는 방식으로 진행
- 데이터셋의 스토리는 저자/LLM 수에 따라 다양성을 가짐
- 단일 LLM이 전체 작성 (N=1)
- 2~5개의 LLM이 협업하여 작성 (N=2~5)
Prompt Sources
- Reddit의 r/WritingPrompts 포럼에서 수집된 Writing Prompts(WP) 데이터셋 사용
- Fan et al. (2018)이 수집한 데이터셋의 test split 활용
- 데이터 정제 기준
- 최소 800단어 이상의 인간 작성 스토리가 있는 프롬프트만 선택
- 이는 프롬프트 자체가 더 긴 스토리라인을 제한하지 않도록 하기 위함
- 테스트 세트의 평균 단어 수(675.75)보다 긴 스토리를 포함하기 위한 기준
- 총 15,138개의 프롬프트-스토리 쌍 중 4,623개의 데이터 포인트 선택
Story Generation Method
- 각 프롬프트에 대해
- 목표 기사 길이(800-900단어)를 저자 수(N)로 나누어 각 저자가 작성할 부분의 길이 계산
- 글쓰기 부담이 LLM 저자들 사이에 대략적으로 균등하게 분배되도록 함
- LLM authorship order의 다양한 permutation을 생성하여 모든 저자가 스토리의 임의 부분에 기여할 수 있도록 함
- 데이터셋이 LLM/저자와 스토리 섹션(예: 시작, 끝) 사이의 spurious correlation이 없도록 함
2. LLM Prompting
Prompt Templates
- 각 N값에 대해 스토리 부분을 순차적으로 생성하기 위한 다양한 프롬프트 사용
- 3가지 프롬프트 템플릿
- 시작 프롬프트: "You are a creative story writer. Write a story that starts with the prompt {starting prompt} in around {n} words. Do not add any instructions. Start the story as follows:"
- 중간 프롬프트: "Write {n} words to continue this storyline: {summary of story so far}. Continue from this sentence: {last sentence from previous part}"
- 마무리 프롬프트: "Write {n} words to conclude this storyline: {summary of story so far}. Do not add any instructions. Continue from this sentence: {last sentence from previous part}"
Prompt Improvements
- 100개의 기사를 생성하고 검토하는 pilot study 진행
- 첫 LLM은 원래 r/WritingPrompts 입력만 사용
- 후속 부분에서는 더 긴 입력 프롬프트가 스토리 길이를 줄인다는 것을 발견
- Falcon.ai summarizer를 사용하여 지금까지의 스토리를 80단어 미만으로 압축
- LLM이 더 긴 시퀀스를 생성할 수 있도록 함
- 부드러운 연속성을 위해 지금까지의 스토리에서 마지막 문장을 포함
- 다른 섹션의 프롬프트는 스토리를 시작, 계속, 또는 결론짓는 지침에서만 차이가 있음
3. Post-processing and Filtering
- Instruction-tuned LLM을 사용했지만 완벽하게 지시를 따르지는 않음
- 목표 단어 수는 800-900단어였으나, 상한을 사용하여 각 LLM이 생성해야 하는 단어 수 계산
- Pilot study에서 대부분의 LLM이 지시에서 목표 단어 수보다 적게 생성하는 경향을 발견
- 적어도 한 부분이 50단어 미만인 모든 스토리를 필터링
- 스토리에서 모든 여분의 공백과 드물게 지시사항의 반복을 제거
Dataset Analysis
Analysis Methods
- TextDescriptives 라이브러리를 사용하여 다양한 지표 측정
- 단어 수(words)
- 문장 수(sentences)
- vocabulary richness
- percentage of stopwords
- readability scores
- entropy
- coherence scores
- 창의성 측정을 위해 OCSAI(Open Creativity Scoring with Artificial Intelligence) 사용:
- GPT-4로 fine-tuned된 인간 주석에 대한 텍스트 창의성 점수 제공
- 인간 판단과의 높은 상관관계로 인해 semantic similarity에만 의존하는 다른 방법보다 더 신뢰할 수 있는 측정값
- Wilcoxon signed-rank test(비모수적 방법) 사용:
- 인간 작성 및 LLM 공동 작성 스토리 간의 텍스트 속성 차이 평가
- 유의수준 p=0.05로 데이터의 비정규 분포 고려
Key Analysis Results

- Overall Quality Maintenance
- 그림 2에서 보여주듯이, 대부분의 측정값에서 저자 수가 증가해도 품질에 유의미한 차이가 없음
- 다중 LLM을 생성 설정에 도입해도 생성된 스토리의 품질을 저하시키지 않음
- Vocabulary Richness Differences
- N∈[2, 3, 4]에서 vocabulary richness(type-token-ratio, TTR)에서만 인간 작성 스토리와 LLM 공동 작성 스토리 간에 통계적으로 유의미한 차이가 발견됨
- 이는 열등한 성능으로 간주되어서는 안 됨
- Coherence and Creativity Interpretation
- LLM 생성 스토리의 높은 coherence 점수는 LLM이 explicit logical flow와 sentence-level similarity를 강조하는 경향에서 비롯됨
- 인간 스토리는 implicit connection, creative leap, 다양한 narrative structure 등 미묘한 storytelling 기법을 사용하는 경향이 있음
- Vocabulary Diversity Understanding
- 인간 저자는 linguistic individuality 이론(Nini, 2023)에 따라 고유한 스타일과 인지적 선호도를 반영하는 선호 언어 단위 집합을 개발함
- 스토리 작성 시 인간은 coherence, consistency 및 fluency를 유지하기 위해 제한된 어휘 세트를 사용하는 경향이 있음
- AI 시스템은 더 넓고 덜 제한적인 lexicon을 활용함
Story Continuity Analysis
- GPT-4o를 사용한 prompt-based evaluation:
- 두 연속적인 스토리 부분이 잘 연결되는지 판단
- 두 가지 유형의 스토리 부분 쌍
- "Correct" 또는 positive sample: 실제 다음 스토리 부분
- "Incorrect" 또는 negative sample: 다른 스토리 또는 같은 스토리에서 무작위로 선택된 부분(실제 연속 부분 아님)
- 연속성 평가 결과
- 다른 스토리의 negative sample
- Incorrect 부분이 이기는 경우가 0%
- 예상된 결과로, 다른 스토리에 속하는 부분은 주제, 플롯 라인, 캐릭터 등이 다르기 때문에 불연속성 감지가 어렵지 않음
- 동일 스토리 내 negative sample
- Incorrect 부분이 이기는 경우가 0%에서 9.67%로 증가
- 두 후보 모두 유사한 평가(Neither Wins)가 30% 이상 증가
- 'Neither Wins' 스토리 쌍의 85% 이상(166개 중 142개)이 두 후보 모두에 대해 연속적인 평가를 받음
Authorship Analysis
Four Main Tasks Analyzed

1. Task 1: Single vs Multi Author Detection
- 목표: 스토리가 여러 저자에 의해 작성되었는지 판단
- 결과: 저자 수(N)가 증가할수록 성능이 향상되었고, N=5일 때 가장 높은 성능을 보였다.
2. Task 2: Predict Number of Authors
- 목표: 스토리 생성에 관여한 저자 수 예측
- 결과: N=1인 경우는 상대적으로 쉽게 예측되었으나, 다중 저자 스토리에서는 BERT와 RoBERTa만이 다른 baseline보다 나은 성능을 보였다(F1 > 0.72).
3. Task 3: Authorship Verification
- 목표: 두 연속 문장이 같은 저자에 의해 작성되었는지 예측
- 결과: Transformer 기반 fine-tuned 방법이 이 태스크에서 우수한 성능을 보였다(F1 > 0.8).
4. Task 4: Authorship Attribution
- 목표: 텍스트 기사의 정확한 저자 예측
- 결과: N 값에 관계없이 attribution 성능이 낮았다(F1 0.6~0.75).
Comprehensive Analysis
- 텍스트가 다중 저자인지 감지하는 것(태스크 1)과 두 연속 텍스트가 같은 저자의 작성인지 판단하는 것(태스크 3)은 상대적으로 쉬웠다.
- 정확한 저자 수 예측(태스크 2)과 정확한 저자 식별(태스크 4)은 현재 기술로는 매우 어려운 과제로 밝혀졌다.
Conclusion
Research Achievements Summary
- 'CollabStory'라는 최초의 LLM-LLM 협업 스토리 데이터셋을 제시했다.
- LLM들이 sequential prompting을 통해 인간이 작성한 스토리와 비슷한 수준의 창의적인 스토리를 협업적으로 생성할 수 있음을 입증했다.
- 다중 LLM authorship 관련 태스크 중 어떤 것이 가장 도전적인지 파악했다.
Reflections on LLM Writing Collaboration
- LLM 지원 글쓰기의 발전은 authorship의 본질에 대한 근본적인 질문을 제기
- 이러한 상황에서 누가 진정한 창작의 원천인가?
- 관련된 모든 LLM에게 credit이 부여되어야 하는가?
- 프롬프트를 설계한 인간 개발자가 주요 저자로 인정받아야 하는가?
- 기여도에 따라 ownership이 달라져야 하는가?
Future Research Directions and Challenges
- "Catch As Catch Can" 방법이 필요하다: 글 내에서 authorship이 변경되는 모든 지점을 찾고 각 segment를 특정 LLM에 귀속시킬 수 있어야 한다.
- 더 많은 LLM이 접근하기 쉬워짐에 따라 두 가지 주요 위험이 존재
- 악의적 행위자들이 다른 LLM의 텍스트를 결합하여 misinformation flaggers를 회피할 수 있다.
- 학생들이 다른 LLM이 학술 논문의 다른 섹션을 작성하게 함으로써 credibility check를 우회할 수 있다.