
화자 수가 많을수록 의미 없는 발화 포함 가능성 ↑
명확한 정제가 필요:
ㅋㅋㅋ, ^^, <br>, \n 등 구어체 특유의 표현 처리✅ 정규표현식 기반 전처리 적극 활용 필요
✅ 불용어 사전 구축 + 형태소 분석 (ex. KoNLPy)
| 항목 | 설명 |
|---|---|
| 역번역 방식 | 대화 구조 깨짐 → 비추천 |
| 의미 없는 문장 증강 | 오히려 모델 성능 악화 |
| 증강 수량 | 최소 1000건 이상부터 효과 있음 |
`{ "topic": "택시 예약",
"dialogue": "...",
"instruction": "유사한 상황의 대화를 구어체로 생성하고 요약도 함께 작성해주세요.", "examples": [
{"dialogue": "...", "summary": "..."}
]
}
| 노이즈 유형 | 처리 방법 |
|---|---|
| HTML 태그 | 정규표현식 제거 |
반복 문자 (ㅋㅋ, ...) | 축약 or 제거 |
| 잘못된 줄바꿈 | 통합 or 구조화 |
| 불필요 감탄사, 이모티콘 | 불용어 사전 기반 제거 |
✅ 평가 지표는 형태소 단위 평가 → 전처리 퀄리티가 곧 점수와 직결
q, k, v, o) 모두 사용하는 것이 좋음예시:
Gold: the cat was under the bed,
Pred: under the bed there was the cat
→ ROUGE-1은 높지만 ROUGE-2/ROUGE-L은 낮을 수 있음
| 항목 | 실무 적용 팁 |
|---|---|
| 전처리 | 정규표현식 + 형태소 분석 필수 |
| 증강 | 토픽 기반 + few-shot LLM 추천 |
| 모델 | Solar + QLoRA 적절히 결합 |
| 클러스터링 | Sentence-BERT 임베딩으로 dialogue 주제 묶기 |
| 평가 | ROUGE 기반 + 형태소 단위 평가 고려 |