대회 내용
Dialogue Summarization | 일상 대화 요약
Team
팀장, EDA&전처리, BART, T5 모델링
팀원1, BERT, T5기반 토크나이즈, 클러스터링
팀원2, 전처리, BART/T5 모델링
팀원3, LLM Few-Shot learning
팀원4, 데이터 기계번역 모델링
0. Overview
Environment
- AMD Ryzen Threadripper 3960X 24-Core Processor
- NVIDIA GeForce RTX 3090
- CUDA Version 12.2
1. Competiton Info
Introduce
Dialogue Summarization 경진대회는 주어진 데이터를 활용하여 일상 대화에 대한 요약을 효과적으로 생성하는 모델을 개발하는 대회입니다.
일상생활에서 대화는 항상 이루어지고 있습니다. 회의나 토의는 물론이고, 사소한 일상 대화 중에도 서로 다양한 주제와 입장들을 주고 받습니다. 나누는 대화를 녹음해두더라도 대화 전체를 항상 다시 들을 수는 없기 때문에 요약이 필요하고, 이를 위한 통화 비서와 같은 서비스들도 등장하고 있습니다.
우리는 이번 대회에서 일상 대화를 바탕으로 요약문을 생성하는 모델을 구축합니다!

Timeline
- August 29, 2024 ~ September 10, 2024
2. Data descrption
Dataset overview
-
train.csv & dev.csv
- Column Name : fname, dialouge, summary, topic
- fname : Data Index
- dialouge : 2~7인 대화문
- summary : dialouge 요약문
- topic : 대화문의 주제
-
test.csv
- Column Name : fname, dialouge
- fname : Data Index
- dialouge : 2~7인 대화문
EDA & Data Processing
1. 오타 수정
배경ㅇ로 → 배경으로
너는 아직ㅍ알맞는 → 너는 아직 알맞는
등등...
2. 제대로 작성되지 않은 Topic
일부 데이터의 Topic이 제대로 작성되지 않은 경우가 있었다. 이를 수정하기 위해 대화문을 통해 Topic을 추론하여 수정하였다.

3. 괄호로 감싸진 대화문 전체 제거
제거하는 이유 : 괄호로 감싸진 대화문을 제거해도 대화에 전혀 이질감이 느껴지지 않고 자연스러을 유지했다.
오타만 수정한 데이터와 오타 + 괄호 제거한 데이터를 성능 비교했을 때 괄호로 감싸진 대화문을 제거한 데이터가 성능이 좋았다.

4. Modeling
Model descrition
구분1
Dialogues 데이터 수치형 변환

구분2
가설1. 입출력의 길이를 늘리면 성능이 좋아질 것이다.

가설2. 학습률을 늘리면 성능이 좋아질 것이다.

가설3. 학습률 스케줄러 유형을 변경하면 성능이 좋아질 것이다.

가설4. T5 모델중 Large모델링을 하면 성능이 대폭 상승할 것이다.

구분3
BART계열 모델 테스트
bart%E1%84%80%E1%85%A8%E1%84%8B%E1%85%A7%E1%86%AF.png?raw=true)
num_beam 파라미터 수정
num_beam.png?raw=true)
learning_rate 파라미터 수정
lr.png?raw=true)
구분4
few shot learning이란?
LLM에게 몇 가지 예시를 제공하여 학습하는 방법입니다.
새로운 작업에 빠르게 적응해야 하거나 학습 데이터가 부족한 상황에서 특히 유용합니다. 또한, LLM을 특정 분야나 스타일에 맞춰 미세 조정하는 데에도 활용될 수 있습니다.
실험내용
- 목표: test 데이터와 가장 유사한 train 데이터를 검색 후 few shot learning을 통한 성능 비교


- 첫번째 이미지
- 검색 모델: bge-m3
- 다국어 문서 검색 데이터셋 MIRACL에서 가장 뛰어난 한국어 성능
- 두번째 이미지
- LLM: rtzr/ko-gemma-2-9b-it
- 한국어 언어모델 다분야 사고력 벤치마크 LogicKor에서 오프소스 모델 중 10B이하 가장 높은 순위
결론
- test 데이터와 유사한 train 데이터를 검색 후 예시로 넣어 few shot learning을 하였을 때 가장 좋은 결과 나타남
- 전체적으로 보았을 때 좋은 점수는 아니지만, llm에서 의도하는 데이터를 통해 few shot learning을 적용했을 때 효과 확인
구분5
아이디어
- Train Dataset과 Test Dataset이 영어를 번역한 번역체라는 점으로 미루어 보았을 때 원문이 영어일 가능성
- 원문이 영어였다면 영어로 학습시키면 좀 더 좋은 성능을 가져올 수 있지 않을까?
- 따라서 모든 Train 및 Test 데이터를 영어로 번역, 영어 모델을 사용하여 Output 생성 후 다시 한글로 번역?
실험순서
- Train 및 Tset 데이터를 한국어에서 영어로 번역
- 영어 모델 선정 및 코드 수정
- 해당 모델로 생성된 Output을 다시 한국어로 번역하여 제출
LLM 영어 모델 선정
- Bart, T5, Pegasus
- Bart : baseline에서 주어진 모델 또한 Bart에서 파생되어 1순위로 선정
- T5 : 팀원이 좋은 성능을 이끌어낸 모델로 2순위 선정
- Pegasus : Translator가 Google인 점, 다만 논문, 뉴스 기사 등 긴 글에 특화된 점으로 3순위 선정