[논문 리뷰]THEANINE: Revisiting Memory Management in Long-term Conversations with Timeline-augmented Response Generation

서다연·2024년 7월 19일
post-thumbnail

1. 서론

선행 연구와의 차이점.

LLM들은 dialogue의 길이가 길어질 수록 병목 현상 때문에 메모리 검색의 성능이 떨어진다는 문제점이 있다. 따라서 많은 선행 연구들에서 메모리를 효과적으로 다루기 위한 방법들이 제시되고 있다.

하지만, 선행 연구들은 (1) 아예 잘못된 답을 생성하거나 (2) 페르소나에 위반되는 답변을 하였다.

선행 연구의 한계 해결 방법.

THEANINE이라는 방법론을 제안하였다.

THEANINE이란?
새로운 정보를 저장할 때 관련이 있는 것끼리 연결하는 방법으로, (1) temporal + (2) cause-effect를 이용하여 메모리를 다루는 방법을 제안하였다.

위의 방법을 이용하면 상위 k개만 검색하여 사용할 때도, 관련 사건의 전개를 모두 탐색하게 된다. 마지막으로, THEANINE이 현재 대화에 맞게 정보를 제공할 수 있도록 세부 조정한다.

Contribution

  1. Refine timelines.
  2. Conclude useful information.
  3. Generate the final response.

Refine timelines와 관련하여
장기 대화에서 THEANINE을 쓰면 G-Eval과 인간 평가에서 (1) 더 상세하고 (2) 과거 대화를 적절히 참조할 수 있었다.

Conclude useful information과 관련하여
TeaFarm이라는 데이터셋을 제안하였다. 반대 사실 기반 질문-응답 파이프라인이다. 과거 대화를 참조하는 시스템을 평가할 수 있는 데이터셋이다. 또한, 자동화된 평가가 가능하다.

Generate the final response와 관련하여
TeaFarm 평가를 위하여 MSC와 CC 데이터셋에서 각각 50개씩 원문 대화를 가져와서 활용하였다. GPT-4가 각 대화마다 2개의 반대 사실 기반 질문-응답 쌍을 생성하였다. 결과적으로 200쌍의 QA쌍을 생성하였다.


2. 제안한 방법

구조


그래프 refine 방법

THEANINE 구조

구조의 특징

노드(event, time)으로 이루어진 그래프 형태다.

대화가 끝날 때 session을 요약한 새로운 노드를 그래프에 추가한다. 이는 인간의 associative memories를 차용한 아이디어다. 새로운 노드와 관련 있는 상위 j개의 메모리를 집합으로 정의한다.

하지만, 위의 방법으로는 응답 생성에 별로 도움이 되지 않는 그래프가 만들어진다.

그래서 연구진들은 이벤트, 시간, 기존의 대화를 기반으로 관계를 정의하는 그래프를 만들었다.

하지만 위의 방법도 원하는 성과가 나오지 않았다.

따라서, 최근에 활성화 된 메모리만 연결하여 네트워크를 현성하는 방법을 제안하였다.

새로운 네트워크를 생성할 때 불필요한 것을 지우거나 중요한 것을 강조하였다. 하지만 이것을 가능하게 하는 방법에 대한 서술이 없다.

질문이 들어왔을 때, refine된 timeline을 이용하여 최종 답변을 생성한다.


3. 실험

대조군과 실험군의 차이

Baselines은 (1) Memory retrieval, (2) Memory update, (3) RSum-LLM, (4) MemoChat, (5) COMEDY다.

이 실험에서 사용된 데이터셋인 TeaFarm은 반대 사실 기반 질문-응답 데이터셋이다. '반대 사실'은 hallucination이 발생하기 쉽기 때문에 장기 대화를 평가하기에 적절하다고 생각한다.

TeaFarm

반대 사실 기반 질문-응답을 Stress-texting으로 평가하였다. 다음의 내용을 평가한다. (1) 디테일을 포함한 답변이 가능한가? (2) 과거의 일을 제대로 답변할 수 있는가? (3) 이용하는 단계가 적절한가? (4) 사람들이 평가하기에도 잘 하였는가?


4. 결과


MSC와 CC 데이터셋에 대한 평가다. THEANINE이 상대 모델보다 성능이 좋았던 비율을 나타낸 표다. RSum-LLM을 제외하고는 항상 보다 좋은 성능을 기록하였다. RSum-LLM이 긴 답변을 생성하는 경향이 있기 때문에 좋은 점수를 받았다고 해석하였다. 하지만, 디테일이 평가 항목인데 긴 답변을 생성한다고 좋은 점수를 받는다면 평가 지표의 허점이 될 수 있을 것이라고 생각한다.

TeaFarm 데이터셋에 대한 평가다. 각각의 지표에서 가장 좋은 성능을 보였다 하지만 MSC에서는 눈에 띄게 좋은 성능을 보인 것 같지는 않다. 하지만 이 결과에 의해서 Relation-aware Linking과 Timeline Refinement가 모두 필요한 것이라는 것을 알 수 있다.

profile
AI 전공. Story Generation, Agent 분야 논문을 주로 리뷰합니다. RAG도 조금 합니다.

0개의 댓글