[논문 리뷰] ValueNet: A New Dataset for Human Value Driven Dialogue System

최동민·2025년 3월 22일

Paper review

목록 보기
6/15
  • value LLM 태초격 논문

Abstract

  • 인간처럼 가치 기반 대화를 하는 에이전트의 필요성
  • 대규모 인간 가치 데이터셋인 VALUENET
  • 21,374개의 텍스트 시나리오에 대한 인간의 태도를 포함
  • intercultural research에서의 기본 인간 가치 이론에 부합하는 10-dim으로 구성되어 있다.
  • 가치 모델에서 제공하는 보상을 활용하여 강화 학습을 통해 generative agent를 만듦으로써 PERSONA-CHAT에서 SOTA를 기록했다.
  • 가치를 추가적인 특성으로 활용하면 기존 감정 인식 모델이 문맥에서 이간의 감정을 더욱 풍부하게 포착할 수 있다 → EMPATHICDIALOGUES에서 성능 향상

Introduction

  • 한 개인의 가치 우선순위 또는 계층 구조는 태도, 신념, 특성에 깊은 영향을 미친다 (Schwartz, 2012).
  • 예를 들어, 로봇이 인간 가치를 인식하도록 설정된 경우, 제리에게 맥주를 마시자고 초대했을 때 제리가 “You know that is tempting but is not good for our fiteness” 라고 대답한다면, 이후 로봇은 제리가 자기 절제적인 생활 패턴을 선호한다고 이해하고 이후에는 방향을 조정한다.
  • 가치가 인간 EQ에서 근본적이고 중요한 역할을 하는데도 불구하고, lack of explicit modeling of values in the dialogue domain

VALUENET

  • curating a knowledge base of human values
  • 가치와 관련된 시나리오는 키워드 검색을 통해 식별되었다.
  • AMT를 통해 제공된 시나리오가 사람의 가치에 어떤 영향을 미치는지 조사
    • 가치가 우리의 태도에 기반하고 있으며, things을 평가하는 지침이라는 가정에 기반
    • 행동/사건이 우리가 가치 있게 여기는 목표의 달성을 촉진하면 +1 반대하면 -1
  • 21k samples

model

  • 가치 모델로부터의 보상을 사용한 강화학습으로 PERSONA-CHAT SOTA
  • incorporating values as additional features , 기존 모델의 감정 분류 정확도를 개선했다 in EMPATHETICDIALOUGES
  • 가치 모델의 시각화를 통해 사용자 프로필을 발화에서 수치적으로 모델링 할 수 있다? (?)

Contribution

  • presenting large-scale dataset VALUENET (well defined in intercultural research)
    • intercultural research Intercultural Research는 서로 다른 문화 간의 상호작용, 차이점, 유사점을 연구하는 학문 분야입니다. 주요 특징을 설명드리면:
      1. 연구 범위:
        • 서로 다른 문화권의 가치관, 관습, 의사소통 방식
        • 문화 간 비즈니스 관행과 협상 스타일
        • 문화적 정체성과 적응 과정
        • 다문화 환경에서의 갈등 해결 방법
      2. 연구 목적:
        • 문화 간 이해와 소통 증진
        • 글로벌 비즈니스 환경에서의 효과적인 협력 방안 모색
        • 다문화 사회의 통합과 발전 방안 연구
        • 문화적 다양성을 존중하는 정책과 제도 개발
  • value model learned from VALUENET → value-driven dialogue system
  • contributions to dialogue systems by incorporating the theory of human value

Theory of Human Value and Utility

  • Schwartz 10가지 기본 가치
    • 필요에 따라 더 세밀하거나 덜 세밀하게 구분 가능 (A refinement of the theory (Schwartz et al. 2012)
  • Utility (in economics) 는 만족의 척도로 정의되며, 모든 수준의 인간 활동을 주도한다고 본다.
    • 에이전트에게 사회적으로 지능적인 방식으로 말하고 행동하도록 가르칠 때, 인간 가치 유틸리티를 고려하는 접근 방식을 채택해야 한다.
    • 가치의 각 차원에 대한 유틸리티 함수를 학습한다.

Social Commonsense Benchmarks

  • ETHICS
    • 언어 모델의 도덕적 개념 지식 평가
  • SCRUPLES
    • 일상에서 윤리적 판단이 담긴 대규모 데이터셋
  • SOCIAL-CHEM-101
    • 일상적 사회 규범과 도덕적 판단을 연구하기 위한rules of thumbs?
  • SOCIAL IQA
    • 사회적 상황에 대한 상식적 추론
  • He at al.
    • 시나리오에서 선호되는 옵션을 예측하기 위한

Emotionally Intelligent Dialogue Datasets

  • DailyDialog
    • 화자의 감정 레이블 / multiturn
  • EmotionLines
    • 각 대화의 모든 발화에 감정 레이블
  • MELD is expansion of EmotionLines
  • SEMAINE
  • COSMIC
    • 대화에서 감정인식을 위해 mental states, events, actions, cause-effect relations
  • DialogRE
    • 사회적 관계 추론을 위한 최초의 인간 주석 대화 기반 데이터셋
  • PERSONA-CHAT
    • speaker의 자연어 프로필
    • Liu et al.(2020)은 인간 이해 모델리을 활용하여 개인화된 대화 생성 품질을 향상시키는 프레임워크
  • EMPATHETICDIALOGUES

The VALUENET Dataset

  • During decision-making, people tend to pick the choice that aligns more with their own values → 근거 찾기. 쓸만한 문장임
  • transferable knowledge base for human value modeling in natural language

Social Scenario Curation

  • curated a set of 21,374 social scenarios from the large scale social-related database SOCIAL-CHEM-101 (Forbes et al. 2020).
  • Value-related scenarios are retrieve with value keywords (어간 추출 및 표제어 처리) (키워드 기반 검색)
    • the keywords in the original definition of each value in Schwartz’s paper
    • words that share a similar meaning, words that are often used to describe the original keywords and words that are strongly associated with the original keywords (datamuse api?)
    • words that are near the original keywords in the GloVe embedding space?
    • → and then value keywords are verified and confirmed by humans as listed in Figure 2

Value-Aspect Attitude Annotation

  • peoples attitudes to the curated scenarios on AMT

  • select qualified workers and ensure the workers understand the concept of each value

  • Benevolence의 정의를 보여줬다. yes / no / unrelated 세가지 경우에 대한 example도 보여줬다

  • prerequestie question을 통과해야 본 서베이 할 수 있게 했다

  • two hidden qualification checking questions도 있다.

    • two ph.d students가 qualification questions by annotating a small subset of the curated scenarios 준비했다.
    • 그들의 질문이 worker selection survvey에 랜덤하게 들어갔다.
  • 더 많은 시나리오를 포함하는 가치 차원에서 worker selection process를 거쳤다?

  • 각 가치 차원에 대하여 가능한 한 데이ㅓㅌ의 균형을 맞추는게 목표였다?

  • 681명 참여해서 443명이 테스트를 통과했다. 각 시나리오는 4명의 작업자에게 할당되었다

    • inter annotator agreement is 64.9%
    • fleiss kappa score is 0.48
    • commonly agreed attitudes towards social scenarios, retain the samples with three or more
  • In other words, for people who appreciate a certain value, actions with a higher utility in this value dimension would be more desirable to them.

    • → 이게 무슨 뜻이지?
    • annotated labels를 numeric value로 환산했는데, 이게 각 scenario 마다 utility가 되는가?

Value Modeling

  • V(s) = [VSEC (s), VPOW (s), VACH (s), VHED (s), VSTI (s), VSD (s), VUNI (s) , VBEN (s), VCON (s), VTRA (s)].
  • regression model
  • BERT encoder에 regression head 씌우고 MSE로 훈련했다.
  • sigmoid 붙여서 -1 ~ 1로 나오게 했다.
  • recall, F1 score, accuracy

PERSONA-CHAT

  • 모델이 다음 발화 x_t^s를 예측하는 성능 평가
  • estimate generation distribution pθ (xst | hst , p)
  • Reward는 에이전트의 프로필과 발화가 가치 공간에서 얼마나 일치하는지를 촉진하도록 설계되었다.
  • 시스템의 발화의 밸류가 프로필의 밸류를 내적한 것이 reward
  • DialoGPT + Value model이 제일 잘했다.

EMPATHETIC DIALOGUES

emotion classification

  • 기존의 BERT cls + Value model cls concate 하고 affine 하고 emotion classification 학습했더니 더 잘하더라

Value profiling

  • “내 딸이 자신의 침대에서 자도록 강요한다”는 발화는 화자가 권력(Power)과 순응(Conformity)을 중요하게 여김을 시사합니다.

Conclusions

  • 사용자의 가치 선호도를 수치적으로 추정할 수 있는 새로운 방법을 제공함.
  • 인간 가치 기반 대화 시스템 구축

Ethical statement

  • 문화적 맥락과 언어적 다양성 같은 외부적 맥락이 부족하다는 한계가 있다.
  • 일부 시나리오는 문화 간에 높은 수준의 agreement를 가질 수 있지만, 다른 것들은 아닐 수도 있따.
  • 북미 지역의 영어 사용 문화를 대표로 하여 가치 모델링에 초점을 맞췄다. 시작 연구니까
profile
코리안코린이

0개의 댓글