Abstract
- Webis-ArgValues-22를 확장
- Touche-ValueEval
- 4780개 arguments → 9324 arguments
- six diverse source : 종교 텍스트, 커뮤니티 토론, 자유 텍스트 주장, 신문 사설, 정치적 토론
- 54개의 인간 가치로 3명의 크라우드 워커가 주석
1. Introduction
- 가치 우선순위의 차이는 사람들이 논쟁적인 주제에 대해 의견의 차이를 갖게 한다.
- 문화적 규범(Cutural Norms)은 가치 우선순위에 강한 영향을 미친다.
- incorporating value in computational linguistics
- 대규모 데이터셋을 활용한 가치에 대한 사회과학 연구를 촉진
- 논증을 문화적, 사회적 관점에서 평가
- 특정 대상 청중을 위해 논증을 생성하거나 선택
- 논쟁적 주제의 양측에서 상반되거나 공유된 가치를 식별하는 데 도움
- Webis-ArgValues-22의 5270개의 논증이 작다고 지적
- Args의 95%가 미국 배경에서 기인
- 동일한 taxonomy인데, 다양한 주제에서 더 많이 수집했다.
- 자유 텍스트 논증(IBM-ArgQ-Rank-30kArgs)
- 정치적 토론(Conference on the Future of Europe)
- 그룹 토론(Group Discussion Ideas)
- 커뮤니티 대화(Zhihu)
- 종교적 텍스트(Nahj al-Balagha)
- 신문 사설(The New York Times)
- 미국 배경 기인하지 않은 것을 20%까지 늘림
- SemEval 2023 Task 4: ValueEval의 “논증의 인간 가치 식별” 과제를 위해 수집 및 주석 처리
- 인간 가치에 대한 역사 조금 이야기 함. → 쓸만할 듯?
- cross-cutural analysis, Schwartz가 개인 및 사회의 보편적 요구를 기반으로 48개의 가치 질문 도출
- 논증에서 주장의 강도는 청중의 가치에 의해 형성된 선호도에 따라 달라질 수 있다.
- 가치 기반 논증 체계(value-based argumentation schemes)(van der Weide et al., 2009)
- 기각 가능 논리 프로그래밍(defeasible logic programming)(Teze et al., 2019)
- Bench-Capon(2003)의 가치 기반 논증 프레임워크
- ValueNet
- 21K scenario (SOCIAL-CHEM-101)
- 일상적인 상황들 포함
- 시나리오가 주어지고 시나리오에 대한 주관적인 평가가 주석으로 달림
- 그러나 Touche는 전제도 다룸? 가치와 설명을 연결하는 근본적인 전제를 명시적으로
3. Collecting Arguments
- 각 논증이 하나의 전제, 하나의 결론, 해당 전제가 결론에 찬성하는지 반대하는지를 나타내는 입장을 포함함

3.1. IBM-ArgQ-Rank-30kArgs
출처:
IBM-ArgQ-Rank-30kArgs는 크라우드워커들이 71개의 논쟁적 주제에 대해 작성한 30,497개의 논증으로 구성되어 있다.
각 논증은 크라우드워커들이 "고품질" 기준에 따라 평가했다.
수집 데이터:
Webis-ArgValues-22에서 5,020개의 논증을 가져왔으며, 추가로 2,999개의 새로운 논증을 포함했다.
다만 새로운 테스트 세트와 결론이 중복되는 Webis-ArgValues-22의 651개 논증은 제외했다.
수집 과정:
"고품질" 평가를 받은 전제들을 샘플링하고, 해당 주제를 결론으로 활용했다.
3.2. Conference on the Future of Europe
출처
Conference on the Future of Europe(CoFE)는 유럽의 미래 방향을 논의하기 위한 대화형 민주주의 플랫폼.
- 시민, 전문가, EU 기관이 참여하여 24개 언어로 제안을 제출하고 토론 가능.
- 사용자 간 지지 또는 반대 의견 표시와 공개적인 댓글 작성 및 응답 기능 제공.
데이터셋:
- 약 20,000개의 댓글과 4,200개의 제안을 포함.
- 댓글의 35%는 사용자가 스스로 의견을 표시, 6%는 전문가가 주석 추가.
수집 과정:
- CoFE 데이터셋에서 1,098개의 댓글을 431개의 논의에서 추출.
- 영어로 작성된 제안만 사용.
- 각 제안에서 결론과 전제를 수동으로 식별.
전처리:
- 논증이 Webis-ArgValues-22 데이터셋과 유사한 길이와 구조를 가지도록 수동으로 보장.
3.3. Group Discussion Ideas
우리는 Group Discussion Ideas 웹페이지에서 수집한 Webis-ArgValues-22 데이터셋의 “India” 부분에 해당하는 100개의 논증을 확장하여, 동일한 출처에서 299개의 새로운 논증을 추가했습니다.
출처:
이 웹사이트는 그룹 토론이나 논쟁에 필요한 지식을 독자들에게 제공하기 위해, 인도 뉴스에서 다룬 다양한 주제의 찬반 논점을 영어로 수집합니다.
데이터셋의 논증을 배포할 수 있도록 웹사이트로부터 허가를 받았습니다.
원래 데이터셋의 100개 논증은 웹사이트의 2021년 섹션에서 가져온 것이며, 새로운 299개 논증은 2022년의 모든 주제에서 수집되었습니다.
3.4. Zhihu
Webis-ArgValues-22 데이터셋에는 Zhihu에서 가져온 100개의 논증이 포함되어 있으며, 이는 데이터셋의 “China” 부분에 해당합니다. 우리는 이러한 논증을 Touché23-ValueEval 데이터셋에 그대로 통합했습니다.
출처
Zhihu는 중국의 질문-답변 플랫폼입니다. 논증은 추천 섹션과 핫리스트 섹션에서 가져왔습니다.
수집 과정
Kiesel et al.(2022)은 답변에서 주요 논점(전제와 결론)을 수동으로 식별하고 재구성했습니다.
전처리
Kiesel et al.(2022)은 이러한 핵심 논점을 영어로 자동 번역한 후, 번역 결과를 수동으로 검토하고 수정했습니다.
3.5. Nahj al-Balagha
출처:
- Nahj al-Balagha는 이슬람의 주요 원로 알리 이븐 아비 탈립의 설교, 서한, 격언을 담은 이슬람 종교 텍스트입니다.
- 이 텍스트는 원래 아랍어로 작성되었으며, 여러 언어로 번역되었습니다.
- 본 연구에서는 페르시아어(Farsi) 번역본을 활용했습니다.
수집 과정:
- 텍스트에서 302개의 전제를 수동으로 추출했습니다(181개는 원문 그대로, 121개는 요약본).
- 유사한 내용의 결론들을 통합하여 정리했습니다.
- 다양한 관점을 확보하기 위해 일부 진술은 결론에 반대되는 형태로 재구성했습니다.
- 모호한 23개의 항목을 제외한 후, 최종적으로 279개의 논증을 선정하여 주석 처리했습니다.
전처리:
- 페르시아어 텍스트를 영어로 자동 번역한 후, 원어민 검토를 통해 정확성을 확보했습니다.
The New York Times
The New York Times에서 발행된 사설에서 80개의 논증을 수집
출처
- The New York Times는 미국의 유명한 일간 신문
수집 과정
- 논증은 2020년 7월부터 2021년 5월 사이에 발행된 12개의 사설에서 추출되었습니다. 이 사설들은 적어도 하나의 다음 태그를 포함하고 있습니다: “coronavirus (2019-ncov)”, “vaccination and immunization”, 또는 “epidemics”.
- 세 명의 언어학적으로 훈련된 주석자가 논증 품질이 전반적으로 높은 사설을 선별했습니다.
전처리
- 전제, 결론, 입장(찬성 또는 반대)을 세 명의 주석자가 각 텍스트별로 수동으로 식별하고, 두 명의 언어학 전문가가 이를 검토했습니다. 최종적으로 특히 명확한 80개의 논증이 데이터셋에 포함되었습니다.
4. Crowdsourcing Value Annotations
- 54개의 level 1 values 각각에 대해 각 arg를 레이블링하는 yes/no 질문을 사용한다.
- 각 논증(문장 또는 텍스트)을 이러한 가치에 따라 레이블링하기 위해, 주석자에게 이 논증이 왜 좋았나요 라고 물어본다. because it is good to have wealth → 여기에 동의하냐 안하냐
- 4,780개의 새로운 논증에 대해 4780 x 54개의 yes/no 주석 작업이 이루어졌다.
- 주석자 간 일치도는 krippendorff’s alpha = 0.41 → 낮음
- 주석자간 동일한 답을 내지 못하는 경우에도 label만들어야 하니까 MACE 썼다.
- 우리는 MACE(Hovy et al., 2013)를 사용해 단일한 정답 데이터를 만들었습니다. 품질 보증을 위해, MACE가 융합 과정에서 낮은 신뢰도를 보고한 Nahj al-Balagha와 The New York Times 같은 복잡한 출처의 논증에 대한 모든 주석을 검토했습니다. 검토 과정에서는 인간 가치를 전문으로 하는 연구진 중 한 명이 주석자 간 의견이 불일치한 727개의 논증을 수동으로 검토했습니다.

5. Analysis
- text statistics
- value stats
6. Baseline Experiments
- 논증이 주어지면 그에 관련된 인간 가치를 식별하는 multi-label classification
7. Conclusion
8. Ethics
이 연구에서는 Kiesel et al.(2022)의 연구와 비교해 다양한 논증 출처를 활용했지만, 데이터셋이 모든 인간 논증을 대표한다고 할 수는 없습니다. 다양한 텍스트를 포함하려고 시도했지만, 이는 문화적 뉘앙스를 완전히 반영하지 못할 수 있으며, 소스 간 분류 강건성을 측정하는 벤치마크로 사용됩니다.
문화적 포괄성을 보장하기 위해 수십 년 동안 여러 문화에서 테스트된 보편적 가치 분류 체계를 사용했습니다. 그러나 주석 작업은 서구권 주석자들에 의해 수행되어, 다른 문화에서 텍스트에 암시된 가치를 잘못 해석할 위험이 있습니다.