Improving the Generalizability of Depression Detection by Leveraging Clinical Questionnaires

Eun·2023년 1월 2일

임상 설문지를 활용하여 우울증 감지의 일반화 가능성 향상

Abstract

Automated method를 이용하여 SNS와 같은 다양한 information source에서 mental health condition을 식별하고 분석해왔습니다.

하지만, real-world healthcare application에 적용하기에는
1. Poor out-of-domain generalization
2. Lack of trust in black box model
위 두 가지의 challenge에 부딪히게 됩니다.

In this work,
PHQ에 표기된 증상의 존재(유무)를 사용해 다른 degree로 constrain 되는 depression dection 하는 방법을 제안합니다.

PHQ란 depression screening process에서 사용되는 questionnaire (설문지) 입니다.

세 개의 social media dataset에 대한 dataset-transfer 실험을 했을 때, PHQ9's symptoms를 grounding the model 한 것이 standard BERT-based approach에 비해 out-of-distribution data에서 generalize 능력이 크게 향상되는 것을 발견했습니다.
-> grounding the model in PHQ9's symptoms이 정확하게 무슨 뜻이지

또한, in-domain data에서도 경쟁력 있는 performance를 보입니다.

Qualitative analyses는 grounding model predictions in clinically-relevant symptoms가 inspect(검사)가 쉬운 모델을 producing함과 동시에 generalizability improve를 시사합니다.

1. Introduction

PHQ에 있는 질문에 해당하는 9가지 증상 감지 모델 개발

질문은 환자가 9개의 증상 그룹에서 얼마나 자주 증상을 경험했는지 묻습니다.
질문 예시) how often have you had “little interest/pleasure in doing things?”

(정신 건강 전문가들의 관점에서) 장점 1. PHQ와 같은 trusted diagnostic tool을 사용함으로서 black box 모델보다 신뢰할 수 있다.

장점 2 spurious shortcut을 사용하는 능력을 제한하기 때문에 generalize 능력이 향상된다.
-> spurious shortcut이 뭘까요?

This strategy is complementary to strategies for reducing temporal and topical artifacts.
-> temporal and topical artifacts 시간적 국소적 산출물???

Questionnaire model & Depression dection model

논문에서 제안한 approach에는 PHQ의 증상을 감지하는 questionnaire model(QM)과 depression dection model(DM)로 구성됩니다.

Spectrum의 한 쪽 끝에서

  • QM은 manually-defined patterns만을 사용
  • DM은 user의 post에서 pattern의 등장 횟수를 세어 classification decision 결정

반대쪽 spectrum의 끝에서는

  • 명시적인 QM 없음
  • BERT가 unconstrained DM 역할

두 spectrum의 사이에 QM을 relex

  • manually-defined patterns을 사용하여 BERT based symptom classifier를 학습
  • count보다는 symptom representation을 고려
  • extra trainable 'other' symptom을 추가
    -> relex가 무슨 의미일까

constrained model이 standard unconstrained BERT보다 더 나은 성능을 발휘하고 특정 post의 관련 증상에서 해석 가능한 모델을 추가로 제공한다는 것을 발견했습니다.

Contributions
1) PHQ의 증상을 식별하기 위한 comprehensive pattern sets와 이를 사용하여 weakly-supervised symptom classifiers를 훈련하기 위한 heuristics
2) 이러한 symptom을 기반으로한 depression detection을 수행하기 위한 progressively less constrained 방법의 범위
3) depression detection 방법의 extensive evaluation

2.Related Work

to be continue...

3. Methodology

3.1 Pattern-based methods

본 논문에서 제시하는 method는 QM과 DM, 두 개의 components로 decompsed 되어 있습니다.

Questionnaire model

pattern-based methods의 questionnaire model은 각 user post를 symptom 패턴과 일치시키는 pattern matcher입니다.
이 모델은 binary pattern을 생성합니다.
i번째 post와 j번째 symptom(question)이 일치하면 (i,j)가 1인 matrix입니다.
matrix의 size는 num_post x 9입니다.
9는 symptom 종류 수

Depression model

QM에서 이전에 생성한 pattern matching matrix를 input으로 하는
depression model의 두 variation을 구현합니다.
1) Count-based approach
Matrix에서 발견된 pattern 수가 threshold를 넘는지만 고려합니다.
2) CNN approach
Matrix 위에 linear layer로 CNN kernel을 적용합니다.
이 방법을 사용하면 consecutive post에 다른 가중치를 부여할 수 있습니다.
-> consecutive post: (연속적인) 다음 게시물?

3.2 Classifier-constrained methods

3.2.1 PHQ

Pattern-based classifier의 한 가지 단점은 패턴 매칭의 유연성(inflexibility)입니다.
Classifier-constrained method는 weakly-supervised data에 대한 QM을 훈련하여 pattern-matching requirement를 완화합니다.

  • weakly-supervised data는 4.1에서 설명

이 방법은 clinical questionnaire를 기반으로 하는 것을 유지하면서도 pattern sets를 넘어 일반화할 수 있는 모델을 생성합니다.

PHQ9 architecture 또한 QM과 DM으로 구성됩니다.

Questionnaire model

QM은 모든 게시물의 BERT torken embedding을 받고 PHQ의 각 질문에 대한 답(positive or negative)을 예측하도록 훈련됩니다.
이 모델은 9개의 symptom classifier로 구성됩니다.
: questionnaire의 9개 문항에 해당하는 anhedonia, concen- tration, eating, fatigue, mood, psychomotor, self- esteem, self-harm and sleep
: (무호흡, 집중, 식사, 피로, 기분, 정신운동, 자존감, 자해, 수면)
각 symptom classifier는 상단에 linear layer가 있는 CNN classifier 입니다.

Figer 1에서 보이는 것처럼 모든 symptom classifier는 weakly-labeled data로 개별적으로 학습됩니다.

  • 4.2에서 자세한 설명

QM의 unseen pattern으로 일반화하는 능력은 두 개의 source에서 비롯됩니다.
1) BERT embedding
2) Weakly-labeled symptom data

Depression model

DM은 각 게시물에 대한 QM output을 기반으로 사용자의 depressed 여부를 예측합니다.
QM 모델의 output은 두 가지로 쓰일 수 있습니다.
1) 최종 question (symptom) score

  • 각 post를 size가 9인 single vector로 나타냄
  • compact하지만 정보량이 적음

2) 9개 sub model의 hidden layer (symptom vectors)

  • 각 post를 hidden size x 9인 matrix로 나타냄
  • 더 많은 정보를 보존

모든 classification architecture를 DM에 사용할 수 있습니다.
단순성을 위해 다양한 size의 CNN kernel에서 추출한 feature 위에 linear classifier를 사용합니다.

CNN kernel은 timestamp 별로 정렬된 연속 게시물의 sliding window 내에서 symptom을 요약하는데 도움이 됩니다.
PHQ instrument가 고려하는 two-week window의 relaxation입니다.
-> 이게 무슨 뜻인가용? PHQ에서 2주동안 겪은 증상을 기반으로 진단하는데 커널이 요약하는 효과를 냄으로써 비슷한 역할을 한다...?

이러한 relaxation을 통해 각 CNN kernel에서 더 많은 게시물을 고려할 수 있으며, two-week window 접근법의 data sparsity 문제를 완화합니다.

DM은 user-level depression label을 사용하여 훈련되고, 훈련되는 동안 encoder와 questionnaire component는 동결됩니다.
가중치를 동결함으로써 모델이 symptom을 탐지하는 원래 목적에서 벗어나지 않도록 합니다.

3.2.2 PHQ9Plus

PHQ9Plus는 PHQ에 추가 symptom(neuron)을 추가하여 PHQ 방법을 확장합니다.
Neuron은 post embedding에 연결되고 모든 post의 점수를 생성합니다.
PHQ 증상과 유사한 다른 신호를 학습하기 위해 end-to-end로 훈련할 수 있는 추가 neuron을 만듭니다.
이를 통해 PHQ9Plus는 PHQ 증상 외에 다른 depressive signal을 학습할 수 있습니다.
하지만, 일반화 능력을 낮추는 위험도 발생할 수 있습니다.

3.3 Unconstrained method (BERT baseline)

이전의 classifier-constrained method에서 depression 분류는 symptom의 존재 여부를 결정하는 QM모델에 의해 제한됩니다.
이것은 모델의 일반화를 개선하기 위한 information bottleneck입니다.
bottleneck의 영향을 정량화 하기 위해 BERT encoder만으로 QM을 대체하는 unconstrained model도 고려합니다.
이 방식은 raw BERT embedding에 접근 할 수 있으므로 QM에 의해 포착된 것보다 더 많은 신호를 활용할 수 있습니다.
그래서 약간의 성능 향상을 보입니다.
-> 맞게 이해한건가욤? (This gives a loose up- per bound on the classifier-constrained methods’s performance since this approach has access to the raw BERT embeddings and thus can utilize more signals (even spurious ones) than those captured by the questionnaire model.)

4. Experiments

세 가지 dataset에 대해 실험을 수행합니다.
모두 Reddit 데이터로 구성되지만 서로 다른 construction methodology로 구성됩니다.

  • self-report statement을 기반으로 depressed user 식별
  • support subreddit의 thread 시작을 기반으로 depressed user 식별

1) RSDD
: Reddit Self-reported Depression Diagnosis
Reddit post로 구성되었고 9,000명의 self-reported diagnosed user와 1,000명의 matched control user를 포함합니다.

2) eRisk20
214명의 depressed user와 인터넷에서 조기 위험 탐지의 효과를 평가하기 위해 큐레이션된 1,493명의 control user data입니다.
Depressed user group은 self-report를 기반으로 수집되었고 mental health subreddit은 제외되지 않았습니다.
훈련 세트의 크기가 작기 때문에 딥러닝 접근법이 불안정했고, 더 많은 데이터를 훈련하기 위해 데이터 세트를 다시 분할했습니다.

3) TRT
: Topic-Restricted-Text
위의 두 dataset과는 다르게 TRT는 community participation을 기반으로 구성되었습니다.
Depressed user는 depression subreddit에서 추출되었고, control user는 AskReddit subreddit에서 샘플링되었습니다.
Depressed user 6,805명과 control user 57,155명이 포함되었습니다.

Positive class (diagnosed)의 F1 score와 AUC (area under the receiver operating characteristic curve)를 성능 지표로 삼았습니다.

4.2 Questionnaire dataset

QM은 post에 PHQ symptom이 포함되어 있는지(positive)를 분류합니다.
이 task에 대한 훈련 데이터가 부족했기 때문에, regular expression pattern과 heuristic을 수집하여 각 증상에 대해 weakly-supervised training data를 구성했습니다.
이 데이터는 훈련에만 사용됩니다.

4.2.1 Positive class

각 question에 대해 positive symptom pattern set을 준비합니다.
각 pattern set는 127개의 mental-health subreddit에서 수집된 post와 일치합니다. 또한, SMHD dataset도 포함합니다.

  • SMHD: Self-reported Mental Health Diagnoses
  • A novel large dataset of social media posts from users with one or multiple mental health conditions along with matched control users.

Labeling step에서 symptom pattern이 포함된 post를 positive로 선택합니다.
Pattern matching은 빠르고 transparent하지만 False positive(FP)를 생성할 수 있습니다.

4가지 유형의 FP를 제거하기 위해 추가적인 heuristic을 사용했습니다.
1) Positive sentiment
Symptom pattern을 포함하지만 positive/happy sentiment 감정을 전달하는 게시물
2) Conditional clause
경험이 아닌 symptom hypothesis를 설명하는 게시물
3) Thrid-person pronouns
user가 겪고 있는 증상에 대해 설명하는 것이 아닌 다른 사람의 증상에 대해 토론하는 게시물
4) Negation
Symptom pattern 앞에 부정 단어(not, never 등)가 있는 게시물

4.2.2 Negative class

Hard negative samples를 식별하기 위해 다섯가지 heurisitc을 사용하여 각 symptom의 negative 예시를 식별합니다.
1) Keywords
Postivie pattern과 관련된 키워드가 포함되어 있지만 일치하지 않는 게시물
ex) sleep은 can't sleep과 일치하지 않음
2) Pronouns
Positive한 예시에서 1인칭 대명사를 3인칭 대명사로 대체하여 합성된 게시물
3) Other symptoms
다른 symptom의 postive한 예시에서 무작위로 샘플링된 post,
현재 symptom과 pattern이 일치하지 않음
4) Negation
Positive한 예시에서 symptom pattern을 부정하여 합성된 게시물
ex) tired -> never tired
5) Positive sentiment
Sentiment140라는 감정 분석 말뭉치에서 neutral 또는 positive class에서 샘플링된 post

4.3 Experiment setup

4.4 Depression detection results

Dataset-transfer의 depression detection result evaluation은 검정색 블록에 있습니다.
Unconstrained method는 유연성을 지녔으며, training corpus 이상의 좋지 못한 일반화를 불러올 수 있습니다.
-> 일반화가 너무 잘돼면 모델 성능이 저하된다는 뜻인가요?

Dataset-transfer가 아닌 경우 모두 unconstrained method가 제일 좋은 성능(AUC)을 보였습니다.
Dataset-transfer인 경우 전반적으로 PHQ9이 좋은 성능을 보였습니다.

추가 neuron은 in-domain에서 상당한 contribute를 합니다.
PHQ9Plus는 대부분의 세팅에서 BERT보다 더 나은 성능을 보입니다.

4.5 Symptom detection results

Weakly supervised QM의 성능을 측정하기 위해 세 명의 annotator가 수동으로 label을 지정한 900개의 sample data를 추가로 준비했습니다.
Test set에서 평가한 결과는 Table 4에 나와 있습니다.

전반적으로 좋은 성능을 보였습니다.
Concentration, eating, self-harm 에서는 좋은 성능을 보이는 반면, anhedonia, mood, fatigue에서는 낮은 F1 score를 보였습니다.
F1 점수가 annotator의 agreement와 positively correlate 경향을 보인다는 것을 발견했습니다.
Anhedonia, fatigue에서는 텍스트의 모호성 때문에 낮은 점수를 보일 수 있습니다.
평범한 나쁜 기분과 우울한 기분을 구분하는 것이 어렵기 때문입니다.
또한, post가 구체적인 맥락일 때 symptom-like language를 사용하는 잘못된 예측이 발생합니다.
ex) I completely lost my interest in him.
I can't concentrate on that movie.
이런 표현은 증상을 뜻하지 않을 수 있지만, 재발하는 경우가 중요합니다.

4.6 Do symptom classifiers generalize?

Symptom classifier가 pattern matching을 넘어 generalize할 수 있는지를 조사하기 위해 실험을 해보았습니다.
각 pattern set를 두 개의 중복되지 않는 그룹(g1, g2)으로 분할합니다.
Pattern 분포가 고르지 않기 때문에 결과 부분 집합이 불균형을 이루는 경우가 있습니다.
train on g1 & test on g2, train on g2 & test on g1으로 symptom classifier를 평가합니다.

두 가지 조건에서 모두 높은 F1 score를 보였습니다.
Concentraion이나 Mood 같은 경우 작은 coverage였음에도 좋은 성능을 보였습니다.
이 실험을 통해 symptom classifier가 함께 학습된 특정 pattern을 넘어 일반화가 가능하다는 것을 알 수 있습니다.

4.7 Effect of labeling methods


정신 건강 하위 레딧에서 얻은 데이터는 SMHD의 더 일반적인 게시물보다 효과에 더 많은 영향을 미칩니다.
따라서 패턴 매칭은 FP case를 줄이고 증상을 더 촘촘하게 반환하여 더 나은 품질의 훈련 데이터를 산출합니다.

4.8 Contributionn of PHQ9 symptoms

우울증 감지에 대한 Symptoms의 기여도를 측정하기 위해 모델에서 각 증상을 제거하고 F1 score의 하락을 확인했습니다.

Self-harm, fatigue, anhedonia가 가장 강력한 우울증 지표임을 알 수 있습니다.

4.9 Comparison with Few-shot Learner

Classifier-constrained method와 GPT를 비교했습니다.

GPT-3에 한 데이터 세트(예: TRT)의 각 (T, F) 클래스에 대해 네 가지 예를 제시하고 다른 데이터 세트(예: RSD, eRisk)에 대해 평가했습니다. GPT-3의 비용이 크기 때문에 각 클래스에 대해 100개씩의 데이터를 사용했습니다.
표 7을 보면 큰 차이로 PHQ9 모델이 더 좋은 성능을 보입니다.
우울증 감지가 대규모 퓨샷 학습자에게 여전히 어렵다는 것을 보여주며, 일반화 가능한 방법에 대한 우리의 기여를 더욱 강조합니다.
그러나 이 설정에는 완전히 공정한 비교를 방해하는 몇 가지 한계가 있습니다.

5. Case study

모든 모델은 매우 높은 신뢰도로 정확한 라벨을 제작할 수 있습니다. 그러나 모델이 예측을 위해 주로 의존하는 게시물에는 분명한 차이가 있습니다.
PHQ9의 post들은 증상이 명확하기 때문에 정신 건강 전문가들은 환자의 상황을 빠르게 이해하고 추가적인 결정을 내릴 수 있었습니다.
PHQ9Plus와 BERT는 관련성은 있지만 증상을 직접 언급하지 않기 때문에 해석하기가 더 어렵습니다. 또한, TRT 훈련 데이터 세트에서, 제어 사용자의 편향된 선택으로 인해, 이러한 삶의 우려/불만은 우울한 사용자를 제어 사용자와 효과적으로 구별하는 shortcut을 형성할 수 있습니다.
그러나 현실의 데이터들은 이러한 shortcut이 일반화되지 않기 때문에 PHQ9Plus와 BERT의 신뢰도가 떨어지게 됩니다.

6. Conclusion

본 연구에서, 우리는 PHQ9 증상의 존재에 의해 제한되는 다양한 우울 감지 방법을 제안합니다.
세 가지 데이터 세트에 대한 실험에서, 우리는 이러한 방법이 강력한 baseline에 비해 잘 수행되는 동시에 유사한 데이터 세트로 더 잘 일반화된다는 것을 발견했습니다.
이는 PHQ9에서 depression predictions을 grounding하면 depression detection의 일반화 가능성과 모델의 해석 가능성을 향상시킬 수 있음을 증명합니다.
본 연구는 depression detection에만 초점을 맞추고 있지만, 모델을 관련 원인만을 고려하도록 제한하는 아이디어는 diagnostic questionnaires를 통한 다른 정신 건강 상태의 detection을 포함하여 더 광범위한 작업에 적용될 수 있습니다.

profile
A-I Can do anything

0개의 댓글