이 글에서는 학술 대회의 주제와 상응하는 논문을 리뷰해보고자 합니다.
1차적으로는 이 논문에서 input으로 넣어준 데이터 형태를 파악하는데 집중하여 논문을 읽어보기로 했습니다.
"at-risk"(이탈 위험이 있는) 학생을 식별하는 것은 중요한 과제입니다. 이 논문에서는 이를 위해 Cox 비례 위험 모델을 사용하여 생존분석 프레임워크를 디벨롭하였습니다.
또한, 시간에 따라 변화하는 요인을 포착하고 이러한 정보를 활용하여 보다 정확히 예측할 수 있는 시간 의존적 Cox(TD-Cox)를 적용했습니다.
인구통계학적 정보, 가족 배경, 재정 상황, 고등학교 정보, 대학 등록 상태, 학기별 학점 등의 변수를 사용합니다.
이 연구를 통해 우선순위에 따라 사전 예방적 교육을 수행할 수 있습니다.
연구 배경 설명 후, 유지율을 정의합니다.
여기서 유지율은 한 학기를 마친 후 다음 학기에 같은 대학에 다시 재등록하는 학생의 비율입니다.
학생 이탈은 갑작스러운 이벤트가 아니라 시간에 따라 완전히 달라지는 긴 과정입니다. 따라서 이를 종단적 문제로 정의하고 정교한 종단적 데이터 분석 기법을 사용하여 문제를 모델링하는 것이 적절합니다.
** 종단 연구: 동일한 연구 대상을 오랜 기간 추적 관찰하는 연구
의료, 공학 등 다른 영역에서 생존분석이 성공했음에도, 학생 유지율 문제에 이러한 방법을 사용하려는 시도는 제한적이었습니다.
이 논문에서는 censored 정보가 존재하는 상황에서 등록 전 정보와 학기 전 정보를 사용하는 생존분석을 제안합니다.
Cox와 TD-Cox를 구현하여 이를 모델링합니다.
이전에 이 문제를 해결하기 위해 로지스틱 회귀, 회귀 트리를 사용했습니다.
인공신경망도 개발되었음을 이야기합니다.
생존분석 기법도 언급하며, 이 논문에서는 학생 데이터에 생존 알고리즘을 심층적으로 적용하고 그 결과를 다른 통계 및 머신러닝 기법과 비교했다고 말합니다.
논문의 용어 정리를 해볼까요?

Dropout Student : 한 학기에 등록하지 않거나 GPA가 0점인 학생
Event : 졸업 전 중퇴한 학생
Censored : 학생이 처음 6학기 또는 특정 시점까지 중퇴하지 않은 경우
time t에서 데이터셋은 다음과 같습니다.
, censored 데이터이고, 1이면 uncensored 데이터입니다.

이 그림에서 A, B, D는 uncensored, 중퇴한 학생이고, C, E는 censored 데이터가 됩니다.
생존함수는 다음과 같이 정의됩니다.


또한, h(t)는 t시간 이후의 생존을 조건으로 하는 시점의 이벤트 발생률입니다.
Cox regression 모델은 일반적인 모수적 방법에 비해 가정이 적은 반모수적 기법으로, baseline 위험함수에 대한 가정을 하지 않습니다.
Cox proportional hazard 모델에서 위험함수는 다음과 같습니다.

는 공변량과 관련된 위험을 말합니다.
따라서, Cox 모델의 생존확률함수는 다음과 같이 정의됩니다.

Cox regression의 파라미터는 다음과 같은 likelihood 함수를 최소화합니다.

위의 모델은 변수가 시간에 독립적이라는 가정을 가지고 있습니다.

이 표에서 Time은 관찰된 학기를 뜻합니다. 즉, 시간에 따라 변하는 변수인 것이죠.
시간 의존적 생존분석을 위해서는 카운팅 프로세스를 사용하여 형식을 변경해야 합니다.
열을 만들어 시간 간격을 고려하고 각 간격에 대해 GPA를 독립적으로 계산합니다.

중퇴는 학기에 등록하지 않거나 학기 GPA가 0인 학생으로 정의합니다.

데이터 준비와 사전 처리를 거친 후, 31개의 예측 속성을 도출합니다.
이는 6가지 그룹으로 분류 가능합니다.

TD-Cox는 표 4에 나열된 31개 속성 모두를 사용했고, 비교를 위한 모델에는 각 학생에 대해 중퇴전 시간적 특징의 평균을 사용했습니다.
Accuracy, F-measure, AUC, MAE를 사용하여 모델의 성능을 평가했습니다.

그 결과 Cox, TD-Cox가 좋은 성능을 보임을 확인할 수 있었습니다.

학기별 정보가 더 많을 때 TD-Cox의 정확도 및 F-measure이 크게 증가하는 것을 볼 수 있습니다. 또한 Cox는 학생 중퇴에 대한 보다 정확한 예측을 제공합니다.
또한, censored 데이터가 있는 경우, Cox/TD-Cox 방식이 더 나은 성능을 보임을 알 수 있습니다.
이 연구 결과를 바탕으로 학생 중퇴에 대한 해결점을 이야기합니다.
우리가 구성할 학술대회 케이스에서 생각해본다면, 각 데이터를 하나의 행에 한 주의 데이터가 구성되도록 만들어야 합니다.
그런 식으로 학생의 point, 과제 제출율 등을 하나의 데이터 프레임으로 만들고, 나머지 전체 특성에 대해 하나의 데이터 프레임으로 구성하여 이 둘을 merge한다면, 비슷하게 생존분석을 적용해볼 수 있지 않을까 생각합니다.