#44 #arx를 활용한 데이터 처리

서영·2026년 5월 29일

ARX를 활용한 데이터 익명화 실습 및 개선

수업 시간에 한 데이터

수업에서는 ARX Anonymization Tool을 사용하여 Adult 데이터셋을 익명화하는 실습을 진행했다.
사용한 quasi-identifier 속성은 sex, age, race, marital-status, education, native-country이며, k-anonymity 기반의 익명화를 수행했다.

수업 데이터 1

수업 데이터 2

수업 데이터 3

수업 데이터 4

수업 데이터 5

수업 데이터 6

수업에서 적용한 최적 변환은 [0, 5, 1, 1, 1, 3]이었으며,
익명화 후 Score: 35.61%, 평균 재식별 위험도는 0.159% 로 크게 감소했다.


아쉬운 점

수업에서 진행한 익명화 결과를 분석하면서 몇 가지 아쉬운 점을 발견했다.

1. education 계층 구조의 비효율성

  • 기존 그룹핑이 8 Set + 3 Set + 4 Set으로 구성되어 있어 교육 수준의 의미적 유사성이 반영되지 않았다.
  • 특히 데이터에서 빈도가 높은 HS-grad가 다른 값들과 함께 묶여, 불필요한 정보 손실이 발생했다.

2. native-country 계층 구조의 비효율성

  • 41개 국가가 지역적 의미 없이 10개 + 3개 + 12개로 단순 묶음 처리되어 있었다.
  • 대륙/지역 기반의 의미 있는 그룹핑이 이루어지지 않아 유틸리티 손실이 컸다.

개선 방안

education 계층 구조 재설계

빈도가 높은 HS-grad를 단독 그룹으로 분리하고, 나머지 값들을 교육 수준에 따라 의미적으로 재그룹핑했다.

Level 1 그룹포함 값개수
미취학/초등Preschool, 1st-4th, 5th-6th3개
중등7th-8th, 9th, 10th, 11th, 12th5개
고등학교 졸업HS-grad1개 (단독)
대학 과정Some-college, Assoc-voc, Assoc-acdm3개
고등교육Bachelors, Masters, Doctorate, Prof-school4개

HS-grad를 단독으로 분리함으로써 해당 그룹의 일반화 수준을 낮추고 정보 손실을 최소화했다.

native-country 계층 구조 재설계

41개 국가를 대륙/지역 기반으로 의미 있게 그룹핑했다.

Level 1 그룹포함 국가개수
북미/카리브United-States, Canada, Mexico, Puerto-Rico, Cuba, Jamaica, Dominican-Republic, Guatemala, El-Salvador, Haiti, Honduras, Nicaragua, Outlying-US(Guam), Trinadad&Tobago14개
남미Columbia, Ecuador, Peru3개
유럽England, France, Germany, Greece, Holand-Netherlands, Hungary, Ireland, Italy, Poland, Portugal, Scotland, Yugoslavia12개
아시아Hong, India, Iran, Japan, Laos, Philippines, Taiwan, Thailand, Vietnam, Cambodia, China, South12개

개선 결과

계층 구조 재설계 후 ARX에서 다시 익명화를 적용한 결과는 다음과 같다.

개선 결과 1

개선 결과 2

개선 결과 3

계층 구조를 데이터의 특성과 의미적 유사성에 맞게 재설계하면, 같은 익명성 수준을 유지하면서도 정보 손실(Score)을 줄일 수 있다는 것을 확인했다.

특히 빈도가 높은 값을 단독 그룹으로 분리하는 전략은 유틸리티 보존에 효과적이며, 국가처럼 범주가 많은 속성은 지역적/개념적 기준으로 그룹핑하는 것이 중요하다는 것을 배웠다.

profile
시대를 따라가는 개발자가 아닌, 시대를 이끄는 개발자

0개의 댓글