수업에서는 ARX Anonymization Tool을 사용하여 Adult 데이터셋을 익명화하는 실습을 진행했다.
사용한 quasi-identifier 속성은 sex, age, race, marital-status, education, native-country이며, k-anonymity 기반의 익명화를 수행했다.






수업에서 적용한 최적 변환은 [0, 5, 1, 1, 1, 3]이었으며,
익명화 후 Score: 35.61%, 평균 재식별 위험도는 0.159% 로 크게 감소했다.
수업에서 진행한 익명화 결과를 분석하면서 몇 가지 아쉬운 점을 발견했다.
1. education 계층 구조의 비효율성
8 Set + 3 Set + 4 Set으로 구성되어 있어 교육 수준의 의미적 유사성이 반영되지 않았다.2. native-country 계층 구조의 비효율성
10개 + 3개 + 12개로 단순 묶음 처리되어 있었다.빈도가 높은 HS-grad를 단독 그룹으로 분리하고, 나머지 값들을 교육 수준에 따라 의미적으로 재그룹핑했다.
| Level 1 그룹 | 포함 값 | 개수 |
|---|---|---|
| 미취학/초등 | Preschool, 1st-4th, 5th-6th | 3개 |
| 중등 | 7th-8th, 9th, 10th, 11th, 12th | 5개 |
| 고등학교 졸업 | HS-grad | 1개 (단독) |
| 대학 과정 | Some-college, Assoc-voc, Assoc-acdm | 3개 |
| 고등교육 | Bachelors, Masters, Doctorate, Prof-school | 4개 |
HS-grad를 단독으로 분리함으로써 해당 그룹의 일반화 수준을 낮추고 정보 손실을 최소화했다.
41개 국가를 대륙/지역 기반으로 의미 있게 그룹핑했다.
| Level 1 그룹 | 포함 국가 | 개수 |
|---|---|---|
| 북미/카리브 | United-States, Canada, Mexico, Puerto-Rico, Cuba, Jamaica, Dominican-Republic, Guatemala, El-Salvador, Haiti, Honduras, Nicaragua, Outlying-US(Guam), Trinadad&Tobago | 14개 |
| 남미 | Columbia, Ecuador, Peru | 3개 |
| 유럽 | England, France, Germany, Greece, Holand-Netherlands, Hungary, Ireland, Italy, Poland, Portugal, Scotland, Yugoslavia | 12개 |
| 아시아 | Hong, India, Iran, Japan, Laos, Philippines, Taiwan, Thailand, Vietnam, Cambodia, China, South | 12개 |
계층 구조 재설계 후 ARX에서 다시 익명화를 적용한 결과는 다음과 같다.



계층 구조를 데이터의 특성과 의미적 유사성에 맞게 재설계하면, 같은 익명성 수준을 유지하면서도 정보 손실(Score)을 줄일 수 있다는 것을 확인했다.
특히 빈도가 높은 값을 단독 그룹으로 분리하는 전략은 유틸리티 보존에 효과적이며, 국가처럼 범주가 많은 속성은 지역적/개념적 기준으로 그룹핑하는 것이 중요하다는 것을 배웠다.