ESDA(Exploratory Spatial Data Analysis)

Euro·2025년 7월 21일

탐색적 공간 데이터 분석 : 공간정보가 포함된 데이터셋 (e.g. 유동인구 데이터)을 분석하여, 공간 패턴/관계/경향성 등을 파악하는 기법. 데이터의 공간적 특성을 이해하기 위한 필수적인 프로세스임

Spatial data analysis (ESDA) is composed of 1) visualizing spatial patterns exhibited in the data, 2) identifying spatial clusters and spatial outliers, and 3) diagnosing possible misspecification of spatial aspects of the statistical models, all of which can help better specify regression models

ref) https://doi.org/10.1007/s11769-012-0534-0

ESDA 기법의 핵심은 공간 자기상관(spatial autocorrelation) 측정이다. 이는 인접한 공간상에서 특정 속성값들 간의 유사도를 나타내는 지표이며, 가장 널리 알려진 지표는 Moran의 I 통계량(Moran’s I)이다.

분석 단계목적주요 기법
1. 시각적 탐색변수의 분포와 초기 공간 패턴 확인Choropleth 지도, Moran Scatterplot
2. 정량적 탐색 (Global)전체 패턴에 대한 공간적 자기상관 확인Global Moran’s I
3. 정량적 탐색 (Local)특정 지역에서의 클러스터나 이상치 탐지Local Moran’s I / LISA 분석
4. 모형 진단 및 보정회귀 모형의 잔차가 공간적으로 독립인지 검증 → 필요시 공간 회귀모형 적용Spatial Lag / Error 모델

구성

공간 패턴 시각화

  • Choropleth 지도나 Moran 산점도 같은 공간 시각화를 통해 데이터의 공간적 분포와 경향성을 직관적으로 파악

국소적 자가상관 분석 → Local Indicators of Spatial Association (LISA) & Moran’s I

  • 인접 지역 간의 변수 유사성을 측정하여 공간적 자기상관(spatial autocorrelation)을 분석
  • Moran’s I : 한 지역의 값이 그 이웃 지역의 값과 유사한지를 수치로 표현한 지표
    • Global Moran’s I전체 영역의 공간적 자기상관 수준을 수치로 요약함. 이는 공간적으로 “클러스터링이 있는가?”, “값이 무작위로 퍼져 있는가?”를 판단하게 함.
    • Global Moran's I가 전체 영역의 전반적인 경향을 측정하는 반면, Local Moran's I 혹은 LISA 분석은 각 지역별로 유의한 클러스터(Hot spot, Cold spot) 및 이상치(outlier)를 확인
Moran’s I 값해석예시
+1 근처높은 양의 공간 자기상관 (비슷한 값들이 이웃함)고소득 지역 주변이 모두 고소득 지역
0무작위 분포 (공간적 자기상관 없음)값이 무작위로 분포된 경우
–1/(N–1) 근처 또는 음수공간적 negative autocorrelation (인접 지역끼리 상반된 값)고소득과 저소득 지역이 체커보드처럼 섞여 있음

공간 클러스터 및 이상치 탐지

  • 인접하고 유사한 특징을 가진 지역을 군집화
  • Local Moran’s I / LISA는 각 공간 단위별로 통계값을 계산
    • High–High (Hot spot), Low–Low (Cold spot) 등의 유의미한 클러스터 위치
    • 혹은 High surrounded by Low 혹은 Low surrounded by High 같은 이상치(outlier)를 식별
  • 이외에도, Getis–Ord Gi*, 공간적 K‑means, DBSCAN과 같은 기법을 사용
  • 각 지역 단위의 통계값에 대해 permutation(순열) 테스트 기반 p‑value를 산출해 유의성을 확인하고, 이 값이 특정 수준보다 작으면 해당 패턴은 통계적으로 유의미
    - 귀무가설 : 공간적 자기상관이 없다(무작위 분포이다)
    - 대립가설 : 공간적 자기상관이 있다(비슷한 값들이 인접)

    💡 permutation 테스트? 귀무가설이 참일 때 발생 가능한 통계량의 분포를 직접 만들어서, 관측된 통계량이 그 분포에서 얼마나 극단적인지를 평가하는 비모수적 검정 방법
    💡 즉, “이 Moran’s I 값이 정말 공간적 자기상관 때문일까? 아니면 그냥 우연일까?” 를 판단하기 위해 사용

통계 모형의 공간적 측면에 대한 오차 여부 진단 → 공간 회귀와 잔차 검정

  • 전통적 회귀분석(OLS)의 독립성, 등분산성 가정이 공간적 상관에 의해 성립하지 않을 수 있음
  • 따라서,
    • ESDA를 통해 공간 구조를 사전 탐색하고,
    • 공간적 자기상관이 잔차에 존재하는지 Moran’s I 등을 통해 진단한 뒤
    • 필요하면 Spatial Lag Model 또는 Spatial Error Model 같은 공간 회귀모형으로 전환

0개의 댓글