[캡스톤] Image-Exclusive Model for Galaxy Merger Classification

2한나·2025년 11월 18일

Image-Exclusive Model for Galaxy Merger Classification

이미지를 사용하지 않는 은하 병합 단계 분류 모델

오늘은 지난 1년 동안 진행한 졸업 연구를 정리해 보려고 합니다.
연구의 목표는 이미지를 사용하지 않고, 물리량만으로 은하의 병합 단계를 분류하는 모델을 만드는 것입니다.


1. 연구 배경 및 필요성

1) 은하 병합과 단계 구분의 필요성

은하 병합(galaxy merger)은 은하 진화에서 핵심적 역할을 합니다.
병합 과정에서는 다음과 같은 물리적 변화가 나타납니다.

  • 별 생성률(SFR) 변화
  • AGN 활동 변동
  • 질량·형태 구조 변화
  • 가스 분포 재편

➡︎ 따라서 은하의 물리적 상태와 진화를 이해하려면 병합 정보를 정확히 파악해야 합니다.


병합은 단일 사건이 아닌, 시간에 따라 진행되는 단계적 과정입니다.
특히 pre-mergerpost-merger는 같은 병합이라도
SFR·AGN activity 등 주요 물리량에서 서로 다른 양상을 보입니다.

➡︎ 따라서 병합 여부만 구분하는 것 뿐 아니라, 은하가 pre / post / non-merger 중 어느 단계에 있는지 구분해야 합니다.


2) 기존 이미지 기반 접근의 한계

현재 병합 단계 분류 연구는 이미지 기반(image-only) 머신러닝에 의존합니다.

선행 연구: Pearson et al. (2024) — Accuracy 0.81±0.01, time sequence 추정 시도

하지만 이미지 기반 접근에는 다음과 같은 구조적 한계가 있습니다.

이미지의 한계

  • 관측 이미지는 단일 순간만 포착
  • pre/post-merger 형태는 약하거나 일시적
  • ongoing merger만 뚜렷하게 보임
    → 병합 시점(stage) 구분이 근본적으로 어려움

해당 이미지를 보면 pre-merger와 post-merger는 이미지 만으로 구분하기 어려움을 확인할 수 있습니다.

실용성 부족

  • 고해상도 이미지 필요
  • 높은 연산 비용
  • GPU 필수
  • 대규모 관측 카탈로그(수십만 개)에 직접 적용하기 어려움

➡︎ 즉, 이미지 기반 접근은 실용성과 확장성 측면에서는 제약이 큽니다.


3) 본 연구의 접근: Image-exclusive Model

이에 이미지를 완전히 배제하고, 물리 파라미터만을 활용해 병합 단계를 분류하는 모델을 구축하였습니다.

연구 목표

  • 이미지 없이도 non / pre / post-merger 분류
  • 기존 image-based 모델 수준의 성능 달성
  • 연산 효율 높은 파이프라인 개발
  • SDSS 관측 데이터에 적용 가능한 모델 구축

연구 의의

  • 고성능 GPU·이미지 전처리 의존성 제거
  • 대규모 관측 데이터에 바로 적용 가능
  • 물리량 기반이라 해석 가능성이 높음
  • 향후 멀티모달(이미지+물리량) 모델 개발의 baseline 제공

2. 연구 전체 파이프라인

모델 학습 파이프라인

모델 학습의 전체적인 파이프라인은 다음과 같습니다.

  • Illustris TNG에서 추출한 17개 물리량을 입력으로 사용
  • StandardScaler로 정규화하고 MICE로 결측값을 보완
  • 총 11개의 ML·DL 모델을 학습해 성능을 비교
  • Stratified K-Fold와 macro-F1을 기준으로 최종 모델 선정

추론 파이프라인

추론 파이프라인은 다음과 같습니다.

  • 학습 단계에서 사용한 동일한 전처리(Scaling + MICE)를 SDSS 관측 데이터에 적용
  • 최종 선정된 Gradient Boost 모델로 각 은하의 병합 단계를 추론
  • TTA를 통해 관측 분포 차이를 보정하여 안정적인 예측 제공

3. 데이터 및 전처리

1) 사용 데이터

본 연구는 다음과 같이 실제 관측 가능한 17개 물리량만 사용하여 물리 기반 병합 단계 분류 모델을 구축했습니다.

색지수

  • color_Ur
  • color_gr
  • color_gi

구조 및 광도 지표

  • AxisRatio
  • B/T
  • SurfaceBrightness
  • EffectiveRadius
  • 절대등급: AbsMag_U, B, V, g, r, i

물리적 파라미터

  • SFR_200Myr
  • StellarMass
  • Stellarmetallicity
  • StellarVelocityDispersion

2) 전처리

Scaling

  • 모든 feature는 StandardScaler로 정규화했습니다.
  • 분포 차이를 최소화하여 모델 안정성을 확보했습니다.
scaler = StandardScalerNaN()
X_scaled = scaler.fit_transform(df[feature_cols])

Imputation

  • MICE(Multivariate Imputation by Chained Equations)를 사용했습니다.
  • IterativeImputer + BayesianRidge 기반
imputer = IterativeImputer(random_state=42, max_iter=10, tol=1e-3)
X_imputed = imputer.fit_transform(X_scaled)

코드 실행 결과

  1. 아래와 같이 데이터의 분포 차이가 크고, 결측치가 존재하는 데이터셋에 대해
  1. Standard Scaler와 MICE Imputaion을 적용하여

  2. 분포가 고르고, 결측치가 없는 데이터셋을 구성하였습니다.


4. 모델 학습 및 비교

1) 비교한 모델

총 11개의 모델 학습 후 비교하였습니다.

Classical Machine Learning

  • Logistic Regression
  • Decision Tree
  • Random Forest
  • Gradient Boost
  • XGBoost
  • LightGBM
  • CatBoost

Tabular Deep Learning

  • MLP
  • FT-Transformer
  • TabTransformer
  • TabM

➡︎ ML과 DL 모델 구조적 특성을 모두 비교하여 물리량 기반 분류에 어떤 모델이 가장 적합한지 평가했습니다.


2) 학습 및 검증 전략

  • 데이터 분할: 학습 80%, 테스트 20%
  • 교차 검증: Stratified K-Fold (5-Fold)
  • 선정 기준: Macro-F1 score

3) 모델 학습 결과

모델별 성능 비교

최고 성능 모델: Gradient Boost

  • Accuracy: 0.8333
  • Macro-F1: 0.8311
    ➡︎ 이는 이미지 기반 선행 연구인Pearson+2024(약 0.81)를 뛰어넘는 정확도입니다.

학습 결과 분석

Confusion Matrix

  • 세 클래스 모두 균형 있게 예측됨
  • 특히 pre-merger ↔ post-merger처럼 구분이 어려운 쌍에서도 오분류 비율이 낮음
  • 가장 흔한 클래스인 non-merger만 잘 맞춘 것이 아니라
    세 클래스 모두에서 고른 성능을 보임

    ➡︎ 이미지를 사용하지 않고도 stage 간 경계가 비교적 명확하게 학습되었음을 확인할 수 있습니다.

Feature Importance

  • B_T, Color_gi feature가 모델 판단에 가장 영향을 많이 주는 물리량임을 보입니다.

5. SDSS 관측 데이터 추론

최종 선정된 Gradient Boost 모델은 Illustris TNG 시뮬레이션 기반으로 학습된 뒤, 실제 관측 데이터(SDSS)에 그대로 적용할 수 있도록 설계하였습니다.

SDSS 데이터는

  • 학습과 동일한 17개 물리량(feature)을 사용했고
  • 학습에 사용된 Scaling + MICE 전처리 방식을 그대로 적용했습니다.

이렇게 구성된 입력값을 모델에 넣어 실제 은하의 병합 단계를 예측합니다.

1) 추론 수행

전처리된 SDSS 물리량을 모델에 입력하여 다음 세 단계 중 하나로 자동 분류합니다.

  • non-merger
  • pre-merger
  • post-merger

2) Gradient Boost 추론 코드

import joblib
import pandas as pd
import numpy as np

# 1) 모델 로드
model = joblib.load("gradientBoost_best_fold.pkl")

# 2) 전처리된 SDSS 데이터 로드
df = pd.read_csv("obs_data_preprocessed.csv")
feature_cols = [c for c in df.columns 
                if c not in ["ObjID", "MergerProbability"]]

# 3) 모델 예측
pred = model.predict(df[feature_cols])
proba = model.predict_proba(df[feature_cols])
confidence = np.max(proba, axis=1)

# 4) 결과 구성
result = pd.DataFrame({
    "ObjID": df["ObjID"],
    "Predicted_Phase": pred,
    "Model_Confidence": confidence
})

result.head()

3) 결과 해석

예측 결과는 다음과 같은 정보를 포함합니다.

  • ObjID
    → SDSS 은하의 고유 ID
  • Predicted_Phase
    → non(0) / pre(1) / post(2) merger 중 어떤 상태인지
  • Model_Confidence
    → 예측에 대한 모델의 신뢰도(score)

➡︎ 예측된 은하 병합 단계 라벨링 결과는 대규모 SDSS 관측 데이터를 기반으로 확장된 병합 단계 카탈로그로 구축하였으며, 이를 향후 천문학계 연구자들이 활용할 수 있도록 제시하고자 합니다.


6. 결론

1) 이미지 없이도 병합 단계 분류가 가능함을 입증

본 연구는 기존의 이미지 기반 딥러닝 접근을 벗어나
오직 물리량만으로도 은하 병합의 세 단계(non / pre / post)를 효과적으로 분류할 수 있음을 보였습니다.

  • Gradient Boost
    → Accuracy 0.8333, Macro-F1 0.8311
  • Pearson+2024 이미지 기반 성능(약 0.81)을 상회

➡︎ 이미지 없이도 image-based 수준 이상의 성능을 달성한 최초 사례입니다.

2) 실용성과 확장성이 매우 높음

  • 이미지 생성/전처리/다운로드 불필요
  • 고성능 GPU 없이도 모델 운용 가능
  • 수십만 개 규모의 SDSS 은하도 빠르게 추론 가능

➡︎ 대규모 카탈로그 분석에 즉시 적용 가능한 파이프라인을 제안했습니다.


3) 물리량 기반이기에 해석 가능성 높음

  • 어떤 feature가 pre·post에 기여했는지 설명 가능
  • 병합 단계별 물리적 변화 양상을 정량적으로 분석 가능
  • 향후 SHAP 등을 활용한 feature 해석 연구 가능

4) 향후 확장 가능성

본 연구는 다음과 같은 후속 연구의 기반이 될 수 있습니다.

멀티모달 모델

이미지 + 물리량 결합한 멀티모달 모델 구축 가능
(현재 연구는 그 baseline 역할을 합니다.)

병합 단계 세분화

pre-merger와 post-merger의 시점을 더욱 세분화하여 시간축에서의 은하 병합 단계 분류 가능

0개의 댓글