[졸업연구] 논문 분석 - Photometric Redshifts

2한나·2025년 3월 20일

졸업연구

목록 보기
4/13

서울대 황호성 교수님께서 그룹에 있던 학생과 쓴 천문학에서 자료 누락과 관련한 논문을 추천해주셔서 읽어보려고 한다.

Machine learning based Photometric Redshifts for Galaxies in the North Ecliptic Pole Wide field: catalogs of spectroscopic and photometric redshifts
https://ui.adsabs.harvard.edu/abs/2025arXiv250200692K/abstract

머신러닝 기반 북쪽 황도극 광역(NEPW) 필드 은하의 측광 적색편이(Photometric Redshifts) 연구


<논문을 읽기 위한 기초 지식>

북쪽 황도극 광역 필드란?

황도(Ecliptic)란?

  • 지구에서 봤을 때 태양이 1년 동안 움직이는 경로

황도극(Ecliptic Pole)이란?

  • 황도와 정확히 90도 떨어진 하늘의 두 점
  • 그 중 북쪽에 있는 점이 북쪽 황도극(North Ecliptic Pole, NEP)이다.

북쪽 황도극 광역 필드(North Ecliptic Pole Wide, NEPW)란?

  • 북쪽 황도극 주변의 넓은 하늘 영역
  • 이 지역은 황도면과 멀어서 태양, 달, 행성의 방해를 덜 받기에 먼 우주의 은하, 활성은하핵, 은하단 연구에 유리함

측광 적색편이(Photometric Redshifts) 란?

적색편이(Redshifts)란?

  • 우주가 팽창하면서 빛의 파장의 길이가 길어지는 현상
  • 적색편이 값을 알면 그 은하까지의 거리와 우주의 나이를 추정할 수 있음
  • z 값이 클수록 더 먼 과거의 우주

적색편이를 측정하는 방법

  • 분광 적색편이(Spectroscopic Redshift, Spec-z)
    • 은하에서 나오는 빛을 프리즘처럼 쪼개서 스펙트럼을 분석하는 방법
    • 특정한 스펙트럼선(ex. 수소, 산소)이 얼마나 적색 이동했는지를 측정해서 적색편이를 구함
    • 가장 정확하지만 관측 시간이 오래걸림
  • 측광 적색편이(Photometric Redshift, Photo-z)
    • 스펙트럼 대신, 여러 파장 대역에서 은하의 밝기를 측정해서 적색편이를 추정하는 방법
    • 분광 분석 없이 다중 파장대의 광도(밝기) 데이터를 이용하여 은하의 적색편이를 예측하는 방법
    • 은하가 여러 파장에서 어느 정도 밝은지를 비교했을 때, 적색편이가 크면 파장이 긴 필터에서 더 밝아지는 경향이 있음
    • 해당 특징을 활용해 분광 정보 없이도 적색편이를 예측할 수 있음
    • 정확도는 낮지만 훨씬 빠르게 수많은 은하의 적색편이를 측정할 수 있음

<초록 (Abstract)>

연구 주제

북쪽 황도극 광역(North Ecliptic Pole Wide, NEPW) 필드에서 MMT/Hectospec 적색편이(redshift)를 조사하고, 이를 활용하여 분광 적색편이(spectroscopic redshift)가 없는 천체들의 측광 적색편이(photometric redshift) 추정하기

MMT/Hectospec 적색편이란?
MMT 망원경의 Hectospec 분광기를 이용하여 얻은 은하 스펙트럼으로부터 적색편이 값을 측정한 것. 이를 통해 은하의 거리와 우주의 팽창 정보를 분석할 수 있음.

연구 결과

  • 해당 연구에서는 2,572개의 적색편이 데이터를 기존 문헌에서 수집한 데이터와 결합하여, 총 4,421개의 은하에 대한 분광 적색편이 샘플을 구축함
  • 이를 바탕으로 랜덤 포레스트(Random Forest) 머신러닝 모델을 사용해 NEPW 필드의 77,755개 천체의 측광 적색편이를 추정함
  • 측정된 측광 적색편이는 일반적으로 분광 적색편이와 잘 일치했으며
    - 분산(Dispersion): 0.028
    - 이상치 비율(Outlier Fraction): 7.3%
    - 평균 편향(Bias): -0.01
  • 랜덤 포레스트 모델에서 개별 의사결정 트리의 예측 표준편차(Standard Deviation)를 이용하면, 이상치 발생 비율 및 측정 불확실성을 추정할 수 있음을 발견함
    -다양한 입력 데이터(색상, 광도 불확실성 등)를 조합하여 실험한 결과, 이러한 조합이 예측 정확도에 미치는 영향은 크지 않음을 확인함

랜덤 포레스트 머신러닝 모델이란?
여러개의 결정 트리를 조합하여 예측을 수행하는 머신러닝 모델

  • 하나의 결정 트리만 사용하면 과적합이 발생할 가능성이 큼
  • 이에 랜덤 포레스트는 여러개의 경정 트리를 학습하여 예측을 조합하는 방식을 사용함
  • 즉, 랜덤하게 여러개의 트리를 만들고, 그 결과를 평균 내거나 다수결 투표하여 최종 예측값을 결정함

결정 트리(Decision Tree)란?

  • 데이터를 여러개의 분기(질문)으로 나누어 예측하는 모델
    • ex) "이 은하가 먼 은하일까?"를 결정하는 트리라면,
      - "이 은하의 색깔이 붉은가?" → YES → "이 은하의 밝기가 낮은가?" → YES → "먼 은하"
      - "이 은하의 색깔이 붉은가?" → NO → "가까운 은하"
  • 위 예시처럼 데이터를 분할하면서 결과를 예측하는 방식

<서론 (Introduction)>

은하의 적색편이를 추정하는 것은 외부은하 천문학과 우주론에서 가장 중요한 과제 중 하나이다.
일반적으로 적색편이는 분광 관측을 통해 높은 정밀도로 측정되지만 많은 은하의 분광 적색편이를 얻으려면 많은 시간과 자원이 필요하므로 모든 천체에 대해 분광 적색편이를 확보하는 것은 현실적으로 어렵다.

측광 적색편이란?

분광 적색편이의 대안적인 방법으로, 여러 파장대의 밝기(광도) 측정과 스펙트럼 에너지 분포 모델을 비교하여 적색편이를 추정하는 방식이다.

기존 연구에서는 SED 피팅 기법을 사용하여 측광 적색편이를 계산하였지만 분광 적색편이보다 정밀도가 낮다는 단점이 있다.

  • 일반적으로 측광 적색편이의 오차(δz) ≈ 0.003 ~ 0.1 (z < 1에서 측정)
  • 반면, 분광 적색편이의 오차는 δz ≲ 0.0001 수준으로 매우 정밀 (예: Ahumada et al. 2020)

측광 적색편이의 한계

  • 광도 측정만을 기반으로 하므로, 같은 관측 데이터를 놓고도 여러 개의 다른 적색편이 값이 나올 수 있음
  • 특정한 광도 특성이 여러 적색편이 값에서 동일하게 보일 가능성이 있어, 혼동 발생 가능성 증가 (Tanaka 2015)
  • 이를 해결하기 위해 최근 연구에서는 다중 밴드(예: 36개 필터) 측광 데이터를 활용하는 방법이 사용됨 (예: Laigle et al. 2016, COSMOS 필드 연구)

머신러닝을 활용한 측광 적색편이 개선

다양한 머신러닝 기법이 측광 적색편이 예측의 정확도를 높이는데 사용되고 있다.
✅ (1) 신경망(Neural Networks) 기반 모델
신경망(Neural Network)은 입력된 측광 데이터를 행렬 연산 및 비선형 함수로 변환하여 적색편이를 예측한다.
최적의 행렬(텐서)을 찾기 위해 훈련 데이터를 활용한다 (Hopfield 1982; Lee & Shin 2021).

✅ (2) 가우시안 프로세스(Gaussian Process) 모델
가우시안 프로세스(Gaussian Process)는 출력 값(y)이 입력 값(x)에 대해 가우시안 분포를 따른다고 가정하는 방식이다.
이를 통해 적색편이를 확률적으로 모델링할 수 있다 (Rasmussen & Williams 2006).
예를 들어, Leistedt & Hogg (2017)은 SED 피팅과 가우시안 프로세스를 결합하여 측광 적색편이를 추정하는 방법을 제안하였다.

✅ (3) 랜덤 포레스트(Random Forest) 모델 적용
해당 논문에서는 랜덤 포레스트(Random Forest)를 활용하여 측광 적색편이를 추정하였다 (Breiman 2001; James et al. 2021).
랜덤 포레스트는 지도 학습(Supervised Learning) 방식으로, 입력 데이터(측광 정보)와 정답(적색편이) 간의 관계를 학습하여 예측하는 모델이다.
이 방법은 단순한 예측 과정을 가지며, 소량의 훈련 데이터만으로도 효과적인 학습이 가능하다.

연구 방법

1️⃣ NEPW 필드의 기존 분광 적색편이(Spec-z) 데이터 확보
MMT/Hectospec 적색편이 조사를 수행하여 2,572개의 새로운 분광 적색편이(Spec-z) 데이터 확보
기존 문헌 데이터와 결합하여 총 4,421개 은하에 대한 분광 적색편이 데이터 구축

2️⃣ 랜덤 포레스트 머신러닝 모델 학습
26개 파장대(3000Å ~ 55,000Å)의 다중 밴드 측광 데이터(광도)를 입력 변수로 사용
훈련 데이터 = 4,421개 은하 (입력: 측광 데이터, 정답: 분광 적색편이 값)
훈련된 랜덤 포레스트 모델을 사용하여 77,755개 천체의 측광 적색편이 예측

3️⃣ 모델 성능 평가 및 이상치(outlier) 검출
랜덤 포레스트 모델에서 개별 트리들의 예측값 표준편차(σ)를 이용하여 측광 적색편이의 신뢰도를 평가
표준편차가 클수록 불확실성이 높거나 이상치일 가능성이 높음


<결과 (Conclusion)>

연구의 핵심

1️⃣ 분광 적색편이(Spec-z)는 "정답 데이터" 역할을 한다
분광 적색편이(Spectroscopic Redshift)는 매우 정확한 적색편이 값이지만, 모든 은하에 대해 직접 측정하기 어렵다.
따라서, 이미 분광 분석을 통해 얻은 적색편이(Spec-z)를 "정답 데이터(Training Label)"로 사용하여 머신러닝 모델을 학습한다.
2️⃣ 머신러닝 모델이 측광 적색편이(Photo-z)를 예측한다
머신러닝 모델(Random Forest)은 훈련 데이터에서 분광 적색편이(Spec-z)와 다중 파장대 광도(Photometry) 간의 관계를 학습한다.
그런 다음, 분광 적색편이 데이터가 없는 천체(77,755개)에 대해 측광 적색편이(Photo-z)를 예측한다.
👉 분광 적색편이(Spec-z) 데이터를 학습하여 더 정확한 측광 적색편이(Photo-z)를 예측하기

0개의 댓글