서울대 황호성 교수님께서 그룹에 있던 학생과 쓴 천문학에서 자료 누락과 관련한 논문을 추천해주셔서 읽어보려고 한다.
Machine learning based Photometric Redshifts for Galaxies in the North Ecliptic Pole Wide field: catalogs of spectroscopic and photometric redshifts
https://ui.adsabs.harvard.edu/abs/2025arXiv250200692K/abstract
황도(Ecliptic)란?
황도극(Ecliptic Pole)이란?
북쪽 황도극 광역 필드(North Ecliptic Pole Wide, NEPW)란?
적색편이(Redshifts)란?
적색편이를 측정하는 방법
북쪽 황도극 광역(North Ecliptic Pole Wide, NEPW) 필드에서 MMT/Hectospec 적색편이(redshift)를 조사하고, 이를 활용하여 분광 적색편이(spectroscopic redshift)가 없는 천체들의 측광 적색편이(photometric redshift) 추정하기
MMT/Hectospec 적색편이란?
MMT 망원경의 Hectospec 분광기를 이용하여 얻은 은하 스펙트럼으로부터 적색편이 값을 측정한 것. 이를 통해 은하의 거리와 우주의 팽창 정보를 분석할 수 있음.
랜덤 포레스트 머신러닝 모델이란?
여러개의 결정 트리를 조합하여 예측을 수행하는 머신러닝 모델
결정 트리(Decision Tree)란?
은하의 적색편이를 추정하는 것은 외부은하 천문학과 우주론에서 가장 중요한 과제 중 하나이다.
일반적으로 적색편이는 분광 관측을 통해 높은 정밀도로 측정되지만 많은 은하의 분광 적색편이를 얻으려면 많은 시간과 자원이 필요하므로 모든 천체에 대해 분광 적색편이를 확보하는 것은 현실적으로 어렵다.
분광 적색편이의 대안적인 방법으로, 여러 파장대의 밝기(광도) 측정과 스펙트럼 에너지 분포 모델을 비교하여 적색편이를 추정하는 방식이다.
기존 연구에서는 SED 피팅 기법을 사용하여 측광 적색편이를 계산하였지만 분광 적색편이보다 정밀도가 낮다는 단점이 있다.
측광 적색편이의 한계
다양한 머신러닝 기법이 측광 적색편이 예측의 정확도를 높이는데 사용되고 있다.
✅ (1) 신경망(Neural Networks) 기반 모델
신경망(Neural Network)은 입력된 측광 데이터를 행렬 연산 및 비선형 함수로 변환하여 적색편이를 예측한다.
최적의 행렬(텐서)을 찾기 위해 훈련 데이터를 활용한다 (Hopfield 1982; Lee & Shin 2021).
✅ (2) 가우시안 프로세스(Gaussian Process) 모델
가우시안 프로세스(Gaussian Process)는 출력 값(y)이 입력 값(x)에 대해 가우시안 분포를 따른다고 가정하는 방식이다.
이를 통해 적색편이를 확률적으로 모델링할 수 있다 (Rasmussen & Williams 2006).
예를 들어, Leistedt & Hogg (2017)은 SED 피팅과 가우시안 프로세스를 결합하여 측광 적색편이를 추정하는 방법을 제안하였다.
✅ (3) 랜덤 포레스트(Random Forest) 모델 적용
해당 논문에서는 랜덤 포레스트(Random Forest)를 활용하여 측광 적색편이를 추정하였다 (Breiman 2001; James et al. 2021).
랜덤 포레스트는 지도 학습(Supervised Learning) 방식으로, 입력 데이터(측광 정보)와 정답(적색편이) 간의 관계를 학습하여 예측하는 모델이다.
이 방법은 단순한 예측 과정을 가지며, 소량의 훈련 데이터만으로도 효과적인 학습이 가능하다.
1️⃣ NEPW 필드의 기존 분광 적색편이(Spec-z) 데이터 확보
MMT/Hectospec 적색편이 조사를 수행하여 2,572개의 새로운 분광 적색편이(Spec-z) 데이터 확보
기존 문헌 데이터와 결합하여 총 4,421개 은하에 대한 분광 적색편이 데이터 구축
2️⃣ 랜덤 포레스트 머신러닝 모델 학습
26개 파장대(3000Å ~ 55,000Å)의 다중 밴드 측광 데이터(광도)를 입력 변수로 사용
훈련 데이터 = 4,421개 은하 (입력: 측광 데이터, 정답: 분광 적색편이 값)
훈련된 랜덤 포레스트 모델을 사용하여 77,755개 천체의 측광 적색편이 예측
3️⃣ 모델 성능 평가 및 이상치(outlier) 검출
랜덤 포레스트 모델에서 개별 트리들의 예측값 표준편차(σ)를 이용하여 측광 적색편이의 신뢰도를 평가
표준편차가 클수록 불확실성이 높거나 이상치일 가능성이 높음
1️⃣ 분광 적색편이(Spec-z)는 "정답 데이터" 역할을 한다
분광 적색편이(Spectroscopic Redshift)는 매우 정확한 적색편이 값이지만, 모든 은하에 대해 직접 측정하기 어렵다.
따라서, 이미 분광 분석을 통해 얻은 적색편이(Spec-z)를 "정답 데이터(Training Label)"로 사용하여 머신러닝 모델을 학습한다.
2️⃣ 머신러닝 모델이 측광 적색편이(Photo-z)를 예측한다
머신러닝 모델(Random Forest)은 훈련 데이터에서 분광 적색편이(Spec-z)와 다중 파장대 광도(Photometry) 간의 관계를 학습한다.
그런 다음, 분광 적색편이 데이터가 없는 천체(77,755개)에 대해 측광 적색편이(Photo-z)를 예측한다.
👉 분광 적색편이(Spec-z) 데이터를 학습하여 더 정확한 측광 적색편이(Photo-z)를 예측하기