[논문리뷰] TabPFN

젤박·2024년 7월 22일

[paper group 1] - TABPFN: A TRANSFORMER THAT SOLVES SMALL TABULAR CLASSIFICATION PROBLEMS IN A SECOND

[논문에 대한 이해]

1. 딥러닝 모델에 대한 개괄적 이해

최근 딥러닝 기술의 발전으로 다양한 분야에서 놀라운 성과를 거두고 있지만, 작은 규모의 표 형식 데이터 분류 문제에서는 여전히 전통적인 머신러닝 방법들이 우세를 보이고 있습니다. 이러한 상황에서 "TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second"은 딥러닝과 베이지안 추론, 그리고 인과 추론의 개념을 결합하여 새로운 접근 방식을 제시합니다.

TabPFN은 트랜스포머 아키텍처를 기반으로 한 딥러닝 모델입니다. 이는 NLP에서 사용되는 BERT나 GPT와 유사한 구조를 가지고 있지만, 표 형식 데이터 처리에 최적화되어 있습니다.

곧, TabPFN은 작은 규모의 표 형식 데이터 분류에 특화되어있으며 TabPFN은 단 1초 만에 기존의 최첨단 AutoML 시스템들과 비슷한 수준의 성능을 달성하면서도, 훨씬 빠른 속도를 보여주고 있습니다.

2. TabPFN의 구조 및 작동 원리

  • TabPFN의 구조

[학습 데이터]  →  [TabPFN 트랜스포머]  →  [예측]

     ↑                            ↑

     |                             |

[테스트 데이터] →→→

  1. 위 구조에서 학습 데이터와 테스트 데이터가 동시에 입력됩니다.
  2. 트랜스포머 내부에서 학습 데이터 간의 self-attention과 테스트 데이터에서 학습 데이터로의 cross-attention이 이루어집니다.
  3. 출력은 테스트 데이터에 대한 클래스 확률 분포입니다.
  • TabPFN 작동의 핵심 세 가지 
[사전 학습된 트랜스포머]

TabPFN은 다양한 합성 데이터셋에 대해 사전 학습된 트랜스포머를 활용합니다. 이는 자연어 처리 분야의 GPT 모델과 유사한 접근법으로, 다양한 데이터 분포에 대한 일반화된 지식을 모델에 내재화시킵니다.

[베이지안 추론 근사]

TabPFN은 베이지안 추론을 근사하여 모델의 불확실성을 명시적으로 고려합니다. 이는 과적합 위험을 줄이고, 특히 소규모 데이터셋에서 더 신뢰할 수 있는 예측을 가능하게 합니다.

[인과적 사전 확률 모델링]

구조적 인과 모델(Structural Causal Models, SCMs)을 사용하여 데이터 생성 과정을 모델링합니다. 이는 단순히 상관관계가 아닌 인과관계를 고려함으로써, 더 robust하고 일반화 가능한 모델을 만듭니다.

3. TabPFN 프레임워크

3-1 Prior-Data Fitted Networks (PFN)

PFN의 핵심 아이디어는 베이지안 추론을 신경망으로 근사하는 것입니다. 이 과정은 다음과 같이 진행됩니다:

  1. 사전 확률 분포 p(D)에서 데이터셋 샘플링
  2. 샘플링된 데이터셋을 학습 데이터 D_train과 테스트 데이터 D_test로 분할
  3. D_train을 조건으로 D_test에 대한 예측 수행
  4. 예측 오차를 최소화하는 방향으로 모델 파라미터 θ 업데이트

수식으로 표현하면 다음과 같습니다:

LPFN = E{({(xtest,y_test)}∪D_train)∼p(D)}[-log qθ(y_test|x_test, D_train)]

이 학습 과정을 통해 PFN은 posterior predictive distribution을 근사하게 됩니다.

3-2 TabPFN의 구조

TabPFN은 트랜스포머 아키텍처를 기반으로 합니다. 주요 특징은 다음과 같습니다:

  1. 입력 형식: [학습 데이터의 특성, 학습 데이터의 레이블, 테스트 데이터의 특성]을 하나의 시퀀스로 입력받습니다.
  2. 어텐션 메커니즘:
  • 학습 데이터 간의 self-attention
  • 테스트 데이터에서 학습 데이터로의 cross-attention
  1. 출력: 테스트 데이터에 대한 클래스 확률 분포

Figure 1- (b)

위의 논문의 Figure 1(b)는 이러한 구조를 시각적으로 보여줍니다. 

이 그림에서 우리는 학습 샘플들이 서로 어떻게 상호작용하는지, 그리고 테스트 샘플이 어떻게 학습 샘플들로부터 정보를 얻는지 명확히 볼 수 있습니다.

3-3 인과적 사전 확률 모델링

TabPFN의 주요 혁신 중 하나는 SCM을 사용한 사전 확률 모델링입니다. 이 접근법의 장점은 다음과 같습니다:

  1. 복잡한 특성 의존성 모델링: SCM은 특성들 간의 복잡한 인과 관계를 그래프 구조로 표현할 수 있습니다.
  2. 단순성 선호: 오캄의 면도날 원리를 반영하여 더 단순한 SCM에 높은 사전 확률을 부여합니다. 이는 과적합을 방지하고 일반화 성능을 향상시킵니다.
  3. 인과 추론 능력: 데이터의 생성 과정을 이해함으로써, 모델은 단순한 상관관계를 넘어선 인과관계를 파악할 수 있습니다.
  4. SCM 기반 사전 확률 모델은 아래 와 같이 이해할 수 있습니다. 

[SCM 기반 사전 확률 모델] 

             z₁ → z₃ → x₁

          ↗   ↘   ↗

z₀ →→→ z₂ → z₄ → x₂

           ↘   ↗   ↘

              z₅ → z₆ → y

  • z₀, z₁, ..., z₆: 잠재 변수
  • x₁, x₂: 관측 가능한 입력 변수
  • y: 목표 변수 (예측하고자 하는 클래스)

이 구조는 변수들 간의 복잡한 인과 관계를 표현하며, TabPFN은 이러한 구조를 학습함으로써 데이터의 생성 과정을 이해하고 더 정확한 예측을 할 수 있게 됩니다.

(Figure 2)

논문의 Figure 2는 SCM의 예시를 보여줍니다. 이 그림에서 우리는 관측 가능한 변수(x)와 관측 불가능한 잠재 변수(z) 사이의 복잡한 인과 관계를 볼 수 있습니다.

4. 실험 결과 / 성능비교

TabPFN의 성능은 OpenML-CC18 벤치마크의 작은 규모 데이터셋(샘플 수 ≤ 1,000, 특성 수 ≤ 100, 클래스 수 ≤ 10)을 사용하여 평가되었습니다. 주요 결과는 다음과 같습니다:

  1. 성능: TabPFN은 1초 이내의 추론 시간으로 AutoML 시스템들의 1시간 학습 결과와 비슷한 수준의 성능을 달성했습니다.
  2. 속도: GPU를 사용할 경우, 기존 방법들에 비해 최대 5,700배 빠른 속도를 보여주었습니다.
  3. 범용성: 다양한 도메인의 데이터셋에서 안정적인 성능을 보였습니다.

TabPFN의 성능 비교

논문의 실험 결과를 바탕으로 TabPFN과 다른 방법들의 성능을 비교한 도표를 만들어보겠습니다:

TabPFN의 성능을 다른 방법들과 비교해보겠습니다:

방법평균 ROC AUC평균 소요 시간
TabPFN0.9340.62초
AutoGluon0.9303077초
Auto-sklearn0.9293601초
LightGBM0.9203280초
XGBoost0.9243364초

이 결과로부터 TabPFN은 다른 방법들보다 더 낫거나 비슷한 성능을 보여주며, 속도 면에서는 비교가 안 될 정도로 빠른 것을 확인할 수 있습니다.

(Figure 5)

논문의 Figure 5는 이러한 결과를 시각적으로 보여줍니다. 이 그래프에서 우리는 TabPFN이 매우 짧은 시간 내에 다른 최신 방법들과 비슷하거나 더 나은 성능을 달성하는 것을 명확히 볼 수 있습니다.

특히 주목할 만한 점은 TabPFN의 성능이 다른 방법들과 상관관계가 낮다는 것입니다. 

이는 TabPFN이 기존 방법들과는 다른 방식으로 문제를 해결한다는 것을 의미하며, 앙상블 모델에서 TabPFN이 큰 가치를 가질 수 있음을 시사합니다.

5. TabPFN의 장단점

장점:

  1. 초고속 추론: 1초 이내의 추론 시간은 실시간 예측이 필요한 응용 분야에서 큰 장점이 될 수 있습니다.
  2. 추가 학습 불필요: 새로운 데이터셋에 대해 추가 학습이나 하이퍼파라미터 튜닝이 필요 없어, 모델 배포와 유지보수가 간편해집니다.
  3. 베이지안 추론: 불확실성 추정이 가능해 위험 관리가 중요한 금융이나 의료 분야에서 유용할 수 있습니다.
  4. 인과적 구조 고려: 데이터의 생성 과정을 이해하므로, 외부 요인 변화에 더 robust한 예측이 가능합니다.

단점:

  1. 대규모 데이터셋 제한: 현재 1,000개 이하의 샘플에 최적화되어 있어, 대규모 데이터셋에는 적용이 어렵습니다.
  2. 범주형 변수 처리 제한: 범주형 변수나 결측치 처리에 개선의 여지가 있습니다.
  3. 특성 수 제한: 100개 이상의 특성을 가진 데이터셋에는 적용이 어려워, 고차원 데이터 처리에 한계가 있습니다.
profile
하루하루는 성실하게 인생은 되는대로

0개의 댓글