
Tabular Data에 대해 정리해보고자 한다.Tabular Data는 쉽게 말하면행과 열로 구성된 표 형태의 데이터를 말한다.우리가 엑셀이나 데이터베이스에서 자주 보는 형태가 바로 Tabular Data다.예를 들어 고객 이탈 예측 문제를 생각해보자.여기서 하나의

이번 글에서는Tabular Data를 다룰 때 사용하는 전통적인 머신러닝 모델에 대해 정리해보고자 한다.이전 글에서 Tabular Data가 무엇인지,그리고 Tabular ML Pipeline이 어떻게 구성되는지 정리했다.이번에는 그 다음 단계다.표 형태의 데이터를 가

이전에는 Tabular Data를 다룰 때XGBoost, LightGBM, CatBoost 같은 Tree-based Model이 강력하다는 내용을 정리했다.그렇다면 여기서 한 가지 의문이 생긴다.딥러닝이 이렇게 발전했는데,Tabular Data에서는 Neural Net

이미지 분야에는 ImageNet이 있고,자연어 분야에는 GPT, BERT 같은 거대한 Foundation Model이 존재한다.그렇다면 문득 이런 의문이 들었다."Tabular Data에도 Foundation Model이 존재할까?"그리고 더 근본적인 질문도 생겼다."

LLM은 Large Language Model의 약자다.말 그대로 방대한 텍스트를 학습하고,언어를 이해하고 생성하는 모델이다.LLM은 수많은 문장 속에서단어와 개념 사이의 의미 관계를 학습한다.그래서 다음과 같은 일을 할 수 있다.그런데 여기서 한 가지 의문이 생겼다.

이전 글에서는 LLM을 활용해Tabular Data를 다루는 방법에 대해 정리했다.LLM이 가지고 있는 Semantic Knowledge를 활용하거나,테이블을 Text 형태로 Serialization하여 예측하거나,Feature Engineering이나 Anomaly