AI가 학습하는 데이터는 여러 요소로 구성된다.
그렇다면 데이터의 구성 요소에는 어떤 것들이 있을까?
1. 데이터 구성
1️⃣ 열(Column) 과 특징(Feature)
- AI가 학습하는데 사용하는 중요한 정보들
- 예) 성별, 운동시간, 심박수 특징들을 보고 칼로리 소모량을 예측
‼️ column과 똑같은 개념 아닌가?
- 데이터 테이블의 열(column)을 의미
- 모든 Feature은 Column이지만, 모든 Column이 Feature가 될 수 없음
- Feature는 AI가 학습할 때 실제로 도움이 되는 Column 틀을 의미함
- 데이터 분석 시 어떤 Column을 Feature로 사용할지 신중히 결정해야 함.
2️⃣ 타겟(Target)
- 머신러닝이 예측하려는 '결과값'
- 머신러닝 모델은 feature을 바탕으로 타겟과의 관계를 학습한 뒤, 새로운 데이터가 주어졌을 때 타켓을 예측하는 역할을 함.
- 보통 하나의 데이터셋에는 하나의 타켓이 있음.
3️⃣ 값(Value)
- 데이터를 구성하는 개별적인 숫자나 정보로 AI가 학습하는 실제 데이터의 값
- 수치형 값(Numerical Value)와 범주형 값(Categorical Value)로 나뉨
4️⃣ 행(Row)
- 데이터를 구성하는 가로줄, 하나의 사례나 관찰 값을 나타냄
- 즉, 각 행이 하나의 독립적인 데이터 샘플이 됨
| 키 | 몸무게 | 공부시간 | 시험합격 |
|---|
| 170 | 65 | 5 | 합격 |
| 160 | 50 | 2 | 불합격 |
➡️ Feature : 공부시간
➡️ Target : 시험합격
2. 머신러닝 모델 평가를 위한 데이터 구성
1️⃣ 학습 데이터(Training Data)
- AI가 학습하는데 사용하는 데이터로, 이 데이터를 분석하여 규칙과 패턴을 찾아 예측함
- 학습 데이터만 사용하면 AI는 단순히 암기하는 모델이 될 수 있음
2️⃣ 테스트 데이터(Test Data)
- AI가 학습한 내용을 실제로 적용해보는데 사용
- 학습 과정에서 본 적 없는 새로운 데이터를 의미
- 테스트 데이터를 바탕으로 예측을 하고, 이를 통해 얼마나 정확하게 적용할 수 있는지 평가하는 과정이 이루어짐