1일차_데이터 타입의 이해

수빈·2026년 1월 8일
post-thumbnail

데이터는 크게 숫자형범주형으로 구분
데이터 타입 분류도

숫자형 데이터 (Numerical Data)

수치로 표현되며 산술 연산(더하기, 빼기, 평균 등)이 가능한 데이터

대표적인 예시

  • 나이 (25세)
  • 키 (175cm)
  • 몸무게 (68kg)
  • 혈압 (120mmHg)
  • 혈당 (95mg/dL)

이러한 데이터는 평균, 분산, 표준편차 등을 계산할 수 있으며, 머신러닝 모델의 입력 데이터로도 많이 사용된다.

숫자형 데이터는 이산형 데이터(Discrete Data)연속형 데이터(Continuous Data)로 나뉜다.


1. 이산형 데이터 (Discrete Data)

셀 수 있는 값을 가지는 데이터다.

값이 정수 형태로 존재하며 중간값을 가질 수 없다.

예를 들어,

  • 병원 방문 횟수 : 5회
  • 자녀 수 : 2명
  • 입원 횟수 : 1회
  • 하루 약 복용 횟수 : 3회

자녀 수는 2명과 3명 사이인 2.5명이 존재할 수 없기 때문에 이산형 데이터에 해당한다.

2. 연속형 데이터 (Continuous Data)

일정한 범위 안에서 어떤 값이든 가질 수 있는 데이터다.

소수점까지 표현이 가능하며, 측정을 통해 얻는 데이터가 대부분 연속형 데이터에 속한다.

예를 들어,

  • 체온 : 36.7℃
  • 키 : 172.4cm
  • 몸무게 : 63.8kg
  • 혈당 : 98.5mg/dL

연속형 데이터는 평균이나 분산 같은 통계 분석뿐 아니라 회귀(Regression) 모델에서도 자주 사용된다.


범주형 데이터 (Categorical Data)

범주형 데이터는 특정 그룹이나 종류를 구분하기 위한 데이터다.

숫자로 표현될 수도 있지만, 그 숫자는 계산을 위한 값이 아니라 단순히 범주를 구분하기 위한 라벨일 뿐이다.

예를 들어,

  • 성별 : 남성, 여성
  • 혈액형 : A형, B형, O형, AB형
  • 흡연 여부 : 예, 아니오
  • 질병 유무 : 정상, 질환

범주형 데이터는 다시 명목형(Nominal)순서형(Ordinal)으로 나뉜다.

1. 명목형 데이터 (Nominal Data)

순서나 크기의 개념 없이 단순히 분류만 가능한 데이터다.

예를 들어,

  • 혈액형
  • 성별
  • 지역
  • 질병 종류

A형이 B형보다 크거나 작다고 말할 수 없기 때문에 명목형 데이터에 해당한다.

2. 순서형 데이터 (Ordinal Data)

순서는 존재하지만, 값의 차이를 수치적으로 계산할 수 없는 데이터다.

예를 들어,

  • 만족도 : 매우 만족 > 만족 > 보통 > 불만족
  • 암 진행 단계 : 1기 → 2기 → 3기 → 4기
  • 통증 정도 : 약함 → 보통 → 심함

순서는 있지만 각 단계 사이의 간격이 일정하다고 볼 수 없기 때문에 평균을 계산하는 것은 적절하지 않다.


정리

데이터 타입특징예시
숫자형계산이 가능키, 몸무게, 혈당
이산형셀 수 있는 값방문 횟수, 자녀 수
연속형측정되는 값체온, 혈압
범주형그룹을 구분성별, 혈액형
명목형순서 없음혈액형, 지역
순서형순서 있음만족도, 암 진행 단계

AI Healthcare에서는 왜 데이터 타입이 중요할까?

AI 모델은 데이터 타입에 따라 전처리 방법이 달라진다.

예를 들어 키나 혈당처럼 숫자형 데이터는 정규화(Normalization)표준화(Standardization)를 수행하는 경우가 많고, 성별이나 혈액형 같은 범주형 데이터는 원-핫 인코딩(One-Hot Encoding) 등을 이용해 모델이 학습할 수 있는 숫자 형태로 변환한다.

즉, 데이터를 분석하기 전에 각 변수의 데이터 타입을 정확하게 파악하는 것이 데이터 분석과 머신러닝의 첫 단계라고 할 수 있다.

profile
안녕하세요 ⊂(ᴑ╹.╹ᴑ)੭ 열심히 하구있습니당!!

0개의 댓글