머신러닝_ X,y 설정, test/train 나누기(2)

김현희·2026년 5월 4일

1. 자료 불러오기

  • load_diabetes()는 sklearn 안에 원래 들어있는 예제용 데이터셋
  • sklearn = 머신러닝 라이브러리
  • datasets = 연습용 데이터 모음

  • bunch :여러 개의 자료를 다발로 묶어 놓은 타입으로 딕셔너리(dict)처럼 생겼는데, 점(.)과 []으로도 접근 가능한 객체
    ➡️ print(diabetes.data), print(diabetes['data'])
  • Bunch를 쓰면 이유는 여러 정보를 한 번에 묶어서 dict처럼 관리하는 게 편하기 떄문

2. 자료 확인


➡️ 결과가 연속형이므로 분류(Classification)가 아닌 회귀(Regression)를 통해 분석해야 함을 알 수 있음

3. X,y 나누기

  • DESCR는 Description(설명)의 줄임말로 이 데이터셋에 대한 설명서 느낌
  • DESCR을 입력하면 엄청 긴 텍스트가 나오는데, 거기에는 데이터가 어떤 데이터인지, 컬럼 의미, 타겟 의미, 샘플 개수, 논문 출처 같은 정보가 포함됨
profile
AI 헬스케어 공부하는 간호사

0개의 댓글