6/27 Today I Learned -1

boks·2024년 6월 27일
post-thumbnail

📖 학습한 내용

  • 시계열 데이터

📖 핵심내용

📌 시계열 데이터

  • 시간 순서대로 수집하거나 정렬한 순차적인(Sequential) 데이터를 활용하여 미래 시점의 상태를 예측
  • 시계열 예측의 특징

    • 완벽한 예측X, 변동 가능성 높음
    • 다변량(multivariate) Data.
    • 데이터셋 구성 변형 어려움
    • 좋은 예측 성능을 위해서 데이터의 성질 고려필요
    • 데이터가 정상성을 띨 때 시계열 예측 정확도가 높음
    • 정상성 갖추지 못했다면 변환 필요이 필요 (차분, 로그변환 등)
  • 시계열 데이터의 특성

    • 시간 종속성
    • 불규칙성
    • 계절성
    • 추세
    • 주기성
    • 정상성
  • 정상성 검증 통계적 방법

📌 마이닝 알고리즘

📖 흥미로운 점 / 새로 알게된 점

  • 데이터 설계를 왜하는가?
    데이터 타입 정하기 - 엄청난 정보를 저장한다면, 메모리가 엄청 크기 때문에 미리 설계를 해야한다. 뉴럴넷에서 여러 자료형을 정하는 것도 중요한 부분이다.

  • 데이터 살펴보기
    csv 같은 데이터를 받았을때, 당연히 먼저 열어서 살펴본다.

  • 자기만의 코드 관리

    • 무엇이 어디에있는지 아는게 제일 중요하다. -> 정리를 체계적으로 잘할 것
    • 시각화만 따로 모아놓기
    • 모델링
    • EDA
    • 주로 내가하는 것 엑기스..
  • flatten()
    이미지는 2차원의 값이다.
    fillna(method='ffill'):

광주시 기온 예측

  • 결측값 채우기
df_fillna.fillna(method='ffill')

이전에 행에 채워진 데이터와 똑같이 채운다

시계열 데이터

  • 데이터셋 구성 변형 어려움
    시계열 데이터는 시간 순서를 유지해야하고, 각 값은 이전 값들과 상관관계를 가진다. 또한 계절성과 트렌드를 포함하고, 연속성의 띄고 있기때문에 구성을 변형하기 어렵다.
    예를 들어, 날씨 데이터에서 오늘의 온도는 어제의 온도와 상관관계가 큽니다. 이를 무시하고 데이터를 변형하면 예측의 정확도가 떨어진다.
  • 다변량(multivariate) Data.
    여러 독립 변수와 여러 종속 변수가 데이터에 들어간다.
    예를 들어, 여러 주식의 가격 변동을 예측할 때, 각 주식의 가격이 다른 주식의 가격 변동과 상관관계가 있을 수 있습니다.
  • 상관관계 기준
    도메인지식, 문제의 심각성, 통상적인 기준으로 상관계수의 기준값을 잡는다
profile
설계엔지니어의 변신

0개의 댓글