📖 학습한 내용
📖 핵심내용
📌 시계열 데이터
- 시간 순서대로 수집하거나 정렬한 순차적인(Sequential) 데이터를 활용하여 미래 시점의 상태를 예측
-
시계열 예측의 특징
- 완벽한 예측X, 변동 가능성 높음
- 다변량(multivariate) Data.
- 데이터셋 구성 변형 어려움
- 좋은 예측 성능을 위해서 데이터의 성질 고려필요
- 데이터가 정상성을 띨 때 시계열 예측 정확도가 높음
- 정상성 갖추지 못했다면 변환 필요이 필요 (차분, 로그변환 등)
-
시계열 데이터의 특성
- 시간 종속성
- 불규칙성
- 계절성
- 추세
- 주기성
- 정상성
-
정상성 검증 통계적 방법
📌 마이닝 알고리즘
📖 흥미로운 점 / 새로 알게된 점
-
데이터 설계를 왜하는가?
데이터 타입 정하기 - 엄청난 정보를 저장한다면, 메모리가 엄청 크기 때문에 미리 설계를 해야한다. 뉴럴넷에서 여러 자료형을 정하는 것도 중요한 부분이다.
-
데이터 살펴보기
csv 같은 데이터를 받았을때, 당연히 먼저 열어서 살펴본다.
-
자기만의 코드 관리
- 무엇이 어디에있는지 아는게 제일 중요하다. -> 정리를 체계적으로 잘할 것
- 시각화만 따로 모아놓기
- 모델링
- EDA
- 주로 내가하는 것 엑기스..
- flatten()
이미지는 2차원의 값이다.
fillna(method='ffill'):
광주시 기온 예측
df_fillna.fillna(method='ffill')
이전에 행에 채워진 데이터와 똑같이 채운다
시계열 데이터
- 데이터셋 구성 변형 어려움
시계열 데이터는 시간 순서를 유지해야하고, 각 값은 이전 값들과 상관관계를 가진다. 또한 계절성과 트렌드를 포함하고, 연속성의 띄고 있기때문에 구성을 변형하기 어렵다.
예를 들어, 날씨 데이터에서 오늘의 온도는 어제의 온도와 상관관계가 큽니다. 이를 무시하고 데이터를 변형하면 예측의 정확도가 떨어진다.
- 다변량(multivariate) Data.
여러 독립 변수와 여러 종속 변수가 데이터에 들어간다.
예를 들어, 여러 주식의 가격 변동을 예측할 때, 각 주식의 가격이 다른 주식의 가격 변동과 상관관계가 있을 수 있습니다.
- 상관관계 기준
도메인지식, 문제의 심각성, 통상적인 기준으로 상관계수의 기준값을 잡는다