표준편차와 분산 계산
데이터 분석에서 표준편차와 분산은 데이터의 분포를 이해하는 중요한 지표로,
Pandas의 std()와 var() 메서드를 사용하면 손쉽게 표준편차와 분산을 계산할 수 있다.
import pandas as pd
# 예제 데이터 생성
data = {'수학': [90, 80, 70], '영어': [98, 88, 95], '음악': [85, 95, 100], '체육': [100, 90, 90]}
df = pd.DataFrame(data, index=["홍길동", "이몽룡", "김삿갓"])
# 표준편차와 분산 계산
print("표준편차:\n", df.std())
print("분산:\n", df.var())
기술 통계 조회
Pandas의 describe() 메서드를 사용하면 데이터의 기본적인 통계 정보를 한 번에 확인할 수 있다. 평균, 표준편차, 최대값, 최소값 등 다양한 통계량을 제공한다.
# 기술 통계 조회
print("기술 통계:\n", df.describe())
데이터 조회 및 변형
데이터를 처리할 때는 특정 행이나 열을 조회하고, 필요에 따라 변형하는 작업이 필요하다.
다음 코드는 loc[]와 drop() 메서드를 사용하여 데이터의 일부를 조회하거나 제거하는 예를 보여준다.
# 이몽룡의 데이터 조회 (loc 사용)
print("이몽룡의 데이터:\n", df.loc["이몽룡"])
# 특정 행 제거 (홍길동)
df.drop(["홍길동"], axis=0, inplace=True)
print("홍길동 제거 후:\n", df)
# 특정 열 제거 (체육)
df.drop(["체육"], axis=1, inplace=True)
print("체육 제거 후:\n", df)
# 인덱스를 컬럼으로 변환
df.reset_index(inplace=True)
print("인덱스 변환 후:\n", df)
# 컬럼을 인덱스로 설정
df.set_index("index", inplace=True)
print("인덱스로 변환 후:\n", df)
데이터 저장 및 불러오기
분석한 데이터를 저장하고 다시 불러오는 것은 데이터 분석 과정에서 매우 중요하다.
Pandas는 to_csv() 메서드를 사용하여 DataFrame을 CSV 파일로 쉽게 저장할 수 있으며, read_csv() 메서드를 통해 다시 불러올 수 있다.
# CSV 파일로 저장
df.to_csv("data/df_sample.csv", index=False)
# CSV 파일로부터 읽기
df_loaded = pd.read_csv("data/df_sample.csv")
print("저장된 데이터 읽기:\n", df_loaded)