[python] Pandas - 표준편차, 분산 및 데이터 처리

혜진·2024년 8월 13일

Python

목록 보기
12/16
post-thumbnail

Pandas로 표준편차, 분산 및 데이터 처리

표준편차와 분산 계산

데이터 분석에서 표준편차와 분산은 데이터의 분포를 이해하는 중요한 지표로,
Pandas의 std()와 var() 메서드를 사용하면 손쉽게 표준편차와 분산을 계산할 수 있다.

📑 표준편차와 분산 계산 예제

import pandas as pd

# 예제 데이터 생성
data = {'수학': [90, 80, 70], '영어': [98, 88, 95], '음악': [85, 95, 100], '체육': [100, 90, 90]}
df = pd.DataFrame(data, index=["홍길동", "이몽룡", "김삿갓"])

# 표준편차와 분산 계산
print("표준편차:\n", df.std())
print("분산:\n", df.var())

기술 통계 조회

Pandas의 describe() 메서드를 사용하면 데이터의 기본적인 통계 정보를 한 번에 확인할 수 있다. 평균, 표준편차, 최대값, 최소값 등 다양한 통계량을 제공한다.

📑 기술 통계 조회 예제

# 기술 통계 조회
print("기술 통계:\n", df.describe())

데이터 조회 및 변형

데이터를 처리할 때는 특정 행이나 열을 조회하고, 필요에 따라 변형하는 작업이 필요하다.
다음 코드는 loc[]와 drop() 메서드를 사용하여 데이터의 일부를 조회하거나 제거하는 예를 보여준다.

📑 데이터 조회 및 변경 예제

# 이몽룡의 데이터 조회 (loc 사용)
print("이몽룡의 데이터:\n", df.loc["이몽룡"])

# 특정 행 제거 (홍길동)
df.drop(["홍길동"], axis=0, inplace=True)
print("홍길동 제거 후:\n", df)

# 특정 열 제거 (체육)
df.drop(["체육"], axis=1, inplace=True)
print("체육 제거 후:\n", df)

📑 reset_index()와 set_index() 메서드 사용 예제

# 인덱스를 컬럼으로 변환
df.reset_index(inplace=True)
print("인덱스 변환 후:\n", df)

# 컬럼을 인덱스로 설정
df.set_index("index", inplace=True)
print("인덱스로 변환 후:\n", df)

데이터 저장 및 불러오기

분석한 데이터를 저장하고 다시 불러오는 것은 데이터 분석 과정에서 매우 중요하다.
Pandas는 to_csv() 메서드를 사용하여 DataFrame을 CSV 파일로 쉽게 저장할 수 있으며, read_csv() 메서드를 통해 다시 불러올 수 있다.

📑 데이터 저장 및 불러오기

# CSV 파일로 저장
df.to_csv("data/df_sample.csv", index=False)

# CSV 파일로부터 읽기
df_loaded = pd.read_csv("data/df_sample.csv")
print("저장된 데이터 읽기:\n", df_loaded)

0개의 댓글