- [ Pandas ] - 분포와 통계량

민짜이·2025년 1월 18일

데이터분석

목록 보기
12/14

집계를 하면 반드시 하나의 결과값이 나옵니다.
이러한 과정을 공학적으로 Reduce 통계적으로 aggregation(집계)라고 합니다.
1개의 값은 대표값, 통계량이라고 표현됩니다.
통계량에는 (평균, 표준편차, 분산, 중앙값, 최빈값, .. )것들이 있습니다.

describe()

describe()은 column별 값의 개수, 평균, 표준편차, 최솟값, 최댓값, 사분위수 보여주는 메서드입니다.

import pandas as pd

df=pd.read_csv("./data/titanic_train.csv")
df.describe()

위 코드의 결과는 다음과 같습니다.

대푯값

메소드설명
min()최솟값
max()최댓값
mean()평균
median()중간값
std()표준편차
var()분산
quantile()분위수

위 메서드를 통해 데이터프레임의 대푯값이나, 특정 컬럼에 대한 대푯값을 구할 수 있습니다.

df.median(numeric_only=True)

위 코드의 결과는 다음과 같습니다.

PassengerId    446.0000
Survived         0.0000
Pclass           3.0000
Age             28.0000
SibSp            0.0000
Parch            0.0000
Fare            14.4542
dtype: float64

corr

corr()는 데이터프레임에서 각 열 간의 상관관계를 계산하는 메서드입니다.
상관계수는 두 변수가 얼마나 함께 변하는지를 나타내는 값으로, 다음과 같은 정의를 가집니다

상관계수(𝑟) = 두 변수가 함께 변하는 정도 (동분산) / 각 변수가 변하는 정도 (각 분산의 곱)

상관계수의 값은 -1부터 1 사이로 나타나며, 다음과 같이 해석됩니다.

  • 1: 완벽한 양의 상관관계 (한 변수가 증가하면 다른 변수도 비례적으로 증가)
  • 0: 상관관계 없음 (두 변수 간에 패턴이 없음)
  • -1: 완벽한 음의 상관관계 (한 변수가 증가하면 다른 변수는 반비례적으로 감소)
df.corr(numeric_only=True)

위 코드의 결과는 다음과 같습니다.

profile
꼬박꼬박

0개의 댓글