집계를 하면 반드시 하나의 결과값이 나옵니다.
이러한 과정을 공학적으로 Reduce 통계적으로 aggregation(집계)라고 합니다.
1개의 값은 대표값, 통계량이라고 표현됩니다.
통계량에는 (평균, 표준편차, 분산, 중앙값, 최빈값, .. )것들이 있습니다.
describe()은 column별 값의 개수, 평균, 표준편차, 최솟값, 최댓값, 사분위수 보여주는 메서드입니다.
import pandas as pd
df=pd.read_csv("./data/titanic_train.csv")
df.describe()
위 코드의 결과는 다음과 같습니다.

| 메소드 | 설명 |
|---|---|
| min() | 최솟값 |
| max() | 최댓값 |
| mean() | 평균 |
| median() | 중간값 |
| std() | 표준편차 |
| var() | 분산 |
| quantile() | 분위수 |
위 메서드를 통해 데이터프레임의 대푯값이나, 특정 컬럼에 대한 대푯값을 구할 수 있습니다.
df.median(numeric_only=True)
위 코드의 결과는 다음과 같습니다.
PassengerId 446.0000
Survived 0.0000
Pclass 3.0000
Age 28.0000
SibSp 0.0000
Parch 0.0000
Fare 14.4542
dtype: float64
corr()는 데이터프레임에서 각 열 간의 상관관계를 계산하는 메서드입니다.
상관계수는 두 변수가 얼마나 함께 변하는지를 나타내는 값으로, 다음과 같은 정의를 가집니다
상관계수(𝑟) = 두 변수가 함께 변하는 정도 (동분산) / 각 변수가 변하는 정도 (각 분산의 곱)
상관계수의 값은 -1부터 1 사이로 나타나며, 다음과 같이 해석됩니다.
df.corr(numeric_only=True)
위 코드의 결과는 다음과 같습니다.
