기술통계 describe()

데이터 분석을 하다보면 통계를 만나는 경우가 종종 있다.

Pandas에서 통계를 사용할 때는 통계를 지원하는 메소드 describe()를 사용한다.

describe를 사용한 데이터프레임 확인

  • 데이터의 분포, count 등의 정보를 파악할 수 있다.
df.describe()

  • count - 갯수
  • mean - 평균값
  • std - 표준편차
  • min - 최소값
  • 25%, 50%, 75% - 분위 수 값
    • 최소~25% 부분에 있는 신장은 어떤가? 178cm
    • 최소~50% 부분에 있는 체중은? 76kg
  • max - 최대값

round함수를 활용하여 반올림도 가능.

df.describe().round(2)

문자열을 통계화 할 수도 있다.

기본적으로 describe() 메소드는 숫자형태만 지원하지만 문자형태도 지원하게 할 수 있다.

df.describe(include =all)

describe 인자에 include를 넣어주고 거기에 all이라고 넣어준다.

이때 숫자를 활용해야 되는 값들은 NaN 표시로 결측 형태를 띔.

추가된 컬럼 unique, top, freq

  • unique - 유니크한 값 갯수
  • top - 가장 많이 있는 데이터, 또는 첫번째 인덱스 정보
    • 먼저 나오는 인덱스 기준으로 가장 많이 있는 데이터를 추출.
      • 이름컬럼은 중복값이 없기 때문에 첫번째 인덱스인 채치수가 나옴.
      • 포지션컬럼은 스몰포워드 6개, 포인트가드 6개 이지만 인덱스에서 스몰포워드가 가장 먼저 나왔기 때문에 top 포지션은 스몰포워드가 됨.
  • freq - top의 값이 몇개인지 보여줌.
    • 채치수는 1명
    • 스몰포워드는 6명
    • 북산은 9명

0개의 댓글