[Python] 08. Statistics

hhyun·2024년 6월 22일

[Python]

목록 보기
8/11

📖 Statistics

🌟 Data Read

import pandas as pd
df = pd.read_csv('링크')

🌟 head()

💭 Q96. 상위 10개의 행을 출력

Ans = df.head(10)
Ans

🌟 deletes

💭 Q97. 'Unnamed: 0' and 'Id'를 제거

# deletes 'Unnamed: 0'
del df['Unnamed: 0']

# deletes 'Id'
del df['Id']

df.head()

# Solutio2)
# df2 = df[['Name', 'Year', 'Gender', 'State', 'Count']]

🌟 value_counts()

💭 Q98. 데이터셋에 남성 이름이 더 많나요, 아니면 여성 이름이 더 많나요?

df['Gender'].value_counts()

🌟 groupby

💭 Q99. 데이터셋을 이름별로 그룹화여 'Count'를 Sum하고, names라는 변수에 할당

  • 상위 5개의 행만 출력
  • sort_values(by=[])
  • ascending=0 = ascending=False
  • ascending=1 = ascending=True
names = pd.DataFrame(df.groupby('Name')['Count'].sum())
names.sort_values(by=['Count'], ascending=0).head(5)

🌟 nunique()

💭 Q100. 서로 다른 이름은 총 몇개인가요?

df['Name'].nunique()

🌟 Count

💭 Q100. 가장 많이 등장한 이름은?

names[names.Count == names.Count.max()]

💭 Q101. 가장 적게 등장한 이름은 몇개인가요?

len(names[names.Count == names.Count.min()])

💭 Q102. 중앙값(median)의 개수를 가지고 있는 이름은?

names[names.Count == names.Count.median()]

💭 Q103. 이름 개수(Count)의 표준편차를 구하기

  • std() : 표준편차
names.Count.std()

🌟 describe()

💭 Q104. names의 평균, 최소, 최대, 표준편차, 4분위수를 계산

names.describe()

0개의 댓글