📖 Statistics
🌟 Data Read
import pandas as pd
df = pd.read_csv('링크')
🌟 head()
💭 Q96. 상위 10개의 행을 출력
Ans = df.head(10)
Ans
🌟 deletes
💭 Q97. 'Unnamed: 0' and 'Id'를 제거
del df['Unnamed: 0']
del df['Id']
df.head()
🌟 value_counts()
💭 Q98. 데이터셋에 남성 이름이 더 많나요, 아니면 여성 이름이 더 많나요?
df['Gender'].value_counts()
🌟 groupby
💭 Q99. 데이터셋을 이름별로 그룹화여 'Count'를 Sum하고, names라는 변수에 할당
- 상위 5개의 행만 출력
sort_values(by=[])
ascending=0 = ascending=False
ascending=1 = ascending=True
names = pd.DataFrame(df.groupby('Name')['Count'].sum())
names.sort_values(by=['Count'], ascending=0).head(5)
🌟 nunique()
💭 Q100. 서로 다른 이름은 총 몇개인가요?
df['Name'].nunique()
🌟 Count
💭 Q100. 가장 많이 등장한 이름은?
names[names.Count == names.Count.max()]
💭 Q101. 가장 적게 등장한 이름은 몇개인가요?
len(names[names.Count == names.Count.min()])
names[names.Count == names.Count.median()]
💭 Q103. 이름 개수(Count)의 표준편차를 구하기
names.Count.std()
🌟 describe()
💭 Q104. names의 평균, 최소, 최대, 표준편차, 4분위수를 계산
names.describe()