contents
summary
matplotlib.pyplotimport matplotlib.pyplot as plt
# 데이터 생성
x = [1, 2, 3, 4, 5]
y = [2, 4, 6, 8, 10]
# 선 그래프 그리기
plt.plot(x, y)
plt.xlabel('X-axis')
plt.ylabel('Y-axis')
plt.title('Example Plot')
plt.show()

import pandas as pd
import matplotlib.pyplot as plt
# 샘플 데이터프레임 생성
data = {
'A': [1, 2, 3, 4, 5],
'B': [5, 4, 3, 2, 1]
}
df = pd.DataFrame(data)
# 선 그래프 그리기
df.plot(x='A', y='B')
plt.show()

ax = df.plot(x='A', y='B', color='green', linestyle='--', marker='o')
plt.show()

색은 초록, 선스타일은 점선, 마커는 o로 표시해준다.
*그외
-Color(색상):
- 색상은 문자열로 지정할 수 있으며, 'blue', 'green', 'red', 'cyan', 'magenta', 'yellow', 'black', 'white'와 같은 기본 색상 이름 또는 RGB 값을 직접 지정할 수 있다.
-Linestyle(선 스타일):
- 선의 스타일은 '-'(실선), '--'(대시선), ':'(점선), '-.'(점-대시선) 등으로 지정할 수 있다.
-Marker(마커):
- 마커는 데이터 포인트를 나타내는 기호로, 'o'(원), '^'(삼각형), 's'(사각형), '+'(플러스), 'x'(엑스) 등 다양한 기호로 지정할 수 있다.
legend() 메서드#1 label
ax = df.plot(x='A', y='B', color='green', linestyle='--', marker='o', label='Data Series')
#2 legend
ax.legend(['Data Series'])
#1번 또는 2번 방법으로 범례를 추가할 수 있습니다.
plt.show()

set_xlabel(), set_ylabel(), set_title() 메서드를 사용하여 x축과 y축의 레이블 및 그래프 제목을 추가할 수 있다.ax.set_xlabel('X-axis Label')
ax.set_ylabel('Y-axis Label')
ax.set_title('Title of the Plot')
plt.show()

text()그래프에 특정 위치에 텍스트를 추가ax.text(3, 3, 'Some Text', fontsize=12)
plt.show()

plot() 함수에 color, linestyle, marker, label 등의 파라미터로 스타일과 범례를 적용xlabel(), ylabel(), title(), legend(), text() 함수들을 사용하여 각각의 설정을 추가*plot() 함수 자체에는 범례, 제목, 텍스트를 직접적으로 입력하는 기능은 내장되어 있지 않다.*import matplotlib.pyplot as plt
# 데이터 생성
x = [1, 2, 3, 4, 5]
y = [2, 4, 6, 8, 10]
# 그래프 그리기
plt.plot(x, y, color='green', linestyle='--', marker='o', label='Data Series')
# 추가 설정
plt.xlabel('X-axis Label')
plt.ylabel('Y-axis Label')
plt.title('Title of the Plot')
plt.legend()
plt.text(3, 8, 'Some Text', fontsize=12) # 특정 좌표에 텍스트 추가
# 그래프 출력
plt.show()

plt.figure() 함수를 사용하여 Figure 객체를 생성하고, 이후에 figsize 매개변수를 이용하여 원하는 크기로 설정할 수 있음.import matplotlib.pyplot as plt
# Figure 객체 생성 및 사이즈 설정
plt.figure(figsize=(8, 6)) # 가로 8인치, 세로 6인치
# 데이터 생성
x = [1, 2, 3, 4, 5]
y = [2, 4, 6, 8, 10]
# 그래프 그리기
plt.plot(x, y)
# 그래프 출력
plt.show()

위에는 (8,6)/밑에는 (18,6)
그래프 유형

Line Plot (선 그래프)
:데이터 간의 연속적인 관계를 시각화하는 데에 적합하고, 주로 시간의 흐름에 따른 데이터의 변화를 보여준다.
-자료 유형: 연속적인 데이터의 추이를 보여줄 때 사용.
-활용: 시간에 따른 데이터의 변화, 추세를 보여줄 때 효과적.
import pandas as pd
import matplotlib.pyplot as plt
# 데이터프레임 생성
data = {'날짜': ['2023-01-01', '2023-01-02', '2023-01-03'],
'값': [10, 15, 8]}
df = pd.DataFrame(data)
# '날짜'를 날짜 형식으로 변환
df['날짜'] = pd.to_datetime(df['날짜'])
# 선 그래프 작성
plt.plot(df['날짜'], df['값'])
plt.xlabel('날짜')
plt.ylabel('값')
plt.title('선 그래프 예시')
plt.show()

# 데이터프레임 생성
data = {'도시': ['서울', '부산', '대구', '인천'],
'인구': [990, 350, 250, 290]}
df = pd.DataFrame(data)
# 막대 그래프 작성
plt.bar(df['도시'], df['인구'])
plt.xlabel('도시')
plt.ylabel('인구')
plt.title('막대 그래프 예시')
plt.show()

-Histogram (히스토그램)
: 연속된 데이터의 분포로 주로 데이터의 빈도를 시각화하여 해당 데이터의 분포를 이해하는 데 사용.
-자료 유형: 연속형 데이터의 분포를 보여줄 때 사용.
-활용: 데이터의 빈도나 분포, 패턴을 이해하고자 할 때 유용.
import matplotlib.pyplot as plt
import numpy as np
# 데이터 생성 (랜덤 데이터)
data = np.random.randn(1000)
# 히스토그램 그리기
plt.hist(data, bins=30, color='pink')
plt.xlabel('Value')
plt.ylabel('Frequency')
plt.title('Histogram')
plt.show()

Bar vs Histogram 의 차이

:막대 그래프는 주로 범주형 데이터의 값을 비교하는데 사용되고, 히스토그램은 연속적인 데이터의 분포를 시각화하는 데 사용된다.
Pie Chart (원 그래프)
전체에서 각 부분의 비율로 주로 카테고리별 비율을 비교할 때 사용.
-자료 유형: 범주형 데이터의 상대적 비율을 시각화하는 데 사용.
-활용: 전체에 대한 각 범주의 비율을 보여줄 때 유용하며, 주로 비율을 비교하는 데 사용.
import matplotlib.pyplot as plt
# 데이터 생성
sizes = [30, 20, 25, 15, 10]
labels = ['A', 'B', 'C', 'D', 'E']
# 원 그래프 그리기
plt.pie(sizes, labels=labels, autopct='%1.1f%%')
plt.title('Pie Chart')
plt.show()

import matplotlib.pyplot as plt
import numpy as np
# 데이터 생성
np.random.seed(10)
data = [np.random.normal(0, std, 100) for std in range(1, 4)]
# 박스 플롯 그리기
plt.boxplot(data)
plt.xlabel('Data')
plt.ylabel('Value')
plt.title('Box Plot')
plt.show()

*박스 플롯의 구성 요소:
1)상자(Box): 데이터의 중앙값과 사분위수(25%와 75%). 상자의 아래쪽 끝은 25%의 값(1사분위수), 상자의 윗쪽 끝은 75%의 값(3사분위수)을 나타내고, 상자의 중앙에 위치한 선은 중앙값.
2)수염(Whisker): 상자의 위 아래로 연장되는 선으로, 일반적으로 1.5배의 사분위 범위로 계산되는데, 이 범위를 넘어가는 값은 이상치(outlier)로 간주. 수염의 끝은 최솟값과 최댓값.
3)이상치(Outliers): 수염 부분을 벗어나는 개별 데이터 포인트로, 일반적인 범위를 벗어나는 값들을 의미. 이상치는 박스 플롯에서 독립적으로 표시.

import matplotlib.pyplot as plt
# 데이터 생성
x = [1, 2, 3, 4, 5]
y = [2, 3, 5, 7, 11]
# 산점도 그리기
plt.scatter(x, y)
plt.xlabel('X-axis')
plt.ylabel('Y-axis')
plt.title('Scatter Plot')
plt.show()

key points
코랩의 경우 한글깨짐현상!
!pip install koreanize-matplotlib
설치후
import koreanize_matplotlib
임포트해서 사용하면 현재 사용가능, 업데이트 이후 사라질 수 도 있음.
일단 데이터에 직접 적용을 해보는 연습이 먼저 필요할 것 같다.