사용한 데이터에 대한 설명
보스턴 집 값 데이터
수집한 데이터의 형식과 속성 설명
기초 통계량 분석


변동계수 높다 → 표준편차 비교적 크다.
CHAS는 0일때 없음. 1일때 있음 의미. 평균 0.06. = > 강가는 거의 없음.
ZN 값이 높으면 대형 주택이 많고, 값이 낮으면 소형 주택이나 상업/산업 용지가 많다는 특징!
ZN 전체 값(506) 중 0이 아닌 값 134. -> 대부분 소형 주택단지,산업/상업 용지, 간혹 대형 주택 단지임.
CRIM 평균은 3.6이지만, 중앙값은 0.25
SELECT COUNT(*) count_crime
FROM boston_house_prices
WHERE CRIM <1;

1보다 낮은 값 332개지만, 큰 값이 매우 커서 평균을 상승시킴.
범죄율 편차가 크기 때문에, 범죄율이 1 이하인 지역으로 결정함.
SELECT *
FROM boston_house_prices
WHERE CRIM < 1
AND CMEDV <=
(SELECT AVG(CMEDV)
FROM boston_house_prices)
AND TAX <=
(SELECT AVG(TAX)
FROM boston_house_prices)
AND DIS <=
(SELECT AVG(DIS)
FROM boston_house_prices)
ORDER BY CMEDV;
40개로 간추림

AVG(RAD) = 3.9250
RAD = INT 값 이므로 RAD >2 조건 추가

Revere 지역이 집 값도 싸고 범죄율도 낮고, 직장과 거리도 가깝다. 그러나 세금은 최종 선택 지역 중 가장 높다. 그래도 평균 수준.
세금 절약을 원한다면, 집 값이 20을 넘지 않고 Revere보다 세금이 100이상 낮은 Sargus, Waltham 등의 지역도 고려하는 것이 좋겠다.
최종적으로, 나라면 Sargus를 선택하겠다. 모든 조건을 다 충족하고 빈민 비율이 10 이하이기 때문이다.
우선 아무 사전 정보 없이 보스턴 집 값 데이터를 가지고 분석하려고하니 어디서 부터 시작할지 몰라 막막했다. 분석 예시를 살펴보고 내가 직접 이사갈 곳을 정한다는 생각으로 분석을 시작했다. 데이터를 분석하면서 부족한 점을 많이 느낄 수 있었다.
실제 데이터 분석을 해보니까 어렵고 팀원들의 분석을 보면서 느낀점도 많고 배운점도 정말 많았다. 벌써 사전캠프가 하루밖에 남지 않았다. 내일 조금 더 잘 해보자! 잘 마무리하고 싶다.