[250213] 사전캠프 20일차 데이터 분석 실습

이효원·2025년 2월 13일

데이터 분석 실습

데이터 분석 문제 정의

  1. 데이터 분석 대상 정의
    보스턴으로 취업에 성공한 20대 후반 직장인. 어디로 이사를 가야할지 선정.
  2. 데이터 분석 문제 정의
    • 집 값은 싸고, 세금이 낮고, 고용센터와 가까운 곳을 찾기.
    • 범죄율이 너무 심한 곳은 제외.
    • 고속도로 접근성 높으면 좋음. (2차 조건 : RAD)

사용한 데이터

  1. 사용한 데이터에 대한 설명

    보스턴 집 값 데이터

  2. 수집한 데이터의 형식과 속성 설명

    • TOWN(object) : 지역 이름
    • LON, LAT(float) : 위도, 경도 정보
    • CMEDV(float) : 해당 지역의 집값(중간값)
    • CRIM(float) : 근방 범죄율
    • ZN(float) : 주택지 비율
    • INDUS(float) : 상업적 비즈니스에 활용되지 않는 농지 면적
    • CHAS(int) : 경계선에 강에 있는지 여부
    • NOX(float) : 산화 질소 농도
    • RM(float) : 자택당 평균 방 개수
    • AGE(float) : 1940 년 이전에 건설된 비율
    • DIS(float) : 5 개의 보스턴 고용 센터와의 거리에 다른 가중치 부여
    • RAD(int) : radial 고속도로와의 접근성 지수
    • TAX(int) : 10000달러당 재산세
    • PTRATIO(float) : 지역별 학생-교사 비율
    • B(float) : 지역의 흑인 지수 (1000(B - 0.63)^2), B는 흑인의 비율.
    • LSTAT(float) : 빈곤층의 비율

데이터 살펴보기

기초 통계량 분석

데이터 분석하기

범죄율 필터링 기준 설정

변동계수 높다 → 표준편차 비교적 크다.

  1. CHAS(강 여부) 3.66
  2. CRIM(범죄율) 2.37
  3. ZN(주택지 비율) 2.05

CHAS는 0일때 없음. 1일때 있음 의미. 평균 0.06. = > 강가는 거의 없음.

ZN 값이 높으면 대형 주택이 많고, 값이 낮으면 소형 주택이나 상업/산업 용지가 많다는 특징!
ZN 전체 값(506) 중 0이 아닌 값 134. -> 대부분 소형 주택단지,산업/상업 용지, 간혹 대형 주택 단지임.

CRIM 평균은 3.6이지만, 중앙값은 0.25

SELECT COUNT(*) count_crime
FROM boston_house_prices
WHERE CRIM <1;


1보다 낮은 값 332개지만, 큰 값이 매우 커서 평균을 상승시킴.
범죄율 편차가 크기 때문에, 범죄율이 1 이하인 지역으로 결정함.

필터링 : 집 값, 세금, 직장과의 거리

    SELECT *
    FROM boston_house_prices
    WHERE CRIM < 1 
    AND CMEDV <= 
    		(SELECT AVG(CMEDV)
    		FROM boston_house_prices) 
    AND TAX <= 
    		(SELECT AVG(TAX)
    		FROM boston_house_prices)
    AND DIS <= 
    		(SELECT AVG(DIS)
    		FROM boston_house_prices)
    ORDER BY CMEDV;

40개로 간추림

RAD 고속도로 접근성 추가

AVG(RAD) = 3.9250

RAD = INT 값 이므로 RAD >2 조건 추가

최종 결과


Revere 지역이 집 값도 싸고 범죄율도 낮고, 직장과 거리도 가깝다. 그러나 세금은 최종 선택 지역 중 가장 높다. 그래도 평균 수준.
세금 절약을 원한다면, 집 값이 20을 넘지 않고 Revere보다 세금이 100이상 낮은 Sargus, Waltham 등의 지역도 고려하는 것이 좋겠다.
최종적으로, 나라면 Sargus를 선택하겠다. 모든 조건을 다 충족하고 빈민 비율이 10 이하이기 때문이다.

느낀점

우선 아무 사전 정보 없이 보스턴 집 값 데이터를 가지고 분석하려고하니 어디서 부터 시작할지 몰라 막막했다. 분석 예시를 살펴보고 내가 직접 이사갈 곳을 정한다는 생각으로 분석을 시작했다. 데이터를 분석하면서 부족한 점을 많이 느낄 수 있었다.

  • 먼저 컬럼명의 의미를 봐도 정확한 지식이 없어서 제대로 이해 불가
    • 산화 질소 농도가 뭔지, 얼마나 높아야 안좋은거고 어디까지는 괜찮은건지 등 세부적인 내용을 모르기 때문에 데이터를 보고도 이해X
    • 덕분에 도메인 지식의 필요성이 체감됨
  • 파이썬을 다루지 못해서 엑셀로 계산을 하고 시각화
    • 툴의 중요성을 느낌
    • 다들 상관관계는 어떻게 구하신걸까?
    • 얼른 캠프를 해서 파이썬을 잘 다루고 싶다!
  • 결론의 의미를 파악하지 못하고 결과 제시에 그침
    • 데이터 처리 이후, 결론을 제시하지 못함
    • 특정 지역에 빈민층이 많은 이유, 세금 300을 넘는 것이 뭘 의미하는지 등등 구체적인 지식이 없어서 해석을 못함
    • 왜 그럴까? 의문점이 더 남으면 안됨

실제 데이터 분석을 해보니까 어렵고 팀원들의 분석을 보면서 느낀점도 많고 배운점도 정말 많았다. 벌써 사전캠프가 하루밖에 남지 않았다. 내일 조금 더 잘 해보자! 잘 마무리하고 싶다.

0개의 댓글