오늘은 Selenium과 BeautifulSoup을 같이 사용해서 동적인 웹 페이지를 크롤링하는 실습을 했다.스타벅스 매장 찾기, 무신사 스냅 이미지, 네이버 영화 관람평을 대상으로 버튼 클릭, 필터 적용, 스크롤, 데이터 추출을 해봤다. 마지막으로 알라딘 베스트셀러
오늘은 Git과 GitHub 수업을 듣고 팀 협업을 실습했다. 팀 저장소를 만들고, 한 명씩 돌아가며 텍스트 파일을 작성해 PR을 보내는 방식이었다.작업은 작은 파일 하나였지만, 내 컴퓨터에서 만든 변경 내용을 팀에 공유하고 다시 받아오는 흐름까지 따라가 봤다.수업에서
지난번 알라딘 과제를 다시 봤다. 잘못 작성한 부분을 고치면서 수집 방식도 두 가지로 정리했다.그리고 과제 범위를 다시 확인했다. 1,000개 전체가 아니라 첫 50개의 책 정보만 가져오는 과제였다. 페이지를 끝까지 넘기는 것까지 생각하면서 범위를 넓게 잡고 있었다.기
오늘은 한 파일을 여러 사람이 수정하는 상황을 실습했다. 같은 파일에 각자 이름을 추가하고, 한 명씩 순서대로 팀 저장소에 반영하는 방식이었다.지난번에 배운 브랜치와 PR 흐름을 다시 사용하면서, 다른 사람이 올린 내용을 받아온 뒤 내 작업을 시작하는 과정까지 연습했다
오늘은 동기·비동기 프로그래밍 수업을 짧게 진행했다. 윗층 공사 소음이 심해서 수업을 길게 이어가지는 못했고, 이후에는 중간 팀프로젝트의 주제를 좁히고 개발 흐름과 기획을 구상하는 시간을 가졌다.수업에서는 프로그램·프로세스·스레드 개념을 정리하고, asyncio 예제로
어제 비동기 실행 흐름을 살펴본 데 이어, 오늘은 SQLAlchemy로 데이터베이스를 다뤘다. PostgreSQL에 회원 테이블을 만들고 추가·조회·수정·삭제하는 수업 실습이었다.같은 작업을 SQL로 직접 작성하는 방식과 SQLAlchemy 구문으로 작성하는 방식으로
오늘은 SQLAlchemy로 멜론 순위 데이터를 DB에 넣는 과제를 진행하고, NumPy 기초를 배웠다. 어제 회원 데이터로 다룬 CRUD를 CSV 데이터에 적용한 뒤, 배열의 값과 구조를 확인하는 실습으로 이어졌다. CSV 데이터를 테이블에 담기 SQLAlchem
어제는 NumPy 배열을 만들고 차원을 확인했다면, 오늘은 배열의 형태를 바꾸고 연산하는 방법을 배웠다. 이어서 pandas의 Series를 만들고, 인덱스로 값을 찾거나 조건에 맞게 묶는 실습을 했다.np.arange()로 연속된 값을 만들고 reshape()로 모양
오늘은 pandas의 DataFrame으로 데이터를 조회하고 조건별로 집계했다. 이어서 Matplotlib으로 그래프를 그리고, 평균·편차·분산·표준편차를 계산해봤다.지난 시간의 Series에서 행과 열을 가진 표로 넘어가, 데이터를 골라 보고 시각화하는 흐름까지 실습
오늘 배운 내용을 카페 예제 데이터로 문제를 내고 풀어봤다. 데이터 조회부터 매출 집계, 결측값 처리, 통계 계산, 그래프까지 순서대로 정리했다. 답은 노트북에 작성한 풀이를 바탕으로 정리했다. 다시 확인하면서 발견한 실수는 기존 풀이와 수정안을 구분해 남겼다. 실
오늘은 확률분포 개념을 정리하고, 결측값·이상치·중복값을 처리하는 방법을 배웠다. 이후 타이타닉 데이터로 상관관계를 살펴보고, 가설을 세워 집단별 생존율을 비교했다.기초 통계에서는 확률변수와 확률분포, 확률질량함수와 확률밀도함수를 다뤘다. 이산형은 각 값이 나올 확률을
오늘은 데이터 전처리와 EDA를 세 가지 데이터에 적용했다. 타이타닉 데이터에서는 전처리 후 가설을 확인했고, 야후 파이낸스 데이터에서는 수익률과 낙폭을 계산했다. 마지막으로 HR 데이터에서 이직 여부와 근무 조건의 관계를 살펴봤다.먼저 수치형 컬럼의 상관관계를 확인하
오늘은 머신러닝이 다루는 작업과 학습 방식의 큰 흐름을 정리하고, scikit-learn으로 Iris 데이터를 분류하는 SVM 실습을 진행했다.규칙을 직접 작성하는 방식과 달리, 머신러닝은 데이터의 특징과 정답을 바탕으로 패턴을 학습해 새로운 입력을 예측한다. 수업에서
오늘은 SVM으로 위조지폐를 분류하고, KNN으로 물고기와 펄서 신호를 분류하는 실습을 진행했다. 같은 분류 문제라도 데이터의 스케일, 클래스 비율, 입력값의 순서가 결과 해석에 영향을 준다는 점을 같이 확인했다.Banknote Authentication 데이터에는 웨
오늘은 펄서 데이터의 KNN 분류를 다시 확인한 뒤, 이진 분류에 사용하는 로지스틱 회귀를 타이타닉과 소셜 광고 데이터에 적용했다. 선형 회귀와 로지스틱 회귀가 같은 0·1 데이터를 다룰 때 왜 다른 선택이 되는지도 비교했다.펄서 데이터는 우주 잡음 11,375개와 펄
오늘은 대학원 합격 데이터를 이용해 로지스틱 회귀와 규제 모델을 비교하고, 중고차 가격 데이터에 결정 트리 회귀를 적용했다. 분류에서는 정답을 맞힌 비율을, 가격 예측에서는 실제 값과 예측값의 차이를 확인했다.대학원 합격 데이터에서 식별용 컬럼 두 개를 제외하고, GR
오늘은 어제 중고차 가격 예측에 사용한 결정 트리를 랜덤 포레스트로 확장하고, 통신사 고객 이탈 데이터로 분류 실습을 진행했다. 여러 트리의 결과를 합치는 방식과 특성 중요도를 확인했다.어제 전처리한 중고차 데이터와 같은 학습·테스트 분할을 사용했다. 랜덤 포레스트는