
Numpy?

Pandas?

matplotlib

seaborn

가설검정 / 제1종오류 / 제2종오류
p-value

t-test

기술통계, 추론통계

결측치, 이상치

Pandas의 merge() 메소드와 join() 메소드의 차이는 무엇이고, 언제 어떤 것을 사용하는 것이 더 적절한가요?

3주차 Weekly Paper 두 번째 question-Q) Tableau Public에서 인상적인 비즈니스 시각화 대시보드를 찾아서 공유해주세요. 태블로의 어떤 기능을 이용하여 구현했을지 추측한 결과를 공유해주세요.Hmm.. 일단 오늘 실습했던 자료가 Super St

Q1) GROUP BY 절과 HAVING 절의 차이점은 무엇인가요? 1. GROUP BY 절 2. HAVING 절 😎

Q2) 데이터베이스에서 NULL 값이란 무엇인가요? NULL 값을 처리하는 함수는 무엇이 있나요? 1. NULL 값? 1) NULL? 값이 없는 상태 missing / unknown / not applicable ex. B의 나이는 0도 아니고 빈 값도 아

Q1) 데이터베이스 정규화란 무엇인가요? 또, 정규화의 장단점은 무엇인가요?1) 정규화란?데이터의 중복을 최소화하고,데이터 구조를 체계적으로 정리하는 과정"같은 데이터를 여러 번 저장하지 않도록 테이블을 잘 나누는 작업"데이터를 여러 개의 테이블로 분리하고,각 테이블이

Q2) 논리적 모델링에서 사용되는 주요 구성 요소인 엔터티, 속성, 관계에 대해 예시를 들어 설명해주세요.>데이터로 관리하고 싶은 대상(객체)ex. - 고객 - 주문 - 상품\-> "정보를 저장할 가치가 있는 대상"이면 엔터티\*\* 특징독립적으로 존재 가능여러

Q1) BeautifulSoup과 Selenium은 어떤 상황에서 각각 더 적합한가요?1) 정의가져온 HTML 문서를 분석하고 원하는 태그를 뽑아내는 도구이미 받은 웹페이지 코드에서 정보만 뽑기!2) 장점가볍고 빠름코드가 비교적 단순함서버 자원 부담이 적음3) 단점자바

Q2) robots.txt 파일이란 무엇이며, 웹 스크래핑 시 왜 중요한가요?웹사이트가 크롤러(봇)에게 주는 접근 규칙 안내 파일"여기는 들어와도 되고, 여기는 들어오지 마세요"라고 알려주는 웹사이트의 이용 가이드사이트 주소 뒤에 아래와 같이 붙이면 확인 가능:1) 법

Q1) AARRR 프레임워크(취득, 활성화, 유지, 수익 창출, 추천)와 리텐션 개념을 설명해 주세요. Funnel 분석과의 연관성을 설명해 주세요.사용자 라이프사이클을 5단계로 나눈 성장 분석 모델사용자가 어디서 유입되었는지주요 지표방문자 수 (Traffic)유입 채

Q2) 코호트와 세그먼트의 차이점은 무엇인가요?같은 시점/이벤트를 기준으로 묶은 사용자 그룹시간 흐름 분석의 핵심 (Retention 필수)ex.2024년 1월 가입자첫 구매가 같은 날인 사용자특정 캠페인 유입 사용자왜 쓰는가?시간에 따른 행동 변화 추적1월 가입자 -

Q3) RFM 분석(Recency, Frequency, Monetary value)이란 무엇이며, 이를 통해 고객을 어떻게 세분화할 수 있는지 설명해 주세요. 각 요소의 중요성을 설명해 주세요.고객의 구매 행동을 3가지 기준으로 평가하는 방법R (Recency): 얼마

Q1) A/B 테스트의 장점과 단점, 그리고 단점을 해결하기 위한 방안들을 설명해 주세요. >Q2) A/B 테스트 결과에서 한 버전이 통계적으로 유의미하게 더 나은 결과를 보여주지 않는다면, 이를 어떻게 해석하고 다음 단계는 무엇인가요?

Q3) 이벤트 데이터 로그 설계(Event Taxonomy)의 주요 구성 요소는 무엇이며, 각 요소가 어떤 역할을 하는지 설명해 주세요.서비스에서 발생하는 사용자 행동을 일관된 구조로 정의하고 기록하는 체계"무슨 행동을 어떻게 기록할 것인가?"를 정하는 것무슨 행동이

지도 학습과 비지도 학습의 차이는 무엇인가요?정답이 포함된 데이터를 학습하는 방식예를 들어:여기서 모델은'공수 시간 => 시험 점수' 관계를 학습. 즉, 입력(X)과 정답(Y)이 함께 존재1) 특징정답(Label)이 있음예측 목적이 강함결과를 맞추는 것이 핵심2) 대표

손실 함수(loss function)란 무엇이며, 왜 중요한가요?머신러닝 모델이 얼마나 틀렸는지 수치로 계산하는 함수'예측값과 실제값의 차이를 점수로 나타내는 기준'머신러닝 모델은 처음엔 대부분 엉뚱하게 예측함예를 들어 집값 예측 모델이:실제 집값: 5억모델 예측: 8

모델 학습 시 발생할 수 있는 편향과 분산에 대해 설명하고, 두 개념의 관계에 대해 설명해 주세요.모델이 실제 데이터의 패턴을 제대로 학습하지 못하는 오류즉, 모델이 너무 단순해서 발생예를 들면:학생 성적을 예측한다고 가정한다실제 관계:공부시간이 늘수록 성적 증가하지만

K-폴드 교차 검증에서 K의 값을 선택할 때 고려해야 할 점은 무엇인가요?

결정 트리의 장점과 단점은 무엇인가요?

부스팅은 어떤 특징을 가진 앙상블 기법인가요? 토픽에서 배운 AdaBoost 이외의 부스팅 모델에는 무엇이 있는지에 대해 구글 등을 활용하여 직접 리서치해보고, 각 부스팅 모델의 특징, 장단점에 대해 말해주세요.

데이터 간의 유사도를 계산할 때, feature의 수가 많다면(예: 100개 이상), 이러한 high-dimensional clustering 문제를 해결하기 위한 방법들을 설명해 주세요

차원 축소 기법인 주성분 분석과 요인 분석의 차이는 무엇인지 설명해 주세요

히스토그램의 주요 단점은 무엇이며, 이를 극복하기 위한 대안적인 시각화 방법을 설명해 주세요

장바구니 분석의 다양한 활용 사례를 설명해 주세요. 각 사례에서 얻을 수 있는 비즈니스 인사이트는 무엇인지 구체적으로 설명해 주세요

Support, Confidence, Lift 지표의 정의와 각 지표의 중요성을 설명해 주세요. 이 지표들을 해석하는 방법을 구체적인 예와 함께 설명해 주세요

절대 경로와 상대 경로는 무엇인가요?

Git에서 branch는 무엇이고, 왜 사용하나요?

DAG와 Task의 관계에 대해 예시를 들어 설명해주세요

수업시간에서 배우지 않은 Operator들의 종류와 활용 사례를 구글링하여 공유해주세요