
본캠프 1일차 - 직무 스터디 데이터 집중 직군과 - 데이터 사이언티스트 데이터 사이언티스트란? 데이터 사이언티스트는 데이터를 수집, 분석하고 모델링하여 인사이트를 도출하는 역할을 한다. 고급 통계학, 머신러닝, 딥러닝 등을 활용하여 예측 모델링과 알고리즘 개발을 한다

Lv7. 예산이 가장 큰 프로젝트는?문제 1. 각 직원이 속한 부서에서 가장 높은 월급을 받는 직원들만 포함된 결과를 조회하는 SQL 쿼리를 작성해주세요.출력 결과에는 직원의 이름, 부서, 그리고 월급이 포함되어야 합니다. 기대 결과내가 작성한 답정답문제 2. 직원이
랜덤한 닉네임을 생성하는 파이썬 코드를 작성해보세요. 사용자는 최소 27가지 이상의 닉네임 중 하나를 랜덤으로 print 할 수 있습니다.(아래의 키워드를 사용해주세요!)기절초풍, 멋있는, 재미있는도전적인, 노란색의, 바보같은돌고래, 개발자, 오랑우탄 내가 작성한 답힌
내일배움캠프 - 데이터 분석반 6기본캠프 2일차 - 아티클스터디 (1) “데이터 시각화 101 : 데이터 시각화는 왜 중요할까?”'우리 주변의 데이터 시각화예시) 교통정보 데이터의 시각요소 매핑노선정보, 총 소요시간, 경로별 소요시간, 경로의 위치정보 등의 다양한 데이

총 14시간 이론총 2시간 기출문제 풀이총 16시간 강의데이터 이해를 바탕으로 데이터 분석 기획, 데이터 분석 능력을 갖췄는지 평가하는 시험데이터를 가공하여 유의미한 정보를 도출하고 분석하는 방법론을 학습통계 이해가 필수인 머신러닝, 딥러닝의 기초과정실기 없이 객관식

일반적인 빅데이터의 정의일반적인 데이터베이스로 관리할 수 있는 범위를 초과하는 규모의 데이터⭐가트너그룹(Gartner Group)의 더그래니(Doug Laney)의 정의 (3V)⭐빅데이터는 데이터의 양(Volume), 데이터 유형과 소스 측면의 다양성(Variety),
문제서울의 오늘 날짜를 출력하는 프로그램을 작성하시오.입력입력은 없다.출력서울의 오늘 날짜를 "YYYY-MM-DD" 형식으로 출력한다.Python에서 현재의 날짜와 시간을 출력하기 위해서는datetime이라는 라이브러리가 필요하다.해당 라이브러리 사용 후 date.to

업로드중..<빅데이터 처리를 위한 툴의 기능별 구조도>데이터 처리 프로세스데이터 소스 - 수집 - 저장 - 처리 - 분석 - 표현데이터 분석 툴Language: SQL, Python DB Tool: Dbeaver, Google Bigquery, MySQL Work
코드카타 Python 알고리즘 1번 ~ 20번2월 17일 ~ 19일까지 진행한 코드카타 Python 알고리즘 문제와 제출한 답을 복습 및 기록용으로 뒤늦게 작성중1번. 두수의 차정수 num1과 num2가 주어질 때, num1에서 num2를 뺀 값을 return하도록 s
코드카타 Python 알고리즘 1번 ~ 20번2월 17일 ~ 19일까지 진행한 코드카타 SQL 문제와 제출한 답을 복습 및 기록용으로 뒤늦게 작성1번. 이름이 있는 동물의 아이디ANIMAL_INS 테이블은 동물 보호소에 들어온 동물의 정보를 담은 테이블입니다. ANIM
내일배움캠프 - 데이터 분석반 6기본캠프 2일차 - 아티클스터디 (1)데이터 분석이란 무엇일까?데이터의 정의데이터란? 특정 사실이나 정보의 집합데이터 분석이란? 데이터를 정리, 변환, 조작, 검사하여 유용한 인사이트를 도출하는 것으로,핵심은 트렌드 예측, 패턴과 상관관
코드카타 SQL 21번 ~ 30번21번. 이름이 없는 동물의 아이디ANIMAL_INS 테이블을 이용하여 동물 보호소에 들어온 동물 중, 이름이 없는 채로 들어온 동물의 ID를 조회하는 SQL 문을 작성해주세요. 단, ID는 오름차순 정렬되어야 합니다.22번. 조건에 맞
코드카타 Python 알고리즘 21번 ~ 30번21번. 하샤드 수양의 정수 x가 하샤드 수이려면 x의 자릿수의 합으로 x가 나누어져야 합니다. 예를 들어 18의 자릿수 합은 1+8=9이고, 18은 9로 나누어 떨어지므로 18은 하샤드 수입니다. 자연수 x를 입력받아 x
import this 를 입력 후 Run하면 아래와 같은 내용이 출력된다.불필요한 조건문이나 반복문을 최소화 (읽기 쉬운)직관적인 문법을 사용동일한 기능인데 더 적은 코드로 구현list 컴프리헨션, 내장함수 활용 \- 리스트 컴프리헨션이란? 반복문과 조건문을 한 줄에

코드카타 SQL 31번 ~ 33번31번. 오랜 기간 보호한 동물(1)ANIMAL_INSANIMAL_INSANIMAL_OUTSANIMAL_OUTS아직 입양을 못 간 동물 중, 가장 오래 보호소에 있었던 동물 3마리의 이름과 보호 시작일을 조회하는 SQL문을 작성해주세요.
31번. 수박수박수박수박수박수?길이가 n이고, "수박수박수박수...."와 같은 패턴을 유지하는 문자열을 리턴하는 함수, solution을 완성하세요. 예를들어 n이 4이면 "수박수박"을 리턴하고 3이라면 "수박수"를 리턴하면 됩니다.길이가 홀수이면 '수', 짝수이면 '

4가지 분석 주제 \- 해결해야 할 문제, 분석 대상이 무엇인지 알고 분석 방법도 알고 있다면 ‘최적화’ \- 분석 대상이 무엇인지 알고 있지만 방법을 모른다면 ‘솔루션’ \- 분석 대상이 무엇인지 모르고 분석 방법도 모른다면, 분석 대상 자체를 새롭게 도출하는 ‘발견

SELECT : 테이블의 열, 컬럼, 필드를 선택할 수 있다.FROM : 레코드를 선택할 테이블의 이름을 명시MySQL에서 마지막 구문은 세미콜론(;)으로 끝나야 한다.다수의 실행하고 싶은 SQL 구문에 마우스 커서를 두고 Ctrl+Enter를 누르면 해당 구문만 실행
본캠프 1일차 (1)데이터 사이언티스트란 무엇인가, 주요 업무, 채용 공고에 대해서 조사함.본캠프 2일차 (1)데이터 시각화 101: 데이터 시각화는 왜 중요할까?데이터 시각화를 해야하는 이유와 그 역할에 대해서 알아봄본캠프 2일차 (2)데이터 분석이란 무엇일까?데이터
ANIMAL_INS와 ANIMAL_OUTS 테이블을 이용하여 SQL문을 작성합니다.관리자의 실수로 일부 동물의 입양일이 잘못 입력되었습니다. 보호 시작일보다 입양일이 더 빠른 동물의 아이디와 이름을 조회하는 SQL문을 작성해주세요. 이때 결과는 보호 시작일이 빠른 순으
문자열 s에 나타나는 문자를 큰것부터 작은 순으로 정렬해 새로운 문자열을 리턴하는 함수, solution을 완성해주세요.s는 영문 대소문자로만 구성되어 있으며, 대문자는 소문자보다 작은 것으로 간주합니다.'20번. 정수 내림차순으로 배치하기'와 유사하지만 문자열을 정렬
RDBMS 최소 단위 테이블전체 데이터 혹은 특정 컬럼을 기준으로 요약해서 확인할 수 있음COUNT 테이블의 행 수를 반환SUM 테이블의 열의 합계를 반환AVG 테이블의 열 평균 반환MIN 테이블의 열 최소값 반환MAX 테이블의 열 최대값 반환여러 개의 집계 함수를 동

분석과제의 적용 범위 및 방식을 설정하는 것이다.분석과제의 우선순위, 적용 범위 종합적으로 고려하여 분석 구현의 로드맵 수립!ISP(Information Strategy Planning) : 내외부 환경 분석, 시스템 구축 우선순위를 결정하는 마스터 플랜 수립 절차.빅
35번. 오랜 기간 보호한 동물(2)ANIMAL_INS와 ANIMAL_OUTS 테이블을 이용하여 입양을 간 동물 중, 보호 기간이 가장 길었던 동물 두 마리의 아이디와 이름을 조회하는 SQL문을 작성해주세요. 이때 결과는 보호 기간이 긴 순으로 조회해야 합니다.36번.
35번. 부족한 금액 계산하기새로 생긴 놀이기구는 인기가 매우 많아 줄이 끊이질 않습니다. 이 놀이기구의 원래 이용료는 price원 인데, 놀이기구를 N 번 째 이용한다면 원래 이용료의 N배를 받기로 하였습니다. 즉, 처음 이용료가 100이었다면 2번째에는 200, 3
선정 아티클SQL 가독성을 높이는 다섯 가지 사소한 습관SQL 작성 시 가독성을 높이는 다섯 가지 작성 습관예약어, 함수는 대문자행갈이는 가능한 한 자주주석의 활용직관적인 Alias(별칭) 사용조직 내 합의된 규칙 사용예약어, 함수는 대문자예약어, 함수는 DB 종류마다
01. R 설치 및 기본 구성 R이란? 제작된 통계 분석을 위한 언어 02. R 데이터 구조 프로그래밍 학습 일반론 데이터 형식 학습 기본 연산 학습 조건문 / 반복문 학습 활용 학습 R이라고 하는 언어는 어떻게 이해하고 실행되는가? 프로그래밍 언어라고 하는 것은

37번. 조건에 맞는 도서와 저자 리스트 출력하기다음은 어느 한 서점에서 판매중인 도서들의 도서 정보(BOOK), 저자 정보(AUTHOR) 테이블입니다.BOOK 테이블은 각 도서의 정보를 담은 테이블로 아래와 같은 구조로 되어있습니다.AUTHOR 테이블은 도서의 저자의

선정 주제: [이커머스] 이커머스 이벤트 히스토리 소비자 행동 데이터를 SQL로 활용하여 기초 분석 진행 세부 주제: 소비자 행동 데이터를 분석하여 마케팅 시간대 전략 수립 시간대별 소비자가 구매한 건 수를 분석하여 언제 마케팅이
01. UNION 함수 2개 이상의 테이블의 수직 결합 기본 구조 UNION은 중복되는 데이터는 제거해서 하나의 결과값만 반환 UNION ALL은 중복되는 데이터 모두 표기 열의 갯수와 모든 순서가 모든 쿼리에서 동일 (구조가 모두 동일해야!) 두 테이블의 컬럼 이름이 일치해야 가능 02. JOIN 함수 테이블의 수평 결합 공통 컬럼이 한 개 이상 없...

🔷 데이터 마트데이터 웨어하우스로부터 특정 사용자가 관심을 갖는 데이터들을 주제별, 부서별로 추출하여 모은 작은 규모의 데이터 웨어하우스🔷 데이터 전처리 (data preprocessing)요약변수원래 데이터로부터 기본적인 통계자료를 추출한 데이터 마트의 가장 기본
44번. 가격대 별 상품 개수 구하기PRODUCT 테이블에서 만원 단위의 가격대 별로 상품 개수를 출력하는 SQL 문을 작성해주세요. 이때 컬럼명은 각각 컬럼명은 PRICE_GROUP, PRODUCTS로 지정해주시고 가격대 정보는 각 구간의 최소금액(10,000원 이상
🔷 INNER JOIN INNER JOIN의 간단한 예 테이블 1과 테이블 2의 공통 컬럼이 일치하는 모든 데이터가 조회 INNER JOIN과 서브쿼리를 응용한 예 🔷 LEFT JOIN LEFT JOIN의 간단한 예 (WHERE절이 없을 때, 간단하게 조인가능
데이터 분석 도구GA(Google Analytics)웹사이트 방문자 데이터를 수집 및 분석하는 웹로그 도구웹+앱 통합 속성 각 사용자의 차별성을 찾아내고 플랫폼별 목표 설정 캠패인이 가능 이벤트 중심(event-driven) 데이터 모델 유저의 다양한 동작들을 추
48번. 즐겨찾기가 가장 많은 식당 정보 출력하기다음은 식당의 정보를 담은 REST_INFO 테이블입니다. REST_INFO 테이블은 다음과 같으며 REST_ID, REST_NAME, FOOD_TYPE, VIEWS, FAVORITES, PARKING_LOT, ADDRE
37번. 행렬의 덧셈행렬의 덧셈은 행과 열의 크기가 같은 두 행렬의 같은 행, 같은 열의 값을 서로 더한 결과가 됩니다. 2개의 행렬 arr1과 arr2를 입력받아, 행렬 덧셈의 결과를 반환하는 함수, solution을 완성해주세요.행렬의 같은 위치에 있는 요소들끼리의
41번. 없어진 기록 찾기 ANIMALINS, ANIMALOUTS 테이블을 이용 천재지변으로 인해 일부 데이터가 유실되었습니다. 입양을 간 기록은 있는데, 보호소에 들어온 기록이 없는 동물의 ID와 이름을 ID 순으로 조회하는 SQL문을 작성해주세요.

JOIN 함수 복습JOIN 순서공통 컬럼 찾기 > 공통 컬럼 관계 찾기 > 알맞은 JOIN 함수선택하기<Spotify의 ERD 예시>테이블 종류fact table : 중심테이블로 측정값을 담고 있음테이블에 대한 외래키 포함dimension table : 팩트에 대
통계의 정의통계란 분석하고자 하는 특정 집단을 대상으로 얻은 자료 및 요약된 형태의 표현 모집단모집단 구성 개체는 추출단위 혹은 원소유한 모집단: 유한 개의 개체로 이루어진 모집단무한 모집단: 무한 개의 개체로 이루어진 모집단으로 모통 개념적으로 상정된 모집단통계
어제부터 SQL 코드카타 문제 풀기 전에 문제에서 요구하는 조회 데이터와, 조건 등에 대해서 먼저 정리해두고아티클 SELECT문으로 SQL 쿼리를 시작하지 마세요에서 언급된 내용처럼 작성순서가 아닌, 작동순서에 따라서 쿼리를 작성하고 있다.이렇게 작성하니 ▶️ 장점문제
선정 아티클:기획자도 파이썬을 배워야 하나요?(이론편)기획자가 파이썬을 학습해야 하는 이유 일곱 가지 1️⃣ 다량의 데이터를 엑셀보다 빠르게 분석 가능하다. 2️⃣ 다른 데이터를 동일한 전처리, 분석 방식을 적용할 경우 데이터를 불러오기만 하면 되기 때문에 간편하다
1주차 - 01. 이번에 배울 것 파이썬은 다양한 데이터 패키지, 시각화 패키지, 머신러닝, 딥러닝 패키지 등을 사용할 수 있기 때문에 데이터 분석을 위해서는 반드시 파이썬 문법을 알아야 함 02. 환경 세팅하기 Colaboratory (필수) 장점 : 구글 계정만

1) window fuction정의 : 행과 행 간의 관계 정의를 위해 제공되는 함수역할 : 순위, 합계 평균, 행 위치 등의 조작 가능, 모든 컬럼을 잃고 싶지 않을 때 사용특징 : GROUP BY와 병행 사용 불가종류 (총 4가지)순위 : RANK, DENSE_RA
오늘부터는 코드카타나 기타 코드를 작성할 때에 타이머를 20분으로 맞춰놓고 작성하기로 했다.코딩테스트 시에는 제한 시간이 있으니까 평소에도 연습을 해두어, 시간을 점점 줄일 수 있도록 노력해보려고 한다.61번. 서울에 위치한 식당 목록 출력하기 12분 20초 소요다음은
3진법이란? 0, 1, 2의 세 가지의 숫자만을 사용하여 수를 표현하는 숫자 체계 각 자리는 3의 거듭제곱에 해당하는 값이다. (2진법처럼) 10진법을 3진법으로 변환하기 10진수를 3으로 나눈 나머지를 구하면서, 나눈 몫을 계속해서 3으로 나누어 나간다. e

확률 변수어떤 확률 실험이나 상황에서 발생할 수 있는 각각의 결과를 수치적 값으로 표현하는 변수확률변수는 정의역(domain) = 표본공간, 치역(range) = 실수값예시) 동전 던지기동전 3개 던지기 표본 공간표본 공간 = { 앞앞앞, 앞앞뒤, 앞뒤앞, 뒤앞앞, 앞

USED_GOODS_BOARD와 USED_GOODS_FILE 테이블에서 조회수가 가장 높은 중고거래 게시물에 대한 첨부파일 경로를 조회하는 SQL문을 작성해주세요. 첨부파일 경로는 FILE ID를 기준으로 내림차순 정렬해주세요. 기본적인 파일경로는 /home/grep/
1. 이메일 프로모션 고객 - 문제 person 테이블 이용하여, 이메일 프로모션을 수락한 개인(소매) 고객의 수를 계산하여 출력하시오 - 내가 작성한 답 - 조건 이메일 프로모션을 수락 (1, 2) 개인(소매) 고객 = IN - 해설 email_promotio

다음은 어느 의류 쇼핑몰의 온라인 상품 판매 정보를 담은 ONLINE_SALE 테이블과 오프라인 상품 판매 정보를 담은 OFFLINE_SALE 테이블 입니다. ONLINE_SALE 테이블은 아래와 같은 구조로 되어있으며 ONLINE_SALE_ID, USER_ID, PR

43번. 크기가 작은 부분문자열숫자로 이루어진 문자열 t와 p가 주어질 때, t에서 p와 길이가 같은 부분문자열 중에서, 이 부분문자열이 나타내는 수가 p가 나타내는 수보다 작거나 같은 것이 나오는 횟수를 return하는 함수 solution을 완성하세요.예를 들어,
02. 조건문 1) 조건문이란? 특정 조건이 True인 경우만 코드 블록을 실행하도록 함 if, elif, else 3가지 키워드를 사용하여 구성 조건의 순서는 상관 없음 2) 들여쓰기 및 띄어쓰기의 중요성 3) 연산자 조건 판단을 위한 '비교 연산자'를 사용 >

1) 함수란?함수의 개념함수는 입력을 받아 원하는 처리를 한 후 출력을 내보내는 일련의 작업을 수행하는 코드 블록프로그램 내에서 특정한 기능을 수행하기 위해 코드를 논리적으로 그룹화하여 재사용 가능한 형태로 정의\-함수의 정의와 호출 방법함수를 호출할 때에는 함수 이름
74번. 특정 기간동안 대여 가능한 자동차들의 대여비용 구하기 CARRENTALCOMPANYCAR 테이블과 CARRENTALCOMPANYRENTALHISTORY 테이블과 CARRENTALCOMPANYDISCOUNT_PLAN 테이블에서 자동차 종류가 '세단' 또는 'S

1) 추정추정이란?통계적 방법론을 통해서 알고자 하는 대상 = 모집단의 확률 분포확률분포의 특징을 표현하는 값을 모수(parameter)대부분 표본조사를 실시하여 모수를 추정한다점추정 (Point Estimation)구간추정 (Interval Estimation)신뢰도
선정 아티클데이터 속 거짓말 발견하기막대 그래프기준선을 확인한다Y축을 확인한다선 그래프하나의 그래프에서 Y축을 2개 이상 두지 않는다누적 그래프는 아닌지 확인한다파이 차트전체 합이 100%인지 확인한다3D 파이 차트일 때 시각적으로 정보가 왜곡될 수 있음을 인지한다.지
\- SQL과 Python 차이점 복습SQL, Python 둘다 데이터에 접근하기 위한 Query(질의)이다.\- 라이브러리란?우리가 자주 쓰는 함수들을 모아놓은 묶음!\- library 호출하기import pandas as pd : pandas라는 라이브러리(모듈)을
요구 지식 : 리스트, 반복문배경 : 전자 상거래 플랫폼에서 고객의 평균 주문을 계산해야 합니다. 이를 위해 숫자 리스트의 평균을 계산하는 방법을 연습합니다.목표 : 주어진 숫자 리스트의 평균을 계산하는 함수를 작성하세요.데이터 : numbers - 숫자가 담긴 리스트

46번. 숫자 문자열과 영단어https://ooyoung.tistory.com/77

1) merge ⭐⭐⭐두 개 이상의 테이블을 수평 결합하는 pandas의 함수 중 하나로, SQL의 JOIN과 유사주요 옵션on : 조건 컬럼(공통 컬럼)이 한 개인지 여러 개인지how : 어떤 조인을 사용할 것인지 (inner, outer, left, right)le
요구 지식 : 딕셔너리, 리스트, 문자열 조작, 반복문배경:당신은 대규모 텍스트 데이터를 분석하는 프로젝트를 진행하고 있습니다. 텍스트 데이터에서 특정 패턴을 찾아내는 작업을 수행해야 합니다. 이번 작업에서는 중복된 문자를 제거하고 각 문자가 한 번씩만 나타나게 하는
1) 파일 확장자CSV 파일 (.csv)CSV (Comma Separated Values) 은 데이터를 쉼표(,)로 구분하여 저장하는 형식Excel 파일 (.xls, .xlsx)표 형태로 데이터를 저장하는 Microsoft Excel의 형식JSON 파일 (.json)J

비즈니스 문제 이해 및 해결하기 위해 데이터 분석비즈니스 프로세스 및 요구 사항 파악, 데이터 기반 의사결정업무 프로세스 개선, 비즈니스 모델 분석, 요구사항 관리앱 서비스나 제품의 성과 평가 및 개선하기 위해 데이터 분석제품 경험과 사용자 행동, 제품 성능 관련 분석
77번. 78번. 79번. Big Countries(https://leetcode.com/problems/big-countries/description/)80번. Article Views I(https://leetcode.com/problems/art
문제 1번. 글로벌 확장 기회 발굴전년 대비 GNP가 감소한 국가 중 인구가 1천만 명 이상인 국가의 수를 조회해야 한다.이전 연도의 GNP 값이 0이거나 NULL인 경우는 제외해주세요.문제 2번. 도시개발구역 인구 분석각 행정 구역(District)내 도시들의 평균

요구 지식: 리스트, 딕셔너리, 반복문배경:축구 경기 데이터 분석가로서, 선수들의 위치 데이터를 활용하여 그들의 활동 범위와 이동 효율성을 계산하는 것은 팀 전략을 세우는 데 중요합니다. 선수들의 이동 패턴을 분석하고 이를 통해 그들의 총 누적 이동 거리를 계산하여 선
요구 지식 : 딕셔너리 매핑, 문자열 조작, 반복문문제배경 :르탄이는 팀스파르타의 대표 캐릭터 입니다 :)어느날, 르탄이가 당신의 길을 막고 암호를 말할테니 이 암호를 풀어야 길을 비켜준다고 합니다.르탄이가 알려주는 암호는 한글과 영어로 쓰여있는 숫자들을 나열한 것인데
84번. Customer Who Visited but Did Not Make Any Transactions(https://leetcode.com/problems/customer-who-visited-but-did-not-make-any-transactions/
제출한 답최대값을 찾는 알고리즘 ⭐️제출한 답try, except갯수를 세는 문제의 경우, 딕셔너리를 사용하는 접근 방식이 좋다.round()대신 float 상대로 :.2f 소수점 2자리 까지만 본다는 뜻 대응되는 데이터가 나오는 문제의 경우 '딕셔너리'를 사용하자!개
양질의 데이터를 판별하는 5가지 방법양질의 데이터를 판별하는 것에 대한 중요성과 그 방법, 분석 방법별 충분한 데이터의 양데이터의 품질가능한 한 다양하고 많은 데이터를 확보하는 것이 반드시 고품질의 데이터와 직결되지는 않는다.품질이 높은 데이터일수록 활용 가치가 높다.

과제 목표 python pandas library로 데이터 기초 핸들링 및 응용 실습 과제 데이터셋 : flightdatahomework 과제 문제마다 하기 기본 library import 참고 자료 : datetime, timedelta란? datetime 라이브러

02. 데이터 불러오기/저장하기 1) 데이터 불러오기 pd.read_excel('파일경로/파일명.확장자') 엑셀 불러오기 pd.read_excel('./파일명.xlsx') # ./ ==> 현재 내가 있는 위치라는 의미 csv 파일 불러오기 pd.read_csv('.

출발 시간(Dep_Time) 컬럼을 기준으로 lambda 함수를 활용하여 아침, 오후, 저녁, 밤 비행기로 항공편(Airline)을 분류하고 그 개수를 count 해주세요.힌트1: pandas의 to_datetime 함수의 infer_datetime_format(여러
87번. Employee Bonus(https://leetcode.com/problems/employee-bonus/)88번. Students and Examinations구글링으로 겨우겨우 푼 문제.join이 공통 컬럼 없이도 그냥 된다는 사실을 처음 알았다

기본 라이브러리 import import pandas as pd import numpy as np from datetime import datetime, timedelta dataframe의 행과 열 개수 확인 df.shape dataframe의 첫 5줄 출력 df

분석할 데이터의 주제 및 목표 설정이 완료되어, 실제로 코드를 분석해보고자 한다.가장 중요한 컬럼인 CGG_NM (자치구명) 컬럼이 결측값인 경우와,직거래인 케이스와 거래가 취소된 케이스도 제거한다.고객의 의뢰대로, 특정 생활권역을 필터링 하기위해서 AREA_NM이라는

어제까지 진행했던 분석 내용이 약간 빈약한 것 같아,선형회귀모델을 사용하여 총 5개의 자치구(강동구, 송파구, 은평구, 서대문구, 마포구)의 평균 거래 금액의 예측모델을 만들어 미래에 가격이 어떻게 될 지 예측해보고자 한다.이 모델 생성은 다음의 gitbub글을 참고하

4-1. 모든 수치형 변수에 대해 표준화를 진행한다참고 자료 : 통계학 - 정규화와 표준화sklearn\_정규화, 표준화4-2. 표준화를 끝낸 데이터셋을 훈련용, 테스트용으로 나눈다.참고 자료 : VIF를 활용한 다중공선성 확인6-1. 선형 회귀 모델링 0.395838

참고 자료 : Random forest 학습하기머신러닝 모델 소개 - Random Forest랜덤 포레스트 원리와 구현 사이킷런 예제로 코드 실습해보기랜덤포레스트 하이퍼파라미터\[머신러닝]\_랜덤포레스트그외 다수 참고링크 추가 예정랜덤포레스트 정의 정리해서 추가 예정1
팀원 각자의 분석 역량 및 논리적 역량이 뛰어나서 좋은 아이디어가 많이 나왔다.서로 도움이 필요한 부분에 대해서 적극적으로 협업했다.발표 때 분석 결과 위주로 발표하여 듣는 사람 입장에서 이해하기도 쉽고 잘 전달되었다.여러 도메인 지식 및 외부 자료를 통해 발표의 근거
문제 #1 (쉬움) 카카오 광고 분석을 위한 ad_events 테이블이 있습니다. 2022년 동안 발생한 클릭률(Click-Through Rate, CTR)을 계산하는 SQL 쿼리를 작성하세요. 결과는 ad_id 기준으로 오름차 정렬하세요. 소수점 둘째 자리까지

데이터 리터러시란? 데이터 수집과 원천을 이해 데이터 활용법 이해 데이터 핵심 지표 이해 > 데이터 리터러시는 올바른 질문을 던질 수 있게 하여 뚜렷한 목적을 얻게 함
A/B 테스트 제대로 이해하기 : ① 테스트를 설계할 때 우리의 질문은? - 요약 A/B 테스트 설계 시 궁극적인 목표는 ‘이번 A/B 테스트의 결과가 테스트 내에서만 유효성을 갖는 것이 아니라, 앞으로도 유효하며 실제로 선택된 시안이 확실하게 효과가 좋으며 이 결과
QCC를 급하게 대비하기 위한 오래간만의 코드카타!89번.Managers with at Least 5 Direct Reports(https://leetcode.com/problems/managers-with-at-least-5-direct-reports/des

데이터는 크게 수치형, 범주형으로 분류된다수치형 : 숫자를 이용해 나타낼 수 있는 데이터연속형 : 일정 범위 안에서 어떤 값이든 취할 수 있는 연속적인 데이터이산형 : 횟수 같은 정수형 값만 취할 수 있는 데이터범주형이진형 : 두개의 값만을 가질 수 있는 데이터 (ex

01. 데이터 분석가의 통계적 실험: A/B 테스트 >- 지난시간 용어 정리 변수 : 대상의 속성이나 특성을 측정하여 기록한 것 독립변수 : 원인이 되는 변수. 설명변수 종속변수 : 결과가 되는 변수. 결과변수. 독립변수의 영향을 받음 모수 : 모집단을 대표하는 값
92번. Average Selling Price(https://leetcode.com/problems/average-selling-price/description/)93번. Project Employees I(https://leetcode.com/pr
2023년 7월 1일부터 9월 30일까지 성공한 로그인 기준으로 직원별 로그인 횟수를 구해야 합니다.성공한 로그인 기록이 없는 직원은 제외하여 로그인 횟수를 집계해주세요성공한 로그인 횟수가 1회인 직원 수, 2회인 직원 수 등으로 묶어야 합니다.출력 컬럼은 unique
컴퓨터가 인간의 개입 최소한으로 데이터를 학습하여 패턴을 찾아내고 새로운 데이터에 대해 예측이나 분류를 수행하는 기술데이터 : 데이터는 양과 질이 중요하다알고리즘 : 머신러닝 모델 그 자체컴퓨팅 파워 : 컴퓨터의 연산 능력치.AI사람의 지능적인 작업을 기계가 수행하도
문제 95번. Queries Quality and Percentage(https://leetcode.com/problems/queries-quality-and-percentage/description/)문제 96번. Monthly Transactions I(h

선정 아티클 : A/B 테스트 제대로 이해하기 : ③ A/B 테스트 계산기의 세팅과 해석계산은 어디서 해야하나요?구글 옵티마이저 : A/B 테스트 툴로, 유의미한 결과를 계산 및 도출해줌A/B Testguide : A/B 테스트 결과를 제공하는 무료 계산 사이트기초 통
문제 99번. Number of Unique Subjects Taught by Each Teacher(https://leetcode.com/problems/number-of-unique-subjects-taught-by-each-teacher/)문제 요구 사항
오늘은 드디어 만점! 몇 일간 코드카타를 열심히 한 보람이 있었다. 아니면 문제 난이도가 내려간 걸 수도 있겠다. 지역별로 매출이 가장 높은 매장을 조회하는 SQL문을 작성해주세요.단, 해당 지역에 매장이 두 개 이상인 경우만 결과에 포함해주세요.결과는 지역 이름을 기

선정 아티클 : A/B 테스트 제대로 이해하기: ④ A/B 테스트 표본 크기와 유의미한 결과의 관계표본(트래픽) 사이즈와 유의미한 결과가 무슨 상관이 있나요?표본이 많을 수록 모집단에 가까워지기 때문에 추측이 정확해지고 결과의 차이가 적더라도 유의미할 수 있다. 표본
1.1 이상탐지란?정상 패턴에서 벗어난 소수의 특이한 데이터인 이상치를 빠르고 정확하게 찾는 것!1.2 이상탐지의 중요성사기 예방, 고장 예측, 장비의 고장 예측 등 1.3 이상탐지 접근 방법1.3.1 통계 기반 접근필수 가정 : 정상 데이터가 특정 분포(정규분포)를
선정 아티클 : A/B테스트 제대로 이해하기: ⑤A/B테스트에 적정한 표본과 주의 사항신뢰 수준에 따라 표본의 크기가 달라질 수 있다.두 방안의 결과가 몇 %정도 차이가 날 것이라고 기대하는지에 따라서 필요한 표본이 정해진다.내가 미는 방안이 이길 때까지 기다리기실험을

= 데이터베이스의 테이블, 레코드= 개체= 두 개 이상의 속성 (attribute, 컬럼)의 집합= 두 개 이상의 인스턴스 (Instance, 행)의 집합첫번째 특징업무에서 필요로 하는 정보가 담겨있다.두번째 특징인스턴스가 식별자(예: 주민번호)에 의해 한개씩만 존재하

CNC 머신의 공정 데이터를 분석해서, 불량 여부를 예측하는 머신러닝 이진 분류 모델을 개발가공 불량에 영향을 주는 주요 요인을 도출, 최적의 가공 조건을 제안공정 상의 문제 현황절삭 가공을 위한 공구가 마모되거나 절삭력의 순간적인 변경으로 인해 파손되어 마모 한계치에

Objective (목표)프로젝트 목표: 프로젝트 주요 목표 정확히 기술문제 및 목표를 정의하는 단계CNC 머신의 공정 데이터를 분석해서, 불량 여부를 예측하는 머신러닝 이진 분류 모델을 개발가공 불량에 영향을 주는 주요 요인을 도출, 최적의 가공 조건을 제안예상 결과

프로젝트 진행 상황 변수 제거 없이, 트리기반 모델만 채택하여 분석을 진행하던 중에 튜터님의 조언으로 다음과 같은 프로젝트 접근 방법을 정리하였다.

어제 변수는 도메인 지식을 활용하여 최종적으로 18개의 독립변수를 선택했다.튜터님의 조언을 통해 Output과 관련된 독립변수에 대해서는 제거를 진행하는 것으로 결정했다.실제 Output(출력)과는 거리가 멀어보이고, 파워 서플라이에서 공급하는 전원, 전류, 전압에 대

불량 여부를 확인하는 것이기 때문에 Fail이 True = 1이 됨!train, val, test셋으로 분리하여 test는 최종 모델 학습시에만 활용하기머신러닝에서 test 데이터셋은 최종적인 예측을 위해 따로 남겨두어야 한다.따라서 학습 후에 모델의 성능을 평가하기
프로젝트 진행 상황 데이터 전처리 stacking model의 성능 및 SHAP까지 도출했지만, 중간에 Sktratified K-fold를 사용한 방식에 있어서 문제가 있었다. 따라서 팀 내부적으로 논의하여, 1) 기존의 방식대로 진행 후 모델 내부에서 Stratifi

SHAP를 통해 M_CURRENT_FEEDRATE (스핀들 순간 공급 속도), S_SystemInertia (토크관성) 이렇게 두 가지 요인이 가장 결과에 큰 영향을 끼치는 것을 알 수 있었다.experiment별 M_CURRENT_FEEDRATE의 분포experime
프로젝트 회고 (KPI)🟢 Keep (유지할 것)잘된 점, 긍정적인 요소앞으로도 지속해야 할 팀의 강점이나 효과적인 방식예시: 원활한 소통, 체계적인 일정 관리, 협업이 잘된 부분적극적인 피드백과 부드러운 의사 소통으로 긍정적인 방향으로 진행될 수 있었다.그리고 프로
💡 메트릭(Metric)이란?특정 목표나 성과를 측정하기 위한 수치적 단위예) 수익, 판매략, 고객 만족도 등회사 기본 구조 이해회사의 수익구조(business model) 파악고객의 대상을 확인 (B2B, B2C)주요 서비스 및 주요 매출 상품매출 구조 살펴보기 (

category 컬럼의 값이 'n/a' 또는 NULL으로 되어 있는 경우, '분류되지 않은 상담'으로 간주전체 상담 건수 대비 분류되지 않은 상담 비율(%)을 구하는 SQL 쿼리를 작성해주세요.결과는 소수점 1자리까지 반올림call_date가 2024-04-15 이전출
선정 아티클 : 주요 지표를 실시간으로 분석하는 대시보드 활용법: KPI 분석을 통해 마케팅 성과를 측정하고 신속한 의사결정으로 비즈니스 성장 가속화하기1\. KPI 정의와 중요성: 비즈니스 성장의 초석KPI란 무엇인가? 기업의 목표 달성을 위한 진척도 측정에 사용되는
문제 설명문자열 s가 주어졌을 때, s의 각 위치마다 자신보다 앞에 나왔으면서, 자신과 가장 가까운 곳에 있는 같은 글자가 어디 있는지 알고 싶습니다.예를 들어, s="banana"라고 할 때, 각 글자들을 왼쪽부터 오른쪽으로 읽어 나가면서 다음과 같이 진행할 수 있

Tableau Desktop 도움말 - 차원 및 측정값, 파란색 및 녹색데이터를 분류하는 기준주로 불연속형 (파란색)예 : 고객명, 주문날짜, 제품 카테고리, 도시 등합산, 평균 등 계산이 가능한 수치주로 연속형 (초록색)예 : 매출, 점수, 수익, 고객수 등어떤 것을
이 데이터셋은 게임 도메인의 데이터 분석가를 위해 생성되었습니다. 게임 내 데이터로는 고객 정보, 경험치, 레벨, 위치, 국가, 운영 체제(OS) 등의 열이 포함되어 있습니다. 기본적인 분석과 통계적 가설 검정을 수행할 수 있으며, 머신러닝에 활용될 수 있도록 설계되었
Kaggle_Amazon Global Sales DashboardPower BI를 활용하여 제작된 아마존 글로벌 판매 대시보드와 그 데이터셋입니다.해당 대시보드는 2012년부터 2015년까지의 아마존 판매 데이터를 기반으로, 다양한 지역, 시장, 고객 세그먼트에 대한
세일즈 전체 관리자의 니즈전체 Key metric : 분기 목표를 달성했는지, ROI (투자대비 매출) 는 어떤지 확인 할 것시기별시기별로 Key metric이 어떠한 추이를 보였는지 확인 할 것(블프 기간(Discount가 적용되었는지?)이 효과가 있었는지도 보통은
주사용자 : MD디자인은 아직 미완성 단계이나 레이아웃은 아마 이런 형태로 가져갈 예정임먼저 Product, Customer 두 가지 대시보드로 이동할 수 있는 물리적 버튼 형태를 제작할 예정현재 Product 대시보드이기 때문에 Product에 highlight대시보
워크시트 내용:전체 매출 중 각 카테고리/서브카테고리의 비중을 도넛 차트로 시각화하여 제품별 전체 시장 성과를 개괄적으로 확인구성 : 도넛 차트 3개 (Category → Sub-category → Product)대시보드 동작 필터 사용하여 클릭 시 단계적으로 필터링

KPT 회고Keep : 튜터님과 거의 매일 피드백을 주고받을 수 있어서, 현재 부족한 점이 어떤 부분인지 구체적으로 피드백 받고 개선할 수 있어서 방향성이 더 정확했다. Tableau Public에서 레퍼런스를 참고하여 더 다양한 대시보드 기능을 활용할 수 있게 만들
각 성별 기준으로 시험 점수가 높은 상위 3명의 학생 성별, 이름과 점수 출력성별, 순위 오름차순 정렬두 학생이 동점일 경우 나이가 많은 학생이 더 순위가 높다.0개월붙어 6개월 후까지 얼마나 주문했는지 월 단위로 재구매한 고객의 수를 집계하시오.6개월 후까지니까 최종

네이버 데이터랩에서 제공하는 검색어 트렌드 API를 활용하여 특정 키워드의 검색량 추이를 분석하는 과제입니다. 시간에 따른 검색어 관심도 변화를 확인하고 데이터를 수집하여 저장합니다.네이버 개발자 센터(https://developers.naver.com) 회원
예를 들어 '디시인사이드 마비노기 모바일 갤러리'의 링크를 살펴보면 다음과 같다.https://gall.dcinside.com/mgallery/board/lists/?id=mabinogimobilehttps > protocol, http의 보안버전gall.dc
데이터 출처, 센서 개수, 측정 간격, 총 시간 범위 등을 구체적으로 설명해야 함.시계열 데이터인지, 공정별로 수집된 이산적 데이터인지 명확히 해야 함.각 컬럼(센서)의 의미 설명이 반드시 필요 (예: 전류, 전압, 온도 등)fillna(method='linear')
주제 디지털의료, 인공지능, chatGPT, AR/VR, 빅데이터, 블록체인, 스마트병원, 고령친화, 장애인, 재활복지, 치매극복, 헬스케어용품, 의료기기, 5G, IoT, App, 메타버스 등 자유주제 머신러닝을 활용한 예측 모델, 분류 모델, 군집, 이상 탐지 가
결측치 처리 선형보간법? 정규분포법? MAPE? meanabsolutepercentage_error 링크텍스트
개요치매 고위험군 환자들의 웨어러블 기기를 통해서 수집된 라이프로그 데이터와 건강 상태 데이터를 통해 치매를 조기진단하는 예측 모델을 개발하고, 병원 예약 기록 및 예약 기록 환자의 건강 상태를 통해 고령 환자들의 노쇼 예측 모델을 개발하고 노쇼 예방을 위한 시스템 구
1차 모델링 XGBoost, CatBoost, LightGBM, GBM, RF를 선정 Feature selection : feature importance vs permutation importance 딥러닝 모델 선정 : Transformer 계열 모델 [논문리뷰]
ONAIR 방식으로 프로젝트 계획 수립Objective (목표)부산시가 직면한 헬스케어 현안에 대한 데이터 분석 및 이를 해결할 수 있는 비즈니스 모델 제시부산시는 고령화, 인구 유출이 심각한 상황주최측이 부산대학교병원임을 고려하여 고령자 타겟의 치매 예측 모델 + 대
라이프로그 데이터셋 전처리 및 EDA 시각화

부산시는 전국 7개 특광역시 중에서 60세 이상 노인 비율이 32.13으로 1위치매 환자는 60세 이상 유병률 7.31, 65세 이상 유병률 9.84로 10명 중 1명이 치매경기도는 ‘AI 노인말벗서비스’, ‘늘편한 AI케어’, ‘AI 어르신 든든지키미’ 서비스를 도입
프로젝트 이름: 부산시 고령자를 위한 치매 조기 검진 및 예방 시스템 구축분석 목적: 부산시는 전국 7개 특광역시 중에서 60세 이상 노인 비율이 32.13으로 1위이며, 치매 환자는 60세 이상 유병률 7.31, 65세 이상 유병률 9.84로 10명 중 1명이 치매인
최종프로젝트

AI와의 음성 대화로 CIST 검진 진행하기NAVER CLOVA Dubbing 사용하여 CIST 검진 항목 스크립트 만들기CIST 검사지의 검사 항목 중, 음성으로 진행 가능한 항목에 대해 스크립트화를 진행했다.각 대사마다 라벨링을 달아주어 재활용성을 높였다. 안그러면

2023년 치매역학조사 및 실태조사 결과 발표증가하는 치매, '이전 단계' 경도인지장애 관리가 중요경도인지장애의 10~15%는 치매로 발병하는 경우가 다수문제 1. 만 40세 이상의 경우 치매 검사 접근성이 낮음문제 2. 경도 인지 장애의 심각성이 낮고, 이 개념에 대

데이터 전처리 현재 사용하려는 데이터셋은 크게 세 가지 데이터로 이루어져 있다 데이터 구성 명목형 데이터 : 성별 (1-남성, 2-여성) 연속형 데이터 : 키, 몸무게, BMI 순서형 데이터 : 나머지 설문조사형 데이터 (1-매우 좋음, 2-상당히 좋음, 3-상당히 나
'만나이', '성별', '세대유형', '치매 환자 가족 여부', '건강수준', '흡연 경험', '일반담배 흡연 경험', '일반담배 현재 흡연 여부', '일반담배 하루 평균 흡연량', '일반담배 간헐적 흡연자의 흡연일수', '일반담배 간헐적 흡연자의 하루 평균 흡연량'
어제 데이터 전처리 후에도 ML modeling을 진행했으나 성능이 큰 차이를 보이지 않았고 통계적 가설 검정을 통해 종속 변수와 독립 변수 간의 관계를 살펴보려고 한다.카이제곱 검정참고자료https://songseungwon.tistory.com/103htt