SQL은 빅데이터 세상에서도 중요! 데이터 분야에서 일하고자 하면 반드시 익혀야할 기본 기술 구조화된 데이터를 다루는한 SQL은 데이터 규모와 상관없이 쓰임 모든 대용량 데이터 웨어하우스는 SQL 기반 Redshift, Snowflake, BigQuery

빅데이터 정의 “서버 한대로 처리할 수 없는 규모의 데이터” 2012년 4월 아마존 클라우드 컨퍼런스에서 아마존의 data scientist인 존 라우저(John Rauser)가 내린 정의 분산 환경이 필요하느냐에 포커스 “기존의 소프트웨어로는 처리할 수 없는 규모의

데이터 자산 메타 정보 중앙 저장소데이터 거버넌스의 첫 걸음많은 회사에서 데이터 카탈로그를 데이터 거버넌스 툴로 사용하거나 데이터 카탈로그 위에 커스텀 기능을 구현데이터 카탈로그의 중요한 기능(반)자동화된 메타 데이터 수집! 데이터 보안! 보통 메타 데이터만 읽어옴테이

(2024-06-09) ETL을 하는 이유는 결국 ELT를 하기 위함이며 이 때 데이터 품질 검증이 중요해짐 데이터 품질의 중요성 증대 입출력 체크 더 다양한 품질 검사 리니지 체크 데이터 히스토리 파악 데이터 품질 유지 -> 비용/노력 감소와 생산성 증대의 지름
프로덕션 사용을 위한 Airflow 환경 설정 airflow.cfg is in /var/lib/airflow/airflow.cfg Airflow Database upgrade (Airflow 설치때 설명) SequentialExecutor 사용 (Airflow 설치때
2024-06-05 Dag를 실행하는 방법 주기적 실행: schedule로 지정 다른 Dag에 의해 트리거 Explicit Trigger: Dag A가 분명하게 Dag B를 트리거 (TriggerDagRunOperator) Reactive Trigger:
2024-06-04 Docker 기반 Airflow 설정 docker-compose.yaml 수정 PIPADDITIONAL_REQUIREMENTS 수정 data 폴더를 호스트 폴더에서 만들고 볼륨으로 공유: 임시 데이터를 저장할 폴더 이를 docker volume으로
airflow.cfg 1. DAGs 폴더는 어디에 지정되는가? a. 기본적으로는 Airflow가 설치된 디렉토리 밑의 dags 폴더가 되며 dags_folder 키에 저장됨 2. DAGs 폴더에 새로운 Dag를 만들면 언제 실제로 Airflow 시스템에서 이를 알게되
데이터 파이프라인 소개 데이터 파이프라인 = ETL = DAG 데이터 웨어하우스의 구성 예 데이터 파이프라인이란? ETL: Extract, Transform and Load Data Pipeline, ETL, Data Workflow, DAG ETL (Extrac

Snowflake 특징 소개 Snowflake 소개 2014년에 클라우드 기반 데이터웨어하우스로 시작됨 (2020년 상장) 지금은 데이터 클라우드라고 부를 수 있을 정도로 발전 글로벌 클라우드위에서 모두 동작 (AWS, GCP, Azure) - 멀티클라우드 데이터

일반적으로 사용자별 테이블별 권한 설정은 하지 않음 \- 너무 복잡하고 실수의 가능성이 높음역할 (Role) 혹은 그룹(Group) 별로 스키마별 접근 권한을 주는 것이 일반적 \- RBAC(Role Based Access Control)가 새로운 트렌드: 그룹 보

AWS에서 지원하는 데이터 웨어하우스 서비스2 PB의 데이타까지 처리 가능 \- 최소 160GB로 시작해서 점진적으로 용량 증감 가능Still OLAP \- 응답속도가 빠르지 않기 때문에 프로덕션 데이터베이스로 사용불가컬럼 기반 스토리지 \- 레코드 별로 저장하는

신뢰할 수 있는 데이터를 바탕으로 부가 가치 생성 \- Data is the new oil? (데이터가 새로운 석유다) \- 데이터의 중요성을 강조하니 데이터 팀도 회사에서 인정을 받는다? (매출에 기여를 해야 인정을 받음) 고품질 데이터를 기반으로 의사 결정권자

DB 인스턴스는 클라우드에서 실행하는 격리된 데이터베이스 환경DB 인스턴스에는 여러 사용자가 만든 데이터베이스가 포함될 수 있으며, 독립 실행형 데이터베이스 인스턴스에 액세스할 때 사용하는 도구 및 애플리케이션을 사용해 액세스할 수 있다. AWS 명령줄 도구, Amaz

전 세계적으로 분포한 데이터 센터에서 200개가 넘는 완벽한 기능의 서비스를 제공하는, 세계적으로 가장 포괄적이며, 널리 채택되고 있는 클라우드 플랫폼.빠르게 성장하는 스타트업, 가장 큰 규모의 엔터프라이즈, 주요 정부 기관을 포함하여 수백만명의 고객이 AWS를 사용하
user_session_channel과 session_transaction과 session_timestamp 테이블을 사용Gross revenue: Refund 포함한 매출고객들이 0 (의향 없음) 에서 10 (의향 아주 높음) \- detractor (비추천자) :

SQL 조인은 두 개 혹은 그 이상의 테이블들을 공통 필드를 가지고 머지하는데사용된다. 이는 스타 스키마로 구성된 테이블들로 분산되어 있던 정보를 통합하는데사용된다.왼쪽 테이블을 LEFT라고 하고 오른쪽 테이블을 RIGHT이라고 하자. JOIN의 결과는 방식에 상관없이
GROUP BY & Aggregate 함수 테이블의 레코드를 그룹핑하여 그룹별로 다양한 정보를 계산 이는 두 단계로 이뤄짐 먼저 그룹핑을 할 필드를 결정 (하나 이상의 필드가 될 수 있음) GROUP BY로 지정 (필드 이름을 사용하거나 필드 일련번호를 사용) 다음

사용자 ID : 보통 웹서비스에서는 등록된 사용자마다 부여하는 유일한 ID세션 ID : 세션마다 부여되는 ID세션: 사용자의 방문을 논리적인 단위로 나눈 것 \- 사용자가 외부 링크(보통 광고)를 타고 오거나 직접 방문해서 올 경우 세션을 생성 \- 사용자가 방문