Datahub 운영 방식

문주은·2025년 4월 21일

Datahub을 사용하는 운영 프로세스의 전체 흐름 순으로 작성되었습니다.

1. Data Source Ingestion

Source : Snowflake, Airflow, PowerBI, ...
주기 : daily
관리 : YAML 파일로 관리

2. Create Metadata

1) YAML파일로 작성 →
2) git에 배포 →
3) jenkins 로 운영 서버에 배포 →
4) jenkins script로 자동 반영 datahub dataset sync --to-datahub

METADATA yaml

  • Description
  • Ownership
  • Glossary
  • Domain...?

3. Table description

1) UI에서 작성된 Table 관련 description 내용은 datahub dataset sync --from-datahub로 백업 →
2) Git에 배포(이력관리)
3) 백업 관리용
주기 : weekly

4. Architecture

Glossary Terms, Domains, Datasets -> Github -> Github Action -> Datahub

Github과 Datahub 연동하기 위해,
1. Datahub에서 dokcker-compose.yml setting 변경

services:
  datahub-gms:
    environment:
    - METADATA_SERVICE_AUTH_ENABLED=${METADATA_SERVICE_AUTH_ENABLED:-true}
  • Generate Token하기 위한 작업으로
  • false-> true로 변경
  1. Datahub UI에서 Token 생성

  2. Github에서 secrets 등록
    DATAHUB_HOST, DATAHUB_TOKEN

  3. Datahub 서버에서 Self-hostted Runner 등록
    Github repository -> Settings -> Actions -> Runner 에서
    Runner image 선택 후 Download, Configure, Using your self-hosted runner를 차례대로 실행.

profile
Data Engineer

0개의 댓글