AWS Cloud School 13기 120일차

Forever 김·2026년 6월 30일

AWS Cloud School

목록 보기
113/116

2026-06-29

Today

  • 7차 멘토링 진행
  • 최종 발표 PPT 흐름 및 생각

Learned

HikariPool / Flyway (Spring Boot DB 부품) — DR 보고서 4장 맥락

  • HikariPool (HikariCP): Spring Boot 기본 DB 커넥션 풀. 연결을 미리 만들어 두고 빌려쓰고 반납 → 매 쿼리마다 새 연결(TCP+인증) 맺는 비용 제거. 풀 크기 = RDS 연결 수.
    • DR 적용: 페일오버 시 앱이 서울이 아니라 도쿄 dr-rds로 풀을 다시 맺어야 함. 못 붙으면 CrashLoopBackOff. 그림5 "RDS 연결 수" 서울↓/도쿄↑가 풀이 옮겨붙는 모습.
  • Flyway: DB 스키마 버전관리(마이그레이션) 도구. 스키마 변경을 V1__, V2__ 순번 SQL로 관리, 앱 기동 시 미적용분만 자동 실행 후 flyway_schema_history에 기록(Git의 DB 스키마판).
    • DR 적용: 도쿄 RDS는 서울의 read replica라 migration 9개가 이미 복제돼 있음 → Flyway가 버전 일치 검증해야 앱 정상 기동(어긋나면 기동 거부).
  • 기동 체인(면접 포인트): 파드 시작 → HikariPool이 도쿄 RDS 연결 → Flyway 스키마 9개 검증 → Tomcat 8080 기동 → Deployment 2/2 Ready. 이 체인 통과가 "전체 서비스 RTO 종료(9분 14초)" 판정 근거.

RTO / RPO (DR 핵심 지표)

  • RTO (Recovery Time Objective): 복구 시간 목표 — 장애~정상복귀까지 허용 시간 상한. "얼마나 빨리". DR 실측 9분 14초(목표 15분, 충족).
  • RPO (Recovery Point Objective): 복구 시점 목표 — 유실 허용 데이터의 시간 폭. "얼마나 잃어도". DR 실측 126초(목표 60초, 미달).
  • 구분: RTO=시간축(언제 복구), RPO=데이터축(어디까지 보존). ⚠️ 쓰기 가능 RTO ≠ Route53 전환 RTO는 따로 기록.

AMP(Amazon Managed Prometheus) 비용 — 수집량 폭주 실측

  • 6월 AMP 청구 $101 전액이 MetricSampleCount(수집) — 11.6억 샘플/3일, remote_write ~5.9 TPS로 현재도 진행 중(방치 시 월 ~$900 추정).
  • 비용 공식: 샘플 수 = 활성 시계열 × (시간 / scrape_interval). 워크스페이스 존재가 아니라 클러스터가 계속 밀어넣는 양이 과금.
  • 튜닝 레버: ① scrape_interval 15s→60s(×1/4) ② 고카디널리티 메트릭 drop(Istio _bucket·cadvisor) ③ remote_write write_relabel_configs로 AMP 전송분만 필터.
profile
나를 한줄로

0개의 댓글