| 항목 | 상태 |
|---|---|
AMP remote-write 구축 — amp.tf 검증·수정(오타+누락 inline policy) → -target apply | ✅ |
| GitOps PR — remote-write(#115) · 차트 ServiceMonitor 4종(#116) 머지 | ✅ |
| DR 대시보드 교정 — RTO 15분·Route53 글로벌 헬스체크 리네임·5xx 비율 ArithmeticError 수정·AMP 더미패널 삭제 | ✅ |
dr-eks amazon-cloudwatch-observability 애드온 설치 (PR #118) | ✅ |
| Backend prod 승격 누락 인시던트 — 원인(main 직접 push→dev 이미지 미빌드) 규명·재배포 트리거 | ✅ |
| AMP 배포검증 문서 6컷 캡처 체크리스트 작성 | ✅ |
| Karpenter 패널 No data 진단 — 이벤트 기반 지표·now-1h 창 밖 사건(노드 i-01df80) | ✅ |
sts:AssumRoleWithWebIdentity 오타(→AssumeRole...) ② aps:RemoteWrite inline policy 자체가 누락. 둘 다 plan에선 안 잡히고 apply 후 remote-write 403으로 드러남. apply는 원칙상 Jenkins(prod/dev)지만 단발 -target은 로컬로 처리, dr은 관례상 수동.api.farmily.info FQDN 1개를 보는 글로벌 체크(메트릭은 항상 us-east-1 발행). 패널명 "API 글로벌 헬스체크"로 리네임, "서울정상" 값 매핑 제거.(m5xx/requests)*100은 requests=0일 때 NaN. 최종 IF(requests, 100*FILL(m5xx,0)/requests, 0)로 0 division 가드. CloudWatch metric math: 결측은 FILL(m,0), 0 나눗셈은 IF().feat→push-image(dev 이미지 빌드)를 건너뜀 → dev-<sha> 부재 → prod 승격(crane copy) 스킵(설계된 안전망 "결정 C"). FF로 feat 동기화 후 prod 워크플로 재실행으로 복구. → 교훈: Infra·Backend 공통 main 직접 push 금지, 항상 feat→PR.nodes_created_total·프로비저닝 히스토그램은 이벤트 기반. 스케일 사건 없으면 빔. 노드 i-01df80(nodepool=default, on-demand)은 00:50 UTC 생성(5.5h 전)이라 대시보드 기본 now-1h 창 밖 → 비어 보임. Last 6h로 넓히면 보임.수집 파이프라인 (인프라 — 익숙한 쪽)
/metrics를 긁어라"고 Prometheus에 알려주는 설정 객체. release 라벨로 Prometheus가 자기 대상인지 판별.통계·쿼리 (대시보드 읽기)
_bucket — 값 분포를 구간별로 센 지표. 여기서 백분위를 뽑는다.서비스 메시 (Istio)
오토스케일링
배포
기타
kubectl exec ... env가 안 됨 → 검증은 pod spec(-o jsonpath).출처: 2026-06-26 AMP 운영 대시보드 구축. 상세는
설계서/모니터링/Farmily-AMP-운영모니터링-설계서.md· 레퍼런스 PDF(바탕화면).