일배치(Batch) 파이프라인이 전사 자원 최적화와 거시적 아키텍처 진단을 위한 '종합 건강검진'이라면, 실시간 이상징후 파악 및 원인 분석(RCA)은 사이트 가동 중단을 막는 '응급실 심폐소생술(CPR)'과 같습니다.
실시간 영역에서 가장 흔히 하는 실수가 "모든 지표와 로그 스트리밍을 LLM에 실시간으로 통과시키는 것"인데, 이는 비용 폭발과 추론 지연(Latency)으로 인해 프로덕션 환경에서는 완전한 안티패턴(Anti-pattern)입니다.
실시간 환경에서는 [경량 룰 기반 탐지] ➡️ [컨텍스트 융합] ➡️ [JIT(Just-In-Time) LLM 원인 분석 Trigger]로 이어지는 3단계 온디맨드(On-Demand) 아키텍처로 접근하는 것이 가장 효율적입니다.
[인프라 레이어 (K8s, Cilium, Keycloak, AIStor)]
│
▼ (실시간 메트릭 & eBPF 스트림)
┌────────────────────────────────────────────────────────┐
│ 1단계: Prometheus Alertmanager & PromQL 룰 엔진 │
│ - 고전적/확정적 임계치 돌파 탐지 (OOM, 드롭 급증, 스큐 폭발) │
└────────────────────────────────────────────────────────┘
│
▼ (경보 발령: Alert Webhook Trigger)
┌────────────────────────────────────────────────────────┐
│ 2단계: 미니 Polars 슬라이딩 윈도우 스냅샷 캡처 │
│ - 장애 발생 시점 기준 최근 15분간의 SRE 지수 즉시 연산 │
│ - Keycloak OIDC 에러 로그 및 Cilium eBPF 트레이스 매핑 │
└────────────────────────────────────────────────────────┘
│
▼ (압축된 장애 컨텍스트 인젝션)
┌────────────────────────────────────────────────────────┐
│ 3단계: 온디맨드 LLM RCA 에이전트 구동 │
│ - 1초 내외 초고속 추론으로 실시간 원인 판독 │
│ - 슬랙(Slack)으로 정밀 진단서 및 즉시 조치 플레이북 발송│
└────────────────────────────────────────────────────────┘
실시간 탐지 레이어는 무조건 가볍고 확정적이어야 합니다. 배치 파이프라인에서 검증한 고차원 SRE 유도 지표 공식을 실시간 PromQL 룰(PrometheusRule)로 이식합니다.
feat_load_skew_cv_max)가 실시간 5분 이동 평균 기준 를 초과할 때 즉시 Alertmanager 경보 발령.feat_mem_oom_proximity 지수가 를 찍는 순간(하드웨어 Limit 임계치 95% 도달), 실제로 OOM이 터지기 전에 미리 경보 트리거.net_drop_errors_total)이 1분간 50건 이상 스파이크를 칠 때 즉시 트리거.Alertmanager가 이상징후를 감지하고 Webhook을 쏘면, 대기하고 있던 경량 수집 스크립트가 장애 발생 직전 15분 동안의 데이터만 Thanos API로 긁어와 메모리 상에서 Polars로 번개처럼 융합합니다.
workload_type 또는 namespace와 연관된 최근 15분간의 11종 핵심 지표.스트리밍이 아니라 경보가 울렸을 때만 LLM을 깨우는(On-Demand) 방식입니다. 2단계에서 실시간으로 압축한 15분간의 SRE 지수 변동 추이와 로그 스냅샷을 LLM 프롬프트에 주입합니다.
이때 실시간 전용 프롬프트는 종합 리포트 형태가 아니라, "당장 엔지니어가 3분 안에 실행해야 할 조치 가이드"에 집중해야 합니다.
💡 실시간 슬랙 경보 사출 예시:
- [위험 레벨]: CRITICAL (StarRocks OLAP 쿼리 타임아웃 징후)
- [실시간 팩트]: 최근 10분간
feat_load_skew_cv_max가 0.52로 폭발. 동시점에 DirectPV 스토리지io_asymmetry_avg가 18.4로 급증(쓰기 증폭 발생).- [LLM 실시간 RCA]: 특정 노드에 StarRocks 태스크가 쏠리면서 로컬 NVMe 스토리지의 백엔드 플러시가 밀리고 있습니다. Keycloak 토큰 스톰 징후는 없으므로 IAM 오버헤드는 아닙니다.
- [즉시 조치 플레이북]:
- 다음 쿼리를 통해 특정 버킷 파티션의 데이터 쏠림 현상을 확인하세요:
SHOW PARTITIONS FROM...- 병목 노드의 커널 스토리지 IOPS 완화를 위해 StarRocks 쿼리 큐 개수를 일시적으로 제한(Throttling) 조치 명령을 하단 스크립트로 실행하세요:
kubectl exec -it ...
이러한 실시간 RCA 구조를 안착시키면 배치 파이프라인과의 강력한 시너지(Feedback Loop)가 일어납니다.
step5와 step6를 통해 인프라의 기저 부하와 장기 거동 패턴을 분석하여 최적의 임계치(Baseline)를 끊임없이 업데이트합니다.이원화 구조로 가야만 인프라 비용을 통제하면서도 가장 똑똑하고 현업 친화적인 AI 기반 고도화 SRE 시스템을 완성할 수 있습니다.