섹션 14: Monitoring of LLM Models in Production

쌀과자AI·2025년 8월 26일

📑 Cheat Sheet – LLM Monitoring with WhyLabs & LangKit

1. WhyLabs & WhyLogs

  • WhyLabs: ML/LLM Observability 플랫폼
    • 문제 탐지: 데이터 드리프트, 품질 저하, 편향, 환각, PII 유출, 독성, 프롬프트 공격
    • 아키텍처:
      • Telemetry Agent → 데이터 수집
      • 플랫폼(UI) → 시각화, 분석, 알림 (PagerDuty 등 연계 가능)
  • WhyLogs: 오픈소스 데이터 프로파일링 도구
    • 데이터셋 요약 통계(Profile) 자동 생성 (원본 데이터 노출 X)

2. LangKit (LLM 특화 모듈)

  • WhyLogs 위에 구축된 LLM 전용 툴킷
  • Telemetry: Prompt & Response에서 신호 추출
  • 지원 메트릭
    • 텍스트 품질: 가독성(Readability), 복잡도, Grade Score
    • 연관성: 프롬프트-응답 유사도, 주제 유사도
    • 보안/프라이버시: PII 탐지, 프롬프트 주입, Jailbreak 탐지, Refusal 감지
    • 감정/독성: Sentiment Score, Toxicity Score
  • 특징: 모듈형, 확장 가능 (사용자 정의 메트릭 추가 가능)

3. LLM/GenAI 모니터링 핵심 포인트

  1. 특징(Features) → 입력 분포가 최신 데이터와 일치하는지 확인
  2. 모델 엔드포인트 → 요청·응답 안정성 추적
  3. 예측(Predictions) → 모델 출력이 기대와 맞는지 확인
  4. Ground Truth → 고객 선호 변화 반영 필요 (ex. 코로나 전후 변화)
  5. KPIs → 기존 KPI가 현실과 불일치 시 조정 필요

4. 실습 핵심 흐름

  1. LangKit 설치 및 초기화
pip install langkit-all
from langkit import lm_metrics
import whylogs as why
lm_metrics.init()
  1. Toy Dataset 로깅
from langkit.whylogs.samples import load_chats
chats = load_chats()
profile = why.log(chats, schema=lm_metrics.init())

→ WhyLabs에 push 후 시각화 (독성, PII 패턴 등 확인 가능)

  1. Hugging Face 모델 연동 (GPT-2)
    • Prompt 입력 → Response 생성 → WhyLogs로 로깅
    • WhyLabs 플랫폼에서 메트릭/인사이트 확인
  2. WhyLabs 계정 연동
    • Org ID, API Key, Resource ID 설정 → Notebook에서 직접 push
  3. Guardrails 적용
    • 예: toxicity_score > 0.5 → 응답 차단/대체
    • 보안 규칙 기반 알림 및 워크플로우 트리거

5. Key Takeaways

  • LLM 운영 = 성능 + 안전성 모니터링 필수
  • WhyLabs + LangKit → 품질·보안·윤리 리스크 감시 가능
  • 실습 결과: LLM 응답에서 독성, PII, Jailbreak 패턴 실시간 탐지 가능
  • 실무 적용 예시
    • 독성 > 임계치 → 알림 발송
    • PII 감지 → 보안팀 검토 프로세스 자동화

👉 한마디로: “LangKit + WhyLabs = LLM 운영 안전망”

📑 예상 기출문제 (LLM Monitoring with WhyLabs & LangKit 기반)


🟢 난이도 하 (기본 개념 확인)

문항 1

LangKit이 제공하는 주요 기능은 무엇인가?

① 모델 압축 및 최적화

② 텍스트 품질 및 보안 관련 메트릭 모니터링

③ 데이터 증강 및 레이블링

④ 모델 아키텍처 탐색

정답: ②

해설: LangKit은 WhyLogs 기반으로 만들어진 LLM 모니터링 전용 툴킷으로, 텍스트 품질·연관성·보안·감정/독성 관련 메트릭을 제공한다 .

난이도: 하


문항 2

다음 중 WhyLogs의 특징으로 옳지 않은 것은?

① 데이터셋의 통계 요약(Profile)을 자동으로 생성한다.

② 원본 데이터 대신 통계 요약을 기록하므로 프라이버시가 보장된다.

③ 실시간 모델 예측 품질을 평가하는 LLM 특화 메트릭을 제공한다.

④ 오픈소스 라이브러리이다.

정답: ③

해설: LLM 특화 메트릭은 LangKit에서 제공하는 기능이며, WhyLogs는 범용 데이터 프로파일링 도구이다 .

난이도: 하


문항 3

LLM 운영 모니터링 시 WhyLabs 플랫폼이 탐지할 수 있는 문제로 옳은 것은?

① 데이터 드리프트

② 모델 압축률 저하

③ 학습 속도 저하

④ GPU 메모리 부족

정답: ①

해설: WhyLabs는 데이터 품질 문제(드리프트, 편향), 모델 성능 저하, 독성·PII 유출 등 LLM 관련 리스크를 탐지할 수 있다 .

난이도: 하


문항 4

LangKit이 기본적으로 제공하는 메트릭 범주가 아닌 것은?

① 텍스트 품질

② 텍스트 연관성

③ 하드웨어 자원 사용량

④ 보안/프라이버시

정답: ③

해설: LangKit은 텍스트 기반 품질/연관성/보안/감정·독성 메트릭을 제공하지만 하드웨어 모니터링 기능은 없다 .

난이도: 하


문항 5

WhyLabs 아키텍처의 구성 요소로 올바른 것은?

① Telemetry Agent + Observability Platform

② Encoder + Decoder

③ Trainer + Evaluator

④ Data Loader + Tokenizer

정답: ①

해설: Telemetry Agent가 데이터를 수집하고, WhyLabs 플랫폼이 이를 시각화·분석한다 .

난이도: 하



🟡 난이도 중 (실무 응용)

문항 6

다음 중 LLM 모니터링에서 Ground Truth를 최신 상태로 유지해야 하는 이유는 무엇인가?

① 모델의 학습 속도를 개선하기 위해

② 사용자 선호나 환경 변화로 데이터 분포가 달라지기 때문

③ GPU 사용량을 줄이기 위해

④ 프롬프트 토큰 수를 줄이기 위해

정답: ②

해설: Ground Truth는 시간에 따라 달라질 수 있으며(예: 코로나 전후 외식 선호 변화), 최신 데이터를 반영해야 올바른 성능 평가가 가능하다 .

난이도: 중


문항 7

WhyLabs에 LangKit 데이터를 업로드할 때 사용하는 방식으로 옳은 것은?

① Telemetry Agent를 통해 WhyLabs Writer를 사용한다.

② Hugging Face Trainer를 통해 자동 업로드된다.

③ Docker 컨테이너 내부에서만 가능하다.

④ 모델 훈련이 끝난 후 오프라인 배치로만 지원된다.

정답: ①

해설: 실습에서 LangKit → WhyLogs로 생성된 Profile을 Telemetry Agent가 WhyLabs Writer를 통해 플랫폼에 업로드한다 .

난이도: 중


문항 8

다음 중 LangKit이 탐지 가능한 보안 관련 리스크에 해당하지 않는 것은?

① 프롬프트 주입(Prompt Injection)

② Jailbreak 시도

③ 개인 식별 정보(PII) 유출

④ 모델 파라미터 수 감소

정답: ④

해설: LangKit은 LLM 보안 위협(Prompt Injection, Jailbreak, PII 노출)을 탐지할 수 있지만 모델 파라미터와 같은 학습 구조적 요소는 모니터링하지 않는다 .

난이도: 중


문항 9

LangKit의 Relevance(연관성) 메트릭은 주로 어떤 목적으로 사용되는가?

① 모델의 학습률 튜닝

② 응답과 프롬프트, 또는 주제 간의 의미적 유사성 평가

③ GPU 사용량 최적화

④ 토큰 분포를 정규화

정답: ②

해설: Relevance 메트릭은 프롬프트-응답 간 의미 일치 여부 및 사용자 정의 주제와의 유사성을 평가한다 .

난이도: 중


문항 10

WhyLabs 플랫폼에서 Insights Explorer가 제공하는 기능으로 옳은 것은?

① 모델 학습률 자동 최적화

② LLM 응답 내 패턴 탐지 (예: 이메일, 카드번호 등)

③ GPU 리소스 사용 현황 시각화

④ 데이터 증강 자동 수행

정답: ②

해설: Insights Explorer는 수집된 텍스트 데이터에서 PII, 독성, jailbreak 등 위험 패턴을 자동 탐지해 인사이트를 제공한다 .

난이도: 중



🔴 난이도 상 (심화/응용)

문항 11

실습에서 toxicity_score > 0.5 조건을 활용하여 구현할 수 있는 대표적인 Guardrail 동작은 무엇인가?

① GPU 메모리 해제

② 해당 입력을 차단하거나 대체 응답 반환

③ 모델 파라미터 수 축소

④ Ground Truth 자동 갱신

정답: ②

해설: Guardrails는 특정 임계값 조건에서 모델 응답을 제어하는 방식으로, 독성 점수가 높을 경우 응답을 거절하거나 사전 정의된 안전 응답을 반환한다 .

난이도: 상


문항 12

LangKit과 WhyLabs의 결합이 LLM 운영에 중요한 이유는 무엇인가?

① 모델 파라미터 효율성을 높여 학습 속도를 향상시킨다.

② LLM의 품질·보안·윤리적 리스크를 실시간으로 모니터링 가능하게 한다.

③ 모델을 자동으로 압축하여 비용을 절감한다.

④ 데이터 레이블링 자동화를 지원한다.

정답: ②

해설: LLM 운영에서 가장 큰 리스크는 환각·독성·PII 노출·프롬프트 공격으로, LangKit+WhyLabs는 이를 실시간 감시하고 대응할 수 있는 체계를 제공한다 .

난이도: 상


문항 13

WhyLabs가 제공하는 Telemetry Agent의 역할로 옳은 것은?

① GPU 리소스 관리

② 데이터 수집 및 프라이버시 보존형 통계 전달

③ 모델 학습률 스케줄링

④ 토큰화 규칙 자동화

정답: ②

해설: Telemetry Agent는 프라이버시 보존 통계를 생성하여 WhyLabs 플랫폼으로 전송해 분석 및 시각화를 가능하게 한다 .

난이도: 상


문항 14

다음 중 LLM 모니터링 과정에서 KPIs(핵심 성과 지표)를 조정해야 하는 상황으로 가장 적절한 것은?

① GPU 사용량이 증가했을 때

② Ground Truth 데이터가 현실 변화를 반영하지 못할 때

③ 토크나이저가 새로운 단어를 인식하지 못할 때

④ 모델 파라미터 수가 늘어날 때

정답: ②

해설: KPI는 모델 성능 평가 기준으로, Ground Truth가 변화하면 기존 KPI가 맞지 않게 되므로 재정의해야 한다 .

난이도: 상


문항 15

실습에서 Hugging Face GPT-2 모델을 WhyLabs에 연동하는 과정의 올바른 순서를 고르시오.

① 프롬프트 입력 → 응답 생성 → LangKit 메트릭 로깅 → WhyLabs Writer 전송

② WhyLabs Writer 전송 → 응답 생성 → LangKit 메트릭 로깅 → 프롬프트 입력

③ LangKit 메트릭 로깅 → 프롬프트 입력 → WhyLabs Writer 전송 → 응답 생성

④ 응답 생성 → WhyLabs Writer 전송 → 프롬프트 입력 → LangKit 메트릭 로깅

정답: ①

해설: 실습에서는 GPT-2로 프롬프트에 응답을 생성하고, LangKit이 해당 프롬프트-응답 쌍에서 메트릭을 추출한 뒤 WhyLabs Writer가 이를 플랫폼에 전송했다 .

난이도: 상

profile
AI에 관심이 많은 23살 대학생입니다.

0개의 댓글