첨부해주신 B300 8-GPU 검증 가이드 및 체크리스트 문서를 바탕으로, 내·외부 이해관계자 및 협업 팀에 현재 진행 중인 태스크의 전반을 명확하고 깔끔하게 공유할 수 있는 표준 개요 문서(Summary/Briefing Document)를 작성했습니다.
문서 목적: 신규 도입된 단일 NVIDIA B300 8-GPU 노드의 하드웨어 무결성 확보, Bare-Metal 환경 기준선(Baseline) 수립, 그리고 Kubernetes(K8s) 및 분산 인프라 연동 시 운영 안정성을 입증하기 위한 검증 체계·진행 상황 공유.
gate_criteria.yaml)을 통해 인수(Acceptance) 판정 자동화 및 향후 모델/드라이버 업그레이드 시 성능 저하(Drift)를 조기 감지하는 지속 운영 체계 수립./mnt/local-nvme-cache)HF_*_OFFLINE=1 강제 운영)검증은 초기 인수(Core Acceptance) 항목을 최우선으로 진행하며, 엔진 워밍업과 정상 상태 측정을 명확히 분리하여 계측의 신뢰성을 확보합니다.
[0단계: Preflight]
└─ 환경변수 단일화(validation_env.sh) & 호환성 검사(00_compatibility_check.sh)
│
[1단계: Bare-Metal HW/인프라 무결성 검증]
├─ Stage 1: HW 무결성 (PCIe Gen6, Fabric Manager, NVLink All-Reduce, FP8/4 부하, gpu-burn 소크)
├─ Stage 2: 네트워크 & 로컬 스토리지 (LACP iperf3, Optic DDM, 200GB 지속 NVMe 쓰기/SMART)
└─ Stage 2c (선택): MemKV Wire-level S3 Baseline (S3 PUT/GET 순수 대역폭)
│
[2단계: 추론 서빙(vLLM) 성능 및 캐시 티어링 실증]
├─ Stage 3a: vLLM 기본 성능 (70B BF16 vs FP8, ITL 하한선 8B, DeepSeek-R1 MoE HBM 실증)
├─ Stage 3a-2~9 (선별): 동시성 포화점 탐색, RAG 가변 길이 곡선, Soak 테스트
└─ Stage 3a10: KV 캐시 티어링 실효성 비교 (GPU Native vs 로컬 NVMe vs 원격 MemKV)
│
[3단계: K8s 클러스터 전이 및 운영 안정성 검증]
├─ Stage 6c / 6a: K8s GPU 토폴로지 및 파드 내 NCCL 재검증 (Bare-metal 대비 편차 확인)
├─ Stage 6b: 파드 간(Pod-to-Pod) 및 노드 네트워크 스루풋 재검증
├─ Stage 6k: K8s vLLM Steady-State 재검증 (Performance-ready 마커 확인 후 지연/처리량 측정)
└─ Stage 6h / 6i / 6f (부분): Cilium NetworkPolicy 격리, Hubble 가시성, 파드 복구(PDB/Probe)
│
[4단계: 게이트 판정 및 요약 리포트]
└─ regression_gate.py 자동 평가 (Hard Gate / Soft Warning) 및 종합 보고서 발행
※ 초기 제외(Deferred) 범위: 대규모 분산 학습(Stage 4), 대체 추론 엔진(Stage 3b Triton/TRT-LLM, 3c SGLang), Spark 대규모 동시 버스트(Stage 6d), 강제 파티션/경합(Stage 6g/6j)은 하드웨어 및 기본 vLLM 인수가 안정화된 이후 2단계로 진행합니다.
판정은 시스템 결함을 의미하는 Hard Gate(배포 차단)와 최적화 검토 대상인 Soft Warning으로 이원화하여 운영합니다.
| 영역 | 검증 항목 | 주요 판단 기준 (Pass Criteria) | 실패/이상 시 대응 방안 |
|---|---|---|---|
| 하드웨어 (Stage 1) | GPU 및 링크 인식 | 8장 전수 인식, PCIe Max=Current(Gen6 x16), Fabric Manager 활성 | 물리적 슬롯 재장착, BIOS ASPM 설정 점검, FM 서비스 재기동 |
| 메모리/통신 무결성 | Uncorrected ECC = 0, 신규 XID 발생 0, NVLink 에러 0 | 발생 시 벤더사 RMA(교체) 즉시 요청 | |
| 성능 및 스트레스 | NCCL All-Reduce 이론치 80%+, gpu-burn 완주(DIED 0), 지속 쓰로틀 <1% | 전원/발열 모니터링, Makefile CC 누락 여부 확인 | |
| 네트워크/저장 (Stage 2) | 본딩 네트워크 | LACP x8 멀티스트림 ~45Gbps(이론치의 90%+), CRC/FEC 패킷 에러 0 | LACP 해시 알고리즘(Layer 3+4) 및 광모듈 상태 확인 |
| 로컬 NVMe 캐시 | 200GB 연속 쓰기 후 급격한 성능 저하 없음, Media Error 0 | 드라이브 스펙(엔터프라이즈급 여부) 재확인, RMA 검토 | |
| 추론 서빙 (Stage 3a) | vLLM 70B 서빙 | 짧은 입력 ITL | chunked-prefill 등 서버 파라미터 스윕, FP8 커널 점검 |
| Prefix Caching | 캐시 미적용 대비 TTFT 5~10배 단축 (목표: <50ms) | 캐시 히트율 및 vLLM 메모리 사용률 재조정 | |
| KV 티어링 (Stage 3a10) | none 대비 local_nvme/remote_obj 사용 시 동시성 확장(Capacity) 확보 | 지연시간 증가폭 대비 유효 동시성(Concurrency) 증가치로 효용 판단 | |
| K8s 연동 (Stage 6) | 컨테이너 환경 전이 | 파드 내 NCCL, 네트워크 대역폭이 Bare-metal 대비 5~10% 이내 유지 | CNI 오버헤드 확인, K8s Topology Manager 설정 점검 |
| 보안 및 격리 | CiliumNetworkPolicy 미허가 트래픽 차단, Hubble 모니터링 정상 기록 | 네임스페이스 라벨링 및 L3/L4/L7 정책 룰 교정 |
baseline.json으로 등록.