26O05b

QK·6일 전

첨부해주신 B300 8-GPU 검증 가이드 및 체크리스트 문서를 바탕으로, 내·외부 이해관계자 및 협업 팀에 현재 진행 중인 태스크의 전반을 명확하고 깔끔하게 공유할 수 있는 표준 개요 문서(Summary/Briefing Document)를 작성했습니다.


[프로젝트 공유] B300 8-GPU 노드 무결성 및 인프라/추론 성능 검증 계획

문서 목적: 신규 도입된 단일 NVIDIA B300 8-GPU 노드의 하드웨어 무결성 확보, Bare-Metal 환경 기준선(Baseline) 수립, 그리고 Kubernetes(K8s) 및 분산 인프라 연동 시 운영 안정성을 입증하기 위한 검증 체계·진행 상황 공유.


1. 검증 목적 (Objective)

  1. 하드웨어 무결성 및 신품 결함 여부 규명: 최신 B300 아키텍처(PCIe Gen6, 4세대 NVSwitch, HBM, FP8/FP4 텐서코어)의 물리적 연결성 및 장시간 풀로드 시 안정성(쓰로틀링/XID/Row-Remap) 전수 확인.
  1. AI 서빙(vLLM) 기준 성능(Baseline) 도출: Llama 3.1 70B/8B 및 DeepSeek-R1(FP8 MoE) 모델을 활용하여 서빙 지연(TTFT/ITL), 처리량, 동시성 포화점, Prefix Caching 및 KV 캐시 티어링(MemKV/로컬 NVMe) 효과 실측.
  1. 컨테이너/클러스터(K8s + Cilium) 환경 전이 손실 최소화: Bare-Metal에서 측정한 성능 지표가 K8s 파드 및 CNI 환경에서도 구조적 병목 없이 유지되는지 확인하고, 정책(NetworkPolicy) 및 장애 복구 탄력성 검증.
  1. 회귀 게이트(Regression Gate) 구축: 코드화된 기준(gate_criteria.yaml)을 통해 인수(Acceptance) 판정 자동화 및 향후 모델/드라이버 업그레이드 시 성능 저하(Drift)를 조기 감지하는 지속 운영 체계 수립.

2. 테스트 환경 요약 (Environment)

  • 하드웨어 노드: NVIDIA HGX B300 8-GPU 노드 (PCIe Gen6, 4세대 NVSwitch, NVLink 통신)
  • 호스트 OS / 런타임: Red Hat Enterprise Linux (RHEL) 10.2, NVIDIA Open Kernel Driver + Fabric Manager, Podman (CDI 인터페이스 적용)
  • 네트워크 / 스토리지:
  • 100Gbps NIC (LACP 본딩, 유효 대역폭 50Gbps 환경, RDMA 미적용/TCP 기반)
  • 초고속 로컬 엔터프라이즈 NVMe 캐시 어레이 (/mnt/local-nvme-cache)
  • 대용량 모델 스토리지: MinIO AIStor / MemKV (S3 호환 엔드포인트)
  • 컨테이너 인프라: Kubernetes (Cilium CNI 기반 ClusterMesh 연동, GPU Operator, Hubble 관측성)
  • 네트워크 제약: 완전 폐쇄망(Air-gap) 환경 (사전 스테이징 PC에서 모델 safetensors, 이미지 tar, Python wheel 번들링 후 반입하여 HF_*_OFFLINE=1 강제 운영)

3. 검증 프레임워크 및 단계별 실행 구조 (Architecture & Steps)

검증은 초기 인수(Core Acceptance) 항목을 최우선으로 진행하며, 엔진 워밍업과 정상 상태 측정을 명확히 분리하여 계측의 신뢰성을 확보합니다.

[0단계: Preflight]
 └─ 환경변수 단일화(validation_env.sh) & 호환성 검사(00_compatibility_check.sh)
        │
[1단계: Bare-Metal HW/인프라 무결성 검증]
 ├─ Stage 1: HW 무결성 (PCIe Gen6, Fabric Manager, NVLink All-Reduce, FP8/4 부하, gpu-burn 소크)
 ├─ Stage 2: 네트워크 & 로컬 스토리지 (LACP iperf3, Optic DDM, 200GB 지속 NVMe 쓰기/SMART)
 └─ Stage 2c (선택): MemKV Wire-level S3 Baseline (S3 PUT/GET 순수 대역폭)
        │
[2단계: 추론 서빙(vLLM) 성능 및 캐시 티어링 실증]
 ├─ Stage 3a: vLLM 기본 성능 (70B BF16 vs FP8, ITL 하한선 8B, DeepSeek-R1 MoE HBM 실증)
 ├─ Stage 3a-2~9 (선별): 동시성 포화점 탐색, RAG 가변 길이 곡선, Soak 테스트
 └─ Stage 3a10: KV 캐시 티어링 실효성 비교 (GPU Native vs 로컬 NVMe vs 원격 MemKV)
        │
[3단계: K8s 클러스터 전이 및 운영 안정성 검증]
 ├─ Stage 6c / 6a: K8s GPU 토폴로지 및 파드 내 NCCL 재검증 (Bare-metal 대비 편차 확인)
 ├─ Stage 6b: 파드 간(Pod-to-Pod) 및 노드 네트워크 스루풋 재검증
 ├─ Stage 6k: K8s vLLM Steady-State 재검증 (Performance-ready 마커 확인 후 지연/처리량 측정)
 └─ Stage 6h / 6i / 6f (부분): Cilium NetworkPolicy 격리, Hubble 가시성, 파드 복구(PDB/Probe)
        │
[4단계: 게이트 판정 및 요약 리포트]
 └─ regression_gate.py 자동 평가 (Hard Gate / Soft Warning) 및 종합 보고서 발행

※ 초기 제외(Deferred) 범위: 대규모 분산 학습(Stage 4), 대체 추론 엔진(Stage 3b Triton/TRT-LLM, 3c SGLang), Spark 대규모 동시 버스트(Stage 6d), 강제 파티션/경합(Stage 6g/6j)은 하드웨어 및 기본 vLLM 인수가 안정화된 이후 2단계로 진행합니다.


4. 핵심 판단 기준 (Pass / Fail Criteria)

판정은 시스템 결함을 의미하는 Hard Gate(배포 차단)와 최적화 검토 대상인 Soft Warning으로 이원화하여 운영합니다.

영역검증 항목주요 판단 기준 (Pass Criteria)실패/이상 시 대응 방안
하드웨어 (Stage 1)GPU 및 링크 인식8장 전수 인식, PCIe Max=Current(Gen6 x16), Fabric Manager 활성물리적 슬롯 재장착, BIOS ASPM 설정 점검, FM 서비스 재기동
메모리/통신 무결성Uncorrected ECC = 0, 신규 XID 발생 0, NVLink 에러 0발생 시 벤더사 RMA(교체) 즉시 요청
성능 및 스트레스NCCL All-Reduce 이론치 80%+, gpu-burn 완주(DIED 0), 지속 쓰로틀 <1%전원/발열 모니터링, Makefile CC 누락 여부 확인
네트워크/저장 (Stage 2)
본딩 네트워크LACP x8 멀티스트림 ~45Gbps(이론치의 90%+), CRC/FEC 패킷 에러 0LACP 해시 알고리즘(Layer 3+4) 및 광모듈 상태 확인
로컬 NVMe 캐시200GB 연속 쓰기 후 급격한 성능 저하 없음, Media Error 0드라이브 스펙(엔터프라이즈급 여부) 재확인, RMA 검토
추론 서빙 (Stage 3a)
vLLM 70B 서빙짧은 입력 ITL 58ms, FP8 적용 시 BF16 대비 TTFT 15~30% 단축chunked-prefill 등 서버 파라미터 스윕, FP8 커널 점검
Prefix Caching캐시 미적용 대비 TTFT 5~10배 단축 (목표: <50ms)캐시 히트율 및 vLLM 메모리 사용률 재조정
KV 티어링 (Stage 3a10)none 대비 local_nvme/remote_obj 사용 시 동시성 확장(Capacity) 확보지연시간 증가폭 대비 유효 동시성(Concurrency) 증가치로 효용 판단
K8s 연동 (Stage 6)컨테이너 환경 전이파드 내 NCCL, 네트워크 대역폭이 Bare-metal 대비 5~10% 이내 유지CNI 오버헤드 확인, K8s Topology Manager 설정 점검
보안 및 격리CiliumNetworkPolicy 미허가 트래픽 차단, Hubble 모니터링 정상 기록네임스페이스 라벨링 및 L3/L4/L7 정책 룰 교정

5. 결과 활용 방안 및 향후 로드맵 (Utilization & Next Steps)

  1. 장비 인수 및 품질 보증 (Sign-off)
  • 하드웨어 스트레스 및 무결성 로그를 바탕으로 신규 서버 벤더 검수 보고서 승인 근거 데이터로 활용.
  1. 사내 AI 워크로드 표준 서빙 스펙 수립
  • 실측된 TTFT/ITL, 메모리 포화점 데이터를 기반으로 프로덕션 LLM 서비스(사내 RAG/Agent/챗봇)의 인프라 사이징 가이드라인 배포.
  • 대규모 MoE(DeepSeek 등) 모델의 단일 노드 호스팅 가용성 및 파티셔닝 전략(TP=8 vs TP=4x2) 확정.
  1. CI/CD 및 지속 회귀 감시 (Regression Gate)
  • 이번에 도출된 최적 결과를 baseline.json으로 등록.
  • 향후 vLLM, CUDA 드라이버, 베이스 OS 업데이트 시 동일 워크로드를 자동으로 돌려 5~10% 이상 성능 저하 발생 시 프로덕션 배포를 차단하는 게이트웨이로 연동.
  1. 추후 단계(Phase 2) 연계
  • 분산 데이터 파이프라인(MinIO/Spark/Airflow) 결합 실시간 대규모 버스트 테스트(Stage 6d) 및 엔터프라이즈 Gateway(LiteLLM) 연동으로 확장.
profile
engineer

0개의 댓글