
최근 오픈소스 LLM 커뮤니티HuggingFace, vLLM, TensorRT-LLM, GitHub 를 보면 NVFP4 포팅과 최적화 작업이 광풍처럼 불고 있습니다.
단순히 엔비디아가 밀고 있어서라기엔, 개발자들이 자발적으로 텐서 코어 커널을 수정하고 최적화 파이프라인을 깎아내며 뛰어들고 있습니다.
엔비디아의 차세대 칩셋의 보급과 맞물려 이러한 현상이 발생하는 기술적 배경, 그리고 NVFP4가 가진 명확한 장단점을정리하기위해 포스팅을 하게되었습니다.
NVFP4는 엔비디아가 블랙웰 아키텍처를 발표하며 제안한 4비트 부동소수점 포맷입니다.
기존 INT4 양자화가 가진 표현력의 한계를 극복하기 위해 16개 블록 단위의 미세한 스케일링과 E4M3 스케일 팩터를 활용합니다.
독점 표준 이슈: NVFP4는 엔비디아의 자체 규격입니다.
이에 반해 OCP 주도의 MXFP4는 업계 공동 개방형 표준입니다.
우회 가능성: 하드웨어 범용성과 독점 라이센스 회피 측면에서는 MXFP4로 이탈하는 것이 유리할 수 있습니다.
하지만 블랙웰 하드웨어 상에서는 NVFP4가 미세 스케일링 덕분에 정밀도 유지 면에서 MXFP4보다 우수한 결과를 보여주고 있습니다.
NVFP4를 지원하는 5세대 텐서 코어는 SM100, SM120 등 블랙웰 아키텍처 GB10, B200, RTX 50 시리즈 등 에만 탑재되어 있습니다.
구세대 카드에서의 성능 저하: Ada Lovelace나 Hopper 등 구형 GPU에서 NVFP4 모델을 로드하려면, 연산 과정에서 FP16/BF16 또는 INT8 등으로 캐스팅하는 우회 연산을 거쳐야 합니다.
결과: 메모리 용량은 아낄 수 있을지 몰라도, 연산 시 변환 오버헤드가 발생하여 오히려 기존 INT8/FP8 연산보다 추론 속도가 느려지거나 heavier해지는 역효과가 발생합니다.
기존 k-quant나 일반적인 4비트 양자화는 메모리에 4비트로 저장해 두었다가, 텐서 연산을 수행할 때 FP16으로 복호화하여 연산하는 방식을 사용합니다.
NVFP4 & MXFP4의 구조적 이점: 블랙웰의 텐서 코어는 4비트 상태 그대로 텐서 마이크로 연산을 수행합니다.
20% 이상의 속도 이득: FP16으로의 복호화 과정이 완전히 생략되기 때문에 메모리 대역폭 이득뿐만 아니라 pure compute 단계에서 약 20% 내외의 레이턴시 및 TPS이득을 얻게 됩니다.
커뮤니티가 이 체감 속도에 열광하는 핵심 이유입니다.
최근 보급되기 시작한 GB10 기반 데스크톱/서버 형태 플랫폼은 텐서 연산 성능은 강력하지만, 하드웨어 구조상 시스템 메모리나 대역폭 제약으로 인해 큰 모델 추론 시 TPS가 기대만큼 나오지 않는 한계가 있습니다.
대역폭 병목 극복 시도: 메모리 병목에 걸린 하드웨어에서 TPS를 조금이라도 더 끌어올리기 위해서는 가장 압축률이 높으면서도 하드웨어 가속이 가능한 NVFP4 연산이 필수적입니다.
개발자들이 커뮤니티에서 자발적으로 NVFP4 포팅 커널을 깎고 있는 현상은, 제한된 폼팩터 장비에서 고성능 LLM의 실용적인 TPS를 확보하기 위한 '배수진을 친 최적화 시도'로 볼 수 있습니다.
NVFP4 연산 실체화 과정에서 커뮤니티에 가장 크게 보고되고 있는 문제는 바로 초장문처리 시의 정밀도 붕괴입니다.
원인: 모델의 가중치뿐만 아니라 연산 과정의 활성화 및 KV 캐시까지 FP4로 강제 연산할 경우, 컨텍스트 길이가 100k 이상으로 늘어나면 누적되는 양자화 오차로 인해 출력 품질이 급격히 저하되거나 헛소리를 출력하는 현상이 발생합니다.
현재의 해결책: 최근 커뮤니티 연구에서는 레이어별 민감도를 측정하여 주요 레이어는 BF16/FP8로 남겨두고 선택적으로 NVFP4를 적용하거나, KV 캐시는 FP8을 유지하는 혼합 정밀도 접근법이 대안으로 제시되고 있습니다.
현재 커뮤니티의 NVFP4 포팅 광풍은 블랙웰 기반 GB10 유저들과 하드웨어 극한의 성능을 뽑아내려는 엔지니어들의 집착이 만들어낸 결과물입니다.
FP16 복호화 없는 순수 4비트 연산의 속도감은 매력적이지만, 롱 컨텍스트 정밀도 이슈와 독점 라이센스/범용성 문제라는 명확한 과제가 남아있습니다.
블로그 글 작성 시 하단에 첨부하거나 각 단락에 인용하기 좋은 1차 출처 링크입니다.
NVFP4 vs MXFP4 기술 사양 및 정밀도 비교
NVFP4와 MXFP4의 스케일링 방식 차이 및 정밀도 유지율 분석
NVIDIA Blackwell GB10 상에서의 NVFP4 MoE 모델 연산 보고서
Blackwell GB10 환경에서 vLLM 커널을 활용해 Qwen3-Next 등 80B급 MoE 모델을 NVFP4로 인퍼런스한 실제 최적화 로그 및 128k 컨텍스트 벤치마크
NVFP4 롱 컨텍스트 문제 해결을 위한 PrismQuant 발표
단일 NVFP4 일괄 적용 시 발생하는 정밀도 하락 문제를 해결하기 위해 레이어별 민감도를 측정하여 혼합 정밀도를 적용하는 최신 커뮤니티 논의
MXFP4의 소프트웨어 기반 수용성 개선 연구
NVFP4 대비 MXFP4가 갖는 정밀도 손실 문제를 Overflow-Aware Scaling으로 극복하여 독점 포맷을 우회하려는 연구 논문