GPU

spring·2026년 5월 18일

Inference

목록 보기
1/1
post-thumbnail

GPU별 지원 데이터 타입 비교 (Matrix/Tensor 연산 기준)

데이터 타입RTX 5090 (Blackwell)R9700 (RDNA 4, 2nd-gen AI Accel.)Arc Pro B70 (Xe2 / Battlemage XMX)Radeon 8060S (RDNA 3.5 iGPU, WMMA)M5 Max (1st-gen Neural Accel.)
FP64✅ (CUDA, 저속)❌ (벡터 에뮬)✅ (XVE 일반 경로, 저속)❌ (에뮬)❌ (에뮬)
FP32✅ (47.8 TF)✅ (22.94 TF)✅ (~29.7 TF)✅ (SIMD 파이프)
TF32❌ (XMX 미지원)
BF16✅ (~209 TF)✅ (191/383 sparse TF)✅ (XMX)⚠️ (RDNA3.5 WMMA, BF16 instruction 제한적이나 동작)⚠️ (Neural Accel. 미노출, 일반 ALU 추정)
FP16✅ (~209 TF)✅ (191/383 sparse TF)✅ (~184 TF XMX)✅ (~59.4 TF WMMA, peak)✅ (~33–41 TF, M5 Max)
FP8 (E4M3/E5M2)✅ (~838 TF FP16 accum.)✅ (383/766 sparse TF)❌ (XMX 미지원)❌ (RDNA3/3.5 하드웨어 미지원)
FP6✅ (Blackwell 신규)
FP4 / NVFP4 / MXFP4✅ (네이티브, ~1676 TF+)⚠️ (MLX MXFP4 모델 실행 가능, 디퀀트 경로)
INT8✅ (~838 TOPS)✅ (383/766 sparse TOPS)✅ (367 TOPS dense, XMX)⚠️ (WMMA, FP16과 동일 속도 — 2× gain 없음)✅ (INT32 accum.)
INT4✅ (766/1531 sparse TOPS)✅ (XMX)⚠️ (제한적)
INT2✅ (XMX, Battlemage 특이점)
Structured Sparsity (2:4)❌ (Xe2 미지원)

새로 추가된 두 칩의 포지셔닝

Intel Arc Pro B70 (Battlemage) — 32GB GDDR6 @ 608 GB/s, $949에 거의 R9700과 동급 VRAM/대역폭을 제공하지만, XMX 매트릭스 엔진의 포맷 지원은 FP16/BF16/INT8/INT4/INT2까지로 제한되고 FP8/FP6/FP4가 전부 빠져 있음. 즉 BF16 추론에서는 가성비가 좋지만, NVFP4·MXFP4 기반 최신 정량화 흐름에서는 한 세대 뒤처짐. 흥미로운 점은 INT2 XMX 명령까지 노출되어 있다는 것(NVIDIA/AMD에 없는 영역). 그리고 Sparsity 가속이 없다는 게 같은 32GB·256-bit 클래스인 R9700과 비교했을 때 INT8 dense throughput 격차(367 vs 383 TOPS dense, 그러나 R9700은 sparse 766)를 더 벌려놓음.

Radeon 8060S (RDNA 3.5 iGPU, Ryzen AI MAX+ 395) — 동일 RDNA 계열이라도 RDNA 3.5는 FP8 하드웨어 가속이 없음이 핵심 차이. RDNA 4에서야 FP8 매트릭스가 들어왔기 때문에, 8060S는 사실상 FP16/BF16 매트릭스(WMMA) + INT8 + FP32 벡터 정도가 실용 영역. INT8이 FP16과 동일 속도로 도는 것도 dGPU급 가속기들과 가장 큰 차이점. 다만 iGPU 특성상 유니파이드 메모리 최대 96GB를 VRAM으로 잡을 수 있다는 게 이 칩의 진짜 강점이라, "느리더라도 70B급 모델을 통째로 메모리에 올려본다" 같은 워크로드에서는 다른 dGPU들과 결이 다른 가치를 가짐. 메모리 대역폭은 LPDDR5X-8000 256-bit로 이론 256 GB/s, 실측 ~212 GB/s 수준 — M5 Max(614 GB/s)와 비교하면 통합 메모리 카테고리 안에서도 격차가 큼.

다섯 칩 큰 그림

  • 포맷 폭(format breadth): RTX 5090 ≫ R9700 > Arc Pro B70 ≈ 8060S > M5 Max
  • 저정밀(FP8 이하) 정량화 추론 효율: RTX 5090 ≫ R9700 ≫ 나머지 셋 (8060S/B70/M5 Max는 사실상 FP16·INT8까지가 한계)
  • 메모리 용량 우선 시: 8060S(96GB) > M5 Max(128GB+) > B70/R9700/RTX 5090 (32GB)
  • 메모리 대역폭: RTX 5090(1792) ≫ R9700(640) ≈ B70(608) ≈ M5 Max(614) ≫ 8060S(~212)
profile
Researcher & Developer @ NAVER Corp | Designer @ HONGIK Univ.

0개의 댓글