datacenter access link bandwidth는 급격히 증가한 반면에, 다른 모든 host resource(core speeed, cache size, NIC buffer size)는 대게 발전이 없었다. 따라서 전통적인 Linux network stack
오늘날의 Linux network stack엔 자주 언급되는 한계들이 있다. inefficient packet processing pipeline기존의 Linux network stack은 packet이 느리게 도착하고, interrupt나 system call이 bo

정의CPU가 접근하는 virtual address를 physical address로 translate 해 주는 HW이점Address Translation OptimizationTLB(Translation Lookaside Buffer)Memory Protection동작
Multi-Instance GPU (MIG)는 GPU를 최대 7개의 독립적인 GPU instance로 안전하게 분할해 준다.MIG가 없던 시절에는 GPU 전체를 단일 사용자가 독점하는 방식이었다. 이때 해당 사용자의 workload가 GPU를 100% 활용하지 않으면,
일반적으로 MIG mode는 꺼져 있다.MIG mode를 활성화시키는 코드는 다음과 같다.다음 명령어를 통해, NVIDIA driver가 A100 GPU에서 MIG 기능을 구성할 때 선택할 수 있는 여러 profile을 확인할 수 있다.nvidia-smi mig -lg

RDMA란 두 컴퓨터가 서로의 main memory 데이터를 cpu, cache, os의 개입 없이 직접 주고받을 수 있게 해 주는 기술이다. 일반적인 네트워크 통신 흐름은, 사용자 application이 data를 보내면, cpu가 data를 kernel에 복사하고,
여러 개의 GPU를 활용하여 AI/ML 학습 속도를 높이는 것은 매우 중요하지만, 이 GPU들 간에 효율적은 통신을 구축하는 일은 까다롭다. 바로 이 지점에서 NVIDIA의 NCCL 라이브러리가 중요한 역할을 한다. NCCL은 기본적으로 GPU 간의 collective
Prerequisite NVLink NVIDIA가 NVIDIA가 개발한 고속 interconnect 기술로 주로, GPU-GPU 또는 GPU-CPU 간 데이터 전송을 빠르고 효율적으로 처리하기 위해 사용된다. 기존의 PCIe 대비 훨씬 높은 bandwidth와 낮은 latency를 제공하며, 여러 GPU를 하나의 shared memory pool처럼 연결할...
Prerequisite BAR (Base Address Register) PCIe device가 자신의 메모리 또는 레지스터 공간을 호스트 시스템의 PCIe 메모리 주소 공간에 매핑하기 위해 사용하는 하드웨어 레지스터이다. 예를 들어, GPU VRAM의 일부를 BAR에

P2P, SHM, NET에 대해서 알아보려고 한다. 참고한 자료이다. https://blogs.nvidia.co.kr/blog/machine-learning-frameworks-interoperability-part-2-data-loading-and-data-

NCCL에서는 node 간 path type을 아래와 같이 나누어 놓는다. (topoPathTypeStr\[])을 보면 된다. 각 type에 대한 NCCL 공식 문서의 설명은 아래와 같다. https://docs.nvidia.com/deeplearning/nc