llama-cpp 활용
- Quantization
- GGUF 포맷 핸들링 (split or merge)
- 추론 환경 구축
설치 프로세스
sudo apt update && sudo apt install -y build-essential cmake
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
# 빌드 요소 구성
cmake -B build
# 빌드 진행
cmake --build build --config Release
# 빌드 요소 구성
cmake -B build -DGGML_CUDA=ON
# 빌드 진행
cmake --build build --config Release
cd build/bin
ls -la
활용 예시
build/bin/llama-gguf-split --split --split-tensors-size 128 ggml-model-q4_0.gguf /tmp/ggml-out-q4_0-2
- GGUF merge (vLLM-v0.7.3은 현재 단일 GGUF 파일만 호환)
# shard된 파일들 중 첫번째 파일을 첫 번째 인자로 입력
build/bin/llama-gguf-split --merge /tmp/ggml-out-q4_0-2-00001-of-00003.gguf /tmp/ggml-out-q4_0-2-merge.gguf