llama-cpp 설치 및 활용 예시

Cafelatte·2025년 3월 5일

llama-cpp 활용

  1. Quantization
  2. GGUF 포맷 핸들링 (split or merge)
  3. 추론 환경 구축

설치 프로세스

  • 커널 업데이트 및 컴파일 도구 설치
sudo apt update && sudo apt install -y build-essential cmake
  • llama-cpp 레포지토리 복사
git clone https://github.com/ggerganov/llama.cpp.git
  • llama-cpp 레포지토리로 이동
cd llama.cpp
  • 컴파일 진행 (For CPU)
# 빌드 요소 구성
cmake -B build
# 빌드 진행
cmake --build build --config Release
  • 컴파일 진행 (For GPU)
# 빌드 요소 구성
cmake -B build -DGGML_CUDA=ON
# 빌드 진행
cmake --build build --config Release
  • bin 폴더 내 실행 파일 생성 체크
cd build/bin
ls -la

활용 예시

  • GGUF split
build/bin/llama-gguf-split --split --split-tensors-size 128 ggml-model-q4_0.gguf /tmp/ggml-out-q4_0-2
  • GGUF merge (vLLM-v0.7.3은 현재 단일 GGUF 파일만 호환)
# shard된 파일들 중 첫번째 파일을 첫 번째 인자로 입력
build/bin/llama-gguf-split --merge /tmp/ggml-out-q4_0-2-00001-of-00003.gguf /tmp/ggml-out-q4_0-2-merge.gguf
profile
바로 활용 가능한 정보 공유를 목적으로 합니다

0개의 댓글