llama.cpp 활용해서 작은 vlm 올려서 사용하면 실시간으로 문장 형태의 이미지 설명이 나오는 데모를 봐서 동일하고 시도해봤다.
설치
내 환경은 Macbook pro 16 21년형(M1)
llama.cpp 설치하기
brew로 설치!
다른 방법 혹은 다른 환경에서의 설치는 여기서 참고하시길.
brew install llama.cpp
llama-server로 모델 서빙하기
llama-server -hf ggml-org/SmolVLM-500M-Instruct-GGUF
- 처음에는 모델 다운로드도 하느라 느림.
- nvidia/amd/intel GPU를 쓴다면 "-ngl 99"를 추가
- 다른 모델은 여기서 확인해서 교체해도 됨.
웹 데모 실행하기
레포 클론
git clone https://github.com/ngxson/smolvlm-realtime-webcam
웹 데모 화면 띄워서 테스트
- index.html 그냥 클릭해도 됨.
- instruction을 수정해도 됨.
- Start 버튼 눌러서 실행
평가
- realtime 이라는게 실시간 요청만 보낼 수 있고 당장은 실시간 대응은 어려움
- 모델 사이즈를 더 키우면 될까 싶음.
- 개발자가 올린 데모보다 실제로 해보면 더 퀄리티가 떨어진다.