llm들 서빙? 모여있는 집합? 전달해준다? 모델을 경량화시켜 배포 해주는 서빙 해주는?
irm https://ollama.com/install.ps1 | iex <-- 설치 cli
구분,허깅페이스 (Hugging Face),올라마 (Ollama)
주요 역할,"전 세계 AI 연구원들이 모델, 데이터셋을 공유하는 저장소(Hub)",오픈소스 모델을 로컬 환경에서 실행하고 관리하는 런타임/엔진
제공 형태,"원본 모델 파일(PyTorch, Safetensors 등) 및 소스 코드",내 컴퓨터 최적화용으로 가공된 모델 파일(GGUF 형태)
실행 방식,Python 코드를 짜서 모델을 로드하고 GPU 설정을 직접 해야 함,CLI 명령어 한 줄로 다운로드부터 API 서버 실행까지 자동 완료
비유,전 세계 온갖 식재료와 레시피가 모여 있는 대형 도매시장,재료를 다 손질해서 냄비에 넣고 버튼만 누르면 되는 밀키트

올라마을 실행하면 즉 "ollama run <모델명>" <--cli으로 실행하면 로컬에서 http://localhost:11434 로 서버을 띄워 api을 실행
ollama run을 입력했을 때 일어나는 일
올라마 서버(데몬) 확인: 먼저 백그라운드에서 돌고 있는 올라마 서버 엔진(기본 11434 포트)에 신호를 보냅니다.
모델을 메모리(VRAM/RAM)로 로드: 지정한 모델 파일을 하드디스크에서 꺼내 GPU의 VRAM(또는 시스템 RAM)에 통째로 올립니다.
API 엔드포인트 개방: 모델이 메모리에 올라간 직후부터 http://localhost:11434/api/generate 같은 REST API 주소가 외부 요청을 받을 준비를 마칩니다.
대화형 CLI 진입: 이와 동시에, 터미널 창은 사용자가 바로 채팅해 볼 수 있는 인터페이스(Client)로 전환됩니다.
💡 핵심 포인트: 터미널 창에서 검은 화면을 보며 모델과 대화하고 있는 그 순간에도, 백그라운드에서는 11434 포트를 통해 외부 백엔드 애플리케이션의 API 요청을 받을 준비가 완전히 끝난 상태입니다.