Ollama란
Ollama는 Llama, Mistral, Gemma 같은 오픈소스 LLM을 로컬 환경(온프레미스 서버 포함)에서 손쉽게 내려받고 실행할 수 있게 해주는 도구입니다. 모델 다운로드, 양자화, 서빙까지 명령어 몇 줄로 처리됩니다.
설치
# Linux
curl -fsSL https://ollama.com/install.sh | sh
모델 내려받고 바로 실행
ollama pull llama3
ollama run llama3
pull은 모델 파일만 내려받고, run은 없으면 자동으로 pull까지 수행한 뒤 대화형 프롬프트를 엽니다.
API 서버로 사용하기
ollama serve
백그라운드에서 REST API 서버로 동작하며, 기존 API 호출 방식과 유사한 형태로 애플리케이션에 연동할 수 있습니다.
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "서버 로그 분석 방법 알려줘"
}'
사내 배포 시 고려사항
모델 크기에 비례해 VRAM/RAM이 필요합니다. 7B급 모델은 양자화(Q4) 기준 약 4~5GB로 충분하지만, 여러 사용자가 동시 접속하는 서비스라면 GPU 메모리 용량을 넉넉히 확보해야 합니다.