Enterprise Infrastructure Intelligence ● Certified engineers online · Fast response guaranteed
AI/소프트웨어

Ollama로 로컬 LLM 5분 만에 구동하기

클라우드 API 없이 사내 서버에서 직접 LLM을 돌리고 싶다면 Ollama가 가장 빠른 시작점입니다. 설치부터 첫 모델 실행까지 정리했습니다.

2026.08.18  ·  32회  · 

Ollama란

Ollama는 Llama, Mistral, Gemma 같은 오픈소스 LLM을 로컬 환경(온프레미스 서버 포함)에서 손쉽게 내려받고 실행할 수 있게 해주는 도구입니다. 모델 다운로드, 양자화, 서빙까지 명령어 몇 줄로 처리됩니다.

설치

# Linux
curl -fsSL https://ollama.com/install.sh | sh

모델 내려받고 바로 실행

ollama pull llama3
ollama run llama3

pull은 모델 파일만 내려받고, run은 없으면 자동으로 pull까지 수행한 뒤 대화형 프롬프트를 엽니다.

API 서버로 사용하기

ollama serve

백그라운드에서 REST API 서버로 동작하며, 기존 API 호출 방식과 유사한 형태로 애플리케이션에 연동할 수 있습니다.

curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "서버 로그 분석 방법 알려줘"
}'

사내 배포 시 고려사항

모델 크기에 비례해 VRAM/RAM이 필요합니다. 7B급 모델은 양자화(Q4) 기준 약 4~5GB로 충분하지만, 여러 사용자가 동시 접속하는 서비스라면 GPU 메모리 용량을 넉넉히 확보해야 합니다.

참고 출처: Ollama (GitHub)
WIKIDATA WORKSTATION
AI·렌더링에 최적화된
전문가용 워크스테이션
NVIDIA RTX GPU · 최대 192GB 메모리 · ECC 지원