VRAM 용량이 중요한 이유
LLM(대형 언어 모델)은 모델 전체가 GPU 메모리(VRAM)에 올라가야 추론이 가능합니다. VRAM이 부족하면 모델이 로드되지 않거나, CPU 메모리로 오프로드되어 속도가 100배 이상 느려집니다.
모델 크기별 VRAM 계산
FP16 정밀도 기준으로 파라미터 1B(10억)당 약 2GB VRAM이 필요합니다.
| 모델 | 파라미터 | FP16 VRAM | INT4 VRAM |
|---|---|---|---|
| Llama-3 8B | 8B | 16GB | 4~5GB |
| Llama-3 70B | 70B | 140GB | 35~40GB |
| Mixtral 8x7B | 47B | 94GB | 24~28GB |
양자화(Quantization) 적용 시
INT4 양자화를 적용하면 VRAM 사용량을 75% 줄일 수 있습니다. 성능 저하는 5~10% 수준으로, 추론 전용 서버에서는 충분히 허용 가능합니다.
# llama.cpp GGUF Q4_K_M 모델 로드 예시
./llama-server -m llama-3-70b-Q4_K_M.gguf --n-gpu-layers 80 --host 0.0.0.0 --port 8080
GPU 선택 가이드
- 7B 이하 모델: RTX 4090 (24GB) 또는 RTX 5080 (16GB)
- 13~34B 모델: RTX 5090 (32GB) 또는 A6000 (48GB)
- 70B 이상 모델: 멀티GPU 구성 필요 (A100 80GB × 2 이상)