양자화란
모델 가중치를 32비트나 16비트 대신 8비트, 4비트 등 더 적은 비트 수로 표현해 메모리 사용량을 줄이는 기법입니다. 정확도는 약간 손해 보지만 VRAM 요구량이 크게 줄어듭니다.
GPTQ
가중치 행렬을 행 단위로 독립적으로 양자화해 오차를 최소화하는 후처리 양자화 기법입니다. 4비트에서도 잘 동작하는 초기 양자화 방식 중 하나로, GPU 추론에 최적화되어 있습니다. 사용 전 캘리브레이션(보정) 과정이 필요합니다.
GGUF — 양자화 기법이 아니라 파일 포맷
GGUF는 양자화 알고리즘이 아니라, 양자화된 모델을 저장하는 파일 포맷입니다. llama.cpp와 함께 쓰이며, CPU 오프로딩을 지원해 GPU 메모리보다 큰 모델도 실행할 수 있게 해줍니다 (예: 24GB GPU에서 40GB 모델 실행).
핵심 차이 요약
| GPTQ | GGUF | |
|---|---|---|
| 성격 | 양자화 알고리즘 | 저장 파일 포맷 |
| 주 실행 환경 | GPU | CPU + GPU 혼합 |
| 대표 도구 | AutoGPTQ | llama.cpp |
어떤 걸 선택할까
고성능 GPU 전용 서버라면 GPTQ 계열, 로컬 PC나 CPU 자원을 함께 활용하고 싶다면 GGUF(llama.cpp) 쪽이 실용적인 경우가 많습니다.