Enterprise Infrastructure Intelligence ● Certified engineers online · Fast response guaranteed
AI/소프트웨어

LLM 양자화란 — GGUF와 GPTQ 차이

70B짜리 모델을 24GB GPU에서 돌린다는 게 어떻게 가능할까요? 양자화의 기본 개념과 GGUF·GPTQ의 차이를 정리했습니다.

2026.08.19  ·  29회  · 

양자화란

모델 가중치를 32비트나 16비트 대신 8비트, 4비트 등 더 적은 비트 수로 표현해 메모리 사용량을 줄이는 기법입니다. 정확도는 약간 손해 보지만 VRAM 요구량이 크게 줄어듭니다.

GPTQ

가중치 행렬을 행 단위로 독립적으로 양자화해 오차를 최소화하는 후처리 양자화 기법입니다. 4비트에서도 잘 동작하는 초기 양자화 방식 중 하나로, GPU 추론에 최적화되어 있습니다. 사용 전 캘리브레이션(보정) 과정이 필요합니다.

GGUF — 양자화 기법이 아니라 파일 포맷

GGUF는 양자화 알고리즘이 아니라, 양자화된 모델을 저장하는 파일 포맷입니다. llama.cpp와 함께 쓰이며, CPU 오프로딩을 지원해 GPU 메모리보다 큰 모델도 실행할 수 있게 해줍니다 (예: 24GB GPU에서 40GB 모델 실행).

핵심 차이 요약

GPTQGGUF
성격양자화 알고리즘저장 파일 포맷
주 실행 환경GPUCPU + GPU 혼합
대표 도구AutoGPTQllama.cpp

어떤 걸 선택할까

고성능 GPU 전용 서버라면 GPTQ 계열, 로컬 PC나 CPU 자원을 함께 활용하고 싶다면 GGUF(llama.cpp) 쪽이 실용적인 경우가 많습니다.

참고 출처: Hugging Face
WIKIDATA WORKSTATION
AI·렌더링에 최적화된
전문가용 워크스테이션
NVIDIA RTX GPU · 최대 192GB 메모리 · ECC 지원