Enterprise Infrastructure Intelligence ● Certified engineers online · Fast response guaranteed
AI/소프트웨어

LoRA란 — 대형 모델을 적은 자원으로 파인튜닝하는 방법

70B 모델 전체를 파인튜닝하려면 수백GB의 VRAM이 필요합니다. LoRA가 어떤 원리로 이 비용을 극적으로 줄이는지 정리했습니다.

2026.08.28  ·  36회  · 

Full Fine-tuning의 문제

모델 전체 파라미터를 다시 학습하는 Full Fine-tuning은 원본 모델과 맞먹는 크기의 그래디언트·옵티마이저 상태를 GPU 메모리에 올려야 해서, 대형 모델일수록 요구 자원이 기하급수적으로 늘어납니다.

LoRA의 원리

LoRA(Low-Rank Adaptation)는 원본 모델 가중치는 그대로 고정(freeze)해 두고, 어텐션 레이어 등 특정 위치에 작은 저랭크(low-rank) 행렬 두 개를 추가로 붙여 이 부분만 학습합니다. 학습 대상 파라미터 수가 원본 모델의 1% 미만으로 줄어드는 경우도 흔합니다.

실무에서의 장점

학습이 끝나면 이 작은 어댑터 행렬만 저장하면 되므로 결과물 용량이 수백MB 이하로 작아지고, 같은 원본 모델에 용도별로 여러 개의 LoRA 어댑터를 만들어 필요할 때 갈아 끼우는 방식도 가능합니다. 이 때문에 온프레미스 GPU 자원이 제한적인 환경에서 특히 많이 채택됩니다.

참고 출처: Hugging Face
WIKIDATA WORKSTATION
AI·렌더링에 최적화된
전문가용 워크스테이션
NVIDIA RTX GPU · 최대 192GB 메모리 · ECC 지원