Full Fine-tuning의 문제
모델 전체 파라미터를 다시 학습하는 Full Fine-tuning은 원본 모델과 맞먹는 크기의 그래디언트·옵티마이저 상태를 GPU 메모리에 올려야 해서, 대형 모델일수록 요구 자원이 기하급수적으로 늘어납니다.
LoRA의 원리
LoRA(Low-Rank Adaptation)는 원본 모델 가중치는 그대로 고정(freeze)해 두고, 어텐션 레이어 등 특정 위치에 작은 저랭크(low-rank) 행렬 두 개를 추가로 붙여 이 부분만 학습합니다. 학습 대상 파라미터 수가 원본 모델의 1% 미만으로 줄어드는 경우도 흔합니다.
실무에서의 장점
학습이 끝나면 이 작은 어댑터 행렬만 저장하면 되므로 결과물 용량이 수백MB 이하로 작아지고, 같은 원본 모델에 용도별로 여러 개의 LoRA 어댑터를 만들어 필요할 때 갈아 끼우는 방식도 가능합니다. 이 때문에 온프레미스 GPU 자원이 제한적인 환경에서 특히 많이 채택됩니다.