아키텍처 및 수학적 정의
SwiGLU의 핵심은 두 개의 병렬 선형 투영 구조입니다. 입력 x에 대해 첫 번째 분기는 가중치 행렬 W를 통해 선형 변환 후 SiLU(x·σ(x)) 활성화를 적용하고, 두 번째 분기는 가중치 V를 통한 선형 변환이 학습 가능한 게이트로 작동합니다. 이 두 분기의 출력을 원소별 곱셈으로 결합한 후 최종 투영 행렬 W2를 통해 출력합니다: SwiGLU(x, W, V, W2) = (SiLU(xW) ⊙ (xV))W2
ReLU/GELU와의 주요 차이점
기존 ReLU 기반 FFN은 정해진 임계값을 사용하지만, SwiGLU는 입력 데이터 기반으로 동적 게이팅을 수행합니다. SiLU의 non-monotonic 특성으로 음수 입력에 대해 0이 아닌 기울기를 유지하고, 상한이 없어 큰 양수값을 보존합니다. 결과적으로 ReLU의 "죽은 뉴런" 문제를 회피하면서 신호 정규화가 개선됩니다.
파라미터 효율성 고려사항
SwiGLU는 기존 2개 투영 행렬 대신 3개를 사용하므로, 동일 파라미터 예산을 유지하려면 중간 차원을 8/3 배수로 감소시킵니다(전형적으로 2048 또는 2/3 배). 이 조정으로 계산 복잡도 증가 없이 표현력 향상을 달성하며, 현대 언어 모델(LLaMA, PaLM, DeepSeek)의 표준 컴포넌트가 되었습니다.