백프로파게이션의 작동 원리
백프로파게이션은 두 단계로 구성됩니다. 첫째, 정방향 전파(Forward Pass)에서 입력값이 출력층까지 차례로 전달되며 각 뉴런의 활성화값이 계산됩니다. 둘째, 역방향 전파(Backward Pass)에서는 출력층의 오차부터 시작하여 입력층 방향으로 그래디언트를 역전파합니다. 이 과정에서 연쇄 법칙을 재귀적으로 적용하여 각 층의 가중치와 편향에 대한 손실 함수의 편미분값을 구합니다.
그래디언트 계산의 효율성
백프로파게이션의 가장 큰 장점은 계산 복잡도입니다. 나이브 방식으로 각 매개변수의 그래디언트를 독립적으로 계산하면 지수적 복잡도가 발생하지만, 백프로파게이션은 중간 계산값(활성화값과 그래디언트)을 재사용함으로써 선형 복잡도를 유지합니다. 미니배치 그래디언트 강하강법과 함께 사용하면 현대 GPU/TPU 하드웨어의 병렬 처리와 행렬 연산 최적화(BLAS, cuBLAS)를 활용할 수 있습니다.
실무 주의사항
소실 그래디언트 문제는 깊은 네트워크에서 하위층의 그래디언트가 곱셈을 거치며 0에 가까워져 학습이 정체되는 현상입니다. ReLU 활성화 함수 사용으로 완화할 수 있습니다. 폭발하는 그래디언트는 큰 가중치로 인해 발생하며, 배치 정규화나 학습률 감소로 대응합니다. 또한 자동 미분 프레임워크(PyTorch, TensorFlow)는 계산 그래프를 유지하면서 백프로파게이션을 자동으로 처리하므로, 엔지니어는 수치 안정성과 메모리 사용 최적화에 집중해야 합니다.