Enterprise Infrastructure Intelligence ● Certified engineers online · Fast response guaranteed
AI/소프트웨어

Precision, Recall, F1 스코어: 분류 모델 평가의 필수 지표와 실무 고려사항

분류 모델의 성능을 평가하기 위한 세 가지 핵심 지표(Precision, Recall, F1)의 수학적 정의, 상호관계, 그리고 임계값 조정에 따른 역학 관계를 설명합니다. 불균형 데이터셋에서의 적용 방식과 다중 클래스 분류 환경에서의 평균화 전략, 그리고 혼동 행렬(Confusion Matrix)을 통한 실제 계산 방법을 다룹니다.

2026.09.29  ·  14회  · 

세 가지 지표의 정의와 혼동 행렬의 역할

Precision(정밀도)은 모델이 양성이라고 예측한 샘플 중 실제로 양성인 비율입니다: TP/(TP+FP). Recall(재현율)은 실제 양성 샘플 중 모델이 올바르게 식별한 비율입니다: TP/(TP+FN). F1 스코어는 두 지표의 조화평균으로, 2×(Precision×Recall)/(Precision+Recall) = 2×TP/(2×TP+FP+FN) 형태로 계산되며, 0과 1 사이의 값을 가집니다.

임계값 조정과 역학 관계

분류 임계값을 상향 조정하면 양성 예측이 감소하여 거짓양성(FP)은 줄지만 거짓음성(FN)이 증가합니다. 결과적으로 Precision은 상승하고 Recall은 하락하는 반대 방향의 움직임을 보입니다. 이 Trade-off 관계에서 F1 스코어는 두 지표가 크게 벌어질수록 더 낮은 값에 수렴하므로, 균형 잡힌 평가가 필요한 상황에서 유용합니다.

불균형 데이터셋과 평균화 전략

Macro 평균은 각 클래스의 F1을 별도 계산 후 단순 평균하므로 소수 클래스 성능에 큰 가중치를 부여합니다. Micro 평균은 전체 TP, FP, FN을 먼저 합산한 뒤 계산하여 클래스 불균형을 무시하고 전체 성능을 반영합니다. Weighted 평균은 각 클래스의 샘플 수에 따라 가중치를 적용하므로 현실적인 데이터 분포를 반영할 수 있습니다.

실무 적용의 주의점

Accuracy만으로는 99% 클래스가 지배적인 데이터셋에서 소수 클래스(1%)를 완전히 무시하는 모델도 높은 점수를 받을 수 있습니다. Precision과 Recall은 진양성(TP)만 기반으로 계산되어 진음성(TN)을 무시하므로, 대규모 음성 샘플이 있는 극단적인 불균형 환경에서는 신뢰성이 낮을 수 있습니다. 특정 도메인의 오류 비용(거짓음성의 피해가 더 큰 의료 진단 vs. 거짓양성 비용이 큰 스팸 필터)을 고려하여 지표 선택과 가중치 조정이 필수적입니다.

WIKIDATA WORKSTATION
AI·렌더링에 최적화된
전문가용 워크스테이션
NVIDIA RTX GPU · 최대 192GB 메모리 · ECC 지원