Whisper란
다양한 음성 처리 작업(다국어 음성 인식, 음성 번역, 언어 식별)을 학습한 트랜스포머 기반 시퀀스-투-시퀀스 모델입니다. OpenAI가 공개한 오픈소스 프로젝트로 MIT 라이선스로 배포됩니다.
설치 및 기본 사용
pip install openai-whisper
whisper meeting.mp3 --language Korean --model medium
모델 크기(tiny/base/small/medium/large)가 클수록 정확도는 높아지지만 처리 속도는 느려지고 더 많은 리소스가 필요합니다.
Python에서 직접 호출하기
import whisper
model = whisper.load_model("medium")
result = model.transcribe("meeting.mp3", language="ko")
print(result["text"])
멀티태스크 모델
Whisper는 단순 받아쓰기뿐 아니라 음성 번역, 언어 식별, 음성 활동 감지(VAD)까지 하나의 모델로 처리할 수 있는 멀티태스크 모델입니다.
활용 예시
- 회의·상담 녹음을 텍스트로 변환해 회의록 자동 생성
- 고객센터 통화 녹음을 텍스트화해 검색·분석에 활용
- 영상 콘텐츠 자막 자동 생성