Enterprise Infrastructure Intelligence ● Certified engineers online · Fast response guaranteed
AI/소프트웨어

Whisper로 음성을 텍스트로 변환하기 (STT 기초)

회의 녹음, 상담 통화를 텍스트로 바꿔야 한다면 OpenAI의 오픈소스 음성인식 모델 Whisper가 가장 쉬운 시작점입니다.

2026.08.19  ·  31회  · 

Whisper란

다양한 음성 처리 작업(다국어 음성 인식, 음성 번역, 언어 식별)을 학습한 트랜스포머 기반 시퀀스-투-시퀀스 모델입니다. OpenAI가 공개한 오픈소스 프로젝트로 MIT 라이선스로 배포됩니다.

설치 및 기본 사용

pip install openai-whisper

whisper meeting.mp3 --language Korean --model medium

모델 크기(tiny/base/small/medium/large)가 클수록 정확도는 높아지지만 처리 속도는 느려지고 더 많은 리소스가 필요합니다.

Python에서 직접 호출하기

import whisper

model = whisper.load_model("medium")
result = model.transcribe("meeting.mp3", language="ko")
print(result["text"])

멀티태스크 모델

Whisper는 단순 받아쓰기뿐 아니라 음성 번역, 언어 식별, 음성 활동 감지(VAD)까지 하나의 모델로 처리할 수 있는 멀티태스크 모델입니다.

활용 예시

  • 회의·상담 녹음을 텍스트로 변환해 회의록 자동 생성
  • 고객센터 통화 녹음을 텍스트화해 검색·분석에 활용
  • 영상 콘텐츠 자막 자동 생성
WIKIDATA WORKSTATION
AI·렌더링에 최적화된
전문가용 워크스테이션
NVIDIA RTX GPU · 최대 192GB 메모리 · ECC 지원