Whisper
Whisper

Whisper

Whisper는 OpenAI가 MIT 라이선스로 공개한 다국어 음성 인식 모델과 Python 참조 구현으로, 로컬 전사·언어 감지·영어 음성 번역에 사용할 수 있습니다.

108

Views

0

Likes

Jan 2026

Added

github.com

프로젝트 링크

Tags

Whisper음성 인식로컬 전사오픈소스 ASR자막

Product Preview

A quick visual look at Whisper before you visit the official site.

Published 1/21/2026
Whisper screenshot

Editorial Review

About Whisper

Whisper는 OpenAI가 공개한 인코더-디코더 음성 모델군이자 MIT 라이선스 Python 참조 구현의 이름입니다. 발화를 원래 언어의 텍스트로 전사하고, 언어를 감지하며, 호환되는 다국어 체크포인트로 음성을 영어로 번역할 수 있습니다. GitHub 저장소는 완성형 전사 SaaS가 아니라 개발 구성 요소이므로 설치, 연산 자원, 파일 보안, 배치 큐, 재시도, 모니터링과 사람의 검수는 운영자가 맡아야 합니다.

같은 이름으로 불리는 세 가지를 구분해야 합니다. openai-whisper는 다운로드한 모델을 실행하는 Python 패키지이고, whisper-1은 OpenAI Audio API에서 운영되는 별도 호스팅 모델입니다. faster-whisper, whisper.cpp, WhisperX와 웹 UI는 Whisper 계열 가중치를 이용하는 독립 구현 또는 파이프라인입니다. 속도, 비용, 개인정보 보호를 비교할 때 어떤 계층인지 적지 않으면 결론이 왜곡됩니다.

OpenAI 공식 Whisper 다중 작업 음성 인식 구조
OpenAI 공식 구조도. log-Mel 스펙트로그램을 인코딩한 뒤 언어, 작업, 타임스탬프 특수 토큰으로 언어 감지, 전사, 영어 번역을 제어합니다.

한 문장으로 판단하기

검사 가능한 업스트림 기준선, 로컬 제어와 폭넓은 생태계 호환성이 필요하고 연산 및 품질 관리까지 소유할 수 있다면 Whisper가 적합합니다. 운영 부담이 더 중요하면 관리형 API를, CPU·엣지 배포, 처리량, 단어 정렬 또는 화자 분리가 핵심이면 전문 런타임을 함께 비교하십시오.

Whisper의 오래가는 강점은 모든 최신 벤치마크에서 항상 1위라는 데 있지 않습니다. 같은 모델 계열을 연구 노트북, 오프라인 워크스테이션, GPU 배치 노드, 엣지 장치에 배치할 수 있다는 선택권이 핵심입니다. 따라서 공통 기준선으로 유용하지만 특정 래퍼와 하드웨어에서 나온 속도를 업스트림 Whisper의 보장으로 표현해서는 안 됩니다.

포함되는 것과 별도로 필요한 것

계층제공 범위직접 준비할 항목
체크포인트여러 크기의 영어 전용·다국어 가중치저장 공간, 런타임, 추론 하드웨어
Python 패키지CLI, Python API, 디코딩과 TXT/SRT/VTT/JSON 출력FFmpeg, 배포, 큐, 재시도, 모니터링
전사원 언어 텍스트, 구간 및 선택적 단어 타임스탬프교정, 화자 분리, 도메인 검증
음성 번역호환 모델로 음성을 영어로 번역다른 목표 언어 번역. turbo는 번역용 아님
MIT 라이선스조건에 따른 사용·수정·배포녹음 권리, 동의, 고지와 규제 준수

Whisper 자체는 화자 분리, 회의 편집, 동의 관리, 감사 로그나 보존 정책을 제공하지 않습니다. 업스트림 패키지가 바로 운영 가능한 실시간 서비스인 것도 아닙니다. 외부 프로젝트가 추가한 기능을 Whisper의 기본 기능처럼 설명하지 않는 것이 중요합니다.

모델과 배포 방식 선택

모델파라미터대략적 VRAM상대 속도*적합한 시작점
tiny / tiny.en39M약 1 GB약 10배프로토타입·제한된 장치
base / base.en74M약 1 GB약 7배빠른 로컬 초안
small / small.en244M약 2 GB약 4배균형 잡힌 기준선
medium / medium.en769M약 5 GB약 2배정확도 우선
large1.55B약 10 GB1배다국어 품질
turbo809M약 6 GB약 8배빠른 전사, 번역용 아님

*OpenAI README가 A100에서 영어를 전사하고 large를 기준으로 측정한 값입니다. 2026-08-20 확인. 언어, 오디오, 하드웨어와 런타임에 따라 달라지며 일반적인 지연 보장이 아닙니다.

tiny, base, small, medium에는 다국어판과 .en 영어 전용판이 있습니다. OpenAI는 tiny와 base에서 영어 전용 이점이 더 크고 small과 medium에서는 차이가 줄어든다고 설명합니다. 일반 GPU 전사는 turbo부터, 자원과 품질의 균형은 small부터, 영어 전용 코퍼스는 같은 크기의 .en 모델을 비교하십시오. 음성을 영어로 번역할 때는 medium 또는 large를 사용해야 하며 turbo는 원래 언어를 반환합니다.

‘98개 언어 지원’은 모델과 토크나이저의 범위이지 동일한 정확도를 뜻하지 않습니다. 공식 모델 카드는 학습 데이터 양, 언어, 억양과 방언에 따라 성능이 달라진다고 밝힙니다. 단일 언어가 확실한 작업은 언어를 지정해 감지 오류를 줄일 수 있습니다. 코드 스위칭 녹음은 하나의 자동 감지 라벨에 의존하지 말고 별도 사례로 평가해야 합니다.

Whisper large-v3와 large-v2 공식 언어별 오류율
Common Voice 15와 FLEURS의 공식 WER/CER 그래프는 언어별 편차를 보여 주지만 조직의 실제 오디오 점수는 아닙니다.

로컬 설치와 재현 가능한 첫 실행

업스트림 경로는 openai-whisper와 운영체제의 FFmpeg를 설치하고 체크포인트를 선택한 뒤 CLI 또는 Python API를 실행하는 방식입니다. 현재 패키지 메타데이터는 Python 3.8 이상을 요구하고 3.13까지 분류하지만 README의 호환성 설명은 더 보수적입니다. 운영에서는 패키지 커밋과 모델 이름을 고정하고 기록 없이 main을 따라가지 마십시오.

python -m venv .venv
source .venv/bin/activate
pip install -U openai-whisper
whisper interview.wav --model turbo --output_format all \
  --output_dir transcripts

CLI는 TXT, VTT, SRT, TSV, JSON을 쓸 수 있습니다. transcribe()는 30초 슬라이딩 창으로 파일을 처리하고 전체 텍스트, 구간과 감지 언어를 반환합니다. 첫 실행에는 모델 다운로드가 포함되므로 콜드 스타트와 워밍된 추론을 분리해 측정하십시오. CPU도 가능하지만 큰 모델은 느리며 VRAM 표는 계획치일 뿐 보장치가 아닙니다.

배치 전사와 자막 제작 절차

  1. 산출물을 먼저 정의합니다.검색용 메모, 자막 초안, 게시 원고와 고위험 증거는 서로 다른 검수 기준이 필요합니다.
  2. 비공개 평가 세트를 만듭니다.깨끗한 음성, 잡음, 침묵, 음악, 억양, 코드 스위칭, 고유명사, 숫자와 최대 길이를 넣고 사람이 확인한 정답을 준비합니다.
  3. 오디오 처리를 분리합니다.원본을 보존하고 동일하게 디코딩합니다. VAD나 노이즈 제거는 잘린 단어와 환각에 미치는 영향을 측정한 뒤 도입합니다.
  4. 통제된 비교를 합니다.하드웨어, 언어 힌트, 디코딩 설정을 고정하고 두세 개 크기의 모델, 수정 버전과 실시간 계수를 기록합니다.
  5. 오류 유형을 따로 봅니다.이름, 숫자, 부정어, 반복, 침묵 구간의 텍스트, 언어 전환과 타임스탬프 드리프트를 평균 WER와 별도로 평가합니다.
  6. 전달 형식을 분리합니다.SRT/VTT 또는 JSON을 만든 뒤 줄 길이, 읽기 속도, 구두점과 화자 표시는 후처리에서 적용합니다.
  7. 영향이 큰 용도는 사람이 다시 듣습니다.의료, 법률, 채용, 연구 인용과 접근성 게시물은 원음을 확인해야 합니다.
오디오 + 동의
   ↓
일관된 디코딩 / 선택적 VAD ── 원본 보존
   ↓
모델 + 언어 + 기록한 설정
   ↓
침묵 · 반복 · 이름 · 숫자 · 시간 드리프트 검사
   ↓
사람 검수 ── 내보내기 ── 보존/삭제

정확도, 환각과 평가 기준

Whisper 논문은 68만 시간의 약지도 다국어·다중 작업 오디오로 강한 제로샷 견고성을 보였습니다. 같은 학습 방식은 한계와도 연결됩니다. 공식 모델 카드는 실제로 말하지 않은 텍스트, 반복, 언어와 억양·방언에 따른 불균형을 경고합니다. 특히 침묵, 음악, 소음과 불명확한 발화에서는 음향 근거보다 언어적으로 그럴듯한 문장을 만들 수 있습니다.

지표사용법놓치는 부분
WER/CER사람이 만든 정답과 비교. 한국어에는 CER도 병행이름·부정어·숫자 한 개의 심각도
개체/숫자 정확도사람, 제품, 날짜, 용량, 가격, 단위를 별도 점수화전체 문장 유창성
환각 구간 비율비음성 또는 근거 부족 구간에 나온 텍스트 라벨링실제 발화 안의 일반 치환
시간 드리프트긴 파일의 시작·중간·끝 경계 확인단어 정확성
실시간 계수처리 초 ÷ 오디오 초다운로드, 대기, 사람 수정
오디오 시간당 검수 분한 시간 오디오의 사람 수정 시간인프라 비용

이 페이지는 맥락 없는 단일 ‘Whisper WER’를 게시하지 않습니다. 체크포인트, 언어, 데이터셋, 전처리와 디코딩 설정이 없으면 비교할 수 없기 때문입니다. 공개 벤치마크는 공식 언어 그래프와 논문 부록을 확인하고, 도입은 버전 관리된 비공개 테스트로 결정하십시오.

프롬프트는 전문 용어와 고유명사의 철자를 유도하지만 보장하지 않으며 프롬프트 자체가 출력될 수도 있습니다. 온도 폴백, 이전 텍스트 조건, 임계값, 단어 시간과 침묵 환각 옵션도 고정 평가 세트에서 오류 유형이 어떻게 바뀌는지 확인한 뒤 조정해야 합니다.

개인정보, 안전과 운영 경계

경계실무 통제
로컬 처리가중치 경로와 외부 통신을 통제하고 원음·결과 암호화 및 삭제를 정의
동의녹음과 전사 허가 확인. 모델 카드도 무동의 개인 녹음을 경고
고위험 결정검증하지 않은 전사만으로 의료·법률·채용 결정을 내리지 않기
화자 분리별도 모델로 평가. Whisper는 누가 말했는지 증명하지 않음
실시간업스트림은 즉시 사용 가능한 스트리밍 제품이 아니며 래퍼별 지연이 다름
유지보수패키지·모델을 고정하고 업그레이드 전에 회귀 코퍼스 실행
라이선스MIT 고지와 함께 오디오·전사·외부 구성 요소 권리 확인

Whisper와 인접 대안 비교

선택지선택할 때주요 절충
openai-whisper업스트림 Python 기준선과 검사 가능한 로컬 실행성능 최적화, 배치와 운영을 직접 담당
faster-whisperCTranslate2 GPU/CPU 처리량, 양자화, 배치독립 구현이므로 업스트림과 회귀 비교
whisper.cppC/C++, CPU, Apple Silicon, 모바일/엣지 오프라인빌드와 모델 변환 관리 추가
WhisperX장문 배치, 단어 정렬, 선택적 화자 분리추가 모델·의존성·라이선스 관리
OpenAI 전사 API관리형 추론과 현재 음성 모델오디오 외부 전송, 사용량 과금, API 제한

현재 OpenAI 가이드는 일반 파일 전사에 gpt-transcribe를 권장하고 단어/구간 시간, 자막 형식, 영어 번역에는 whisper-1의 용도를 설명합니다. 2026-08-20 공식 추정 비용은 gpt-transcribe $0.0045/분, gpt-4o-transcribe $0.006/분, mini $0.003/분이었습니다. 모델과 가격은 변하므로 예산 전에 공식 페이지를 다시 확인하십시오. 파일 업로드 한도는 25 MB로 안내됩니다.

자주 묻는 질문

Whisper는 무료인가요?

업스트림 코드와 공개 모델은 MIT 라이선스라 자체 실행에 분당 라이선스 비용은 없습니다. 그러나 연산, 저장, 엔지니어링과 검수 비용은 발생하며 호스팅 API는 별도 유료입니다.

완전히 오프라인으로 사용할 수 있나요?

의존성과 모델을 미리 저장하면 오디오를 API로 보내지 않고 추론할 수 있습니다. 에어갭이라고 부르려면 앱 전체의 통신, 로그, 저장도 확인해야 합니다.

어떤 모델부터 선택해야 하나요?

GPU의 빠른 전사는 turbo, 균형은 small, 영어 전용은 .en 모델을 비교하십시오. 실제 녹음으로 최소 두 크기를 시험하고 영어 번역에는 turbo를 쓰지 않습니다.

화자를 구분할 수 있나요?

Whisper 자체에는 화자 분리가 없습니다. WhisperX 등은 별도 정렬·화자 모델을 결합하므로 정확도, 권한과 의존성을 별도로 평가합니다.

실시간 전사가 가능한가요?

업스트림 패키지는 완성형 스트리밍 서비스가 아닙니다. 외부 구현은 가능하지만 VAD, 버퍼, 문맥과 지연은 그 구현의 특성입니다.

왜 말하지 않은 문장이나 반복이 나오나요?

공식 모델 카드가 인정하는 오류입니다. 침묵과 음악을 평가에 넣고 유창함을 충실함으로 착각하지 말며 중요한 결과는 원음으로 확인하십시오.

검토한 출처

독립 기술 검토: 2026-08-20. 모델, 문서, API와 가격은 바뀔 수 있습니다. 배포 전 1차 출처와 자체 평가를 다시 확인하십시오.

Whisper 공식 자료 확인

공식 저장소, 문서 또는 모델 자료를 엽니다.

공식 자료 보기

Quick Info

프로젝트 링크
github.com
Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper.cpp

Whisper.cpp

Whisper.cpp은 로컬 전사, 번역, 스트리밍, 서버 및 임베디드 앱을 위한 OpenAI Whisper의 종속성이 적은 C/C++ 구현입니다. 이 가이드에서는 모델, 양자화, 백엔드, 정확성, 개인 정보 보호 및 배포를 다룹니다.

speech-recognitionfree
1190
Buzz

Buzz

Buzz은 macOS, Windows 및 Linux에서 로컬 Whisper 전사, 자막, 라이브 캡션, 번역 및 화자 레이블 지정을 위한 무료 MIT 라이선스 데스크톱 앱입니다. 이 가이드에서는 백엔드, 하드웨어, 개인 정보 보호, 정확성 테스트, 자막 QA, CLI 자동화 및 클라우드 대안을 비교합니다.

BuzzBuzz Captions오프라인 전사
4600
WhisperDesktop

WhisperDesktop

WhisperDesktop은 오디오, 비디오 및 마이크 입력에서 로컬로 OpenAI Whisper을 실행하기 위한 Windows 데스크톱 앱 및 DirectCompute 구현입니다. 이 가이드에서는 설정, 모델, GPU, 자막, 개인 정보 보호 및 대안을 다룹니다.

WhisperDesktopOpenAI Whisperspeech recognition
2420
WhisperX

WhisperX

WhisperX는 faster-whisper 배치 전사에 언어별 단어 강제 정렬과 선택적 pyannote 화자 분리를 더하는 장문 음성용 오픈소스 파이프라인입니다.

WhisperXspeech alignmentspeaker diarization
1080