Buzz 오디오 및 비디오를 대본, 자막 및 라이브 캡션으로 변환하는 무료 오픈 소스 데스크톱 애플리케이션입니다. 이는 Whisper, Whisper.cpp, Faster Whisper, 호환 가능한 Hugging Face 모델 및 호스팅된 OpenAI 호환 API 등 여러 음성 인식 백엔드를 macOS, Windows 및 Linux용 그래픽 워크플로로 래핑합니다. 저장소는 MIT 라이센스를 받았습니다.
Buzz은 사용자가 Python, FFmpeg 및 모델 도구를 조립하지 않고 로컬 처리 및 편집 가능한 내보내기를 원할 때 가장 유용합니다. "오프라인"은 절대적인 제품 속성이 아닌 구성 선택입니다. 로컬 백엔드는 컴퓨터에 미디어를 보관할 수 있는 반면 API 기록, AI 번역, URL 가져오기, 모델 다운로드 및 선택적 라이브 업로드 기능은 네트워크 트래픽을 생성합니다. 라벨에 의존하기보다는 선택한 작업 흐름을 확인하세요.


모델을 선택하기 전에 실행 경로를 선택하세요
| 백엔드 | 최적의 핏 | 힘 | 일차적인 절충안 |
|---|---|---|---|
| 속삭임 | 일반 지역 기준선 | 참조 생태계 및 광범위한 언어 지원 | 리소스 집약적일 수 있음 |
| Whisper.cpp | CPU, Apple Silicon 또는 Vulkan 지원 장치 | 이식 가능한 기본 런타임 및 양자화 모델 | 빌드/가속 동작은 플랫폼에 따라 다릅니다. |
| Faster Whisper | NVIDIA GPU 또는 최적화된 로컬 배치 작업 | 효율적인 CTranslate2 구현 및 양자화 | 드라이버, VRAM 및 패키지 호환성 문제 |
| Hugging Face | 전문 언어 또는 미세 조정 모델 | 대형 모델 카탈로그; Buzz 문서 MMS 지원 | 품질과 라이선스는 모델에 따라 다릅니다. |
| OpenAI 호환 API | 약한 로컬 하드웨어 또는 중앙 집중식 서비스 | 로컬 추론 설정이 없으며 잠재적으로 더 빠른 처리 시간이 소요됩니다. | 업로드 개인 정보 보호, 사용 비용 및 공급자 종속성 |
동일한 클립에 대해 2~3개의 현실적인 선택을 벤치마킹합니다. 모델 크기만으로는 최상의 생산 결과를 예측할 수 없습니다. 깨끗한 오디오, 알려진 언어, 신속한 사람의 검토가 중요한 경우에는 작은 모델이 승리할 수 있습니다. 더 큰 모델은 너무 느리게 실행되어 사용자가 품질 검사를 건너뛸 경우 손실될 수 있습니다.
증거로 그려진 전사 파이프라인
오디오/비디오
|
+--> 선택적 음성 분리
|
v
디코드 + 리샘플 --> 모델/백엔드 --> 시간 제한 세그먼트
|
.------------+---------.
v v v
텍스트 검토 화자 라벨 번역
| | |
'----------+---------'
v
TXT/SRT/VTT/CSV
'내보내기 완료'는 '캡션 게시 준비'와 다릅니다.
각 단계마다 다른 오류가 발생할 수 있습니다. 음성 분리는 조용한 단어를 제거할 수 있습니다. 언어 감지는 짧은 소개에서 잘못된 언어를 선택할 수 있습니다. 모델은 침묵 중에 환각을 느낄 수 있습니다. 분할은 화자를 교환할 수 있습니다. 번역은 의미를 바꿀 수 있습니다. 자막 분할은 말로는 정확할 수 있지만 읽기는 어렵습니다.
대표적인 정확도 세트 구축
하나의 깔끔한 독백으로 평가하지 마십시오. 다양한 스피커, 악센트, 마이크, 실내 에코, 음악, 중첩, 도메인 용어, 숫자 및 코드 전환 등 중요한 조건을 다루는 20~40개의 짧은 동의 클립을 만듭니다. 인간 참조 성적표를 생성하고 모델 출력과 별도로 보관합니다.
| 테스트 슬라이스 | 측정 대상 | 일반적인 실패 |
|---|---|---|
| 싱글 스피커 청소 | 단어 오류 및 구두점 기준선 | 이름, 약어 및 희귀 용어 |
| 시끄러운 인터뷰 | 삭제율과 묵묵부답의 허위문자 | 연설로 해석되는 음악 |
| 겹치는 스피커 | 화자 속성 및 콘텐츠 손실 | 병합 또는 교환된 회전 |
| 숫자/날짜 | 철자 유사성이 아닌 의미적 정확성 | 금액, 단위, 약속 시간이 잘못되었습니다. |
| 다국어/코드 전환 | 언어 선택 및 번역되지 않은 용어 | 음성 대체 |
| 장시간 녹음 | 드리프트, 메모리 사용 및 처리량 | 타임스탬프 드리프트 또는 지연 실행 속도 저하 |
단어 오류율은 유용하지만 충분하지 않습니다. 중요한 용어의 정확성, 타임스탬프 오류, 화자 속성, 시간당 환각 및 인간 수정 시간(분)을 추적합니다. 접근성 캡션의 경우 가독성과 동기화는 작은 WER 개선보다 더 중요할 수 있습니다.
언어 선택 및 프롬프트
실시간 녹음 문서에서는 감지가 오디오 시작 부분에 의존하는 경우가 많기 때문에 알려진 언어를 선택하도록 권장합니다. 음악 소개, 다른 언어로 된 인사말 또는 짧은 클립은 오해를 불러일으킬 수 있습니다. 녹음에 포함되지 않은 콘텐츠를 추가하는 경우가 아니라 이름, 기술 용어 및 예상 철자에 대한 초기 프롬프트를 사용하세요.
프로젝트 용어집을 유지하고 각 백엔드가 프롬프트를 일관되게 사용하는지 테스트하세요. 오디오와 비교하여 숫자를 확인하세요. 법률, 의료, 학술 또는 저널리즘 작업의 경우 녹음을 유지하고 조용히 추측하기보다는 불확실한 부분에 타임스탬프를 표시하세요.
번역은 별도의 품질 문제입니다
Whisper의 표준 번역 작업은 지원되는 음성을 영어로 변환합니다. Buzz의 문서에는 Large-v3-turbo가 해당 표준 변환 경로와 호환되지 않는다고 나와 있습니다. Buzz은 로컬로 호스팅되는 엔드포인트를 포함하여 OpenAI 호환 언어 모델 엔드포인트를 통한 번역도 지원합니다. 두 번째 경로는 원본 오디오가 아닐 수도 있는 인식된 텍스트를 구성된 서비스로 전송하지만 여전히 개인 정보 보호 및 품질 검토가 필요합니다.
| 작업흐름 | 다음과 같은 경우에 사용하세요. | 검증 |
|---|---|---|
| 속삭임 음성을 영어로 | 지원되는 소스 음성에서 빠른 영어 렌더링 | 생략된 이름, 숫자, 문화 용어 비교 |
| 성적 증명서 후 LLM 번역 | 대상 언어가 영어가 아니거나 스타일 제어 문제 | 원본 성적표를 먼저 확인한 다음 이중 언어 검토 |
| 로컬 OpenAI 호환 번역기 | 미디어/텍스트는 제어되는 하드웨어에 남아 있어야 합니다. | 엔드포인트, 로그, 모델 라이선스 및 네트워크 격리 확인 |
| 전문 번역가 | 출판, 법적 또는 고위험의 의미 | 사람이 오디오와 상황에 따라 승인합니다. |
언어 모델이 자막 줄에 메모, 요약 또는 꾸며낸 맥락을 추가하도록 허용하지 마세요. 공식 문서에서는 명시적인 번역 지침을 권장합니다. 또한 줄 수, 타이밍 연관, 명명된 엔터티 및 반복되는 용어에 대한 일관성을 검증합니다.
화자 식별 및 음성 분리
Buzz은 완료된 텍스트 변환에서 화자를 식별할 수 있으며 인식 전에 음성을 추출/분리할 수 있습니다. 이러한 기능은 신원 확인이 아닌 보조 기능입니다. 라벨은 인간이 음성을 사람에게 매핑할 때까지 "스피커 1"을 출력합니다. 분할만으로 신원, 역할, 성별 또는 의도를 추론하지 마십시오.
분리 기능을 켰을 때와 껐을 때를 비교해 보세요. 배경 음악이 포함된 녹음 품질을 향상시킬 수 있지만 공격적인 처리로 인해 호흡, 조용한 음성 또는 중복이 손상될 수 있습니다. 손대지 않은 소스, 처리된 트랙 및 설정을 저장합니다. 증거 또는 보관 무결성이 중요한 경우 원본을 해시하고 사본을 편집합니다.
자막 QA: 단어는 작업의 절반에 불과합니다.
| 확인 | 실제 규칙 | 이유 |
|---|---|---|
| 타이밍 | 캡션이 음성과 함께 표시되며 읽기 시간이 충분합니다. | 자막이 늦어서 이해력이 떨어집니다 |
| 줄 바꿈 | 밀접하게 연결된 단어 사이가 아닌 자연스러운 문구에서 중단 | 스캔 향상 |
| 읽기 속도 | 플랫폼/대상 접근성 표준 사용 | 빽빽한 캡션을 읽을 수 없습니다. |
| 소리 신호 | 필요한 경우 의미 있는 비음성 오디오 추가 | 접근성에는 대화 이상의 것이 포함됩니다. |
| 스피커 변경 | 군더더기 없이 명확하게 변경하세요. | 인터뷰와 패널에서 중요 |
| 이름/번호 | 신뢰할 수 있는 컨텍스트에 대해 수동으로 확인 | 작은 표기 오류로 인해 의미가 바뀔 수 있습니다. |
Buzz은 TXT, SRT 및 VTT를 내보내고 프로젝트에서는 현재 제품 자료의 CSV 내보내기도 설명합니다. 대상 편집기나 플랫폼에 대해 정확한 형식을 테스트합니다. UTF-8 문자를 유지하고 첫 번째, 중간, 마지막 섹션에서 드리프트를 검사합니다.
실시간 전사는 대기 시간 예산이 더 엄격합니다.
공식 문서에서는 로컬 마이크 녹음이 리소스 집약적이며 실시간이 아닐 수 있다고 경고합니다. 전체 이벤트 기간 동안 캡처-디스플레이 지연, 누락된 오디오, 보정 안정성 및 열 조절을 측정합니다. 유선 마이크를 사용하고 절전 모드를 비활성화하세요. 중요한 접근성 이벤트에 대해 사람이 캡션을 작성하거나 대체 디스플레이를 제공합니다.
Buzz은 OBS와 같은 소프트웨어를 제공할 수 있는 프레젠테이션 창과 실시간 성적표 내보내기 옵션을 제공합니다. 또한 기본 설정에는 스크립트나 번역 텍스트를 서버에 게시할 수 있는 업로드 URL이 문서화되어 있습니다. 이를 활성화하면 로컬 워크플로가 네트워크 공개로 전환됩니다. 수신자를 인증하고, 전송을 암호화하고, 엔드포인트가 공개적으로 노출되지 않도록 하세요.
개인정보 보호 및 로컬 처리 확인
- 격리된 환경에 들어가기 전에 모델을 다운로드한 다음 테스트 중에 아웃바운드 연결을 모니터링하세요.
- 클라우드 처리가 금지되면 로컬 백엔드를 선택하고 API 키를 비워 두세요.
- 명시적으로 승인되지 않는 한 실시간 업로드 및 외부 번역을 비활성화합니다.
- 임시 파일, 내보내기 폴더, 최근 파일 목록, 충돌 로그 및 OS 백업을 확인하세요.
- 장치 및 녹음 저장소를 암호화합니다. 보존 정책에 따라 작업 복사본을 삭제합니다.
- 관할권 및 환경에 적합한 녹음 및 전사 동의를 얻습니다.
오픈 소스 코드는 검사 가능성을 향상시키지만 바이너리가 안전하다는 것을 증명하지는 않습니다. 공식 릴리스 채널을 통해 다운로드하고, 제공된 서명 또는 체크섬을 확인하고, 종속성을 최신 상태로 유지하고, 조직 정책에 따라 설치 아티팩트를 검사합니다.
하드웨어 및 처리량 결정
실시간 요소를 측정합니다. 처리 시간을 오디오 시간으로 나눈 값입니다. 값이 0.5라는 것은 1시간 분량의 오디오가 약 30분 정도 걸린다는 의미입니다. 2.0은 약 2시간을 의미합니다. 모델, 백엔드, 양자화, 장치, 가속, 파일 형식, 배치 크기 및 최대 메모리를 기록합니다. 노트북 배터리, 발열 및 동시 편집으로 인해 결과가 크게 달라질 수 있습니다.
양자화는 메모리를 줄이고 속도를 향상시킬 수 있으며 때로는 정확도가 저하되기도 합니다. Vulkan 지원은 더 넓은 범위의 GPU에서 Whisper.cpp을 가속화할 수 있는 반면, CUDA 및 Apple Silicon 경로에는 자체 호환성 조건이 있습니다. 실제 머신에 대한 명확한 벤치마크는 일반적인 하드웨어 주장보다 더 신뢰할 수 있습니다.
CLI 및 배치 자동화
Buzz CLI는 파일 또는 URL을 추가하고, 전사 또는 번역을 선택하고, 백엔드/모델/언어를 선택하고, 초기 프롬프트를 제공하고, SRT, VTT 또는 TXT를 내보낼 수 있습니다. GUI를 숨길 수 있어 감시 폴더나 미디어 파이프라인에 유용합니다. 자동화에는 여전히 충돌 방지 파일 이름, 종료 코드 확인, 로그 및 오류 격리가 필요합니다.
buzz add --task transcribe --언어 en --model-type Whispercpp --model-size small --prompt "이름: Ada Lovelace, Babbage" --srt --vtt 인터뷰.mp4
설치된 버전에 대해 CLI 옵션을 확인합니다. 프로덕션에서 릴리스를 고정하고 업그레이드 후 알려진 픽스처를 실행합니다. 자막 분할 또는 백엔드 변경은 명령이 성공하더라도 다운스트림 차이점을 변경할 수 있습니다.
대안
| 옵션 | 최적의 핏 | Buzz과의 절충 |
|---|---|---|
| Buzz | 크로스 플랫폼 로컬 GUI와 여러 Whisper 백엔드 | 데스크톱 리소스 및 수동 QA가 여전히 필요함 |
| Whisper.cpp CLI | 린 로컬 또는 임베디드 자동화 | 덜 통합된 편집 작업 흐름 |
| Faster Whisper 스크립트 | 커스텀 GPU 배치 파이프라인 | 추가 엔지니어링 및 종속성 관리 |
| OpenAI 음성-텍스트 API | 관리형 규모 및 최소한의 로컬 컴퓨팅 | 업로드, 가격 및 제공업체 약관 |
| Descript / 프리미어 텍스트 도구 | 편집실 내 전사 | 상업적인 생태계와 지역 통제가 덜함 |
| 인간 전사/캡션 | 고위험 접근성 또는 출판 | 직접 비용은 높지만 책임 있는 상황별 검토 |
자주 묻는 질문
Buzz은 무료인가요?
공식 저장소는 MIT 라이선스를 받았으며 데스크톱 소프트웨어는 구독 없이 사용할 수 있습니다. 호스팅된 API, 하드웨어 및 타사 모델에는 별도의 비용이 발생할 수 있습니다.
Buzz은 완전히 오프라인으로 작동하나요?
필수 자산을 사용할 수 있게 된 후 구성된 로컬 모델 워크플로의 경우 예입니다. API 전사, 외부 번역, URL 가져오기 및 실시간 업로드는 네트워크를 사용합니다.
어떤 운영 체제가 지원되나요?
이 프로젝트는 플랫폼별 배포 및 가속 옵션과 함께 macOS, Windows 및 Linux를 문서화합니다.
자막을 만들 수 있나요?
그렇습니다. SRT 및 VTT를 포함한 시간 형식을 내보냅니다. 사람의 타이밍, 가독성 및 용어 검토가 여전히 필요합니다.
화자를 식별할 수 있나요?
전사된 미디어에서 화자 식별을 지원하지만 라벨은 사람의 확인이 필요하며 생체 인식 신원 증명이 아닙니다.
영어 이외의 언어로 번역할 수 있나요?
Buzz은 로컬 엔드포인트를 포함하여 구성 가능한 OpenAI 호환 AI 서비스를 통해 추가 번역을 문서화합니다. 개인정보 보호와 번역 품질을 별도로 검증하세요.
전사가 느린 이유는 무엇입니까?
모델 크기, 백엔드, 양자화, 가속, 오디오 길이 및 하드웨어가 모두 중요합니다. 하드웨어를 구매하기 전에 더 작은 모델과 최적화된 백엔드를 벤치마킹하세요.
1차 소스
최종 검토일: 2026년 7월 25일. 대표 오디오에서 정확한 Buzz 릴리스 및 백엔드를 테스트합니다. 모델 지원, 가속 및 배포 패키지는 시간이 지남에 따라 변경됩니다.


