Buzz
Buzz

Buzz

Buzz은 macOS, Windows 및 Linux에서 로컬 Whisper 전사, 자막, 라이브 캡션, 번역 및 화자 레이블 지정을 위한 무료 MIT 라이선스 데스크톱 앱입니다. 이 가이드에서는 백엔드, 하드웨어, 개인 정보 보호, 정확성 테스트, 자막 QA, CLI 자동화 및 클라우드 대안을 비교합니다.

457

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

BuzzBuzz Captions오프라인 전사Whisper 전사오픈소스 자막음성 인식SRT 자막VTT 자막오디오 번역

Product Preview

A quick visual look at Buzz before you visit the official site.

Published 1/21/2026
Buzz screenshot

Editorial Review

About Buzz

Buzz 오디오 및 비디오를 대본, 자막 및 라이브 캡션으로 변환하는 무료 오픈 소스 데스크톱 애플리케이션입니다. 이는 Whisper, Whisper.cpp, Faster Whisper, 호환 가능한 Hugging Face 모델 및 호스팅된 OpenAI 호환 API 등 여러 음성 인식 백엔드를 macOS, Windows 및 Linux용 그래픽 워크플로로 래핑합니다. 저장소는 MIT 라이센스를 받았습니다.

Buzz은 사용자가 Python, FFmpeg 및 모델 도구를 조립하지 않고 로컬 처리 및 편집 가능한 내보내기를 원할 때 가장 유용합니다. "오프라인"은 절대적인 제품 속성이 아닌 구성 선택입니다. 로컬 백엔드는 컴퓨터에 미디어를 보관할 수 있는 반면 API 기록, AI 번역, URL 가져오기, 모델 다운로드 및 선택적 라이브 업로드 기능은 네트워크 트래픽을 생성합니다. 라벨에 의존하기보다는 선택한 작업 흐름을 확인하세요.

Official Buzz offline transcription banner
Buzz은 속삭임 기반 전사를 크로스 플랫폼 데스크톱 앱에 패키지합니다. 모델 선택에 따라 하드웨어 및 오디오 품질이 속도와 정확성을 결정합니다.
Official Buzz file import and transcription interface
가져오기 워크플로는 작업, 언어, 백엔드 및 모델 설정을 노출합니다. 나중에 수정 사항을 재현할 수 있도록 이러한 선택 사항을 출력과 함께 저장하십시오.

모델을 선택하기 전에 실행 경로를 선택하세요

백엔드최적의 핏일차적인 절충안
속삭임일반 지역 기준선참조 생태계 및 광범위한 언어 지원리소스 집약적일 수 있음
Whisper.cppCPU, Apple Silicon 또는 Vulkan 지원 장치이식 가능한 기본 런타임 및 양자화 모델빌드/가속 동작은 플랫폼에 따라 다릅니다.
Faster WhisperNVIDIA GPU 또는 최적화된 로컬 배치 작업효율적인 CTranslate2 구현 및 양자화드라이버, VRAM 및 패키지 호환성 문제
Hugging Face전문 언어 또는 미세 조정 모델대형 모델 카탈로그; Buzz 문서 MMS 지원품질과 라이선스는 모델에 따라 다릅니다.
OpenAI 호환 API약한 로컬 하드웨어 또는 중앙 집중식 서비스로컬 추론 설정이 없으며 잠재적으로 더 빠른 처리 시간이 소요됩니다.업로드 개인 정보 보호, 사용 비용 및 공급자 종속성

동일한 클립에 대해 2~3개의 현실적인 선택을 벤치마킹합니다. 모델 크기만으로는 최상의 생산 결과를 예측할 수 없습니다. 깨끗한 오디오, 알려진 언어, 신속한 사람의 검토가 중요한 경우에는 작은 모델이 승리할 수 있습니다. 더 큰 모델은 너무 느리게 실행되어 사용자가 품질 검사를 건너뛸 경우 손실될 수 있습니다.

증거로 그려진 전사 파이프라인

 오디오/비디오
    |
    +--> 선택적 음성 분리
    |
    v
 디코드 + 리샘플 --> 모델/백엔드 --> 시간 제한 세그먼트
                                          |
                  .------------+---------.
                  v v v
             텍스트 검토 화자 라벨 번역
                  |                       |                      |
                  '----------+---------'
                                          v
                                  TXT/SRT/VTT/CSV

 '내보내기 완료'는 '캡션 게시 준비'와 다릅니다.

각 단계마다 다른 오류가 발생할 수 있습니다. 음성 분리는 조용한 단어를 제거할 수 있습니다. 언어 감지는 짧은 소개에서 잘못된 언어를 선택할 수 있습니다. 모델은 침묵 중에 환각을 느낄 수 있습니다. 분할은 화자를 교환할 수 있습니다. 번역은 의미를 바꿀 수 있습니다. 자막 분할은 말로는 정확할 수 있지만 읽기는 어렵습니다.

대표적인 정확도 세트 구축

하나의 깔끔한 독백으로 평가하지 마십시오. 다양한 스피커, 악센트, 마이크, 실내 에코, 음악, 중첩, 도메인 용어, 숫자 및 코드 전환 등 중요한 조건을 다루는 20~40개의 짧은 동의 클립을 만듭니다. 인간 참조 성적표를 생성하고 모델 출력과 별도로 보관합니다.

테스트 슬라이스측정 대상일반적인 실패
싱글 스피커 청소단어 오류 및 구두점 기준선이름, 약어 및 희귀 용어
시끄러운 인터뷰삭제율과 묵묵부답의 허위문자연설로 해석되는 음악
겹치는 스피커화자 속성 및 콘텐츠 손실병합 또는 교환된 회전
숫자/날짜철자 유사성이 아닌 의미적 정확성금액, 단위, 약속 시간이 잘못되었습니다.
다국어/코드 전환언어 선택 및 번역되지 않은 용어음성 대체
장시간 녹음드리프트, 메모리 사용 및 처리량타임스탬프 드리프트 또는 지연 실행 속도 저하

단어 오류율은 유용하지만 충분하지 않습니다. 중요한 용어의 정확성, 타임스탬프 오류, 화자 속성, 시간당 환각 및 인간 수정 시간(분)을 추적합니다. 접근성 캡션의 경우 가독성과 동기화는 작은 WER 개선보다 더 중요할 수 있습니다.

언어 선택 및 프롬프트

실시간 녹음 문서에서는 감지가 오디오 시작 부분에 의존하는 경우가 많기 때문에 알려진 언어를 선택하도록 권장합니다. 음악 소개, 다른 언어로 된 인사말 또는 짧은 클립은 오해를 불러일으킬 수 있습니다. 녹음에 포함되지 않은 콘텐츠를 추가하는 경우가 아니라 이름, 기술 용어 및 예상 철자에 대한 초기 프롬프트를 사용하세요.

프로젝트 용어집을 유지하고 각 백엔드가 프롬프트를 일관되게 사용하는지 테스트하세요. 오디오와 비교하여 숫자를 확인하세요. 법률, 의료, 학술 또는 저널리즘 작업의 경우 녹음을 유지하고 조용히 추측하기보다는 불확실한 부분에 타임스탬프를 표시하세요.

번역은 별도의 품질 문제입니다

Whisper의 표준 번역 작업은 지원되는 음성을 영어로 변환합니다. Buzz의 문서에는 Large-v3-turbo가 해당 표준 변환 경로와 호환되지 않는다고 나와 있습니다. Buzz은 로컬로 호스팅되는 엔드포인트를 포함하여 OpenAI 호환 언어 모델 엔드포인트를 통한 번역도 지원합니다. 두 번째 경로는 원본 오디오가 아닐 수도 있는 인식된 텍스트를 구성된 서비스로 전송하지만 여전히 개인 정보 보호 및 품질 검토가 필요합니다.

작업흐름다음과 같은 경우에 사용하세요.검증
속삭임 음성을 영어로지원되는 소스 음성에서 빠른 영어 렌더링생략된 이름, 숫자, 문화 용어 비교
성적 증명서 후 LLM 번역대상 언어가 영어가 아니거나 스타일 제어 문제원본 성적표를 먼저 확인한 다음 이중 언어 검토
로컬 OpenAI 호환 번역기미디어/텍스트는 제어되는 하드웨어에 남아 있어야 합니다.엔드포인트, 로그, 모델 라이선스 및 네트워크 격리 확인
전문 번역가출판, 법적 또는 고위험의 의미사람이 오디오와 상황에 따라 승인합니다.

언어 모델이 자막 줄에 메모, 요약 또는 꾸며낸 맥락을 추가하도록 허용하지 마세요. 공식 문서에서는 명시적인 번역 지침을 권장합니다. 또한 줄 수, 타이밍 연관, 명명된 엔터티 및 반복되는 용어에 대한 일관성을 검증합니다.

화자 식별 및 음성 분리

Buzz은 완료된 텍스트 변환에서 화자를 식별할 수 있으며 인식 전에 음성을 추출/분리할 수 있습니다. 이러한 기능은 신원 확인이 아닌 보조 기능입니다. 라벨은 인간이 음성을 사람에게 매핑할 때까지 "스피커 1"을 출력합니다. 분할만으로 신원, 역할, 성별 또는 의도를 추론하지 마십시오.

분리 기능을 켰을 때와 껐을 때를 비교해 보세요. 배경 음악이 포함된 녹음 품질을 향상시킬 수 있지만 공격적인 처리로 인해 호흡, 조용한 음성 또는 중복이 손상될 수 있습니다. 손대지 않은 소스, 처리된 트랙 및 설정을 저장합니다. 증거 또는 보관 무결성이 중요한 경우 원본을 해시하고 사본을 편집합니다.

자막 QA: 단어는 작업의 절반에 불과합니다.

확인실제 규칙이유
타이밍캡션이 음성과 함께 표시되며 읽기 시간이 충분합니다.자막이 늦어서 이해력이 떨어집니다
줄 바꿈밀접하게 연결된 단어 사이가 아닌 자연스러운 문구에서 중단스캔 향상
읽기 속도플랫폼/대상 접근성 표준 사용빽빽한 캡션을 읽을 수 없습니다.
소리 신호필요한 경우 의미 있는 비음성 오디오 추가접근성에는 대화 이상의 것이 포함됩니다.
스피커 변경군더더기 없이 명확하게 변경하세요.인터뷰와 패널에서 중요
이름/번호신뢰할 수 있는 컨텍스트에 대해 수동으로 확인작은 표기 오류로 인해 의미가 바뀔 수 있습니다.

Buzz은 TXT, SRT 및 VTT를 내보내고 프로젝트에서는 현재 제품 자료의 CSV 내보내기도 설명합니다. 대상 편집기나 플랫폼에 대해 정확한 형식을 테스트합니다. UTF-8 문자를 유지하고 첫 번째, 중간, 마지막 섹션에서 드리프트를 검사합니다.

실시간 전사는 대기 시간 예산이 더 엄격합니다.

공식 문서에서는 로컬 마이크 녹음이 리소스 집약적이며 실시간이 아닐 수 있다고 경고합니다. 전체 이벤트 기간 동안 캡처-디스플레이 지연, 누락된 오디오, 보정 안정성 및 열 조절을 측정합니다. 유선 마이크를 사용하고 절전 모드를 비활성화하세요. 중요한 접근성 이벤트에 대해 사람이 캡션을 작성하거나 대체 디스플레이를 제공합니다.

Buzz은 OBS와 같은 소프트웨어를 제공할 수 있는 프레젠테이션 창과 실시간 성적표 내보내기 옵션을 제공합니다. 또한 기본 설정에는 스크립트나 번역 텍스트를 서버에 게시할 수 있는 업로드 URL이 문서화되어 있습니다. 이를 활성화하면 로컬 워크플로가 네트워크 공개로 전환됩니다. 수신자를 인증하고, 전송을 암호화하고, 엔드포인트가 공개적으로 노출되지 않도록 하세요.

개인정보 보호 및 로컬 처리 확인

  • 격리된 환경에 들어가기 전에 모델을 다운로드한 다음 테스트 중에 아웃바운드 연결을 모니터링하세요.
  • 클라우드 처리가 금지되면 로컬 백엔드를 선택하고 API 키를 비워 두세요.
  • 명시적으로 승인되지 않는 한 실시간 업로드 및 외부 번역을 비활성화합니다.
  • 임시 파일, 내보내기 폴더, 최근 파일 목록, 충돌 로그 및 OS 백업을 확인하세요.
  • 장치 및 녹음 저장소를 암호화합니다. 보존 정책에 따라 작업 복사본을 삭제합니다.
  • 관할권 및 환경에 적합한 녹음 및 전사 동의를 얻습니다.

오픈 소스 코드는 검사 가능성을 향상시키지만 바이너리가 안전하다는 것을 증명하지는 않습니다. 공식 릴리스 채널을 통해 다운로드하고, 제공된 서명 또는 체크섬을 확인하고, 종속성을 최신 상태로 유지하고, 조직 정책에 따라 설치 아티팩트를 검사합니다.

하드웨어 및 처리량 결정

실시간 요소를 측정합니다. 처리 시간을 오디오 시간으로 나눈 값입니다. 값이 0.5라는 것은 1시간 분량의 오디오가 약 30분 정도 걸린다는 의미입니다. 2.0은 약 2시간을 의미합니다. 모델, 백엔드, 양자화, 장치, 가속, 파일 형식, 배치 크기 및 최대 메모리를 기록합니다. 노트북 배터리, 발열 및 동시 편집으로 인해 결과가 크게 달라질 수 있습니다.

양자화는 메모리를 줄이고 속도를 향상시킬 수 있으며 때로는 정확도가 저하되기도 합니다. Vulkan 지원은 더 넓은 범위의 GPU에서 Whisper.cpp을 가속화할 수 있는 반면, CUDA 및 Apple Silicon 경로에는 자체 호환성 조건이 있습니다. 실제 머신에 대한 명확한 벤치마크는 일반적인 하드웨어 주장보다 더 신뢰할 수 있습니다.

CLI 및 배치 자동화

Buzz CLI는 파일 또는 URL을 추가하고, 전사 또는 번역을 선택하고, 백엔드/모델/언어를 선택하고, 초기 프롬프트를 제공하고, SRT, VTT 또는 TXT를 내보낼 수 있습니다. GUI를 숨길 수 있어 감시 폴더나 미디어 파이프라인에 유용합니다. 자동화에는 여전히 충돌 방지 파일 이름, 종료 코드 확인, 로그 및 오류 격리가 필요합니다.

buzz add --task transcribe --언어 en --model-type Whispercpp --model-size small --prompt "이름: Ada Lovelace, Babbage" --srt --vtt 인터뷰.mp4

설치된 버전에 대해 CLI 옵션을 확인합니다. 프로덕션에서 릴리스를 고정하고 업그레이드 후 알려진 픽스처를 실행합니다. 자막 분할 또는 백엔드 변경은 명령이 성공하더라도 다운스트림 차이점을 변경할 수 있습니다.

대안

옵션최적의 핏Buzz과의 절충
Buzz크로스 플랫폼 로컬 GUI와 여러 Whisper 백엔드데스크톱 리소스 및 수동 QA가 여전히 필요함
Whisper.cpp CLI린 로컬 또는 임베디드 자동화덜 통합된 편집 작업 흐름
Faster Whisper 스크립트커스텀 GPU 배치 파이프라인추가 엔지니어링 및 종속성 관리
OpenAI 음성-텍스트 API관리형 규모 및 최소한의 로컬 컴퓨팅업로드, 가격 및 제공업체 약관
Descript / 프리미어 텍스트 도구편집실 내 전사상업적인 생태계와 지역 통제가 덜함
인간 전사/캡션고위험 접근성 또는 출판직접 비용은 높지만 책임 있는 상황별 검토

자주 묻는 질문

Buzz은 무료인가요?

공식 저장소는 MIT 라이선스를 받았으며 데스크톱 소프트웨어는 구독 없이 사용할 수 있습니다. 호스팅된 API, 하드웨어 및 타사 모델에는 별도의 비용이 발생할 수 있습니다.

Buzz은 완전히 오프라인으로 작동하나요?

필수 자산을 사용할 수 있게 된 후 구성된 로컬 모델 워크플로의 경우 예입니다. API 전사, 외부 번역, URL 가져오기 및 실시간 업로드는 네트워크를 사용합니다.

어떤 운영 체제가 지원되나요?

이 프로젝트는 플랫폼별 배포 및 가속 옵션과 함께 macOS, Windows 및 Linux를 문서화합니다.

자막을 만들 수 있나요?

그렇습니다. SRT 및 VTT를 포함한 시간 형식을 내보냅니다. 사람의 타이밍, 가독성 및 용어 검토가 여전히 필요합니다.

화자를 식별할 수 있나요?

전사된 미디어에서 화자 식별을 지원하지만 라벨은 사람의 확인이 필요하며 생체 인식 신원 증명이 아닙니다.

영어 이외의 언어로 번역할 수 있나요?

Buzz은 로컬 엔드포인트를 포함하여 구성 가능한 OpenAI 호환 AI 서비스를 통해 추가 번역을 문서화합니다. 개인정보 보호와 번역 품질을 별도로 검증하세요.

전사가 느린 이유는 무엇입니까?

모델 크기, 백엔드, 양자화, 가속, 오디오 길이 및 하드웨어가 모두 중요합니다. 하드웨어를 구매하기 전에 더 작은 모델과 최적화된 백엔드를 벤치마킹하세요.

1차 소스

최종 검토일: 2026년 7월 25일. 대표 오디오에서 정확한 Buzz 릴리스 및 백엔드를 테스트합니다. 모델 지원, 가속 및 배포 패키지는 시간이 지남에 따라 변경됩니다.

Ready to try Buzz?

Visit the official website to get started

Visit Buzz

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper는 OpenAI가 MIT 라이선스로 공개한 다국어 음성 인식 모델과 Python 참조 구현으로, 로컬 전사·언어 감지·영어 음성 번역에 사용할 수 있습니다.

Whisper음성 인식로컬 전사
1070
Whisper.cpp

Whisper.cpp

Whisper.cpp은 로컬 전사, 번역, 스트리밍, 서버 및 임베디드 앱을 위한 OpenAI Whisper의 종속성이 적은 C/C++ 구현입니다. 이 가이드에서는 모델, 양자화, 백엔드, 정확성, 개인 정보 보호 및 배포를 다룹니다.

speech-recognitionfree
1180
WhisperDesktop

WhisperDesktop

WhisperDesktop은 오디오, 비디오 및 마이크 입력에서 로컬로 OpenAI Whisper을 실행하기 위한 Windows 데스크톱 앱 및 DirectCompute 구현입니다. 이 가이드에서는 설정, 모델, GPU, 자막, 개인 정보 보호 및 대안을 다룹니다.

WhisperDesktopOpenAI Whisperspeech recognition
2410
WhisperX

WhisperX

WhisperX는 faster-whisper 배치 전사에 언어별 단어 강제 정렬과 선택적 pyannote 화자 분리를 더하는 장문 음성용 오픈소스 파이프라인입니다.

WhisperXspeech alignmentspeaker diarization
1070