Buzz
Buzz

Buzz

Buzz は、macOS、Windows、Linux 上でローカルの Whisper 文字起こし、字幕、ライブ キャプション、翻訳、話者ラベル付けを行うための MIT ライセンスの無料デスクトップ アプリです。このガイドでは、バックエンド、ハードウェア、プライバシー、精度テスト、字幕 QA、CLI 自動化、およびクラウド代替手段を比較します。

2,365

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

BuzzBuzz Captionsオフライン文字起こしWhisper transcription字幕作成音声認識SRT字幕VTT字幕

Product Preview

A quick visual look at Buzz before you visit the official site.

Published 1/21/2026
Buzz screenshot

Editorial Review

About Buzz

Buzz は、オーディオとビデオをトランスクリプト、字幕、ライブ キャプションに変換するための無料のオープンソース デスクトップ アプリケーションです。これは、いくつかの音声認識バックエンド (Whisper、Whisper.cpp、Faster Whisper、互換性のある Hugging Face モデル、およびホストされた OpenAI 互換性のある API) を、macOS、Windows、Linux 用のグラフィカル ワークフローにラップします。リポジトリは MIT ライセンスを取得しています。

Buzz は、ユーザーが Python、FFmpeg、およびモデル ツールを組み立てずにローカル処理と編集可能なエクスポートを必要とする場合に最も価値があります。 「オフライン」は構成の選択であり、絶対的な製品特性ではありません。ローカル バックエンドはメディアをコンピューター上に保持できますが、API 文字起こし、AI 変換、URL インポート、モデルのダウンロード、およびオプションのライブ アップロード機能によってネットワーク トラフィックが作成されます。ラベルに依存するのではなく、選択したワークフローを確認してください。

Official Buzz offline transcription banner
Buzz は、Whisper ベースの文字起こしをクロスプラットフォームのデスクトップ アプリにパッケージ化します。モデルの選択、ハードウェア、およびオーディオの品質が速度と精度を決定します。
Official Buzz file import and transcription interface
インポート ワークフローでは、タスク、言語、バックエンド、モデルの設定が公開されます。これらの選択を出力とともに保存すると、後で修正を再現できるようになります。

モデルを選択する前に実行パスを選択してください

バックエンドベストフィット強さ一次トレードオフ
ささやき一般的なローカルベースラインリファレンスエコシステムと幅広い言語サポートリソースを大量に消費する可能性がある
Whisper.cppCPU、Apple Silicon または Vulkan 対応デバイスポータブルなネイティブ ランタイムと量子化モデルビルド/アクセラレーションの動作はプラットフォームによって異なります
Faster WhisperNVIDIA GPU または最適化されたローカル バッチ作業効率的な CTranslate2 の実装と量子化ドライバー、VRAM、パッケージの互換性が重要
Hugging Face特殊な言語または微調整されたモデル大規模なモデルカタログ。 Buzz ドキュメント MMS サポート品質とライセンスはモデルによって異なります
OpenAI 互換 API脆弱なローカル ハードウェアまたは集中型サービスローカル推論セットアップが不要で、ターンアラウンドが短縮される可能性がありますアップロードのプライバシー、使用コスト、プロバイダーへの依存関係

同じクリップで 2 つまたは 3 つの現実的な選択肢をベンチマークします。モデルのサイズだけでは、最良の生産結果を予測することはできません。きれいな音声、既知の言語、人間による迅速なレビューが重要な場合は、小規模なモデルが勝つ可能性があります。より大きなモデルは、実行速度が非常に遅く、ユーザーが品質チェックをスキップすると、失われる可能性があります。

証拠に基づいて作成された転写パイプライン

 オーディオ/ビデオ
    |
    +--> オプションの音声分離
    |
    v
 デコード + リサンプル --> モデル/バックエンド --> タイミングセグメント
                                          |
                  .----------------------+----------------------。
                  vvv
             テキストレビュースピーカーラベル翻訳
                  |                       |                      |
                  '---------------------+----------------------'
                                          v
                                  TXT / SRT / VTT / CSV

 「エクスポートが完了しました」は「キャプションの公開準備が完了しました」とは異なります

各段階で異なるエラーが発生する可能性があります。音声の分離により、静かな単語が削除される可能性があります。言語検出では、短いイントロから間違った言語が選択される可能性があります。モデルは沈黙中に幻覚を見ることがあります。ダイアライゼーションでは話者を交換できます。翻訳は意味を変える可能性があります。また、字幕の分割は言葉では正確ですが、読むのが困難です。

代表的な精度セットを構築する

きれいな独り言だけで評価しないでください。さまざまな話者、アクセント、マイク、室内エコー、音楽、重複、ドメイン用語、番号、コードスイッチなど、重要な条件をカバーする同意を得た短いクリップを 20 ~ 40 個作成します。人間の参照トランスクリプトを作成し、モデルの出力とは別に保管します。

テストスライス何を測定するかよくある失敗
クリーンなシングルスピーカー単語エラーと句読点のベースライン名前、頭字語、珍しい用語
騒々しいインタビュー削除率と無言の虚偽テキスト音声として解釈された音楽
オーバーラップスピーカー講演者の帰属と失われたコンテンツターンの結合または交換
数字/日付スペルの類似性ではなく、意味上の正確性金額、単位、予約時間が間違っています
多言語/コードスイッチ言語選択と未翻訳の用語音声置換
長時間録音ドリフト、メモリ使用量、スループットタイムスタンプのドリフトまたは遅延実行速度の低下

ワードエラー率は便利ですが不十分です。臨界期の正確さ、タイムスタンプエラー、話者の帰属、1時間あたりの幻覚、人間による修正の分数を追跡します。アクセシビリティ キャプションの場合、WER の小さな改善よりも、読みやすさと同期性が重要になる場合があります。

言語の選択とプロンプト

多くの場合、検出は音声の先頭に依存するため、ライブ録音のドキュメントでは、言語がわかっているときに言語を選択することを推奨しています。音楽のイントロ、別の言語での挨拶、または短いクリップは誤解を招く可能性があります。録音に含まれていないコンテンツを追加するためではなく、名前、技術用語、予想されるスペルについての最初のプロンプトを使用します。

プロジェクトの用語集を保管し、各バックエンドがプロンプトを一貫して使用しているかどうかをテストします。数字を音声と照らし合わせて確認します。法律、医療、学術、ジャーナリストの仕事の場合は、黙って推測するのではなく、記録を保存し、不確かな箇所にタイムスタンプを付けてください。

翻訳は別の品質問題です

Whisper の標準翻訳タスクは、サポートされている音声を英語に変換します。 Buzz のドキュメントには、Large-v3-turbo がその標準変換パスと互換性がないことが記載されています。 Buzz は、ローカルでホストされるエンドポイントを含む、OpenAI 互換の言語モデル エンドポイントを介した翻訳もサポートします。 2 番目のパスは、認識されたテキスト (必ずしもオリジナルの音声ではない) を構成されたサービスに送信しますが、それでもプライバシーと品質のレビューが必要です。

ワークフローいつ使用しますか検証
ささやき声から英語へサポートされているソース音声からの高速英語レンダリング省略された名前、数字、文化用語を比較する
トランスクリプト、次に LLM 翻訳ターゲット言語が英語ではない、またはスタイル管理が重要であるまず原文のトランスクリプトを確認してから、バイリンガルでレビューしてください
ローカルの OpenAI 互換トランスレーターメディア/テキストは管理されたハードウェア上に残しておく必要がありますエンドポイント、ログ、モデルライセンス、ネットワーク分離を確認する
プロの翻訳者出版、法的または一か八かの意味音声とコンテキストに対して人間がサインオフする

言語モデルに、字幕行にメモ、要約、または創作されたコンテキストを追加させないでください。公式ドキュメントでは、明示的な翻訳手順を推奨しています。また、行数、タイミングの関連付け、名前付きエンティティ、および繰り返される用語間の一貫性も検証します。

話者の識別と音声の分離

Buzz は、完了した文字起こしで話者を識別し、認識前に音声を抽出/分離できます。これらの機能は補助的なものであり、本人確認を行うものではありません。人間が音声を人物にマッピングするまで、ラベルは「スピーカー 1」を出力します。日記だけからアイデンティティ、役割、性別、意図を推測しないでください。

分離オンとオフを比較します。バックグラウンド ミュージックを使用した録音を改善できますが、積極的な処理により、呼吸、静かな会話、または重複が損なわれる可能性があります。変更されていないソース、処理されたトラック、設定を保存します。証拠やアーカイブの整合性が重要な場合は、オリジナルをハッシュし、コピーを編集します。

字幕 QA: 言葉は仕事の半分に過ぎません

チェックする実践的なルール理由
タイミング音声とともにキャプションが表示され、十分な読書時間を確保できます。字幕が遅いと理解力が低下する
改行密接に結びついた単語の間ではなく、自然なフレーズで区切るスキャンの改善
読書速度プラットフォーム/視聴者のアクセシビリティ標準を使用する濃いキャプションは読めない
サウンドキュー必要に応じて意味のある非音声音声を追加するアクセシビリティには対話以上のものが含まれます
スピーカーの変更乱雑にせずに明確な変更を行うインタビューやパネルディスカッションで重要なこと
名前/番号信頼できるコンテキストに対して手動で検証する小さな転記ミスが意味を変える可能性がある

Buzz は TXT、SRT、および VTT をエクスポートします。プロジェクトでは、現在の製品資料で CSV エクスポートについても説明します。宛先のエディターまたはプラットフォームに対して正確な形式をテストします。 UTF-8 文字を保持し、最初、中間、最後のセクションのずれを検査します。

ライブ文字起こしではレイテンシーバジェットがより厳しくなります

公式ドキュメントでは、ローカルマイクの文字起こしはリソースを大量に消費し、リアルタイムではない可能性があると警告しています。イベント期間全体にわたって、キャプチャから表示までの遅延、音声の欠落、補正の安定性、サーマル スロットルを測定します。有線マイクを使用し、スリープを無効にします。重要なアクセシビリティ イベントについては、人間によるキャプショナまたはフォールバック ディスプレイを用意します。

Buzz は、プレゼンテーション ウィンドウと、OBS などのソフトウェアにフィードできるオプションのライブ トランスクリプト エクスポートを提供します。プリファレンスには、トランスクリプトまたは翻訳テキストをサーバーに POST できるアップロード URL も文書化されています。これを有効にすると、ローカル ワークフローがネットワーク公開に変わります。受信者を認証し、トランスポートを暗号化し、エンドポイントの公開を回避します。

プライバシーとローカル処理の検証

  • 隔離された環境に入る前にモデルをダウンロードし、テスト中にアウトバウンド接続を監視します。
  • クラウド処理が禁止されている場合は、ローカル バックエンドを選択し、API キーを空のままにしておきます。
  • 明示的に承認されない限り、ライブ アップロードと外部翻訳を無効にします。
  • 一時ファイル、エクスポート フォルダー、最近使用したファイルのリスト、クラッシュ ログ、OS バックアップを確認します。
  • デバイスと録画ストレージを暗号化します。保持ポリシーに従って作業コピーを削除します。
  • 管轄区域および環境に応じて適切な録音および転写の同意を取得します。

オープンソース コードは検査可能性を向上させますが、バイナリが安全であることを証明するものではありません。公式リリース チャネルを通じてダウンロードし、提供されている場合は署名またはチェックサムを検証し、依存関係を最新に保ち、組織のポリシーに基づいてインストール アーティファクトをスキャンします。

ハードウェアとスループットの決定

リアルタイム係数を測定します。処理秒数をオーディオ秒数で割ります。値 0.5 は、1 時間の音声に約 30 分かかることを意味します。 2.0 は約 2 時間を意味します。モデル、バックエンド、量子化、デバイス、加速度、ファイル形式、バッチ サイズ、ピーク メモリを記録します。ラップトップのバッテリー、熱、同時編集により、結果が大きく変わる可能性があります。

量子化によりメモリが削減され、速度が向上しますが、場合によっては精度が犠牲になります。 Vulkan サポートにより、より広範囲の GPU で Whisper.cpp を高速化できますが、CUDA および Apple Silicon パスには独自の互換性条件があります。実際のマシンでのクリーンなベンチマークは、一般的なハードウェアの主張よりも信頼できます。

CLIとバッチ自動化

Buzz CLI は、ファイルまたは URL の追加、転写または翻訳の選択、バックエンド/モデル/言語の選択、初期プロンプトの提供、SRT、VTT、または TXT のエクスポートを行うことができます。 GUI を非表示にできるため、監視フォルダーやメディア パイプラインに役立ちます。自動化には、衝突安全なファイル名、終了コードのチェック、ログ、障害の隔離が依然として必要です。

uzz add --task transcribe -- language en --model-type Whispercpp --model-size small --prompt "Names: Ada Lovelace、Babbage" --srt --vtt Interview.mp4

インストールされているバージョンに対して CLI オプションを確認します。リリースを運用環境に固定し、アップグレード後に既知のフィクスチャを実行します。字幕のセグメンテーションやバックエンドの変更により、コマンドが成功した場合でもダウンストリームの差分が変更される可能性があります。

代替案

オプションベストフィットトレードオフと Buzz
Buzzクロスプラットフォームのローカル GUI と複数の Whisper バックエンドデスクトップ リソースと手動の QA が引き続き必要
Whisper.cpp CLI無駄のないローカルまたは組み込みオートメーションあまり統合されていない編集ワークフロー
Faster Whisper スクリプトカスタム GPU バッチ パイプラインエンジニアリングと依存関係の管理の強化
OpenAI 音声テキスト変換 API管理されたスケールと最小限のローカル コンピューティングアップロード、価格設定、プロバイダー条件
Descript / プレミア テキスト ツール編集スイート内での文字起こし商用エコシステムとローカル制御の低下
人間による文字起こし/キャプション一か八かのアクセシビリティまたは出版直接コストは高くなりますが、責任ある状況に応じたレビューが可能

よくある質問

Buzz は無料ですか?

公式リポジトリは MIT ライセンスを取得しており、デスクトップ ソフトウェアはサブスクリプションなしで使用できます。ホストされた API、ハードウェアおよびサードパーティ モデルでは、別途コストが発生する場合があります。

Buzz は完全にオフラインで動作しますか?

必要なアセットが利用可能になった後、構成済みのローカル モデル ワークフローの場合は「はい」です。 API 文字起こし、外部翻訳、URL インポート、ライブ アップロードにはネットワークが使用されます。

どのオペレーティング システムがサポートされていますか?

このプロジェクトでは、プラットフォーム固有のディストリビューションとアクセラレーションのオプションを備えた macOS、Windows、Linux について文書化しています。

字幕を作成できますか?

はい。 SRT や VTT などの時間指定フォーマットをエクスポートします。人間によるタイミング、読みやすさ、用語の見直しは引き続き必要です。

発言者を特定できるのでしょうか?

転写されたメディアでの話者の識別をサポートしていますが、ラベルは人間による検証が必要であり、生体認証による身元証明ではありません。

英語以外の言語に翻訳できますか?

Buzz は、ローカル エンドポイントを含む、構成可能な OpenAI 互換の AI サービスを介した追加の変換を文書化します。プライバシーと翻訳の品質を個別に検証します。

転写が遅いのはなぜですか?

モデルのサイズ、バックエンド、量子化、アクセラレーション、オーディオの長さ、ハードウェアがすべて重要です。ハードウェアを購入する前に、より小規模なモデルと最適化されたバックエンドをベンチマークします。

一次情報源

最終レビュー日は 2026 年 7 月 25 日です。代表的なオーディオで正確な Buzz リリースとバックエンドをテストします。モデルのサポート、アクセラレーション、および配布パッケージは時間の経過とともに変化します。

Ready to try Buzz?

Visit the official website to get started

Visit Buzz

Quick Info

Category
音声認識
Added
1/21/2026
Published
1/21/2026
Updated
9/7/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Whisper

Whisper

Whisper は OpenAI が MIT ライセンスで公開する多言語音声認識モデルと Python 参照実装で、ローカル文字起こしと言語識別、英語への音声翻訳に対応します。

Whisper音声認識ローカル文字起こし
1010
Whisper.cpp

Whisper.cpp

Whisper.cpp は、ローカルの文字起こし、翻訳、ストリーミング、サーバー、組み込みアプリ向けの OpenAI Whisper の依存関係の少ない C/C++ 実装です。このガイドでは、モデル、量子化、バックエンド、精度、プライバシー、展開について説明します。

speech-recognitionfree
910
WhisperDesktop

WhisperDesktop

WhisperDesktop は、オーディオ、ビデオ、およびマイク入力でローカルに OpenAI Whisper を実行するための Windows デスクトップ アプリおよび DirectCompute 実装です。このガイドでは、セットアップ、モデル、GPU、字幕、プライバシー、および代替手段について説明します。

WhisperDesktopOpenAI Whisperspeech recognition
2460
WhisperX

WhisperX

WhisperXは、faster-whisperのバッチ文字起こしに言語別の単語強制アラインメントと任意のpyannote話者分離を加える長時間音声向けOSSパイプラインです。

WhisperXspeech alignmentspeaker diarization
980