Buzz は、オーディオとビデオをトランスクリプト、字幕、ライブ キャプションに変換するための無料のオープンソース デスクトップ アプリケーションです。これは、いくつかの音声認識バックエンド (Whisper、Whisper.cpp、Faster Whisper、互換性のある Hugging Face モデル、およびホストされた OpenAI 互換性のある API) を、macOS、Windows、Linux 用のグラフィカル ワークフローにラップします。リポジトリは MIT ライセンスを取得しています。
Buzz は、ユーザーが Python、FFmpeg、およびモデル ツールを組み立てずにローカル処理と編集可能なエクスポートを必要とする場合に最も価値があります。 「オフライン」は構成の選択であり、絶対的な製品特性ではありません。ローカル バックエンドはメディアをコンピューター上に保持できますが、API 文字起こし、AI 変換、URL インポート、モデルのダウンロード、およびオプションのライブ アップロード機能によってネットワーク トラフィックが作成されます。ラベルに依存するのではなく、選択したワークフローを確認してください。


モデルを選択する前に実行パスを選択してください
| バックエンド | ベストフィット | 強さ | 一次トレードオフ |
|---|---|---|---|
| ささやき | 一般的なローカルベースライン | リファレンスエコシステムと幅広い言語サポート | リソースを大量に消費する可能性がある |
| Whisper.cpp | CPU、Apple Silicon または Vulkan 対応デバイス | ポータブルなネイティブ ランタイムと量子化モデル | ビルド/アクセラレーションの動作はプラットフォームによって異なります |
| Faster Whisper | NVIDIA GPU または最適化されたローカル バッチ作業 | 効率的な CTranslate2 の実装と量子化 | ドライバー、VRAM、パッケージの互換性が重要 |
| Hugging Face | 特殊な言語または微調整されたモデル | 大規模なモデルカタログ。 Buzz ドキュメント MMS サポート | 品質とライセンスはモデルによって異なります |
| OpenAI 互換 API | 脆弱なローカル ハードウェアまたは集中型サービス | ローカル推論セットアップが不要で、ターンアラウンドが短縮される可能性があります | アップロードのプライバシー、使用コスト、プロバイダーへの依存関係 |
同じクリップで 2 つまたは 3 つの現実的な選択肢をベンチマークします。モデルのサイズだけでは、最良の生産結果を予測することはできません。きれいな音声、既知の言語、人間による迅速なレビューが重要な場合は、小規模なモデルが勝つ可能性があります。より大きなモデルは、実行速度が非常に遅く、ユーザーが品質チェックをスキップすると、失われる可能性があります。
証拠に基づいて作成された転写パイプライン
オーディオ/ビデオ
|
+--> オプションの音声分離
|
v
デコード + リサンプル --> モデル/バックエンド --> タイミングセグメント
|
.----------------------+----------------------。
vvv
テキストレビュースピーカーラベル翻訳
| | |
'---------------------+----------------------'
v
TXT / SRT / VTT / CSV
「エクスポートが完了しました」は「キャプションの公開準備が完了しました」とは異なります
各段階で異なるエラーが発生する可能性があります。音声の分離により、静かな単語が削除される可能性があります。言語検出では、短いイントロから間違った言語が選択される可能性があります。モデルは沈黙中に幻覚を見ることがあります。ダイアライゼーションでは話者を交換できます。翻訳は意味を変える可能性があります。また、字幕の分割は言葉では正確ですが、読むのが困難です。
代表的な精度セットを構築する
きれいな独り言だけで評価しないでください。さまざまな話者、アクセント、マイク、室内エコー、音楽、重複、ドメイン用語、番号、コードスイッチなど、重要な条件をカバーする同意を得た短いクリップを 20 ~ 40 個作成します。人間の参照トランスクリプトを作成し、モデルの出力とは別に保管します。
| テストスライス | 何を測定するか | よくある失敗 |
|---|---|---|
| クリーンなシングルスピーカー | 単語エラーと句読点のベースライン | 名前、頭字語、珍しい用語 |
| 騒々しいインタビュー | 削除率と無言の虚偽テキスト | 音声として解釈された音楽 |
| オーバーラップスピーカー | 講演者の帰属と失われたコンテンツ | ターンの結合または交換 |
| 数字/日付 | スペルの類似性ではなく、意味上の正確性 | 金額、単位、予約時間が間違っています |
| 多言語/コードスイッチ | 言語選択と未翻訳の用語 | 音声置換 |
| 長時間録音 | ドリフト、メモリ使用量、スループット | タイムスタンプのドリフトまたは遅延実行速度の低下 |
ワードエラー率は便利ですが不十分です。臨界期の正確さ、タイムスタンプエラー、話者の帰属、1時間あたりの幻覚、人間による修正の分数を追跡します。アクセシビリティ キャプションの場合、WER の小さな改善よりも、読みやすさと同期性が重要になる場合があります。
言語の選択とプロンプト
多くの場合、検出は音声の先頭に依存するため、ライブ録音のドキュメントでは、言語がわかっているときに言語を選択することを推奨しています。音楽のイントロ、別の言語での挨拶、または短いクリップは誤解を招く可能性があります。録音に含まれていないコンテンツを追加するためではなく、名前、技術用語、予想されるスペルについての最初のプロンプトを使用します。
プロジェクトの用語集を保管し、各バックエンドがプロンプトを一貫して使用しているかどうかをテストします。数字を音声と照らし合わせて確認します。法律、医療、学術、ジャーナリストの仕事の場合は、黙って推測するのではなく、記録を保存し、不確かな箇所にタイムスタンプを付けてください。
翻訳は別の品質問題です
Whisper の標準翻訳タスクは、サポートされている音声を英語に変換します。 Buzz のドキュメントには、Large-v3-turbo がその標準変換パスと互換性がないことが記載されています。 Buzz は、ローカルでホストされるエンドポイントを含む、OpenAI 互換の言語モデル エンドポイントを介した翻訳もサポートします。 2 番目のパスは、認識されたテキスト (必ずしもオリジナルの音声ではない) を構成されたサービスに送信しますが、それでもプライバシーと品質のレビューが必要です。
| ワークフロー | いつ使用しますか | 検証 |
|---|---|---|
| ささやき声から英語へ | サポートされているソース音声からの高速英語レンダリング | 省略された名前、数字、文化用語を比較する |
| トランスクリプト、次に LLM 翻訳 | ターゲット言語が英語ではない、またはスタイル管理が重要である | まず原文のトランスクリプトを確認してから、バイリンガルでレビューしてください |
| ローカルの OpenAI 互換トランスレーター | メディア/テキストは管理されたハードウェア上に残しておく必要があります | エンドポイント、ログ、モデルライセンス、ネットワーク分離を確認する |
| プロの翻訳者 | 出版、法的または一か八かの意味 | 音声とコンテキストに対して人間がサインオフする |
言語モデルに、字幕行にメモ、要約、または創作されたコンテキストを追加させないでください。公式ドキュメントでは、明示的な翻訳手順を推奨しています。また、行数、タイミングの関連付け、名前付きエンティティ、および繰り返される用語間の一貫性も検証します。
話者の識別と音声の分離
Buzz は、完了した文字起こしで話者を識別し、認識前に音声を抽出/分離できます。これらの機能は補助的なものであり、本人確認を行うものではありません。人間が音声を人物にマッピングするまで、ラベルは「スピーカー 1」を出力します。日記だけからアイデンティティ、役割、性別、意図を推測しないでください。
分離オンとオフを比較します。バックグラウンド ミュージックを使用した録音を改善できますが、積極的な処理により、呼吸、静かな会話、または重複が損なわれる可能性があります。変更されていないソース、処理されたトラック、設定を保存します。証拠やアーカイブの整合性が重要な場合は、オリジナルをハッシュし、コピーを編集します。
字幕 QA: 言葉は仕事の半分に過ぎません
| チェックする | 実践的なルール | 理由 |
|---|---|---|
| タイミング | 音声とともにキャプションが表示され、十分な読書時間を確保できます。 | 字幕が遅いと理解力が低下する |
| 改行 | 密接に結びついた単語の間ではなく、自然なフレーズで区切る | スキャンの改善 |
| 読書速度 | プラットフォーム/視聴者のアクセシビリティ標準を使用する | 濃いキャプションは読めない |
| サウンドキュー | 必要に応じて意味のある非音声音声を追加する | アクセシビリティには対話以上のものが含まれます |
| スピーカーの変更 | 乱雑にせずに明確な変更を行う | インタビューやパネルディスカッションで重要なこと |
| 名前/番号 | 信頼できるコンテキストに対して手動で検証する | 小さな転記ミスが意味を変える可能性がある |
Buzz は TXT、SRT、および VTT をエクスポートします。プロジェクトでは、現在の製品資料で CSV エクスポートについても説明します。宛先のエディターまたはプラットフォームに対して正確な形式をテストします。 UTF-8 文字を保持し、最初、中間、最後のセクションのずれを検査します。
ライブ文字起こしではレイテンシーバジェットがより厳しくなります
公式ドキュメントでは、ローカルマイクの文字起こしはリソースを大量に消費し、リアルタイムではない可能性があると警告しています。イベント期間全体にわたって、キャプチャから表示までの遅延、音声の欠落、補正の安定性、サーマル スロットルを測定します。有線マイクを使用し、スリープを無効にします。重要なアクセシビリティ イベントについては、人間によるキャプショナまたはフォールバック ディスプレイを用意します。
Buzz は、プレゼンテーション ウィンドウと、OBS などのソフトウェアにフィードできるオプションのライブ トランスクリプト エクスポートを提供します。プリファレンスには、トランスクリプトまたは翻訳テキストをサーバーに POST できるアップロード URL も文書化されています。これを有効にすると、ローカル ワークフローがネットワーク公開に変わります。受信者を認証し、トランスポートを暗号化し、エンドポイントの公開を回避します。
プライバシーとローカル処理の検証
- 隔離された環境に入る前にモデルをダウンロードし、テスト中にアウトバウンド接続を監視します。
- クラウド処理が禁止されている場合は、ローカル バックエンドを選択し、API キーを空のままにしておきます。
- 明示的に承認されない限り、ライブ アップロードと外部翻訳を無効にします。
- 一時ファイル、エクスポート フォルダー、最近使用したファイルのリスト、クラッシュ ログ、OS バックアップを確認します。
- デバイスと録画ストレージを暗号化します。保持ポリシーに従って作業コピーを削除します。
- 管轄区域および環境に応じて適切な録音および転写の同意を取得します。
オープンソース コードは検査可能性を向上させますが、バイナリが安全であることを証明するものではありません。公式リリース チャネルを通じてダウンロードし、提供されている場合は署名またはチェックサムを検証し、依存関係を最新に保ち、組織のポリシーに基づいてインストール アーティファクトをスキャンします。
ハードウェアとスループットの決定
リアルタイム係数を測定します。処理秒数をオーディオ秒数で割ります。値 0.5 は、1 時間の音声に約 30 分かかることを意味します。 2.0 は約 2 時間を意味します。モデル、バックエンド、量子化、デバイス、加速度、ファイル形式、バッチ サイズ、ピーク メモリを記録します。ラップトップのバッテリー、熱、同時編集により、結果が大きく変わる可能性があります。
量子化によりメモリが削減され、速度が向上しますが、場合によっては精度が犠牲になります。 Vulkan サポートにより、より広範囲の GPU で Whisper.cpp を高速化できますが、CUDA および Apple Silicon パスには独自の互換性条件があります。実際のマシンでのクリーンなベンチマークは、一般的なハードウェアの主張よりも信頼できます。
CLIとバッチ自動化
Buzz CLI は、ファイルまたは URL の追加、転写または翻訳の選択、バックエンド/モデル/言語の選択、初期プロンプトの提供、SRT、VTT、または TXT のエクスポートを行うことができます。 GUI を非表示にできるため、監視フォルダーやメディア パイプラインに役立ちます。自動化には、衝突安全なファイル名、終了コードのチェック、ログ、障害の隔離が依然として必要です。
uzz add --task transcribe -- language en --model-type Whispercpp --model-size small --prompt "Names: Ada Lovelace、Babbage" --srt --vtt Interview.mp4
インストールされているバージョンに対して CLI オプションを確認します。リリースを運用環境に固定し、アップグレード後に既知のフィクスチャを実行します。字幕のセグメンテーションやバックエンドの変更により、コマンドが成功した場合でもダウンストリームの差分が変更される可能性があります。
代替案
| オプション | ベストフィット | トレードオフと Buzz |
|---|---|---|
| Buzz | クロスプラットフォームのローカル GUI と複数の Whisper バックエンド | デスクトップ リソースと手動の QA が引き続き必要 |
| Whisper.cpp CLI | 無駄のないローカルまたは組み込みオートメーション | あまり統合されていない編集ワークフロー |
| Faster Whisper スクリプト | カスタム GPU バッチ パイプライン | エンジニアリングと依存関係の管理の強化 |
| OpenAI 音声テキスト変換 API | 管理されたスケールと最小限のローカル コンピューティング | アップロード、価格設定、プロバイダー条件 |
| Descript / プレミア テキスト ツール | 編集スイート内での文字起こし | 商用エコシステムとローカル制御の低下 |
| 人間による文字起こし/キャプション | 一か八かのアクセシビリティまたは出版 | 直接コストは高くなりますが、責任ある状況に応じたレビューが可能 |
よくある質問
Buzz は無料ですか?
公式リポジトリは MIT ライセンスを取得しており、デスクトップ ソフトウェアはサブスクリプションなしで使用できます。ホストされた API、ハードウェアおよびサードパーティ モデルでは、別途コストが発生する場合があります。
Buzz は完全にオフラインで動作しますか?
必要なアセットが利用可能になった後、構成済みのローカル モデル ワークフローの場合は「はい」です。 API 文字起こし、外部翻訳、URL インポート、ライブ アップロードにはネットワークが使用されます。
どのオペレーティング システムがサポートされていますか?
このプロジェクトでは、プラットフォーム固有のディストリビューションとアクセラレーションのオプションを備えた macOS、Windows、Linux について文書化しています。
字幕を作成できますか?
はい。 SRT や VTT などの時間指定フォーマットをエクスポートします。人間によるタイミング、読みやすさ、用語の見直しは引き続き必要です。
発言者を特定できるのでしょうか?
転写されたメディアでの話者の識別をサポートしていますが、ラベルは人間による検証が必要であり、生体認証による身元証明ではありません。
英語以外の言語に翻訳できますか?
Buzz は、ローカル エンドポイントを含む、構成可能な OpenAI 互換の AI サービスを介した追加の変換を文書化します。プライバシーと翻訳の品質を個別に検証します。
転写が遅いのはなぜですか?
モデルのサイズ、バックエンド、量子化、アクセラレーション、オーディオの長さ、ハードウェアがすべて重要です。ハードウェアを購入する前に、より小規模なモデルと最適化されたバックエンドをベンチマークします。
一次情報源
- 公式 Buzz リポジトリとライセンス
- 公式機能ドキュメント
- 公式インストールガイド
- ファイルのインポートとモデルの設定
- ライブレコーディングのご案内
- 翻訳動作
- ビューアと編集機能
- CLI リファレンス
- 公式リリース履歴
最終レビュー日は 2026 年 7 月 25 日です。代表的なオーディオで正確な Buzz リリースとバックエンドをテストします。モデルのサポート、アクセラレーション、および配布パッケージは時間の経過とともに変化します。


