VoxCPM
VoxCPM

VoxCPM

VoxCPM2 は、OpenBMB の Apache-2.0 トークナイザー不要の 30 言語対応 2B テキスト読み上げモデル、音声設計、制御可能なクローン作成、ストリーミング、微調整、および 48kHz 出力を備えています。このガイドでは、モード、展開、評価、同意、出所、および代替手段について説明します。

79

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

音声合成音声クローン多言語音声オープンソースTTS

Product Preview

A quick visual look at VoxCPM before you visit the official site.

Published 6/16/2026
VoxCPM screenshot

Editorial Review

About VoxCPM

VoxCPM2 は、OpenBMB のトークナイザーを使用しない音声生成スタックの現在のメジャー リリースです。 20 億パラメータのモデルは、200 万時間以上の多言語音声でトレーニングされていると説明されており、30 の言語、リストされた 9 つの中国語方言グループ、テキストのみの音声設計、リファレンスベースの音声クローン、リファレンスとトランスクリプトの継続、ストリーミング生成、SFT/LoRA アダプテーション、およびネイティブ 48kHz 出力をサポートしています。コードと重みは Apache-2.0 に基づいてリリースされます。

これらの機能により、自己ホスト型ナレーション、多言語アシスタント、ゲーム キャラクター、アクセシビリティ プロトタイプ、および制御されたブランド音声に関連するようになります。また、アイデンティティ ガバナンスも不可欠なものとなります。技術的にオープンなモデルとは、人の声をコピーしたり、リスナーに誤解を与えたり、同意のない録音を使用したりすることを許可するものではありません。

Hand-drawn consent-first VoxCPM2 workflow covering identity and consent, scoped reference audio, generation, human QA, provenance labeling and revocation
音声の品質は生産の 1 つのゲートにすぎません。導入可能なワークフローには、本人確認、書面化された範囲、管理されたデータ、人間による聴取、開示、出所、および取り消しまたは悪用への対応方法が必要です。

さまざまなジョブを解決する 4 つの生成モード

モード入力最適な使用方法主なリスク
テキスト読み上げテキストと生成の設定中立的なナレーションとベースライン明瞭度テスト制御されていない音声アイデンティティまたは一貫性のない長い形式の韻律
音声デザインテキストの先頭に追加される自然言語の説明リファレンスオーディオを使用せずに新しいボイスを作成するプロンプト属性はシードごとに異なる可能性があり、認識可能なアイデンティティに移行する可能性があります
制御可能なクローン作成短いリファレンス クリップ。オプションのスタイル指示ペース、感情、表現をコントロールしながら音色を維持同意、偽装、および参照スタイルとコントロール プロンプトの間の競合
究極のクローン作成リファレンスオーディオと正確なトランスクリプト、オプションで音色リファレンスとして再利用リズムやボーカルのニュアンスを維持した類似性の高い継続性不正確な転写は継続性を低下させ、強い類似性は誤用の影響を増大させます

どのデモが最も印象的かではなく、製品の要件に応じてモードを選択してください。架空のキャラクターは、音声デザインによってより安全で制御しやすい可能性があります。契約したアクターは、継続性のためにクローンを作成する必要がある場合がありますが、それは合意された言語、文字、メディア、地域、用語内でのみ必要です。参照とト​​ランスクリプトの継続は、類似性が重要であり、トランスクリプトを正確に検証できる場合に役立ちます。

アーキテクチャと「トークナイザーフリー」の意味

VoxCPM2 は、最初にオーディオを一連の個別のコーデック トークンに変換するのではなく、連続した音声表現を生成します。公式資料では、MiniCPM-4 をバックボーンとして使用し、LocEnc、TSLM、RALM、LocDiT ステージを介して AudioVAE V2 潜在空間で動作する拡散自己回帰システムについて説明しています。言語モデルのトークン レートは 6.25 Hz と記載されています。

トークナイザーが不要であることは、テキスト処理がなくなることや、発音が自動的に正確になることを意味するものではありません。テキストの正規化、数字、略語、名前、句読点、コード切り替え、および言語固有の読み取り規則により、出力が形成されます。モデルは文脈から韻律を推測できますが、間違いが重要な場合は、プロダクション スクリプトで発音と休止を明示する必要があります。

現在のモデルの事実とその限界

正式仕様報告値それをどう解釈するか
モデルサイズ2Bパラメータ、BF16モデルカードモデルのメモリとランタイム、VAE、キャッシュ、同時リクエストのオーバーヘッドを計画します。
言語リストされている 30 の言語とリストされている中国語の方言サポートの品質は同等ではありません。各ターゲット言語、アクセント、ドメインをテストする
基準/出力レート16kHz 基準を受け入れます。 48kHz出力を生成しますサンプルレートが高いと、ノイズの多いソースオーディオから失われたアイデンティティの詳細を復元できません
VRAM公式比較では約8GB構成固有の推定値であり、すべての入力スタックまたはサービングスタックを保証するものではありません
RTX 4090 の RTF標準約0.30。 Nano-vLLM の場合は約 0.13ベンダーが報告した単一ハードウェアの結果。ベンチマークの同時実行性と最初のチャンクのレイテンシ
最大シーケンスモデルカード内のトークンは 8,192 個長い入力は依然として不安定になる可能性があるため、言語構造によって分割する必要があります
ライセンスApache-2.0ソフトウェア/分銅の商用利用を許可します。音声、スクリプト、またはデータの権利を付与しません

クイックスタート

pip インストール voxcpm

voxcpm インポート VoxCPM から
サウンドファイルをSFとしてインポート

モデル = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=False、
)
wav = モデル.生成(
    text="短いレビュー済みの実稼働テスト。",
    cfg_value=2.0、
    inference_timesteps=10、
    シード=42、
)
sf.write("test.wav", wav, model.tts_model.sample_rate)

リポジトリには、プライマリ パスとして Python 3.10 ~ 3.12、PyTorch 2.5 以降、および CUDA 12 以降がリストされています。また、デモ用の CPU、MPS、CUDA、スループット用の Nano-vLLM、マルチテナント サービス用の vLLM-Omni、CPU 用の独立した llama.cpp-omni GGUF パス、Metal、CUDA またはVulkan。各ランタイムを、独自の数値出力、レイテンシ、サポートされているフラグ、メンテナンス ステータスを備えた個別の製品構成として扱います。

参考音声チェックリスト

  • 講演者、許可された使用、言語、メディア、聴衆、地理、期間、モデルのトレーニング/クローン作成、および失効パスを指定した書面による同意を取得します。
  • 音楽、部屋のエコー、エフェクト、圧縮ポンピング、または別の音声を含まない、クリーンなシングルスピーカーオーディオをキャプチャします。
  • 自然なバリエーションを維持しますが、感情が望ましいニュートラルなアイデンティティのベースラインと矛盾するクリップは避けてください。
  • 継続的にクローンを作成するには、すべての話された単語、フィラー、および関連する句読点を正確に書き写します。記録を「クリーンアップ」しないでください。
  • ソース ファイルをハッシュし、暗号化し、アクセスを制限し、同意メタデータをアセット ワークフロー内に曖昧に埋め込まずに横に保持します。
  • 参照に削除すべき機密性の高い発言、個人的な背景の発言、またはメタデータが含まれているかどうかをテストします。

音声品質を評価する方法

次元測定失敗例
わかりやすさ強力な ASR と人間による記録のレビューによる WER/CER名前、否定、数字、または薬物用語の変更
スピーカーの類似性盲検聴取者の評価と話者埋め込みの類似性音色はリファレンスに似ていますが、段落ごとに同一性が漂います
韻律リズム、ストレス、休止、感情、スタイルの遵守に関する人間による評価深刻な内容や不自然なフレーズの区切りを明るく伝える
オーディオの完全性クリック、クリッピング、ノイズフロア、繰り返し、ドロップアウト、スペクトル異常48kHz ファイルには高周波アーティファクトまたは繰り返される音節が含まれています
長い形式の安定性分/セグメントごとのエラーとアイデンティティのドリフト数段落後に声が変わる
ストリーミング体験最初のオーディオまでの時間、ギャップ レート、チャンクの連続性、負荷時の RTF平均生成は速いが、継ぎ目が聞こえるか、最初のチャンクが遅延する
安全性不正なアイデンティティ、許可されていないスクリプトおよび来歴のテストサービスは同意制御なしであらゆるパブリック クリップを受け入れます

このリポジトリは、Seed-TTS-eval、多言語および命令制御の結果を公開します。これらのテーブルは、個人的な評価を置き換えるものではなく、仮説を立てるのに役立ちます。一部の結果は内部的なものであり、自動転写または類似性モデルを使用します。公開ベンチマーク平均では、製品にとって重要なアクセント、数値、ドメインが隠蔽される可能性があります。

生産評価プロトコル

  1. 音声コントラクトを定義します。 アイデンティティ、許容されるスタイル、発音ガイド、開示および禁止されているコンテンツを指定します。
  2. 多言語テスト セットを構築します。 ネイティブのレビュー担当者、コード切り替え、名前、日付、通貨、頭字語、感情の変化、難しい句読点などを含めます。
  3. 固定シードとさまざまなシードを実行します。 固定シードは回帰テストをサポートします。多様な種子は世代の差異を明らかにします。
  4. モードを比較します。 音声設計、基本的なクローン作成、トランスクリプト条件付き継続は、それぞれが法的に許可されている場合にのみテストしてください。
  5. 長いスクリプトをセグメント化します。 セマンティック境界で分割し、スタイル状態を維持し、結合全体をリッスンします。
  6. 選択したランタイムの負荷テストを行います。 GPU メモリ、最初のチャンクのレイテンシ、RTF、スループット、キューイング、障害回復をキャプチャします。
  7. レッドチームのアイデンティティ侵害。 著名人のクリップ、一致しない同意、禁止されたスクリプト、および開示を削除する試みを試してください。
  8. 証拠をアーカイブします。 モデル/リビジョン、ランタイム、プロンプト、シード、設定、参照ハッシュ、レビュー担当者、同意および出力ハッシュを保存します。

導入の選択肢

パスこんな方に最適検証する
標準 PyTorchリサーチ、オフライン生成、機能探索VRAM、再現性、パッケージのバージョン、バッチ動作
Nano-vLLM-VoxCPM同時 GPU サービスとそれ以下のレポート RTFAPI 成熟度、バッチ処理、ストリーミング、メトリクス、バージョンの互換性
vLLM-OmniOpenAI 互換のエンドポイント、連続バッチ処理、およびマルチ GPU 操作急速に進化するインストール、認証、クォータ、分離、および正確な機能の同等性
llama.cpp-omniエッジ/オンデバイス CPU、Metal、CUDA、または Vulkan (GGUF アーティファクトあり)量子化後の品質、RTF、メモリ、サポートされているモード、および独立したプロジェクトのメンテナンス
管理された音声 APIホストされたスケール、モデレーション、サポートを好むチーム音声の権利、保持、地域的な処理、コスト、ベンダーへの依存性

同意、開示、インシデント対応

Apache-2.0 は、リリースされたソフトウェアと重みを管理します。パブリシティ権、台本や録音の著作権、労働権、生体認証の同意、商標の許可、または欺く権利を付与するものではありません。要件は管轄区域や状況によって異なるため、実在の人物のクローン作成や影響の大きい使用については、適格な法的審査を受けてください。

  • 同意範囲と発言者の身元が確認されるまで、クローン作成をブロックします。
  • リスナーが誤解を招く可能性があるユーザー インターフェイスおよびコンテンツ内の合成音声にラベルを付けます。
  • 来歴メタデータまたは透かしは削除できることを認識した上で、利用可能な場合は使用します。
  • 音声資産が承認されたプロジェクト以外にエクスポートまたは再利用されるのを防ぎます。
  • 検索可能な出力来歴を使用して、迅速な削除、取り消し、およびインシデントのプロセスを作成します。
  • 特別な管理と法的根拠なしに、認証、緊急指示、政治的説得、財政的認可、なりすましのためにクローン音声を決して導入しないでください。

代替案

オプション潜在的な利点注意深く比較してください
VoxCPM2設計、クローン作成、微調整、複数のランタイムを組み合わせたオープンな 30 言語スタック言語ごとの品質、ランタイムの成熟度、ガバナンスとコンピューティング
CosyVoice多言語のオープンスピーチファミリーとクローン作成ワークフローを確立言語範囲、ライセンス/バージョン、ストリーミングおよびスタイル制御
Fish Speechアクティブなエコシステムによる表現力豊かなオープンスピーチの生成モデル/ライセンスの種類、ハードウェアおよび評価の同等性
XTTS使い慣れた多言語クローン作成ワークフローと広範なコミュニティ資料現在のメンテナンス、モデルライセンス、品質と言語のニーズ
ElevenLabs管理された API、製品ツールと運用上の利便性定期的なコスト、同意制御、保持、セルフホスティングのニーズ
プロの声優指示されたパフォーマンス、明示的な契約、微妙な長文の納品スケジュールとプロジェクトごとのコストが削減され、多くの場合、アイデンティティと品質のリスクが軽減されます。

よくある質問

VoxCPM2 は商用利用が無料ですか?

公式リポジトリとモデル カードは Apache-2.0 を使用します。商用展開には、テキスト、参考録音、話者の身元および使用目的に対する権利が依然として必要です。

48kHz はスタジオ品質を保証しますか?

いいえ。サンプルレートは出力帯域幅を表すものであり、発音、パフォーマンス、録音のきれいさ、アーティファクトの有無を表すものではありません。完全な信号を聞いて測定します。

どれくらいの GPU メモリが必要ですか?

公式の比較では、VoxCPM2 について約 8 GB と記載されています。実行時間、同時実行性、入力長、および処理エンジンは、実際のピーク メモリに影響します。ヘッドルームを使ってテストします。

Apple Silicon で実行できますか?

デモでは MPS の選択について説明し、llama.cpp-omni では Metal/GGUF の実行について説明します。リポジトリは、Apple M4 Pro 上の Q8_0 の 1.76 付近の RTF の実例を報告しています。あなたのマシン上で再現します。

どれくらいのリファレンスオーディオが必要ですか?

このモデルは短いクリップからのクローン作成をサポートしていますが、微調整ガイダンスでは 5 ~ 10 分でスピーカー/ドメインを適応させることができると述べています。クリーンで代表的な、同意された音声は、普遍的な持続時間よりも重要です。

30 の言語はすべて同じように優れていますか?

いいえ。公式の制限では、トレーニング データの可用性によってパフォーマンスが変化することが明示されています。ロケールごとにネイティブ レビュアーとドメイン固有のスクリプトを使用します。

一次情報源

最終レビュー日は 2026 年 7 月 25 日です。ハードウェア、ベンチマーク、トレーニングに関する記載は公式プロジェクトに帰属します。運用環境で使用する前に、現在のリビジョン、依存関係、法律、および同意契約を確認してください。

Ready to try VoxCPM?

Visit the official website to get started

Visit VoxCPM

Quick Info

Added
6/2/2026
Published
6/16/2026
Updated
8/9/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Index TTS

Index TTS

IndexTTSはBilibiliのオープンソース、産業レベルの制御可能で効率的なゼロショットTTSシステムです。完成したWeb音声アプリではなく、音声研究者と開発者向けの実験プロジェクトです。

Index TTStext to speechzero-shot TTS
1040
Azure Text to Speech

Azure Text to Speech

The best and most realistic voice tools currently available - スマートな AI ツールで生産性を向上。

text-to-speech
870
Hailuo AI TTS

Hailuo AI TTS

Hailuo AI TTSは、MiniMax Audioと関連する多言語テキスト読み上げ、AI音声、音声クローン向けの音声生成ツールです。

Hailuo AI TTSMiniMax Audiotext to speech
720
Coqui TTS

Coqui TTS

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - スマートな AI ツールで生産性を向上。

text-to-speechfree
880