VoxCPM2 は、OpenBMB のトークナイザーを使用しない音声生成スタックの現在のメジャー リリースです。 20 億パラメータのモデルは、200 万時間以上の多言語音声でトレーニングされていると説明されており、30 の言語、リストされた 9 つの中国語方言グループ、テキストのみの音声設計、リファレンスベースの音声クローン、リファレンスとトランスクリプトの継続、ストリーミング生成、SFT/LoRA アダプテーション、およびネイティブ 48kHz 出力をサポートしています。コードと重みは Apache-2.0 に基づいてリリースされます。
これらの機能により、自己ホスト型ナレーション、多言語アシスタント、ゲーム キャラクター、アクセシビリティ プロトタイプ、および制御されたブランド音声に関連するようになります。また、アイデンティティ ガバナンスも不可欠なものとなります。技術的にオープンなモデルとは、人の声をコピーしたり、リスナーに誤解を与えたり、同意のない録音を使用したりすることを許可するものではありません。
さまざまなジョブを解決する 4 つの生成モード
| モード | 入力 | 最適な使用方法 | 主なリスク |
|---|---|---|---|
| テキスト読み上げ | テキストと生成の設定 | 中立的なナレーションとベースライン明瞭度テスト | 制御されていない音声アイデンティティまたは一貫性のない長い形式の韻律 |
| 音声デザイン | テキストの先頭に追加される自然言語の説明 | リファレンスオーディオを使用せずに新しいボイスを作成する | プロンプト属性はシードごとに異なる可能性があり、認識可能なアイデンティティに移行する可能性があります |
| 制御可能なクローン作成 | 短いリファレンス クリップ。オプションのスタイル指示 | ペース、感情、表現をコントロールしながら音色を維持 | 同意、偽装、および参照スタイルとコントロール プロンプトの間の競合 |
| 究極のクローン作成 | リファレンスオーディオと正確なトランスクリプト、オプションで音色リファレンスとして再利用 | リズムやボーカルのニュアンスを維持した類似性の高い継続性 | 不正確な転写は継続性を低下させ、強い類似性は誤用の影響を増大させます |
どのデモが最も印象的かではなく、製品の要件に応じてモードを選択してください。架空のキャラクターは、音声デザインによってより安全で制御しやすい可能性があります。契約したアクターは、継続性のためにクローンを作成する必要がある場合がありますが、それは合意された言語、文字、メディア、地域、用語内でのみ必要です。参照とトランスクリプトの継続は、類似性が重要であり、トランスクリプトを正確に検証できる場合に役立ちます。
アーキテクチャと「トークナイザーフリー」の意味
VoxCPM2 は、最初にオーディオを一連の個別のコーデック トークンに変換するのではなく、連続した音声表現を生成します。公式資料では、MiniCPM-4 をバックボーンとして使用し、LocEnc、TSLM、RALM、LocDiT ステージを介して AudioVAE V2 潜在空間で動作する拡散自己回帰システムについて説明しています。言語モデルのトークン レートは 6.25 Hz と記載されています。
トークナイザーが不要であることは、テキスト処理がなくなることや、発音が自動的に正確になることを意味するものではありません。テキストの正規化、数字、略語、名前、句読点、コード切り替え、および言語固有の読み取り規則により、出力が形成されます。モデルは文脈から韻律を推測できますが、間違いが重要な場合は、プロダクション スクリプトで発音と休止を明示する必要があります。
現在のモデルの事実とその限界
| 正式仕様 | 報告値 | それをどう解釈するか |
|---|---|---|
| モデルサイズ | 2Bパラメータ、BF16モデルカード | モデルのメモリとランタイム、VAE、キャッシュ、同時リクエストのオーバーヘッドを計画します。 |
| 言語 | リストされている 30 の言語とリストされている中国語の方言 | サポートの品質は同等ではありません。各ターゲット言語、アクセント、ドメインをテストする |
| 基準/出力レート | 16kHz 基準を受け入れます。 48kHz出力を生成します | サンプルレートが高いと、ノイズの多いソースオーディオから失われたアイデンティティの詳細を復元できません |
| VRAM | 公式比較では約8GB | 構成固有の推定値であり、すべての入力スタックまたはサービングスタックを保証するものではありません |
| RTX 4090 の RTF | 標準約0.30。 Nano-vLLM の場合は約 0.13 | ベンダーが報告した単一ハードウェアの結果。ベンチマークの同時実行性と最初のチャンクのレイテンシ |
| 最大シーケンス | モデルカード内のトークンは 8,192 個 | 長い入力は依然として不安定になる可能性があるため、言語構造によって分割する必要があります |
| ライセンス | Apache-2.0 | ソフトウェア/分銅の商用利用を許可します。音声、スクリプト、またはデータの権利を付与しません |
クイックスタート
pip インストール voxcpm
voxcpm インポート VoxCPM から
サウンドファイルをSFとしてインポート
モデル = VoxCPM.from_pretrained(
"openbmb/VoxCPM2",
load_denoiser=False、
)
wav = モデル.生成(
text="短いレビュー済みの実稼働テスト。",
cfg_value=2.0、
inference_timesteps=10、
シード=42、
)
sf.write("test.wav", wav, model.tts_model.sample_rate)
リポジトリには、プライマリ パスとして Python 3.10 ~ 3.12、PyTorch 2.5 以降、および CUDA 12 以降がリストされています。また、デモ用の CPU、MPS、CUDA、スループット用の Nano-vLLM、マルチテナント サービス用の vLLM-Omni、CPU 用の独立した llama.cpp-omni GGUF パス、Metal、CUDA またはVulkan。各ランタイムを、独自の数値出力、レイテンシ、サポートされているフラグ、メンテナンス ステータスを備えた個別の製品構成として扱います。
参考音声チェックリスト
- 講演者、許可された使用、言語、メディア、聴衆、地理、期間、モデルのトレーニング/クローン作成、および失効パスを指定した書面による同意を取得します。
- 音楽、部屋のエコー、エフェクト、圧縮ポンピング、または別の音声を含まない、クリーンなシングルスピーカーオーディオをキャプチャします。
- 自然なバリエーションを維持しますが、感情が望ましいニュートラルなアイデンティティのベースラインと矛盾するクリップは避けてください。
- 継続的にクローンを作成するには、すべての話された単語、フィラー、および関連する句読点を正確に書き写します。記録を「クリーンアップ」しないでください。
- ソース ファイルをハッシュし、暗号化し、アクセスを制限し、同意メタデータをアセット ワークフロー内に曖昧に埋め込まずに横に保持します。
- 参照に削除すべき機密性の高い発言、個人的な背景の発言、またはメタデータが含まれているかどうかをテストします。
音声品質を評価する方法
| 次元 | 測定 | 失敗例 |
|---|---|---|
| わかりやすさ | 強力な ASR と人間による記録のレビューによる WER/CER | 名前、否定、数字、または薬物用語の変更 |
| スピーカーの類似性 | 盲検聴取者の評価と話者埋め込みの類似性 | 音色はリファレンスに似ていますが、段落ごとに同一性が漂います |
| 韻律 | リズム、ストレス、休止、感情、スタイルの遵守に関する人間による評価 | 深刻な内容や不自然なフレーズの区切りを明るく伝える |
| オーディオの完全性 | クリック、クリッピング、ノイズフロア、繰り返し、ドロップアウト、スペクトル異常 | 48kHz ファイルには高周波アーティファクトまたは繰り返される音節が含まれています |
| 長い形式の安定性 | 分/セグメントごとのエラーとアイデンティティのドリフト | 数段落後に声が変わる |
| ストリーミング体験 | 最初のオーディオまでの時間、ギャップ レート、チャンクの連続性、負荷時の RTF | 平均生成は速いが、継ぎ目が聞こえるか、最初のチャンクが遅延する |
| 安全性 | 不正なアイデンティティ、許可されていないスクリプトおよび来歴のテスト | サービスは同意制御なしであらゆるパブリック クリップを受け入れます |
このリポジトリは、Seed-TTS-eval、多言語および命令制御の結果を公開します。これらのテーブルは、個人的な評価を置き換えるものではなく、仮説を立てるのに役立ちます。一部の結果は内部的なものであり、自動転写または類似性モデルを使用します。公開ベンチマーク平均では、製品にとって重要なアクセント、数値、ドメインが隠蔽される可能性があります。
生産評価プロトコル
- 音声コントラクトを定義します。 アイデンティティ、許容されるスタイル、発音ガイド、開示および禁止されているコンテンツを指定します。
- 多言語テスト セットを構築します。 ネイティブのレビュー担当者、コード切り替え、名前、日付、通貨、頭字語、感情の変化、難しい句読点などを含めます。
- 固定シードとさまざまなシードを実行します。 固定シードは回帰テストをサポートします。多様な種子は世代の差異を明らかにします。
- モードを比較します。 音声設計、基本的なクローン作成、トランスクリプト条件付き継続は、それぞれが法的に許可されている場合にのみテストしてください。
- 長いスクリプトをセグメント化します。 セマンティック境界で分割し、スタイル状態を維持し、結合全体をリッスンします。
- 選択したランタイムの負荷テストを行います。 GPU メモリ、最初のチャンクのレイテンシ、RTF、スループット、キューイング、障害回復をキャプチャします。
- レッドチームのアイデンティティ侵害。 著名人のクリップ、一致しない同意、禁止されたスクリプト、および開示を削除する試みを試してください。
- 証拠をアーカイブします。 モデル/リビジョン、ランタイム、プロンプト、シード、設定、参照ハッシュ、レビュー担当者、同意および出力ハッシュを保存します。
導入の選択肢
| パス | こんな方に最適 | 検証する |
|---|---|---|
| 標準 PyTorch | リサーチ、オフライン生成、機能探索 | VRAM、再現性、パッケージのバージョン、バッチ動作 |
| Nano-vLLM-VoxCPM | 同時 GPU サービスとそれ以下のレポート RTF | API 成熟度、バッチ処理、ストリーミング、メトリクス、バージョンの互換性 |
| vLLM-Omni | OpenAI 互換のエンドポイント、連続バッチ処理、およびマルチ GPU 操作 | 急速に進化するインストール、認証、クォータ、分離、および正確な機能の同等性 |
| llama.cpp-omni | エッジ/オンデバイス CPU、Metal、CUDA、または Vulkan (GGUF アーティファクトあり) | 量子化後の品質、RTF、メモリ、サポートされているモード、および独立したプロジェクトのメンテナンス |
| 管理された音声 API | ホストされたスケール、モデレーション、サポートを好むチーム | 音声の権利、保持、地域的な処理、コスト、ベンダーへの依存性 |
同意、開示、インシデント対応
Apache-2.0 は、リリースされたソフトウェアと重みを管理します。パブリシティ権、台本や録音の著作権、労働権、生体認証の同意、商標の許可、または欺く権利を付与するものではありません。要件は管轄区域や状況によって異なるため、実在の人物のクローン作成や影響の大きい使用については、適格な法的審査を受けてください。
- 同意範囲と発言者の身元が確認されるまで、クローン作成をブロックします。
- リスナーが誤解を招く可能性があるユーザー インターフェイスおよびコンテンツ内の合成音声にラベルを付けます。
- 来歴メタデータまたは透かしは削除できることを認識した上で、利用可能な場合は使用します。
- 音声資産が承認されたプロジェクト以外にエクスポートまたは再利用されるのを防ぎます。
- 検索可能な出力来歴を使用して、迅速な削除、取り消し、およびインシデントのプロセスを作成します。
- 特別な管理と法的根拠なしに、認証、緊急指示、政治的説得、財政的認可、なりすましのためにクローン音声を決して導入しないでください。
代替案
| オプション | 潜在的な利点 | 注意深く比較してください |
|---|---|---|
| VoxCPM2 | 設計、クローン作成、微調整、複数のランタイムを組み合わせたオープンな 30 言語スタック | 言語ごとの品質、ランタイムの成熟度、ガバナンスとコンピューティング |
| CosyVoice | 多言語のオープンスピーチファミリーとクローン作成ワークフローを確立 | 言語範囲、ライセンス/バージョン、ストリーミングおよびスタイル制御 |
| Fish Speech | アクティブなエコシステムによる表現力豊かなオープンスピーチの生成 | モデル/ライセンスの種類、ハードウェアおよび評価の同等性 |
| XTTS | 使い慣れた多言語クローン作成ワークフローと広範なコミュニティ資料 | 現在のメンテナンス、モデルライセンス、品質と言語のニーズ |
| ElevenLabs | 管理された API、製品ツールと運用上の利便性 | 定期的なコスト、同意制御、保持、セルフホスティングのニーズ |
| プロの声優 | 指示されたパフォーマンス、明示的な契約、微妙な長文の納品 | スケジュールとプロジェクトごとのコストが削減され、多くの場合、アイデンティティと品質のリスクが軽減されます。 |
よくある質問
VoxCPM2 は商用利用が無料ですか?
公式リポジトリとモデル カードは Apache-2.0 を使用します。商用展開には、テキスト、参考録音、話者の身元および使用目的に対する権利が依然として必要です。
48kHz はスタジオ品質を保証しますか?
いいえ。サンプルレートは出力帯域幅を表すものであり、発音、パフォーマンス、録音のきれいさ、アーティファクトの有無を表すものではありません。完全な信号を聞いて測定します。
どれくらいの GPU メモリが必要ですか?
公式の比較では、VoxCPM2 について約 8 GB と記載されています。実行時間、同時実行性、入力長、および処理エンジンは、実際のピーク メモリに影響します。ヘッドルームを使ってテストします。
Apple Silicon で実行できますか?
デモでは MPS の選択について説明し、llama.cpp-omni では Metal/GGUF の実行について説明します。リポジトリは、Apple M4 Pro 上の Q8_0 の 1.76 付近の RTF の実例を報告しています。あなたのマシン上で再現します。
どれくらいのリファレンスオーディオが必要ですか?
このモデルは短いクリップからのクローン作成をサポートしていますが、微調整ガイダンスでは 5 ~ 10 分でスピーカー/ドメインを適応させることができると述べています。クリーンで代表的な、同意された音声は、普遍的な持続時間よりも重要です。
30 の言語はすべて同じように優れていますか?
いいえ。公式の制限では、トレーニング データの可用性によってパフォーマンスが変化することが明示されています。ロケールごとにネイティブ レビュアーとドメイン固有のスクリプトを使用します。
一次情報源
- 公式 VoxCPM リポジトリ、セットアップ、ベンチマーク、制限事項
- 公式 VoxCPM2 モデル カード
- 公式 VoxCPM ドキュメント
- VoxCPM 技術レポート
- 公式オーディオサンプルとプロジェクトページ
- Apache-2.0 ライセンス ファイル
- vLLM-Omni サービス提供プロジェクト
- llama.cpp-omni エッジ推論プロジェクト
最終レビュー日は 2026 年 7 月 25 日です。ハードウェア、ベンチマーク、トレーニングに関する記載は公式プロジェクトに帰属します。運用環境で使用する前に、現在のリビジョン、依存関係、法律、および同意契約を確認してください。




