So-VITS-SVC は、歌声変換 (SVC) の研究フレームワークです。既存のボーカルパフォーマンスを取得し、その言語内容とメロディーをトレーニングされたターゲット音色でレンダリングします。これはテキスト読み上げではなく、音声モデルは同梱されておらず、法的または倫理的に、パフォーマーのアイデンティティ、ソースソング、またはトレーニング録音に対する権利を提供することはできません。
オリジナル svc-開発チーム/so-vits-svc リポジトリは 2023 年 11 月にアーカイブされ、読み取り専用です。その 4.1-Stable ブランチは依然として広く参照されていますが、現在採用するということは、古い依存関係を固定し、サードパーティのチェックポイントを検証し、メンテナンスに対する全責任を負うことを意味します。 README では学術的使用について説明し、架空の人物の意図を強調し、ユーザーにデータセットの承認を解決するよう要求し、追加の出版/開示条件を設定します。リポジトリを使用する前に、リポジトリの正確な README とライセンスを一緒にお読みください。

SVC は TTS、ボコーダーまたはソース分離ではありません
| テクノロジー | 入力 | 出力 | 提供されないもの |
|---|---|---|---|
| So-VITS-SVC | 歌/話し言葉のソースオーディオ + トレーニングされたターゲットモデル | 目標の音色に向けて同じパフォーマンスを実現 | 歌詞と演奏の生成または使用権 |
| テキスト読み上げ | テキスト + 音声/スタイルのコンディショニング | 新しい音声波形 | 既存の歌唱パフォーマンスを忠実に移植 |
| 歌声合成 | 歌詞、メモ、表現のコントロール | 新歌唱パフォーマンス | 歌手を模倣するための自動的な法的許可 |
| ボコーダー | 音響表現 | 波形 | コンテンツ/音色変換ポリシー |
| ソース分離 | ミックスソング | 推定ボーカル/楽器ステム | クリーンなオリジナルのマルチトラックまたは音声変換 |
パイプライン全体とアーティファクトが入る場所
同意されたターゲットの録音
|
v
クリーン -> セグメント -> リサンプル -> コンテンツ機能 + F0
| |
「----------トレーニング----------」
|
v
ターゲットボイスモデル
|
ソースボーカル -> F0/コンテンツ抽出 -> ジェネレーター -> オプションの拡散
| |
'------ レンダリング -------'
|
ヒューマンオーディオ + 権利 QA
コンテンツ エンコーダは、ソース ID を抑制しながら音声情報を表現しようとします。 F0 はピッチを伝えます。ジェネレーターとボコーダーは、ターゲットの音色でオーディオを再構築します。不完全な絡み合いは「音色漏れ」を引き起こし、ソース歌手の声が聞こえるままになります。分離が悪いと、トレーニング データに楽器やリバーブが追加されます。一貫性のないピッチ抽出によりオクターブジャンプが発生します。クリッピングやサンプルレートの不一致は金属的なアーチファクトになります。
ダウンロードまたはトレーニング前の権利ゲート
技術的に公開された記録は、自動的に合法的なトレーニング データセットになるわけではありません。目的のトレーニング、モデルの保存、協力者、地域、商業的地位、および出力の配布について、特定可能な声優および権利所有者から文書による許可を取得します。リリースされたカバーで使用されている作曲、歌詞、マスター/ソース ボーカル、およびバッキング トラックのライセンスを個別に取得します。
| 資産または権利 | 保管すべき証拠 | よくある間違った思い込み |
|---|---|---|
| 対象となる音声録音 | 出演者の同意と録音/原盤権 | 「オンラインで利用可能」とはトレーニングが可能であることを意味します |
| 声のアイデンティティ/ペルソナ | 範囲、期間、取り消し、および許可されるコンテキスト | ソフトウェアライセンスには肖像権が付与されます |
| ソースボーカル | 録音許可とツール互換条件 | 切り離された幹はあなたのものになります |
| 曲・歌詞 | 該当する場合、構成/機械/同期権限 | 表紙をつけると出版権がなくなる |
| モデル/チェックポイント | 出所、ライセンス、データセット ステートメント、およびチェックサム | ダウンロードページは正規データであることを証明する |
| 最終リリース | プラットフォームポリシーのレビュー、開示、クレジット | 「AI生成」は完全な法的防御である |
他人の認識可能な声で、欺瞞的ななりすまし、詐欺、嫌がらせ、性的コンテンツ、または政治的メッセージを作成しないでください。架空のキャラクターのプロジェクトの場合は、キャラクターと原作の出演権もクリアされていることを確認してください。同意が撤回された場合は、実用的なモデルの削除と配布の削除プロセスを実行します。
データセットの設計: 無差別な期間に勝る品質
同意したターゲットからの、清潔で乾燥した、隔離された録音を使用してください。楽器のブリード、部屋の重いリバーブ、倍増したボーカル、極端なエフェクト、クリッピング、長い沈黙、その他のスピーカーを削除します。互換性のない録音チェーンをやみくもに混合することなく、意図した出力 (ピッチ範囲、母音、子音、音域、ダイナミクス) に一致する表現の多様性を維持します。
ランダムな隣接クリップではなく、連続したソース セッションまたは曲ごとに分割されるため、検証にはトレーニングからのほぼ重複したものが含まれません。チューニングには決して使用されないロックされたテスト セットを保管してください。ファイル ハッシュ、オリジン、同意記録、サンプル レート、期間、前処理ステップ、トランスクリプト/歌詞 (利用可能な場合)、および除外理由を含むマニフェストを管理します。
| データセットのチェック | パス信号 | 修正 |
|---|---|---|
| 孤立 | 伴奏やバックシンガーが聞こえない | 元の茎を使用するか、廃棄します。分離は不完全です |
| レベル | クリッピングはありません。一貫した使用可能な信号 | 慎重に正規化し、推測によって深刻なクリッピングを修復しないでください |
| アイデンティティ | スピーカー ラベルごとに 1 つの認定ターゲット | コラボレーターと群衆の反応を削除する |
| ピッチカバレッジ | 意図した歌唱範囲に一致する | 同意された欠落レジスタを記録する |
| 検証の独立性 | トレーニングのさまざまなセッション/フレーズ | 測定前に再分割 |
| 来歴 | すべてのクリップは許可レコードにマッピングされます | 属性のないファイルを隔離する |
バージョンと依存関係の現実
4.1-Stable README では、テスト済みの安定バージョンとして Python 3.8.9 が報告されており、個別の事前トレーニングされたエンコーダー/ボコーダー アセットが必要です。 2026 年には、これはレガシー環境になります。隔離されたコンテナーまたは仮想マシン内に構築し、ハッシュを固定し、依存関係をスキャンし、不要なネットワーク アクセスを拒否します。古い CUDA または Python パッケージを満たすために、最新のワークステーションをグローバルに弱体化しないでください。
サードパーティのフォーク、ノートブック、GUI、およびモデル パックは別のプロジェクトです。コード、ライセンス、テレメトリ、またはデフォルトのダウンロードが変更される場合があります。上流の祖先、コミット、インストーラーの内容、モデルの来歴を検証します。信頼できない PyTorch チェックポイントをシークレットを含むマシンにロードしないでください。従来のシリアル化形式では、ロード中にコードが実行される可能性があります。
コンテンツエンコーダ、F0、および取得の選択肢
4.1 では、一般的な選択肢として ContentVec バリアントを含む複数の音声エンコーダについて文書化しています。エンコーダの寸法と構成はチェックポイントと一致する必要があります。 4.0 との互換性を確保するには、正しいものを追加する必要がある場合があります スピーチエンコーダ フィールド。異なるブランチのモデルと前処理されたアセットは、普遍的に互換性があるわけではありません。
歌う場合は、堅牢な F0 抽出機能を使用してソース メロディーを保存し、オクターブの動作を検証します。 README では、自動 F0 予測は歌唱時に大幅なピッチシフトを引き起こす可能性があるため、通常は有効にすべきではないと警告しています。特徴の取得またはクラスタリングは、ソース音色の漏れを減らし、場合によっては明瞭さを改善することができますが、混合比が高いとデータセットのアーティファクトがコピーされ、推論が遅くなる可能性があります。文書化された 0.5 の例は、普遍的な最適値ではなく、出発点として扱ってください。
| 制御 | 聞いてください | 設定不良の症状 |
|---|---|---|
| F0抽出器 | 安定したメロディー、ビブラート、有声音/無声音の切り替え | オクターブジャンプ、ロボットピッチ、子音の消失 |
| ピッチシフト | フォルマント崩れのない快適なターゲット範囲 | シマリス/ブーイングトーンと不安定な高音 |
| 検索/クラスタ率 | 記憶されたアーティファクトのないターゲットの類似性 | Buzzing、コピーされたノイズ、または明瞭度の低下 |
| 浅い拡散 | 過剰な処理を行わずに滑らかなディテールを実現 | ぼやけたトランジェントと追加のコンピューティング |
| ノイズスケール/スライス | 自然な質感とフレーズの連続性 | ブレスノイズ、継ぎ目、または一貫性のない音色 |
単一の損失値を追わずにトレーニングする
小規模な構成と監査可能なベースラインから始めます。構成、シード、コードコミット、依存関係ロック、GPU、前処理マニフェスト、およびチェックポイントハッシュを保存します。同意された同じ検証フレーズを定期的にレンダリングします。知覚される自然さ、わかりやすさ、またはターゲットの類似性が停滞または低下する一方で、トレーニングの損失は減少する可能性があります。
コミュニティが推奨する歩数ではなく、ブラインド検証とアーティファクト率に基づいて停止します。トレーニング チェックポイントと公開可能な推論チェックポイントを分離してください。リポジトリには、トレーニングのみのデータを削除し、最終的なサイズを大幅に削減できるモデル圧縮が記述されています。トレーニングの継続が許可されている場合は、元のチェックポイントを管理されたストレージにのみ保存します。
評価: 1 つの「良い音」スコアではなく、3 つの品質
| 次元 | 人間によるテスト | サポート指標 |
|---|---|---|
| 自然さ | 目に見えないフレーズに対するブラインド MOS 評価 | タイプと期間ごとのアーティファクト数 |
| ターゲットの類似性 | ターゲットに対する同意を意識したA/B判定 | 類似したスピーカーを埋め込んでおり、単独で使用されることはありません |
| 内容の正確性 | 歌詞や批判的な言葉を書き写す | 該当する場合、音素/単語エラー |
| ピッチ忠実度 | ミュージシャンがメロディーと表現意図をチェック | F0相関、RMSE、音声エラー |
| ソース漏れ | リスナーは依然としてソース歌手を特定できますか? | ソース/ターゲットの埋め込み傾向を比較 |
| 運用コスト | クリーンな入力からステムが受け入れられるまでの時間 | リアルタイム係数、VRAM、修正分 |
トレーニング セット以外の複数のソース歌手と曲を使用します。高音、低音、息継ぎ部分、速い歌詞、ビブラート、無音などが含まれます。サンプルをランダム化し、システム名を評価者から隠します。最良のデモだけでなく、信頼区間と拒否された出力もレポートします。
ポストプロダクションと開示
ミキシング前に、変換されたボーカルソロを検査します。局所的なアーティファクトのみを修復し、前処理によってドリフトが生じたタイミングを調整し、歯擦音とブレスを制御して、合法的に入手したインストゥルメンタルとミックスします。評価時にモデルの失敗を隠すために重い効果を使用しないでください。
プロジェクトの規約では、プラットフォームにアップロードする入力ソースのボーカル/オーディオの明確な帰属を要求しています。その最小値を超えると、結果を AI 音声変換としてラベル付けし、同意された場合は承認された音声/モデルの所有者を特定し、曲とソースの権利をクレジットし、意味のある編集について説明します。モデルのハッシュ、ソース、設定、同意、最終マスターをリンクするプライベートのプロダクション シートを保存します。
セキュリティと配布管理
- トレーニング データとチェックポイントをロールベースのアクセスで暗号化して保存します。
- チェックサムとモデルカードを公開します。未加工のトレーニング クリップを配布しないでください。
- 契約とアクセス制御を通じてリリースされたモデルの使用を制限します。テキストライセンスだけではコピーを防ぐことはできません。
- ロードする前に、使い捨てのネットワーク制限された環境でチェックポイントをテストします。
- なりすまし、モデルの漏洩、同意の撤回に対するインシデント対応を定義します。
- デモの共有とダウンロードの許可を分離します。レンダリングされたサンプルは重みを公開する必要はありません。
代替案
| オプション | ベストフィット | トレードオフ |
|---|---|---|
| So-VITS-SVC 4.1 | 既知のパイプラインを使用して古い SVC 研究を再現する | アーカイブされたレガシー依存関係とユーザー所有のメンテナンス |
| RVC | アクセス可能な検索ベースの音声変換ワークフロー | 異なるアーキテクチャ/モデルのエコシステムと同じ権利リスク |
| 普及/現代SVC研究 | 現在の品質またはゼロショット手法を評価するチーム | より複雑で不均一な再現性 |
| 認可された商用音声サービス | サポートと明示的な出演者カタログ条件が必要な制作 | コスト、プラットフォームの制限、引き続き必要なソース曲の権利 |
| 同意するボーカリスト | 商用リリース、表現上の方向性と説明責任 | スケジュールと直接の制作コスト |
| 伝統的なボーカル処理 | 本来の認定演奏の訂正 | アイデンティティは変更できませんが、パフォーマーとの関係は維持されます |
よくある質問
So-VITS-SVC はまだ維持されていますか?
元のリポジトリはアーカイブされ、読み取り専用です。フォークはアクティブであってもかまいませんが、個別に評価する必要があります。
歌詞から歌を生み出すのでしょうか?
いいえ、既存のボーカルパフォーマンスを変換します。歌唱合成と TTS は別のタスクです。
音声モデルは含まれますか?
いいえ。公式プロジェクトでは、ユーザーはモデルを個別にトレーニングする必要があると述べています。サードパーティのパックは、上流の貢献者によって承認されていません。
有名人の曲からトレーニングできますか?
録音が公開されているからというだけではありません。適切な音声、演奏、録音、作曲および使用の権利を取得します。
どれくらいのデータ量が必要ですか?
普遍的な分カウントはありません。無差別に収集するよりも、クリーンで代表的で、認可された範囲と独立した検証が重要です。
結果にソース歌手が残るのはなぜですか?
コンテンツの表現は不完全です。よりクリーンなデータ、エンコーダの選択、慎重に調整された取得/クラスタリングにより漏洩は減少する可能性がありますが、削除を保証することはできません。
ダウンロードしたチェックポイントは安全ですか?
自動的ではありません。モデルのシリアル化には実行可能リスクが伴う可能性があるため、出所とハッシュを検証し、隔離された環境でのみロードしてください。
一次情報源
- 公式アーカイブリポジトリ
- 公式 4.1-Stable README、条件およびワークフロー
- 公式中国語 README
- リポジトリライセンス
- 公式設定テンプレート
- VITS ベースの SVC および DSPGAN の研究
- ウィスパーおよびマルチスケール F0 SVC 研究
- So-VITS-SVC を参照する言論間の調査
- 米国著作権局の AI イニシアチブと現在のレポート
最終レビュー日は 2026 年 7 月 25 日です。これは、非常に重要な README 条件が含まれるアーカイブされた研究プロジェクトです。実験や公開の前に、固定されたブランチ、依存関係、ライセンス、およびすべての音声/音楽権限を確認してください。



