So-VITS-SVC
So-VITS-SVC
Active

So-VITS-SVC

So-VITS-SVC 4.1 は、テキスト読み上げではなく、歌声変換のためのアーカイブされたオープンソース研究フレームワークです。この独立したガイドでは、同意、ライセンス、クリーンなデータセット、F0 とエンコーダー、トレーニング、推論、評価、開示、セキュリティ、および代替手段について説明します。

1,141

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

so-vits-svc歌声変換声質変換AI歌声SoftVC VITS音声処理

Product Preview

A quick visual look at So-VITS-SVC before you visit the official site.

Published 1/21/2026
So-VITS-SVC screenshot

Editorial Review

About So-VITS-SVC

So-VITS-SVC は、歌声変換 (SVC) の研究フレームワークです。既存のボーカルパフォーマンスを取得し、その言語内容とメロディーをトレーニングされたターゲット音色でレンダリングします。これはテキスト読み上げではなく、音声モデルは同梱されておらず、法的または倫理的に、パフォーマーのアイデンティティ、ソースソング、またはトレーニング録音に対する権利を提供することはできません。

オリジナル svc-開発チーム/so-vits-svc リポジトリは 2023 年 11 月にアーカイブされ、読み取り専用です。その 4.1-Stable ブランチは依然として広く参照されていますが、現在採用するということは、古い依存関係を固定し、サードパーティのチェックポイントを検証し、メンテナンスに対する全責任を負うことを意味します。 README では学術的使用について説明し、架空の人物の意図を強調し、ユーザーにデータセットの承認を解決するよう要求し、追加の出版/開示条件を設定します。リポジトリを使用する前に、リポジトリの正確な README とライセンスを一緒にお読みください。

Official So-VITS-SVC repository diagram and project media
プロジェクト公式メディア。維持されるアーティファクトは、アーカイブされた研究コードベースであり、ホストされたサービスやライセンスされた音声カタログではありません。

SVC は TTS、ボコーダーまたはソース分離ではありません

テクノロジー入力出力提供されないもの
So-VITS-SVC歌/話し言葉のソースオーディオ + トレーニングされたターゲットモデル目標の音色に向けて同じパフォーマンスを実現歌詞と演奏の生成または使用権
テキスト読み上げテキスト + 音声/スタイルのコンディショニング新しい音声波形既存の歌唱パフォーマンスを忠実に移植
歌声合成歌詞、メモ、表現のコントロール新歌唱パフォーマンス歌手を模倣するための自動的な法的許可
ボコーダー音響表現波形コンテンツ/音色変換ポリシー
ソース分離ミックスソング推定ボーカル/楽器ステムクリーンなオリジナルのマルチトラックまたは音声変換

パイプライン全体とアーティファクトが入る場所

 同意されたターゲットの録音
          |
          v
 クリーン -> セグメント -> リサンプル -> コンテンツ機能 + F0
          |                           |
          「----------トレーニング----------」
                         |
                         v
                 ターゲットボイスモデル
                         |
 ソースボーカル -> F0/コンテンツ抽出 -> ジェネレーター -> オプションの拡散
                         |                    |
                         '------ レンダリング -------'
                                      |
                              ヒューマンオーディオ + 権利 QA

コンテンツ エンコーダは、ソース ID を抑制しながら音声情報を表現しようとします。 F0 はピッチを伝えます。ジェネレーターとボコーダーは、ターゲットの音色でオーディオを再構築します。不完全な絡み合いは「音色漏れ」を引き起こし、ソース歌手の声が聞こえるままになります。分離が悪いと、トレーニング データに楽器やリバーブが追加されます。一貫性のないピッチ抽出によりオクターブジャンプが発生します。クリッピングやサンプルレートの不一致は金属的なアーチファクトになります。

ダウンロードまたはトレーニング前の権利ゲート

技術的に公開された記録は、自動的に合法的なトレーニング データセットになるわけではありません。目的のトレーニング、モデルの保存、協力者、地域、商業的地位、および出力の配布について、特定可能な声優および権利所有者から文書による許可を取得します。リリースされたカバーで使用されている作曲、歌詞、マスター/ソース ボーカル、およびバッキング トラックのライセンスを個別に取得します。

資産または権利保管すべき証拠よくある間違った思い込み
対象となる音声録音出演者の同意と録音/原盤権「オンラインで利用可能」とはトレーニングが可能であることを意味します
声のアイデンティティ/ペルソナ範囲、期間、取り消し、および許可されるコンテキストソフトウェアライセンスには肖像権が付与されます
ソースボーカル録音許可とツール互換条件切り離された幹はあなたのものになります
曲・歌詞該当する場合、構成/機械/同期権限表紙をつけると出版権がなくなる
モデル/チェックポイント出所、ライセンス、データセット ステートメント、およびチェックサムダウンロードページは正規データであることを証明する
最終リリースプラットフォームポリシーのレビュー、開示、クレジット「AI生成」は完全な法的防御である

他人の認識可能な声で、欺瞞的ななりすまし、詐欺、嫌がらせ、性的コンテンツ、または政治的メッセージを作成しないでください。架空のキャラクターのプロジェクトの場合は、キャラクターと原作の出演権もクリアされていることを確認してください。同意が撤回された場合は、実用的なモデルの削除と配布の削除プロセスを実行します。

データセットの設計: 無差別な期間に勝る品質

同意したターゲットからの、清潔で乾燥した、隔離された録音を使用してください。楽器のブリード、部屋の重いリバーブ、倍増したボーカル、極端なエフェクト、クリッピング、長い沈黙、その他のスピーカーを削除します。互換性のない録音チェーンをやみくもに混合することなく、意図した出力 (ピッチ範囲、母音、子音、音域、ダイナミクス) に一致する表現の多様性を維持します。

ランダムな隣接クリップではなく、連続したソース セッションまたは曲ごとに分割されるため、検証にはトレーニングからのほぼ重複したものが含まれません。チューニングには決して使用されないロックされたテスト セットを保管してください。ファイル ハッシュ、オリジン、同意記録、サンプル レート、期間、前処理ステップ、トランスクリプト/歌詞 (利用可能な場合)、および除外理由を含むマニフェストを管理します。

データセットのチェックパス信号修正
孤立伴奏やバックシンガーが聞こえない元の茎を使用するか、廃棄します。分離は不完全です
レベルクリッピングはありません。一貫した使用可能な信号慎重に正規化し、推測によって深刻なクリッピングを修復しないでください
アイデンティティスピーカー ラベルごとに 1 つの認定ターゲットコラボレーターと群衆の反応を削除する
ピッチカバレッジ意図した歌唱範囲に一致する同意された欠落レジスタを記録する
検証の独立性トレーニングのさまざまなセッション/フレーズ測定前に再分割
来歴すべてのクリップは許可レコードにマッピングされます属性のないファイルを隔離する

バージョンと依存関係の現実

4.1-Stable README では、テスト済みの安定バージョンとして Python 3.8.9 が報告されており、個別の事前トレーニングされたエンコーダー/ボコーダー アセットが必要です。 2026 年には、これはレガシー環境になります。隔離されたコンテナーまたは仮想マシン内に構築し、ハッシュを固定し、依存関係をスキャンし、不要なネットワーク アクセスを拒否します。古い CUDA または Python パッケージを満たすために、最新のワークステーションをグローバルに弱体化しないでください。

サードパーティのフォーク、ノートブック、GUI、およびモデル パックは別のプロジェクトです。コード、ライセンス、テレメトリ、またはデフォルトのダウンロードが変更される場合があります。上流の祖先、コミット、インストーラーの内容、モデルの来歴を検証します。信頼できない PyTorch チェックポイントをシークレットを含むマシンにロードしないでください。従来のシリアル化形式では、ロード中にコードが実行される可能性があります。

コンテンツエンコーダ、F0、および取得の選択肢

4.1 では、一般的な選択肢として ContentVec バリアントを含む複数の音声エンコーダについて文書化しています。エンコーダの寸法と構成はチェックポイントと一致する必要があります。 4.0 との互換性を確保するには、正しいものを追加する必要がある場合があります スピーチエンコーダ フィールド。異なるブランチのモデルと前処理されたアセットは、普遍的に互換性があるわけではありません。

歌う場合は、堅牢な F0 抽出機能を使用してソース メロディーを保存し、オクターブの動作を検証します。 README では、自動 F0 予測は歌唱時に大幅なピッチシフトを引き起こす可能性があるため、通常は有効にすべきではないと警告しています。特徴の取得またはクラスタリングは、ソース音色の漏れを減らし、場合によっては明瞭さを改善することができますが、混合比が高いとデータセットのアーティファクトがコピーされ、推論が遅くなる可能性があります。文書化された 0.5 の例は、普遍的な最適値ではなく、出発点として扱ってください。

制御聞いてください設定不良の症状
F0抽出器安定したメロディー、ビブラート、有声音/無声音の切り替えオクターブジャンプ、ロボットピッチ、子音の消失
ピッチシフトフォルマント崩れのない快適なターゲット範囲シマリス/ブーイングトーンと不安定な高音
検索/クラスタ率記憶されたアーティファクトのないターゲットの類似性Buzzing、コピーされたノイズ、または明瞭度の低下
浅い拡散過剰な処理を行わずに滑らかなディテールを実現ぼやけたトランジェントと追加のコンピューティング
ノイズスケール/スライス自然な質感とフレーズの連続性ブレスノイズ、継ぎ目、または一貫性のない音色

単一の損失値を追わずにトレーニングする

小規模な構成と監査可能なベースラインから始めます。構成、シード、コードコミット、依存関係ロック、GPU、前処理マニフェスト、およびチェックポイントハッシュを保存します。同意された同じ検証フレーズを定期的にレンダリングします。知覚される自然さ、わかりやすさ、またはターゲットの類似性が停滞または低下する一方で、トレーニングの損失は減少する可能性があります。

コミュニティが推奨する歩数ではなく、ブラインド検証とアーティファクト率に基づいて停止します。トレーニング チェックポイントと公開可能な推論チェックポイントを分離してください。リポジトリには、トレーニングのみのデータを削除し、最終的なサイズを大幅に削減できるモデル圧縮が記述されています。トレーニングの継続が許可されている場合は、元のチェックポイントを管理されたストレージにのみ保存します。

評価: 1 つの「良い音」スコアではなく、3 つの品質

次元人間によるテストサポート指標
自然さ目に見えないフレーズに対するブラインド MOS 評価タイプと期間ごとのアーティファクト数
ターゲットの類似性ターゲットに対する同意を意識したA/B判定類似したスピーカーを埋め込んでおり、単独で使用されることはありません
内容の正確性歌詞や批判的な言葉を書き写す該当する場合、音素/単語エラー
ピッチ忠実度ミュージシャンがメロディーと表現意図をチェックF0相関、RMSE、音声エラー
ソース漏れリスナーは依然としてソース歌手を特定できますか?ソース/ターゲットの埋め込み傾向を比較
運用コストクリーンな入力からステムが受け入れられるまでの時間リアルタイム係数、VRAM、修正分

トレーニング セット以外の複数のソース歌手と曲を使用します。高音、低音、息継ぎ部分、速い歌詞、ビブラート、無音などが含まれます。サンプルをランダム化し、システム名を評価者から隠します。最良のデモだけでなく、信頼区間と拒否された出力もレポートします。

ポストプロダクションと開示

ミキシング前に、変換されたボーカルソロを検査します。局所的なアーティファクトのみを修復し、前処理によってドリフトが生じたタイミングを調整し、歯擦音とブレスを制御して、合法的に入手したインストゥルメンタルとミックスします。評価時にモデルの失敗を隠すために重い効果を使用しないでください。

プロジェクトの規約では、プラットフォームにアップロードする入力ソースのボーカル/オーディオの明確な帰属を要求しています。その最小値を超えると、結果を AI 音声変換としてラベル付けし、同意された場合は承認された音声/モデルの所有者を特定し、曲とソースの権利をクレジットし、意味のある編集について説明します。モデルのハッシュ、ソース、設定、同意、最終マスターをリンクするプライベートのプロダクション シートを保存します。

セキュリティと配布管理

  • トレーニング データとチェックポイントをロールベースのアクセスで暗号化して保存します。
  • チェックサムとモデルカードを公開します。未加工のトレーニング クリップを配布しないでください。
  • 契約とアクセス制御を通じてリリースされたモデルの使用を制限します。テキストライセンスだけではコピーを防ぐことはできません。
  • ロードする前に、使い捨てのネットワーク制限された環境でチェックポイントをテストします。
  • なりすまし、モデルの漏洩、同意の撤回に対するインシデント対応を定義します。
  • デモの共有とダウンロードの許可を分離します。レンダリングされたサンプルは重みを公開する必要はありません。

代替案

オプションベストフィットトレードオフ
So-VITS-SVC 4.1既知のパイプラインを使用して古い SVC 研究を再現するアーカイブされたレガシー依存関係とユーザー所有のメンテナンス
RVCアクセス可能な検索ベースの音声変換ワークフロー異なるアーキテクチャ/モデルのエコシステムと同じ権利リスク
普及/現代SVC研究現在の品質またはゼロショット手法を評価するチームより複雑で不均一な再現性
認可された商用音声サービスサポートと明示的な出演者カタログ条件が必要な制作コスト、プラットフォームの制限、引き続き必要なソース曲の権利
同意するボーカリスト商用リリース、表現上の方向性と説明責任スケジュールと直接の制作コスト
伝統的なボーカル処理本来の認定演奏の訂正アイデンティティは変更できませんが、パフォーマーとの関係は維持されます

よくある質問

So-VITS-SVC はまだ維持されていますか?

元のリポジトリはアーカイブされ、読み取り専用です。フォークはアクティブであってもかまいませんが、個別に評価する必要があります。

歌詞から歌を生み出すのでしょうか?

いいえ、既存のボーカルパフォーマンスを変換します。歌唱合成と TTS は別のタスクです。

音声モデルは含まれますか?

いいえ。公式プロジェクトでは、ユーザーはモデルを個別にトレーニングする必要があると述べています。サードパーティのパックは、上流の貢献者によって承認されていません。

有名人の曲からトレーニングできますか?

録音が公開されているからというだけではありません。適切な音声、演奏、録音、作曲および使用の権利を取得します。

どれくらいのデータ量が必要ですか?

普遍的な分カウントはありません。無差別に収集するよりも、クリーンで代表的で、認可された範囲と独立した検証が重要です。

結果にソース歌手が残るのはなぜですか?

コンテンツの表現は不完全です。よりクリーンなデータ、エンコーダの選択、慎重に調整された取得/クラスタリングにより漏洩は減少する可能性がありますが、削除を保証することはできません。

ダウンロードしたチェックポイントは安全ですか?

自動的ではありません。モデルのシリアル化には実行可能リスクが伴う可能性があるため、出所とハッシュを検証し、隔離された環境でのみロードしてください。

一次情報源

最終レビュー日は 2026 年 7 月 25 日です。これは、非常に重要な README 条件が含まれるアーカイブされた研究プロジェクトです。実験や公開の前に、固定されたブランチ、依存関係、ライセンス、およびすべての音声/音楽権限を確認してください。

Ready to try So-VITS-SVC?

Visit the official website to get started

Visit So-VITS-SVC

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/3/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Vocal Remover

Vocal Remover

Separate voice from music out of a song free with powerful AI algorithms - スマートな AI ツールで生産性を向上。

voice-processingfree
720
Lalal.ai

Lalal.ai

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - スマートな AI ツールで生産性を向上。

voice-processingfree
760
PollyReach

PollyReach

PollyReach は voice-processing 分野の AI プロダクトで、実運用ワークフローに組み込みたいユーザーに向いています。

voice-processingAI ツール
720
Klariqo

Klariqo

Klariqo は、コールセンターや BPO チーム向けの音声エージェント基盤です。AI が通話を事前選別し、価値の低いコールを減らしてから、商談化しやすい会話だけを人間の担当者へ渡します。

AI 音声エージェントコールセンター自動化SIP ダイヤラー
650