So-VITS-SVC
So-VITS-SVC
Active

So-VITS-SVC

So-VITS-SVC 4.1 ist ein archiviertes Open-Source-Forschungsframework für die Konvertierung von Gesangsstimmen, nicht für die Umwandlung von Text in Sprache. Dieser unabhängige Leitfaden behandelt Einwilligung, Lizenzierung, saubere Datensätze, F0 und Encoder, Schulung, Schlussfolgerung, Bewertung, Offenlegung, Sicherheit und Alternativen.

90

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

so-vits-svcSinging Voice ConversionVoice ConversionAI Singing VoiceSoftVC VITS

Product Preview

A quick visual look at So-VITS-SVC before you visit the official site.

Published 1/21/2026
So-VITS-SVC screenshot

Editorial Review

About So-VITS-SVC

So-VITS-SVC ist ein Forschungsrahmen für die Singing Voice Conversion (SVC): Es nimmt eine vorhandene Gesangsdarbietung und gibt deren sprachlichen Inhalt und Melodie mit einem trainierten Ziel-Timbre wieder. Es handelt sich nicht um Text-to-Speech, wird nicht mit einem Sprachmodell ausgeliefert und kann rechtlich oder ethisch keine Rechte an der Identität eines Künstlers, dem Quelllied oder den Trainingsaufnahmen gewähren.

Das Original svc-develop-team/so-vits-svc Das Repository wurde im November 2023 archiviert und ist schreibgeschützt. Auf den 4.1-Stable-Zweig wird weiterhin häufig verwiesen, aber die Einführung bedeutet jetzt, alte Abhängigkeiten zu fixieren, Prüfpunkte von Drittanbietern zu validieren und die volle Verantwortung für die Wartung zu übernehmen. Die README-Datei beschreibt die akademische Nutzung, betont die Absicht fiktionaler Charaktere, verlangt von Benutzern die Klärung der Datensatzautorisierung und legt zusätzliche Veröffentlichungs-/Offenlegungsbedingungen fest. Lesen Sie die genaue README-Datei und die Lizenz des Repositorys zusammen, bevor Sie es verwenden.

Official So-VITS-SVC repository diagram and project media
Offizielle Projektmedien. Bei dem gepflegten Artefakt handelt es sich um eine archivierte Forschungscodebasis, nicht um einen gehosteten Dienst oder lizenzierten Stimmenkatalog.

SVC ist kein TTS, kein Vocoder oder keine Quellentrennung

TechnologieEingabeAusgabeWas es nicht bietet
So-VITS-SVCGesungene/gesprochene Audioquelle + trainiertes ZielmodellGleiche Leistung in Richtung des Ziel-TimbresRechte zur Generierung oder Nutzung von Liedtexten zur Aufführung
Text-zu-SpracheKonditionierung von Text + Stimme/StilNeue gesprochene WellenformOriginalgetreue Übertragung einer bestehenden gesungenen Darbietung
GesangssyntheseLiedtexte, Notizen und AusdruckssteuerungNeue gesungene AufführungAutomatische gesetzliche Erlaubnis zur Nachahmung eines Sängers
VocoderAkustische DarstellungWellenformRichtlinie zur Inhalts-/Klangkonvertierung
QuellentrennungGemischtes LiedGeschätzte Vokal-/InstrumentalstämmeBereinigen Sie Original-Multitracks oder Sprachkonvertierung

Die vollständige Pipeline und wo Artefakte eintreten

 eingewilligte Zielaufnahmen
          |
          v
 bereinigen -> segmentieren -> neu abtasten -> Inhaltsfunktionen + F0
          |                           |
          '----------- Ausbildung ------'
                         |
                         v
                 Ziel-Sprachmodell
                         |
 Quellgesang -> F0/Inhaltsextraktion -> Generator -> optionale Diffusion
                         |                    |
                         '------ rendern ------'
                                      |
                              Human Audio + Rechte-QA

Inhaltsencoder versuchen, phonetische Informationen darzustellen und gleichzeitig die Quellenidentität zu unterdrücken. F0 trägt die Tonhöhe; Der Generator und der Vocoder rekonstruieren das Audiomaterial im Ziel-Timbre. Eine unvollständige Entwirrung führt zu einem „Timbre-Leck“, bei dem der ursprüngliche Sänger hörbar bleibt. Durch eine schlechte Trennung werden den Trainingsdaten Instrumente und Hall hinzugefügt. inkonsistente Tonhöhenextraktion führt zu Oktavsprüngen; Clipping und nicht übereinstimmende Abtastraten werden zu metallischen Artefakten.

Rights Gate vor jedem Download oder Training

Eine technisch öffentliche Aufzeichnung ist nicht automatisch ein rechtmäßiger Trainingsdatensatz. Holen Sie vom identifizierbaren Synchronsprecher und den Rechteinhabern eine dokumentierte Genehmigung für die beabsichtigte Schulung, Modellspeicherung, Mitarbeiter, Gebiete, den kommerziellen Status und die Ausgabeverteilung ein. Lizenzieren Sie die Komposition, die Texte, den Master-/Quellgesang und den Backing-Track, die in einem veröffentlichten Cover verwendet werden, separat.

Vermögenswert oder RechtBeweise, die es aufzubewahren giltHäufige Fehlannahme
Zielgerichtete SprachaufnahmenEinwilligung des Künstlers und Aufnahme-/Masterrechte„Online verfügbar“ bedeutet trainierbar
Stimmidentität/PersonaUmfang, Dauer, Widerruf und zulässige KontexteEine Softwarelizenz gewährt Ähnlichkeitsrechte
Quelle GesangAufnahmegenehmigung und Tool-kompatible BedingungenEin abgetrennter Stiel gehört Ihnen
Lied/TextKompositions-/mechanische/Synchronisierungsberechtigungen, sofern zutreffendDurch ein Cover entfällt das Veröffentlichungsrecht
Modell/KontrollpunktProvenienz, Lizenz, Datensatzaussage und PrüfsummeEine Download-Seite weist autorisierte Daten nach
Endgültige VeröffentlichungÜberprüfung, Offenlegung und Quellenangabe der Plattformrichtlinien„KI generiert“ ist eine vollständige Rechtsverteidigung

Erstellen Sie keine betrügerischen Nachahmungen, keinen Betrug, keine Belästigungen, keine sexuellen Inhalte oder keine politischen Botschaften mit der erkennbaren Stimme einer anderen Person. Bestätigen Sie bei einem Projekt mit fiktionalen Charakteren, dass auch die Rechte an den Charakteren und der ursprünglichen Aufführung geklärt sind. Wenn die Einwilligung widerrufen wird, führen Sie einen praktischen Prozess zur Löschung und Entfernung des Musters durch.

Datensatzdesign: Qualität schlägt wahllose Dauer

Verwenden Sie saubere, trockene und isolierte Aufnahmen des zustimmenden Ziels. Entfernen Sie Instrumentenbluten, starken Raumhall, doppelten Gesang, extreme Effekte, Übersteuerungen, lange Stille und andere Lautsprecher. Behalten Sie eine Ausdrucksvielfalt bei, die der beabsichtigten Ausgabe entspricht – Tonhöhenbereich, Vokale, Konsonanten, Register und Dynamik –, ohne inkompatible Aufnahmeketten blind zu mischen.

Aufteilung nach zusammenhängender Quellsitzung oder Song, nicht nach zufälligen benachbarten Clips, sodass die Validierung keine Beinahe-Duplikate aus dem Training enthält. Bewahren Sie einen verschlossenen Testsatz auf, der niemals zum Tuning verwendet wird. Pflegen Sie ein Manifest mit Datei-Hash, Herkunft, Einwilligungsdatensatz, Abtastrate, Dauer, Vorverarbeitungsschritten, Transkript/Texten (falls verfügbar) und Ausschlussgrund.

DatensatzprüfungSignal übergebenBeheben
IsolationKeine hörbare Begleitung oder BackgroundsängerOriginalstiele verwenden oder wegwerfen; Die Trennung ist unvollkommen
EbeneKein Clipping; konsistent nutzbares SignalFühren Sie eine sorgfältige Normalisierung durch, reparieren Sie schwerwiegende Überschneidungen niemals durch bloßes Erraten
IdentitätEin autorisiertes Ziel pro SprecheretikettEntfernen Sie Mitarbeiter und Crowd-Antworten
SpielfeldabdeckungEntspricht dem vorgesehenen GesangsbereichErfassen Sie zugestimmte fehlende Register
ValidierungsunabhängigkeitVerschiedene Sitzungen/Sätze aus dem TrainingVor der Messung erneut teilen
ProvenienzJeder Clip ist einem Berechtigungsdatensatz zugeordnetNicht zugeordnete Dateien unter Quarantäne stellen

Versions- und Abhängigkeitsrealität

Die 4.1-Stable README meldet Python 3.8.9 als getestete stabile Version und erfordert separate vorab trainierte Encoder/Vocoder-Assets. Im Jahr 2026 handelt es sich um eine Legacy-Umgebung. Erstellen Sie es in einem isolierten Container oder einer virtuellen Maschine, pinnen Sie Hashes, scannen Sie Abhängigkeiten und verweigern Sie nicht benötigten Netzwerkzugriff. Schwächt eine moderne Workstation nicht global, um alte CUDA- oder Python-Pakete zu erfüllen.

Forks, Notebooks, GUIs und Modellpakete von Drittanbietern sind separate Projekte. Sie können Code, Lizenzierung, Telemetrie oder Standard-Downloads ändern. Überprüfen Sie die Upstream-Abstammung, das Commit, den Inhalt des Installationsprogramms und die Herkunft des Modells. Laden Sie niemals nicht vertrauenswürdige PyTorch-Prüfpunkte auf einen Computer, der Geheimnisse enthält: Ältere Serialisierungsformate können während des Ladens Code ausführen.

Inhaltsencoder, F0 und Abrufoptionen

4.1 dokumentiert mehrere Sprachencoder, wobei ContentVec-Varianten zu den häufigsten Optionen gehören. Abmessungen und Konfiguration des Encoders müssen mit dem Prüfpunkt übereinstimmen; 4.0-Kompatibilität erfordert möglicherweise das Hinzufügen des richtigen Speech_Encoder Feld. Modelle und vorverarbeitete Assets aus verschiedenen Branchen sind nicht universell austauschbar.

Behalten Sie beim Singen die Quellmelodie mit einem robusten F0-Extraktor bei und überprüfen Sie das Oktavverhalten. Die README-Datei warnt davor, dass die automatische F0-Vorhersage beim Gesang zu erheblichen Tonhöhenverschiebungen führen kann und dort generell nicht aktiviert werden sollte. Das Abrufen von Merkmalen oder das Clustering kann den Verlust der Quellklangfarbe reduzieren und manchmal die Artikulation verbessern, aber ein hohes Mischungsverhältnis kann Datensatzartefakte kopieren und die Schlussfolgerung verlangsamen. Betrachten Sie das dokumentierte 0,5-Beispiel als Ausgangspunkt und nicht als universelles Optimum.

KontrolleHören Sie zuSchlechtes Einstellungssymptom
F0-ExtraktorStabile Melodie, Vibrato und stimmhafte/stimmlose ÜbergängeOktavsprünge, Robotertonhöhe oder verlorene Konsonanten
TonhöhenverschiebungKomfortabler Zielbereich ohne FormantenkollapsChipmunk/dröhnender Ton und instabile Höhen
Abruf-/Cluster-VerhältnisZielähnlichkeit ohne gespeicherte ArtefakteBuzzing, kopiertes Rauschen oder verminderte Verständlichkeit
Flache DiffusionGlattere Details ohne ÜberbearbeitungUnscharfe Transienten und zusätzliche Rechenleistung
Rauschskala / SlicingNatürliche Textur und PhrasenkontinuitätAtemgeräusche, Nähte oder inkonsistenter Ton

Trainieren, ohne einem einzigen Verlustwert hinterherzujagen

Beginnen Sie mit einer kleinen Konfiguration und einer überprüfbaren Basislinie. Speichern Sie Konfiguration, Seed, Code-Commit, Abhängigkeitssperre, GPU, Vorverarbeitungsmanifest und Prüfpunkt-Hash. Geben Sie in regelmäßigen Abständen dieselben genehmigten Validierungsphrasen wieder. Der Trainingsverlust kann sinken, während die wahrgenommene Natürlichkeit, Verständlichkeit oder Zielähnlichkeit stagniert oder sich verschlechtert.

Stoppen Sie basierend auf Blindvalidierung und Artefaktraten, nicht auf einer von der Community empfohlenen Schrittzahl. Halten Sie Schulungs- und veröffentlichungsfähige Inferenzkontrollpunkte getrennt. Das Repository beschreibt die Modellkomprimierung, die reine Trainingsdaten entfernt und die endgültige Größe erheblich reduzieren kann; Bewahren Sie den ursprünglichen Kontrollpunkt nur dann in einem kontrollierten Lager auf, wenn eine weitere Schulung genehmigt ist.

Bewertung: drei Qualitäten, nicht eine „klingt gut“-Bewertung

DimensionMenschlicher TestUnterstützende Metrik
NatürlichkeitBlinde MOS-Bewertung für unsichtbare PhrasenArtefakte werden nach Typ und Dauer gezählt
ZielähnlichkeitZustimmungsbewusste A/B-Beurteilung des ZielsLautsprechereinbettungsähnlichkeit, nie alleine verwendet
Inhaltliche GenauigkeitTranskribieren Sie Liedtexte und kritische WorteGegebenenfalls Phonem-/Wortfehler
TonhöhentreueMusiker prüft Melodie und AusdrucksabsichtF0-Korrelation, RMSE und stimmhafter Fehler
QuellenleckKönnen Zuhörer den Originalsänger noch identifizieren?Vergleichen Sie die Einbettungstendenz zwischen Quelle und Ziel
BetriebskostenZeit von der sauberen Eingabe bis zum akzeptierten StammEchtzeitfaktor, VRAM und Korrekturminuten

Verwenden Sie mehrere Quellsänger und -lieder außerhalb des Trainingssatzes. Fügen Sie hohe und tiefe Noten, atemlose Abschnitte, schnelle Liedtexte, Vibrato und Stille hinzu. Randomisieren Sie Stichproben und verbergen Sie Systemnamen vor Bewertern. Melden Sie Konfidenzintervalle und abgelehnte Ausgaben, nicht nur die beste Demo.

Postproduktion und Offenlegung

Überprüfen Sie das umgewandelte Gesangssolo vor dem Mischen. Reparieren Sie nur lokalisierte Artefakte, richten Sie das Timing dort aus, wo durch die Vorverarbeitung Drift verursacht wurde, kontrollieren Sie Zischlaute und Atemzüge und mischen Sie dann mit einem rechtmäßig erhaltenen Instrumentalstück. Verwenden Sie keine starken Effekte, um Modellfehler bei der Bewertung zu verbergen.

Die Bedingungen des Projekts erfordern eine klare Zuordnung der Eingabequelle Gesang/Audio für Plattform-Uploads. Wenn Sie über dieses Minimum hinausgehen, kennzeichnen Sie das Ergebnis als KI-Sprachkonvertierung, identifizieren Sie den autorisierten Stimm-/Modelleigentümer, wenn vereinbart, geben Sie Song- und Quellenrechte an und beschreiben Sie sinnvolle Bearbeitung. Bewahren Sie ein privates Produktionsblatt auf, das Modell-Hash, Quelle, Einstellungen, Einwilligungen und endgültigen Master verknüpft.

Sicherheits- und Vertriebskontrollen

  • Speichern Sie Trainingsdaten und Kontrollpunkte verschlüsselt mit rollenbasiertem Zugriff.
  • Prüfsummen und eine Musterkarte veröffentlichen; Verteilen Sie keine rohen Trainingsclips.
  • Beschränken Sie die Nutzung eines freigegebenen Modells durch Vertrags- und Zugriffskontrolle; Eine Textlizenz allein kann das Kopieren nicht verhindern.
  • Testen Sie Prüfpunkte vor dem Laden in einer verfügbaren, netzwerkbeschränkten Umgebung.
  • Definieren Sie die Reaktion auf Vorfälle bei Identitätsdiebstahl, durchgesickerten Modellen und dem Widerruf der Einwilligung.
  • Trennen Sie die Demo-Freigabe von der Download-Berechtigung. Eine gerenderte Probe muss keine Gewichte offenlegen.

Alternativen

OptionBeste PassformKompromiss
So-VITS-SVC 4.1Reproduktion älterer SVC-Forschung mit bekannter PipelineArchivierte, veraltete Abhängigkeiten und benutzereigene Wartung
RVCZugängliche abrufbasierte Sprachkonvertierungs-WorkflowsUnterschiedliches Architektur-/Modell-Ökosystem und gleiche Rechterisiken
Verbreitung/moderne SVC-ForschungTeams, die aktuelle Qualität oder Zero-Shot-Methoden bewertenHöhere Komplexität und ungleichmäßige Reproduzierbarkeit
Lizenzierter kommerzieller SprachdienstProduktion, die Unterstützung und explizite Künstlerkatalogbedingungen benötigtKosten, Plattformbeschränkungen und weiterhin erforderliche Quell-Song-Rechte
Zustimmender SängerKommerzielle Veröffentlichung, ausdrucksstarke Regie und VerantwortungTerminplanung und direkte Produktionskosten
Traditionelle StimmverarbeitungKorrektur der ursprünglich genehmigten LeistungDie Identität kann nicht geändert werden, die Beziehung zum Darsteller bleibt jedoch erhalten

Häufig gestellte Fragen

Wird So-VITS-SVC noch gepflegt?

Das Original-Repository ist archiviert und schreibgeschützt. Forks können aktiv sein, müssen aber unabhängig ausgewertet werden.

Erzeugt es Gesang aus Texten?

Nein. Es wandelt eine vorhandene Gesangsdarbietung um. Gesangssynthese und TTS sind unterschiedliche Aufgaben.

Sind Sprachmodelle enthalten?

Nein. Das offizielle Projekt besagt, dass Benutzer Modelle unabhängig trainieren; Pakete von Drittanbietern werden von den Upstream-Mitwirkenden nicht unterstützt.

Kann ich anhand der Lieder einer Berühmtheit trainieren?

Nicht nur, weil die Aufnahmen öffentlich sind. Besorgen Sie sich die entsprechenden Stimm-, Aufführungs-, Aufnahme-, Kompositions- und Nutzungsrechte.

Wie viele Daten werden benötigt?

Es gibt keine universelle Minutenzählung. Saubere, repräsentative, autorisierte Berichterstattung und unabhängige Validierung sind wichtiger als wahlloses Sammeln.

Warum bleibt im Ergebnis der Quellsänger erhalten?

Inhaltliche Darstellungen sind unvollkommen. Sauberere Daten, die Wahl des Encoders und sorgfältig abgestimmtes Abrufen/Clustern können die Leckage verringern, können jedoch nicht die Entfernung garantieren.

Ist ein heruntergeladener Checkpoint sicher?

Nicht automatisch. Überprüfen Sie Herkunft und Hashes und laden Sie sie nur in einer isolierten Umgebung, da die Modellserialisierung ein Risiko für die Ausführung mit sich bringen kann.

Primärquellen

Zuletzt überprüft am 25. Juli 2026. Dies ist ein archiviertes Forschungsprojekt mit ungewöhnlich wichtigen README-Begriffen. Überprüfen Sie vor jedem Experiment oder jeder Veröffentlichung den angehefteten Zweig, Abhängigkeiten, Lizenzen und alle Sprach-/Musikberechtigungen.

Ready to try So-VITS-SVC?

Visit the official website to get started

Visit So-VITS-SVC

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
8/31/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Vocal Remover

Vocal Remover

Separate voice from music out of a song free with powerful AI algorithms - Intelligentes KI-Tool für mehr Produktivität.

voice-processingfree
710
Lalal.ai

Lalal.ai

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - Intelligentes KI-Tool für mehr Produktivität.

voice-processingfree
630
PollyReach

PollyReach

PollyReach ist ein KI-Produkt im Bereich voice-processing und eignet sich für Nutzer, die reale Workflows produktiv abbilden möchten.

voice-processingKI-Tool
690
Klariqo

Klariqo

Klariqo ist eine Voice-Agent-Plattform fuer Callcenter- und BPO-Teams, die Anrufe durch AI vorqualifizieren, schlechte Leads herausfiltern und nur vertriebsreife Gespraeche an menschliche Closer weitergeben wollen.

AI-Voice-AgentenCallcenter-AutomatisierungSIP-Dialer
650