So-VITS-SVC ist ein Forschungsrahmen für die Singing Voice Conversion (SVC): Es nimmt eine vorhandene Gesangsdarbietung und gibt deren sprachlichen Inhalt und Melodie mit einem trainierten Ziel-Timbre wieder. Es handelt sich nicht um Text-to-Speech, wird nicht mit einem Sprachmodell ausgeliefert und kann rechtlich oder ethisch keine Rechte an der Identität eines Künstlers, dem Quelllied oder den Trainingsaufnahmen gewähren.
Das Original svc-develop-team/so-vits-svc Das Repository wurde im November 2023 archiviert und ist schreibgeschützt. Auf den 4.1-Stable-Zweig wird weiterhin häufig verwiesen, aber die Einführung bedeutet jetzt, alte Abhängigkeiten zu fixieren, Prüfpunkte von Drittanbietern zu validieren und die volle Verantwortung für die Wartung zu übernehmen. Die README-Datei beschreibt die akademische Nutzung, betont die Absicht fiktionaler Charaktere, verlangt von Benutzern die Klärung der Datensatzautorisierung und legt zusätzliche Veröffentlichungs-/Offenlegungsbedingungen fest. Lesen Sie die genaue README-Datei und die Lizenz des Repositorys zusammen, bevor Sie es verwenden.

SVC ist kein TTS, kein Vocoder oder keine Quellentrennung
| Technologie | Eingabe | Ausgabe | Was es nicht bietet |
|---|---|---|---|
| So-VITS-SVC | Gesungene/gesprochene Audioquelle + trainiertes Zielmodell | Gleiche Leistung in Richtung des Ziel-Timbres | Rechte zur Generierung oder Nutzung von Liedtexten zur Aufführung |
| Text-zu-Sprache | Konditionierung von Text + Stimme/Stil | Neue gesprochene Wellenform | Originalgetreue Übertragung einer bestehenden gesungenen Darbietung |
| Gesangssynthese | Liedtexte, Notizen und Ausdruckssteuerung | Neue gesungene Aufführung | Automatische gesetzliche Erlaubnis zur Nachahmung eines Sängers |
| Vocoder | Akustische Darstellung | Wellenform | Richtlinie zur Inhalts-/Klangkonvertierung |
| Quellentrennung | Gemischtes Lied | Geschätzte Vokal-/Instrumentalstämme | Bereinigen Sie Original-Multitracks oder Sprachkonvertierung |
Die vollständige Pipeline und wo Artefakte eintreten
eingewilligte Zielaufnahmen
|
v
bereinigen -> segmentieren -> neu abtasten -> Inhaltsfunktionen + F0
| |
'----------- Ausbildung ------'
|
v
Ziel-Sprachmodell
|
Quellgesang -> F0/Inhaltsextraktion -> Generator -> optionale Diffusion
| |
'------ rendern ------'
|
Human Audio + Rechte-QA
Inhaltsencoder versuchen, phonetische Informationen darzustellen und gleichzeitig die Quellenidentität zu unterdrücken. F0 trägt die Tonhöhe; Der Generator und der Vocoder rekonstruieren das Audiomaterial im Ziel-Timbre. Eine unvollständige Entwirrung führt zu einem „Timbre-Leck“, bei dem der ursprüngliche Sänger hörbar bleibt. Durch eine schlechte Trennung werden den Trainingsdaten Instrumente und Hall hinzugefügt. inkonsistente Tonhöhenextraktion führt zu Oktavsprüngen; Clipping und nicht übereinstimmende Abtastraten werden zu metallischen Artefakten.
Rights Gate vor jedem Download oder Training
Eine technisch öffentliche Aufzeichnung ist nicht automatisch ein rechtmäßiger Trainingsdatensatz. Holen Sie vom identifizierbaren Synchronsprecher und den Rechteinhabern eine dokumentierte Genehmigung für die beabsichtigte Schulung, Modellspeicherung, Mitarbeiter, Gebiete, den kommerziellen Status und die Ausgabeverteilung ein. Lizenzieren Sie die Komposition, die Texte, den Master-/Quellgesang und den Backing-Track, die in einem veröffentlichten Cover verwendet werden, separat.
| Vermögenswert oder Recht | Beweise, die es aufzubewahren gilt | Häufige Fehlannahme |
|---|---|---|
| Zielgerichtete Sprachaufnahmen | Einwilligung des Künstlers und Aufnahme-/Masterrechte | „Online verfügbar“ bedeutet trainierbar |
| Stimmidentität/Persona | Umfang, Dauer, Widerruf und zulässige Kontexte | Eine Softwarelizenz gewährt Ähnlichkeitsrechte |
| Quelle Gesang | Aufnahmegenehmigung und Tool-kompatible Bedingungen | Ein abgetrennter Stiel gehört Ihnen |
| Lied/Text | Kompositions-/mechanische/Synchronisierungsberechtigungen, sofern zutreffend | Durch ein Cover entfällt das Veröffentlichungsrecht |
| Modell/Kontrollpunkt | Provenienz, Lizenz, Datensatzaussage und Prüfsumme | Eine Download-Seite weist autorisierte Daten nach |
| Endgültige Veröffentlichung | Überprüfung, Offenlegung und Quellenangabe der Plattformrichtlinien | „KI generiert“ ist eine vollständige Rechtsverteidigung |
Erstellen Sie keine betrügerischen Nachahmungen, keinen Betrug, keine Belästigungen, keine sexuellen Inhalte oder keine politischen Botschaften mit der erkennbaren Stimme einer anderen Person. Bestätigen Sie bei einem Projekt mit fiktionalen Charakteren, dass auch die Rechte an den Charakteren und der ursprünglichen Aufführung geklärt sind. Wenn die Einwilligung widerrufen wird, führen Sie einen praktischen Prozess zur Löschung und Entfernung des Musters durch.
Datensatzdesign: Qualität schlägt wahllose Dauer
Verwenden Sie saubere, trockene und isolierte Aufnahmen des zustimmenden Ziels. Entfernen Sie Instrumentenbluten, starken Raumhall, doppelten Gesang, extreme Effekte, Übersteuerungen, lange Stille und andere Lautsprecher. Behalten Sie eine Ausdrucksvielfalt bei, die der beabsichtigten Ausgabe entspricht – Tonhöhenbereich, Vokale, Konsonanten, Register und Dynamik –, ohne inkompatible Aufnahmeketten blind zu mischen.
Aufteilung nach zusammenhängender Quellsitzung oder Song, nicht nach zufälligen benachbarten Clips, sodass die Validierung keine Beinahe-Duplikate aus dem Training enthält. Bewahren Sie einen verschlossenen Testsatz auf, der niemals zum Tuning verwendet wird. Pflegen Sie ein Manifest mit Datei-Hash, Herkunft, Einwilligungsdatensatz, Abtastrate, Dauer, Vorverarbeitungsschritten, Transkript/Texten (falls verfügbar) und Ausschlussgrund.
| Datensatzprüfung | Signal übergeben | Beheben |
|---|---|---|
| Isolation | Keine hörbare Begleitung oder Backgroundsänger | Originalstiele verwenden oder wegwerfen; Die Trennung ist unvollkommen |
| Ebene | Kein Clipping; konsistent nutzbares Signal | Führen Sie eine sorgfältige Normalisierung durch, reparieren Sie schwerwiegende Überschneidungen niemals durch bloßes Erraten |
| Identität | Ein autorisiertes Ziel pro Sprecheretikett | Entfernen Sie Mitarbeiter und Crowd-Antworten |
| Spielfeldabdeckung | Entspricht dem vorgesehenen Gesangsbereich | Erfassen Sie zugestimmte fehlende Register |
| Validierungsunabhängigkeit | Verschiedene Sitzungen/Sätze aus dem Training | Vor der Messung erneut teilen |
| Provenienz | Jeder Clip ist einem Berechtigungsdatensatz zugeordnet | Nicht zugeordnete Dateien unter Quarantäne stellen |
Versions- und Abhängigkeitsrealität
Die 4.1-Stable README meldet Python 3.8.9 als getestete stabile Version und erfordert separate vorab trainierte Encoder/Vocoder-Assets. Im Jahr 2026 handelt es sich um eine Legacy-Umgebung. Erstellen Sie es in einem isolierten Container oder einer virtuellen Maschine, pinnen Sie Hashes, scannen Sie Abhängigkeiten und verweigern Sie nicht benötigten Netzwerkzugriff. Schwächt eine moderne Workstation nicht global, um alte CUDA- oder Python-Pakete zu erfüllen.
Forks, Notebooks, GUIs und Modellpakete von Drittanbietern sind separate Projekte. Sie können Code, Lizenzierung, Telemetrie oder Standard-Downloads ändern. Überprüfen Sie die Upstream-Abstammung, das Commit, den Inhalt des Installationsprogramms und die Herkunft des Modells. Laden Sie niemals nicht vertrauenswürdige PyTorch-Prüfpunkte auf einen Computer, der Geheimnisse enthält: Ältere Serialisierungsformate können während des Ladens Code ausführen.
Inhaltsencoder, F0 und Abrufoptionen
4.1 dokumentiert mehrere Sprachencoder, wobei ContentVec-Varianten zu den häufigsten Optionen gehören. Abmessungen und Konfiguration des Encoders müssen mit dem Prüfpunkt übereinstimmen; 4.0-Kompatibilität erfordert möglicherweise das Hinzufügen des richtigen Speech_Encoder Feld. Modelle und vorverarbeitete Assets aus verschiedenen Branchen sind nicht universell austauschbar.
Behalten Sie beim Singen die Quellmelodie mit einem robusten F0-Extraktor bei und überprüfen Sie das Oktavverhalten. Die README-Datei warnt davor, dass die automatische F0-Vorhersage beim Gesang zu erheblichen Tonhöhenverschiebungen führen kann und dort generell nicht aktiviert werden sollte. Das Abrufen von Merkmalen oder das Clustering kann den Verlust der Quellklangfarbe reduzieren und manchmal die Artikulation verbessern, aber ein hohes Mischungsverhältnis kann Datensatzartefakte kopieren und die Schlussfolgerung verlangsamen. Betrachten Sie das dokumentierte 0,5-Beispiel als Ausgangspunkt und nicht als universelles Optimum.
| Kontrolle | Hören Sie zu | Schlechtes Einstellungssymptom |
|---|---|---|
| F0-Extraktor | Stabile Melodie, Vibrato und stimmhafte/stimmlose Übergänge | Oktavsprünge, Robotertonhöhe oder verlorene Konsonanten |
| Tonhöhenverschiebung | Komfortabler Zielbereich ohne Formantenkollaps | Chipmunk/dröhnender Ton und instabile Höhen |
| Abruf-/Cluster-Verhältnis | Zielähnlichkeit ohne gespeicherte Artefakte | Buzzing, kopiertes Rauschen oder verminderte Verständlichkeit |
| Flache Diffusion | Glattere Details ohne Überbearbeitung | Unscharfe Transienten und zusätzliche Rechenleistung |
| Rauschskala / Slicing | Natürliche Textur und Phrasenkontinuität | Atemgeräusche, Nähte oder inkonsistenter Ton |
Trainieren, ohne einem einzigen Verlustwert hinterherzujagen
Beginnen Sie mit einer kleinen Konfiguration und einer überprüfbaren Basislinie. Speichern Sie Konfiguration, Seed, Code-Commit, Abhängigkeitssperre, GPU, Vorverarbeitungsmanifest und Prüfpunkt-Hash. Geben Sie in regelmäßigen Abständen dieselben genehmigten Validierungsphrasen wieder. Der Trainingsverlust kann sinken, während die wahrgenommene Natürlichkeit, Verständlichkeit oder Zielähnlichkeit stagniert oder sich verschlechtert.
Stoppen Sie basierend auf Blindvalidierung und Artefaktraten, nicht auf einer von der Community empfohlenen Schrittzahl. Halten Sie Schulungs- und veröffentlichungsfähige Inferenzkontrollpunkte getrennt. Das Repository beschreibt die Modellkomprimierung, die reine Trainingsdaten entfernt und die endgültige Größe erheblich reduzieren kann; Bewahren Sie den ursprünglichen Kontrollpunkt nur dann in einem kontrollierten Lager auf, wenn eine weitere Schulung genehmigt ist.
Bewertung: drei Qualitäten, nicht eine „klingt gut“-Bewertung
| Dimension | Menschlicher Test | Unterstützende Metrik |
|---|---|---|
| Natürlichkeit | Blinde MOS-Bewertung für unsichtbare Phrasen | Artefakte werden nach Typ und Dauer gezählt |
| Zielähnlichkeit | Zustimmungsbewusste A/B-Beurteilung des Ziels | Lautsprechereinbettungsähnlichkeit, nie alleine verwendet |
| Inhaltliche Genauigkeit | Transkribieren Sie Liedtexte und kritische Worte | Gegebenenfalls Phonem-/Wortfehler |
| Tonhöhentreue | Musiker prüft Melodie und Ausdrucksabsicht | F0-Korrelation, RMSE und stimmhafter Fehler |
| Quellenleck | Können Zuhörer den Originalsänger noch identifizieren? | Vergleichen Sie die Einbettungstendenz zwischen Quelle und Ziel |
| Betriebskosten | Zeit von der sauberen Eingabe bis zum akzeptierten Stamm | Echtzeitfaktor, VRAM und Korrekturminuten |
Verwenden Sie mehrere Quellsänger und -lieder außerhalb des Trainingssatzes. Fügen Sie hohe und tiefe Noten, atemlose Abschnitte, schnelle Liedtexte, Vibrato und Stille hinzu. Randomisieren Sie Stichproben und verbergen Sie Systemnamen vor Bewertern. Melden Sie Konfidenzintervalle und abgelehnte Ausgaben, nicht nur die beste Demo.
Postproduktion und Offenlegung
Überprüfen Sie das umgewandelte Gesangssolo vor dem Mischen. Reparieren Sie nur lokalisierte Artefakte, richten Sie das Timing dort aus, wo durch die Vorverarbeitung Drift verursacht wurde, kontrollieren Sie Zischlaute und Atemzüge und mischen Sie dann mit einem rechtmäßig erhaltenen Instrumentalstück. Verwenden Sie keine starken Effekte, um Modellfehler bei der Bewertung zu verbergen.
Die Bedingungen des Projekts erfordern eine klare Zuordnung der Eingabequelle Gesang/Audio für Plattform-Uploads. Wenn Sie über dieses Minimum hinausgehen, kennzeichnen Sie das Ergebnis als KI-Sprachkonvertierung, identifizieren Sie den autorisierten Stimm-/Modelleigentümer, wenn vereinbart, geben Sie Song- und Quellenrechte an und beschreiben Sie sinnvolle Bearbeitung. Bewahren Sie ein privates Produktionsblatt auf, das Modell-Hash, Quelle, Einstellungen, Einwilligungen und endgültigen Master verknüpft.
Sicherheits- und Vertriebskontrollen
- Speichern Sie Trainingsdaten und Kontrollpunkte verschlüsselt mit rollenbasiertem Zugriff.
- Prüfsummen und eine Musterkarte veröffentlichen; Verteilen Sie keine rohen Trainingsclips.
- Beschränken Sie die Nutzung eines freigegebenen Modells durch Vertrags- und Zugriffskontrolle; Eine Textlizenz allein kann das Kopieren nicht verhindern.
- Testen Sie Prüfpunkte vor dem Laden in einer verfügbaren, netzwerkbeschränkten Umgebung.
- Definieren Sie die Reaktion auf Vorfälle bei Identitätsdiebstahl, durchgesickerten Modellen und dem Widerruf der Einwilligung.
- Trennen Sie die Demo-Freigabe von der Download-Berechtigung. Eine gerenderte Probe muss keine Gewichte offenlegen.
Alternativen
| Option | Beste Passform | Kompromiss |
|---|---|---|
| So-VITS-SVC 4.1 | Reproduktion älterer SVC-Forschung mit bekannter Pipeline | Archivierte, veraltete Abhängigkeiten und benutzereigene Wartung |
| RVC | Zugängliche abrufbasierte Sprachkonvertierungs-Workflows | Unterschiedliches Architektur-/Modell-Ökosystem und gleiche Rechterisiken |
| Verbreitung/moderne SVC-Forschung | Teams, die aktuelle Qualität oder Zero-Shot-Methoden bewerten | Höhere Komplexität und ungleichmäßige Reproduzierbarkeit |
| Lizenzierter kommerzieller Sprachdienst | Produktion, die Unterstützung und explizite Künstlerkatalogbedingungen benötigt | Kosten, Plattformbeschränkungen und weiterhin erforderliche Quell-Song-Rechte |
| Zustimmender Sänger | Kommerzielle Veröffentlichung, ausdrucksstarke Regie und Verantwortung | Terminplanung und direkte Produktionskosten |
| Traditionelle Stimmverarbeitung | Korrektur der ursprünglich genehmigten Leistung | Die Identität kann nicht geändert werden, die Beziehung zum Darsteller bleibt jedoch erhalten |
Häufig gestellte Fragen
Wird So-VITS-SVC noch gepflegt?
Das Original-Repository ist archiviert und schreibgeschützt. Forks können aktiv sein, müssen aber unabhängig ausgewertet werden.
Erzeugt es Gesang aus Texten?
Nein. Es wandelt eine vorhandene Gesangsdarbietung um. Gesangssynthese und TTS sind unterschiedliche Aufgaben.
Sind Sprachmodelle enthalten?
Nein. Das offizielle Projekt besagt, dass Benutzer Modelle unabhängig trainieren; Pakete von Drittanbietern werden von den Upstream-Mitwirkenden nicht unterstützt.
Kann ich anhand der Lieder einer Berühmtheit trainieren?
Nicht nur, weil die Aufnahmen öffentlich sind. Besorgen Sie sich die entsprechenden Stimm-, Aufführungs-, Aufnahme-, Kompositions- und Nutzungsrechte.
Wie viele Daten werden benötigt?
Es gibt keine universelle Minutenzählung. Saubere, repräsentative, autorisierte Berichterstattung und unabhängige Validierung sind wichtiger als wahlloses Sammeln.
Warum bleibt im Ergebnis der Quellsänger erhalten?
Inhaltliche Darstellungen sind unvollkommen. Sauberere Daten, die Wahl des Encoders und sorgfältig abgestimmtes Abrufen/Clustern können die Leckage verringern, können jedoch nicht die Entfernung garantieren.
Ist ein heruntergeladener Checkpoint sicher?
Nicht automatisch. Überprüfen Sie Herkunft und Hashes und laden Sie sie nur in einer isolierten Umgebung, da die Modellserialisierung ein Risiko für die Ausführung mit sich bringen kann.
Primärquellen
- Offizielles archiviertes Repository
- Offizielle 4.1-Stable-README-Datei, Bedingungen und Arbeitsablauf
- Offizielle chinesische README
- Repository-Lizenz
- Offizielle Konfigurationsvorlagen
- VITS-basierte SVC- und DSPGAN-Forschung
- Flüster- und Multiskalen-F0-SVC-Forschung
- Interspeech-Forschung mit Bezug auf So-VITS-SVC
- KI-Initiative des US Copyright Office und aktuelle Berichte
Zuletzt überprüft am 25. Juli 2026. Dies ist ein archiviertes Forschungsprojekt mit ungewöhnlich wichtigen README-Begriffen. Überprüfen Sie vor jedem Experiment oder jeder Veröffentlichung den angehefteten Zweig, Abhängigkeiten, Lizenzen und alle Sprach-/Musikberechtigungen.



