So-VITS-SVC
So-VITS-SVC
Active

So-VITS-SVC

So-VITS-SVC 4.1 est un cadre de recherche open source archivé pour la conversion de la voix chantée, et non la synthèse vocale. Ce guide indépendant couvre le consentement, les licences, les ensembles de données propres, F0 et encodeurs, la formation, l'inférence, l'évaluation, la divulgation, la sécurité et les alternatives.

108

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

so-vits-svcconversion voix chantéevoice conversionAI singing voiceSoftVC VITS

Product Preview

A quick visual look at So-VITS-SVC before you visit the official site.

Published 1/21/2026
So-VITS-SVC screenshot

Editorial Review

About So-VITS-SVC

So-VITS-SVC est un cadre de recherche pour la conversion de la voix chantée (SVC) : il prend une performance vocale existante et restitue son contenu linguistique et sa mélodie avec un timbre cible entraîné. Il ne s’agit pas de synthèse vocale, n’est pas livré avec un modèle vocal et ne peut légalement ou éthiquement fournir des droits sur l’identité d’un artiste, sa chanson source ou ses enregistrements de formation.

L'original svc-develop-team/so-vits-svc le référentiel a été archivé en novembre 2023 et est en lecture seule. Sa branche 4.1-Stable reste largement référencée, mais son adoption signifie désormais épingler les anciennes dépendances, valider les points de contrôle tiers et assumer l'entière responsabilité de la maintenance. Le README décrit l'utilisation académique, met l'accent sur l'intention du personnage fictif, oblige les utilisateurs à résoudre l'autorisation de l'ensemble de données et définit des conditions de publication/divulgation supplémentaires. Lisez ensemble le fichier README et la licence exacts du référentiel avant de l'utiliser.

Official So-VITS-SVC repository diagram and project media
Médias officiels du projet. L'artefact conservé est une base de code de recherche archivée, et non un service hébergé ou un catalogue de voix sous licence.

SVC n'est pas TTS, un vocodeur ou une séparation de source

TechnologieEntréeSortieCe qu'il ne fournit pas
So-VITS-SVCSource audio chantée/parlée + modèle cible entraînéMême performance rendue vers le timbre cibleDroits de génération ou d'utilisation des paroles à la performance
Synthèse vocaleTexte + conditionnement voix/styleNouvelle forme d'onde parléeReprise fidèle d'une prestation chantée existante
Synthèse chantéeParoles, notes et contrôles d'expressionNouvelle performance chantéeAutorisation légale automatique d'imiter un chanteur
VocodeurReprésentation acoustiqueForme d'ondePolitique de conversion contenu/timbre
Séparation des sourcesChanson mixteEstimation des tiges vocales/instrumentalesNettoyer les multipistes originales ou la conversion vocale

Le pipeline complet et l'endroit où les artefacts entrent

 enregistrements cibles consentis
          |
          v
 nettoyer -> segment -> rééchantillonner -> fonctionnalités de contenu + F0
          |                           |
          '--------------- formation ------'
                         |
                         v
                 modèle de voix cible
                         |
 source vocale -> extraction F0/contenu -> générateur -> diffusion optionnelle
                         |                    |
                         '------ rendu ------'
                                      |
                              audio humain + contrôle qualité des droits

Les encodeurs de contenu tentent de représenter les informations phonétiques tout en supprimant l'identité de la source. F0 porte le pitch ; le générateur et le vocodeur reconstruisent l'audio dans le timbre cible. Un démêlage imparfait crée une « fuite de timbre », où le chanteur source reste audible. Une mauvaise séparation ajoute des instruments et de la réverbération aux données d'entraînement ; une extraction de hauteur incohérente produit des sauts d'octave ; l'écrêtage et les fréquences d'échantillonnage incompatibles deviennent des artefacts métalliques.

Portail des droits avant tout téléchargement ou formation

Un enregistrement techniquement public ne constitue pas automatiquement un ensemble de données de formation licite. Obtenez l'autorisation documentée de l'interprète vocal identifiable et des titulaires de droits pour la formation prévue, le stockage du modèle, les collaborateurs, les territoires, le statut commercial et la distribution des résultats. Licencez séparément la composition, les paroles, la voix principale/source et la piste d'accompagnement utilisées dans une reprise publiée.

Actif ou droitPreuve à conserverHypothèse erronée courante
Cibler les enregistrements vocauxConsentement de l’interprète et droits d’enregistrement/master« Disponible en ligne » signifie formable
Identité vocale/personaPortée, durée, révocation et contextes autorisésUne licence de logiciel accorde des droits de ressemblance
Source vocaleAutorisation d'enregistrement et conditions compatibles avec les outilsUne tige séparée devient la vôtre
Chanson/parolesAutorisations de composition/mécanique/synchronisation, le cas échéantUne couverture supprime les droits de publication
Modèle/point de contrôleProvenance, licence, déclaration de l'ensemble de données et somme de contrôleUne page de téléchargement prouve les données autorisées
Version finaleExamen de la politique de la plateforme, divulgation et crédits« Généré par l'IA » est une défense juridique complète

Ne créez pas d’usurpation d’identité trompeuse, de fraude, de harcèlement, de contenu à caractère sexuel ou de messages politiques avec la voix reconnaissable d’une autre personne. Pour un projet de personnage fictif, confirmez que les droits du personnage et de l'exécution originale sont également autorisés. Lorsque le consentement est retiré, disposez d’un processus pratique de suppression du modèle et de retrait de distribution.

Conception des ensembles de données : la qualité bat la durée sans discernement

Utilisez des enregistrements propres, secs et isolés de la cible consentante. Supprimez le saignement des instruments, la réverbération lourde de la pièce, les voix doublées, les effets extrêmes, l'écrêtage, les longs silences et autres haut-parleurs. Préservez une variété expressive qui correspond au résultat souhaité (plage de hauteur, voyelles, consonnes, registres et dynamiques) sans mélanger aveuglément des chaînes d'enregistrement incompatibles.

Divisé par session ou chanson source contiguë, et non par clips adjacents aléatoires, de sorte que la validation ne contient pas de quasi-doublons de la formation. Conservez un ensemble de test verrouillé qui n’est jamais utilisé pour le réglage. Conservez un manifeste avec le hachage du fichier, l'origine, l'enregistrement de consentement, la fréquence d'échantillonnage, la durée, les étapes de prétraitement, la transcription/les paroles si disponibles et le motif de l'exclusion.

Vérification de l'ensemble de donnéesSignal de passageCorriger
IsolementPas d'accompagnement audible ni de choristeUtilisez les tiges originales ou jetez-les ; la séparation est imparfaite
NiveauPas de coupure ; signal utilisable cohérentNormalisez soigneusement, ne réparez jamais les coupures graves par conjecture
IdentitéUne cible autorisée par label d'intervenantSupprimer les collaborateurs et les réponses de la foule
Couverture du pitchCorrespond à la gamme de chant prévueEnregistrer les registres manquants consentis
Indépendance des validationsDifférentes séances/phrases de la formationRe-diviser avant de mesurer
ProvenanceChaque clip est mappé à un enregistrement d'autorisationMettre en quarantaine les fichiers non attribués

Réalité des versions et des dépendances

Le README 4.1-Stable signale Python 3.8.9 comme sa version stable testée et nécessite des actifs d'encodeurs/vocodeur pré-entraînés distincts. En 2026, il s’agit d’un environnement hérité. Construisez-le dans un conteneur isolé ou une machine virtuelle, épinglez des hachages, analysez les dépendances et refusez l'accès au réseau inutile. N'affaiblissez pas globalement un poste de travail moderne pour satisfaire les anciens packages CUDA ou Python.

Les forks, notebooks, interfaces graphiques et packs de modèles tiers sont des projets distincts. Ils peuvent modifier le code, les licences, la télémétrie ou les téléchargements par défaut. Vérifiez l’ascendance en amont, la validation, le contenu du programme d’installation et la provenance du modèle. Ne chargez jamais de points de contrôle PyTorch non fiables sur une machine contenant des secrets : les anciens formats de sérialisation peuvent exécuter du code pendant le chargement.

Encodeur de contenu, F0 et choix de récupération

4.1 documente plusieurs encodeurs vocaux, avec des variantes ContentVec parmi les choix courants. Les dimensions et la configuration de l'encodeur doivent correspondre au point de contrôle ; La compatibilité 4.0 peut nécessiter l'ajout du bon encodeur_parole champ. Les modèles et les actifs prétraités de différentes branches ne sont pas universellement interchangeables.

Pour le chant, préservez la mélodie source à l’aide d’un extracteur F0 robuste et validez le comportement d’octave. Le README avertit que la prédiction automatique de F0 peut provoquer un changement de hauteur important pour le chant et ne devrait généralement pas y être activée. La récupération ou le regroupement de fonctionnalités peuvent réduire les fuites de timbre source et parfois améliorer l'articulation, mais un rapport de mixage élevé peut copier les artefacts de l'ensemble de données et ralentir l'inférence. Traitez l'exemple documenté de 0,5 comme un point de départ et non comme un optimal universel.

ContrôleÉcoutezSymptôme de mauvais réglage
Extracteur F0Mélodie stable, vibrato et transitions voisées/non voiséesSauts d'octave, hauteur robotique ou consonnes perdues
Changement de hauteurPlage cible confortable sans effondrement des formantsTonalité tamia/en plein essor et aigus instables
Rapport récupération/clusterCibler la similarité sans artefacts mémorisésBuzzing, bruit copié ou intelligibilité réduite
Diffusion superficielleDétails plus lisses sans surtraitementTransitoires flous et calcul supplémentaire
Échelle de bruit / découpageTexture naturelle et continuité des phrasesBruit respiratoire, coutures ou tonalité incohérente

S'entraîner sans courir après une seule valeur de perte

Commencez par une petite configuration et une base de référence vérifiable. Enregistrez la configuration, la graine, la validation du code, le verrouillage des dépendances, le GPU, le manifeste de prétraitement et le hachage du point de contrôle. Rendu périodiquement les mêmes phrases de validation consenties. La perte de formation peut diminuer tandis que le naturel perçu, l’intelligibilité ou la similarité des cibles stagnent ou se dégradent.

Arrêtez-vous en fonction d'une validation en aveugle et de taux d'artefacts, et non d'un nombre de pas recommandé par la communauté. Séparez les points de contrôle de formation et d’inférence publiables. Le référentiel décrit la compression du modèle qui supprime les données de formation uniquement et peut réduire considérablement la taille finale ; conserver le point de contrôle d'origine uniquement dans un stockage contrôlé si la formation continue est autorisée.

Évaluation : trois qualités, pas une seule note « ça sonne bien »

DimensionsTest humainMétrique de support
NaturalitéÉvaluation MOS aveugle sur les phrases invisiblesNombre d'artefacts par type et durée
Similitude cibleJugement A/B conscient du consentement contre la cibleHaut-parleur intégrant la similarité, jamais utilisé seul
Exactitude du contenuTranscrire les paroles et les mots critiquesErreur de phonème/mot le cas échéant
Fidélité du pitchLe musicien vérifie la mélodie et l'intention expressiveCorrélation F0, RMSE et erreur sonore
Fuite à la sourceLes auditeurs peuvent-ils encore identifier le chanteur source ?Comparer la tendance d'intégration source/cible
Coût opérationnelTemps écoulé entre l'entrée propre et la tige acceptéeFacteur temps réel, VRAM et minutes de correction

Utilisez plusieurs chanteurs et chansons sources en dehors de l’ensemble de formation. Incluez des notes aiguës, des notes graves, des sections haletantes, des paroles rapides, du vibrato et du silence. Randomisez les échantillons et masquez les noms des systèmes aux évaluateurs. Signalez les intervalles de confiance et les résultats rejetés, pas seulement la meilleure démo.

Post-production et divulgation

Inspectez le solo vocal converti avant de mixer. Réparez uniquement les artefacts localisés, alignez le timing là où le prétraitement a introduit la dérive, contrôlez les sifflements et les respirations, puis mixez avec un instrument obtenu légalement. N'utilisez pas d'effets lourds pour masquer l'échec du modèle lors de l'évaluation.

Les termes du projet exigent une attribution claire de la source d’entrée vocale/audio pour les téléchargements sur la plateforme. Au-delà de ce minimum, qualifiez le résultat de conversion vocale IA, identifiez le propriétaire autorisé de la voix/du modèle une fois convenu, créditez les droits de la chanson et de la source et décrivez une édition significative. Conservez une feuille de production privée reliant le hachage du modèle, la source, les paramètres, les consentements et le master final.

Contrôles de sécurité et de distribution

  • Stockez les données d’entraînement et les points de contrôle chiffrés avec un accès basé sur les rôles.
  • Publier des sommes de contrôle et un modèle de carte ; ne distribuez pas de clips de formation bruts.
  • Restreindre l’utilisation d’un modèle publié via un contrat et un contrôle d’accès ; une licence de texte ne peut à elle seule empêcher la copie.
  • Testez les points de contrôle dans un environnement jetable et restreint au réseau avant le chargement.
  • Définissez la réponse aux incidents en cas d'usurpation d'identité, de modèles divulgués et de retrait de consentement.
  • Séparez le partage de démo de l'autorisation de téléchargement ; un échantillon rendu n'a pas besoin d'exposer des poids.

Alternatives

OptionsMeilleur ajustementCompromis
So-VITS-SVC 4.1Reproduire des recherches SVC plus anciennes avec un pipeline connuDépendances archivées, héritées et maintenance appartenant à l'utilisateur
RVCFlux de travail de conversion vocale accessibles basés sur la récupérationArchitecture/écosystème de modèles différents et mêmes risques liés aux droits
Recherche en diffusion/SVC moderneÉquipes évaluant la qualité actuelle ou les méthodes de tir zéroComplexité plus élevée et reproductibilité inégale
Service vocal commercial sous licenceProduction nécessitant un soutien et des termes explicites du catalogue des artistesCoût, limites de la plateforme et droits sur la chanson source toujours requis
Chanteur consentantSortie commerciale, direction expressive et responsabilitéPlanification et coût direct de production
Traitement vocal traditionnelCorrection de la performance originale autoriséeNe peut pas changer d'identité, mais préserve la relation avec l'interprète

Questions fréquemment posées

So-VITS-SVC est-il toujours maintenu ?

Le référentiel d'origine est archivé et en lecture seule. Les fourches peuvent être actives mais doivent être évaluées indépendamment.

Est-ce que cela génère du chant à partir des paroles ?

Non. Il convertit une performance vocale existante. La synthèse vocale et le TTS sont des tâches différentes.

Est-ce que cela inclut des modèles vocaux ?

Non. Le projet officiel indique que les utilisateurs entraînent les modèles de manière indépendante ; les packs tiers ne sont pas approuvés par les contributeurs en amont.

Puis-je m’entraîner à partir des chansons d’une célébrité ?

Pas seulement parce que les enregistrements sont publics. Obtenez les droits appropriés pour la voix, l’interprétation, l’enregistrement, la composition et l’utilisation.

Quelle quantité de données est requise ?

Il n’existe pas de décompte universel des minutes. Une couverture propre, représentative et autorisée et une validation indépendante comptent plus que la collecte sans discernement.

Pourquoi le résultat retient-il le chanteur source ?

Les représentations du contenu sont imparfaites. Des données plus propres, un choix d'encodeur et une récupération/regroupement soigneusement réglés peuvent réduire les fuites mais ne peuvent pas garantir la suppression.

Un point de contrôle téléchargé est-il sûr ?

Pas automatiquement. Vérifiez la provenance et les hachages et chargez-le uniquement dans un environnement isolé, car la sérialisation du modèle peut comporter des risques exécutables.

Sources primaires

Dernière révision le 25 juillet 2026. Il s'agit d'un projet de recherche archivé contenant des termes README inhabituellement importants. Vérifiez la branche épinglée, les dépendances, les licences et toutes les autorisations voix/musique avant toute expérience ou publication.

Ready to try So-VITS-SVC?

Visit the official website to get started

Visit So-VITS-SVC

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/3/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Vocal Remover

Vocal Remover

Separate voice from music out of a song free with powerful AI algorithms - Outil IA intelligent pour améliorer votre productivité.

voice-processingfree
770
Lalal.ai

Lalal.ai

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - Outil IA intelligent pour améliorer votre productivité.

voice-processingfree
690
PollyReach

PollyReach

PollyReach est un produit IA de la catégorie voice-processing, utile pour les utilisateurs qui veulent déployer de vrais workflows en production.

voice-processingoutil IA
660
Klariqo

Klariqo

Klariqo est une plateforme d'agents vocaux pour centres d'appels et equipes BPO qui veulent laisser l'IA prequalifier les appels, filtrer les mauvais leads et ne transferer que les conversations vraiment vendeuses aux closers humains.

agents vocaux IAautomatisation centre d'appelsdialer SIP
610