So-VITS-SVC est un cadre de recherche pour la conversion de la voix chantée (SVC) : il prend une performance vocale existante et restitue son contenu linguistique et sa mélodie avec un timbre cible entraîné. Il ne s’agit pas de synthèse vocale, n’est pas livré avec un modèle vocal et ne peut légalement ou éthiquement fournir des droits sur l’identité d’un artiste, sa chanson source ou ses enregistrements de formation.
L'original svc-develop-team/so-vits-svc le référentiel a été archivé en novembre 2023 et est en lecture seule. Sa branche 4.1-Stable reste largement référencée, mais son adoption signifie désormais épingler les anciennes dépendances, valider les points de contrôle tiers et assumer l'entière responsabilité de la maintenance. Le README décrit l'utilisation académique, met l'accent sur l'intention du personnage fictif, oblige les utilisateurs à résoudre l'autorisation de l'ensemble de données et définit des conditions de publication/divulgation supplémentaires. Lisez ensemble le fichier README et la licence exacts du référentiel avant de l'utiliser.

SVC n'est pas TTS, un vocodeur ou une séparation de source
| Technologie | Entrée | Sortie | Ce qu'il ne fournit pas |
|---|---|---|---|
| So-VITS-SVC | Source audio chantée/parlée + modèle cible entraîné | Même performance rendue vers le timbre cible | Droits de génération ou d'utilisation des paroles à la performance |
| Synthèse vocale | Texte + conditionnement voix/style | Nouvelle forme d'onde parlée | Reprise fidèle d'une prestation chantée existante |
| Synthèse chantée | Paroles, notes et contrôles d'expression | Nouvelle performance chantée | Autorisation légale automatique d'imiter un chanteur |
| Vocodeur | Représentation acoustique | Forme d'onde | Politique de conversion contenu/timbre |
| Séparation des sources | Chanson mixte | Estimation des tiges vocales/instrumentales | Nettoyer les multipistes originales ou la conversion vocale |
Le pipeline complet et l'endroit où les artefacts entrent
enregistrements cibles consentis
|
v
nettoyer -> segment -> rééchantillonner -> fonctionnalités de contenu + F0
| |
'--------------- formation ------'
|
v
modèle de voix cible
|
source vocale -> extraction F0/contenu -> générateur -> diffusion optionnelle
| |
'------ rendu ------'
|
audio humain + contrôle qualité des droits
Les encodeurs de contenu tentent de représenter les informations phonétiques tout en supprimant l'identité de la source. F0 porte le pitch ; le générateur et le vocodeur reconstruisent l'audio dans le timbre cible. Un démêlage imparfait crée une « fuite de timbre », où le chanteur source reste audible. Une mauvaise séparation ajoute des instruments et de la réverbération aux données d'entraînement ; une extraction de hauteur incohérente produit des sauts d'octave ; l'écrêtage et les fréquences d'échantillonnage incompatibles deviennent des artefacts métalliques.
Portail des droits avant tout téléchargement ou formation
Un enregistrement techniquement public ne constitue pas automatiquement un ensemble de données de formation licite. Obtenez l'autorisation documentée de l'interprète vocal identifiable et des titulaires de droits pour la formation prévue, le stockage du modèle, les collaborateurs, les territoires, le statut commercial et la distribution des résultats. Licencez séparément la composition, les paroles, la voix principale/source et la piste d'accompagnement utilisées dans une reprise publiée.
| Actif ou droit | Preuve à conserver | Hypothèse erronée courante |
|---|---|---|
| Cibler les enregistrements vocaux | Consentement de l’interprète et droits d’enregistrement/master | « Disponible en ligne » signifie formable |
| Identité vocale/persona | Portée, durée, révocation et contextes autorisés | Une licence de logiciel accorde des droits de ressemblance |
| Source vocale | Autorisation d'enregistrement et conditions compatibles avec les outils | Une tige séparée devient la vôtre |
| Chanson/paroles | Autorisations de composition/mécanique/synchronisation, le cas échéant | Une couverture supprime les droits de publication |
| Modèle/point de contrôle | Provenance, licence, déclaration de l'ensemble de données et somme de contrôle | Une page de téléchargement prouve les données autorisées |
| Version finale | Examen de la politique de la plateforme, divulgation et crédits | « Généré par l'IA » est une défense juridique complète |
Ne créez pas d’usurpation d’identité trompeuse, de fraude, de harcèlement, de contenu à caractère sexuel ou de messages politiques avec la voix reconnaissable d’une autre personne. Pour un projet de personnage fictif, confirmez que les droits du personnage et de l'exécution originale sont également autorisés. Lorsque le consentement est retiré, disposez d’un processus pratique de suppression du modèle et de retrait de distribution.
Conception des ensembles de données : la qualité bat la durée sans discernement
Utilisez des enregistrements propres, secs et isolés de la cible consentante. Supprimez le saignement des instruments, la réverbération lourde de la pièce, les voix doublées, les effets extrêmes, l'écrêtage, les longs silences et autres haut-parleurs. Préservez une variété expressive qui correspond au résultat souhaité (plage de hauteur, voyelles, consonnes, registres et dynamiques) sans mélanger aveuglément des chaînes d'enregistrement incompatibles.
Divisé par session ou chanson source contiguë, et non par clips adjacents aléatoires, de sorte que la validation ne contient pas de quasi-doublons de la formation. Conservez un ensemble de test verrouillé qui n’est jamais utilisé pour le réglage. Conservez un manifeste avec le hachage du fichier, l'origine, l'enregistrement de consentement, la fréquence d'échantillonnage, la durée, les étapes de prétraitement, la transcription/les paroles si disponibles et le motif de l'exclusion.
| Vérification de l'ensemble de données | Signal de passage | Corriger |
|---|---|---|
| Isolement | Pas d'accompagnement audible ni de choriste | Utilisez les tiges originales ou jetez-les ; la séparation est imparfaite |
| Niveau | Pas de coupure ; signal utilisable cohérent | Normalisez soigneusement, ne réparez jamais les coupures graves par conjecture |
| Identité | Une cible autorisée par label d'intervenant | Supprimer les collaborateurs et les réponses de la foule |
| Couverture du pitch | Correspond à la gamme de chant prévue | Enregistrer les registres manquants consentis |
| Indépendance des validations | Différentes séances/phrases de la formation | Re-diviser avant de mesurer |
| Provenance | Chaque clip est mappé à un enregistrement d'autorisation | Mettre en quarantaine les fichiers non attribués |
Réalité des versions et des dépendances
Le README 4.1-Stable signale Python 3.8.9 comme sa version stable testée et nécessite des actifs d'encodeurs/vocodeur pré-entraînés distincts. En 2026, il s’agit d’un environnement hérité. Construisez-le dans un conteneur isolé ou une machine virtuelle, épinglez des hachages, analysez les dépendances et refusez l'accès au réseau inutile. N'affaiblissez pas globalement un poste de travail moderne pour satisfaire les anciens packages CUDA ou Python.
Les forks, notebooks, interfaces graphiques et packs de modèles tiers sont des projets distincts. Ils peuvent modifier le code, les licences, la télémétrie ou les téléchargements par défaut. Vérifiez l’ascendance en amont, la validation, le contenu du programme d’installation et la provenance du modèle. Ne chargez jamais de points de contrôle PyTorch non fiables sur une machine contenant des secrets : les anciens formats de sérialisation peuvent exécuter du code pendant le chargement.
Encodeur de contenu, F0 et choix de récupération
4.1 documente plusieurs encodeurs vocaux, avec des variantes ContentVec parmi les choix courants. Les dimensions et la configuration de l'encodeur doivent correspondre au point de contrôle ; La compatibilité 4.0 peut nécessiter l'ajout du bon encodeur_parole champ. Les modèles et les actifs prétraités de différentes branches ne sont pas universellement interchangeables.
Pour le chant, préservez la mélodie source à l’aide d’un extracteur F0 robuste et validez le comportement d’octave. Le README avertit que la prédiction automatique de F0 peut provoquer un changement de hauteur important pour le chant et ne devrait généralement pas y être activée. La récupération ou le regroupement de fonctionnalités peuvent réduire les fuites de timbre source et parfois améliorer l'articulation, mais un rapport de mixage élevé peut copier les artefacts de l'ensemble de données et ralentir l'inférence. Traitez l'exemple documenté de 0,5 comme un point de départ et non comme un optimal universel.
| Contrôle | Écoutez | Symptôme de mauvais réglage |
|---|---|---|
| Extracteur F0 | Mélodie stable, vibrato et transitions voisées/non voisées | Sauts d'octave, hauteur robotique ou consonnes perdues |
| Changement de hauteur | Plage cible confortable sans effondrement des formants | Tonalité tamia/en plein essor et aigus instables |
| Rapport récupération/cluster | Cibler la similarité sans artefacts mémorisés | Buzzing, bruit copié ou intelligibilité réduite |
| Diffusion superficielle | Détails plus lisses sans surtraitement | Transitoires flous et calcul supplémentaire |
| Échelle de bruit / découpage | Texture naturelle et continuité des phrases | Bruit respiratoire, coutures ou tonalité incohérente |
S'entraîner sans courir après une seule valeur de perte
Commencez par une petite configuration et une base de référence vérifiable. Enregistrez la configuration, la graine, la validation du code, le verrouillage des dépendances, le GPU, le manifeste de prétraitement et le hachage du point de contrôle. Rendu périodiquement les mêmes phrases de validation consenties. La perte de formation peut diminuer tandis que le naturel perçu, l’intelligibilité ou la similarité des cibles stagnent ou se dégradent.
Arrêtez-vous en fonction d'une validation en aveugle et de taux d'artefacts, et non d'un nombre de pas recommandé par la communauté. Séparez les points de contrôle de formation et d’inférence publiables. Le référentiel décrit la compression du modèle qui supprime les données de formation uniquement et peut réduire considérablement la taille finale ; conserver le point de contrôle d'origine uniquement dans un stockage contrôlé si la formation continue est autorisée.
Évaluation : trois qualités, pas une seule note « ça sonne bien »
| Dimensions | Test humain | Métrique de support |
|---|---|---|
| Naturalité | Évaluation MOS aveugle sur les phrases invisibles | Nombre d'artefacts par type et durée |
| Similitude cible | Jugement A/B conscient du consentement contre la cible | Haut-parleur intégrant la similarité, jamais utilisé seul |
| Exactitude du contenu | Transcrire les paroles et les mots critiques | Erreur de phonème/mot le cas échéant |
| Fidélité du pitch | Le musicien vérifie la mélodie et l'intention expressive | Corrélation F0, RMSE et erreur sonore |
| Fuite à la source | Les auditeurs peuvent-ils encore identifier le chanteur source ? | Comparer la tendance d'intégration source/cible |
| Coût opérationnel | Temps écoulé entre l'entrée propre et la tige acceptée | Facteur temps réel, VRAM et minutes de correction |
Utilisez plusieurs chanteurs et chansons sources en dehors de l’ensemble de formation. Incluez des notes aiguës, des notes graves, des sections haletantes, des paroles rapides, du vibrato et du silence. Randomisez les échantillons et masquez les noms des systèmes aux évaluateurs. Signalez les intervalles de confiance et les résultats rejetés, pas seulement la meilleure démo.
Post-production et divulgation
Inspectez le solo vocal converti avant de mixer. Réparez uniquement les artefacts localisés, alignez le timing là où le prétraitement a introduit la dérive, contrôlez les sifflements et les respirations, puis mixez avec un instrument obtenu légalement. N'utilisez pas d'effets lourds pour masquer l'échec du modèle lors de l'évaluation.
Les termes du projet exigent une attribution claire de la source d’entrée vocale/audio pour les téléchargements sur la plateforme. Au-delà de ce minimum, qualifiez le résultat de conversion vocale IA, identifiez le propriétaire autorisé de la voix/du modèle une fois convenu, créditez les droits de la chanson et de la source et décrivez une édition significative. Conservez une feuille de production privée reliant le hachage du modèle, la source, les paramètres, les consentements et le master final.
Contrôles de sécurité et de distribution
- Stockez les données d’entraînement et les points de contrôle chiffrés avec un accès basé sur les rôles.
- Publier des sommes de contrôle et un modèle de carte ; ne distribuez pas de clips de formation bruts.
- Restreindre l’utilisation d’un modèle publié via un contrat et un contrôle d’accès ; une licence de texte ne peut à elle seule empêcher la copie.
- Testez les points de contrôle dans un environnement jetable et restreint au réseau avant le chargement.
- Définissez la réponse aux incidents en cas d'usurpation d'identité, de modèles divulgués et de retrait de consentement.
- Séparez le partage de démo de l'autorisation de téléchargement ; un échantillon rendu n'a pas besoin d'exposer des poids.
Alternatives
| Options | Meilleur ajustement | Compromis |
|---|---|---|
| So-VITS-SVC 4.1 | Reproduire des recherches SVC plus anciennes avec un pipeline connu | Dépendances archivées, héritées et maintenance appartenant à l'utilisateur |
| RVC | Flux de travail de conversion vocale accessibles basés sur la récupération | Architecture/écosystème de modèles différents et mêmes risques liés aux droits |
| Recherche en diffusion/SVC moderne | Équipes évaluant la qualité actuelle ou les méthodes de tir zéro | Complexité plus élevée et reproductibilité inégale |
| Service vocal commercial sous licence | Production nécessitant un soutien et des termes explicites du catalogue des artistes | Coût, limites de la plateforme et droits sur la chanson source toujours requis |
| Chanteur consentant | Sortie commerciale, direction expressive et responsabilité | Planification et coût direct de production |
| Traitement vocal traditionnel | Correction de la performance originale autorisée | Ne peut pas changer d'identité, mais préserve la relation avec l'interprète |
Questions fréquemment posées
So-VITS-SVC est-il toujours maintenu ?
Le référentiel d'origine est archivé et en lecture seule. Les fourches peuvent être actives mais doivent être évaluées indépendamment.
Est-ce que cela génère du chant à partir des paroles ?
Non. Il convertit une performance vocale existante. La synthèse vocale et le TTS sont des tâches différentes.
Est-ce que cela inclut des modèles vocaux ?
Non. Le projet officiel indique que les utilisateurs entraînent les modèles de manière indépendante ; les packs tiers ne sont pas approuvés par les contributeurs en amont.
Puis-je m’entraîner à partir des chansons d’une célébrité ?
Pas seulement parce que les enregistrements sont publics. Obtenez les droits appropriés pour la voix, l’interprétation, l’enregistrement, la composition et l’utilisation.
Quelle quantité de données est requise ?
Il n’existe pas de décompte universel des minutes. Une couverture propre, représentative et autorisée et une validation indépendante comptent plus que la collecte sans discernement.
Pourquoi le résultat retient-il le chanteur source ?
Les représentations du contenu sont imparfaites. Des données plus propres, un choix d'encodeur et une récupération/regroupement soigneusement réglés peuvent réduire les fuites mais ne peuvent pas garantir la suppression.
Un point de contrôle téléchargé est-il sûr ?
Pas automatiquement. Vérifiez la provenance et les hachages et chargez-le uniquement dans un environnement isolé, car la sérialisation du modèle peut comporter des risques exécutables.
Sources primaires
- Dépôt archivé officiel
- README officiel 4.1-Stable, termes et flux de travail
- README chinois officiel
- Licence de référentiel
- Modèles de configuration officiels
- Recherche SVC et DSPGAN basées sur VITS
- Recherche chuchotée et multi-échelle F0 SVC
- Recherche interspeech faisant référence à So-VITS-SVC
- Initiative IA du US Copyright Office et rapports actuels
Dernière révision le 25 juillet 2026. Il s'agit d'un projet de recherche archivé contenant des termes README inhabituellement importants. Vérifiez la branche épinglée, les dépendances, les licences et toutes les autorisations voix/musique avant toute expérience ou publication.



