So-VITS-SVC es un marco de investigación para la conversión de voz cantada (SVC): toma una interpretación vocal existente y presenta su contenido lingüístico y melodía con un timbre objetivo entrenado. No es conversión de texto a voz, no viene con un modelo de voz y no puede proporcionar legal o éticamente derechos sobre la identidad de un intérprete, la canción original o las grabaciones de entrenamiento.
el original svc-desarrollo-equipo/so-vits-svc El repositorio se archivó en noviembre de 2023 y es de solo lectura. Su rama 4.1-Stable sigue siendo ampliamente citada, pero su adopción ahora significa fijar dependencias antiguas, validar puntos de control de terceros y asumir la responsabilidad total del mantenimiento. El README describe el uso académico, enfatiza la intención del personaje ficticio, requiere que los usuarios resuelvan la autorización del conjunto de datos y establece términos adicionales de publicación/divulgación. Lea el archivo README y la licencia exactos del repositorio antes de usarlo.

SVC no es TTS, ni un vocoder ni una separación de fuentes.
| Tecnología | Entrada | Salida | Lo que no proporciona |
|---|---|---|---|
| So-VITS-SVC | Audio fuente cantado/hablado + modelo objetivo entrenado | Misma interpretación renderizada hacia el timbre objetivo | Derechos de uso o generación de letra a interpretación |
| Texto a voz | Texto + voz/condicionamiento de estilo | Nueva forma de onda hablada | Transferencia fiel de una interpretación cantada existente. |
| Síntesis de canto | Controles de letras, notas y expresión. | Nueva interpretación cantada | Permiso legal automático para imitar a un cantante. |
| codificador de voz | representación acústica | Forma de onda | Política de conversión de contenido/timbre |
| Separación de fuentes | cancion mixta | Tallos vocales/instrumentales estimados | Limpiar multipistas originales o conversión de voz. |
El proceso completo y por dónde entran los artefactos
grabaciones de destino consentidas
|
v
limpiar -> segmento -> remuestrear -> características de contenido + F0
| |
'----------- entrenamiento ------'
|
v
modelo de voz objetivo
|
fuente vocal -> F0/extracción de contenido -> generador -> difusión opcional
| |
'------ renderizar ------'
|
audio humano + derechos de calidad
Los codificadores de contenido intentan representar información fonética mientras suprimen la identidad de la fuente. F0 transporta el tono; el generador y el vocoder reconstruyen el audio en el timbre objetivo. El desenredo imperfecto crea una “fuga tímbrica”, donde el cantante fuente permanece audible. Una mala separación añade instrumentos y reverberación a los datos de entrenamiento; la extracción inconsistente del tono produce saltos de octava; el recorte y las frecuencias de muestreo no coincidentes se convierten en artefactos metálicos.
Puerta de derechos antes de cualquier descarga o capacitación.
Una grabación técnicamente pública no es automáticamente un conjunto de datos de entrenamiento legal. Obtenga un permiso documentado del intérprete de voz identificable y de los titulares de derechos para la capacitación prevista, el almacenamiento del modelo, los colaboradores, los territorios, el estado comercial y la distribución de resultados. Licencia por separado la composición, la letra, la voz principal/fuente y la pista de acompañamiento utilizadas en una portada publicada.
| Bien o derecho | Evidencia a retener | Suposición errónea común |
|---|---|---|
| Grabaciones de voz de destino | Consentimiento del intérprete y derechos de grabación/master | “Disponible en línea” significa entrenable |
| Identidad de voz/persona | Alcance, duración, revocación y contextos permitidos | Una licencia de software otorga derechos de imagen |
| fuente vocal | Permiso de grabación y términos compatibles con herramientas | Un tallo separado se vuelve tuyo |
| Canción/letra | Permisos de composición/mecánicos/sincronización según corresponda | Una portada elimina los derechos de publicación |
| Modelo/punto de control | Procedencia, licencia, declaración del conjunto de datos y suma de verificación | Una página de descarga prueba los datos autorizados. |
| lanzamiento final | Revisión, divulgación y créditos de la política de la plataforma | La “IA generada” es una defensa legal completa |
No cree suplantaciones engañosas, fraude, acoso, contenido sexual o mensajes políticos en la voz reconocible de otra persona. Para un proyecto de personaje de ficción, confirme que los derechos del personaje y de la interpretación original también estén autorizados. Cuando se retire el consentimiento, contar con un proceso práctico de eliminación y distribución del modelo.
Diseño de conjuntos de datos: la calidad supera la duración indiscriminada
Utilice grabaciones limpias, secas y aisladas del objetivo que haya dado su consentimiento. Elimine el sangrado de instrumentos, la reverberación intensa de la sala, las voces duplicadas, los efectos extremos, los recortes, los silencios prolongados y otros altavoces. Conserve la variedad expresiva que coincida con el resultado deseado (rango de tono, vocales, consonantes, registros y dinámica) sin mezclar ciegamente cadenas de grabación incompatibles.
Dividido por sesión o canción de origen contigua, no por clips adyacentes aleatorios, de modo que la validación no contenga casi duplicados del entrenamiento. Mantenga un equipo de prueba bloqueado que nunca se utilice para realizar ajustes. Mantenga un manifiesto con hash del archivo, origen, registro de consentimiento, frecuencia de muestreo, duración, pasos de preprocesamiento, transcripción/letra si están disponibles y motivo de exclusión.
| Verificación del conjunto de datos | pasar señal | Arreglar |
|---|---|---|
| Aislamiento | Sin acompañamiento audible ni corista. | Utilice tallos originales o deséchelos; la separación es imperfecta |
| Nivel | Sin recortes; señal utilizable consistente | Normalice con cuidado, nunca repare recortes severos por conjetura |
| Identidad | Un objetivo autorizado por etiqueta de altavoz | Eliminar colaboradores y respuestas multitudinarias |
| Cobertura de campo | Coincide con el rango de canto previsto | Registro de registros faltantes consentidos |
| Independencia de validación | Diferentes sesiones/frases del entrenamiento | Volver a dividir antes de medir |
| Procedencia | Cada clip se asigna a un registro de permiso | Poner en cuarentena archivos no atribuidos |
Versión y realidad de dependencia.
El archivo README 4.1-Stable informa Python 3.8.9 como su versión estable probada y requiere codificadores/vocoders previamente entrenados por separado. En 2026, este será un entorno heredado. Constrúyalo en un contenedor aislado o en una máquina virtual, fije hashes, escanee dependencias y niegue el acceso innecesario a la red. No debilite globalmente una estación de trabajo moderna para satisfacer paquetes antiguos CUDA o Python.
Las bifurcaciones, los cuadernos, las GUI y los paquetes de modelos de terceros son proyectos independientes. Pueden cambiar el código, las licencias, la telemetría o las descargas predeterminadas. Verifique la ascendencia, la confirmación, el contenido del instalador y la procedencia del modelo. Nunca cargue puntos de control PyTorch que no sean de confianza en una máquina que contenga secretos: los formatos de serialización heredados pueden ejecutar código durante la carga.
Codificador de contenido, F0 y opciones de recuperación
4.1 documenta múltiples codificadores de voz, con variantes ContentVec entre las opciones comunes. Las dimensiones y configuración del codificador deben coincidir con el punto de control; La compatibilidad 4.0 puede requerir agregar el correcto codificador de voz campo. Los modelos y activos preprocesados de diferentes ramas no son universalmente intercambiables.
Para cantar, conserve la melodía de origen utilizando un extractor F0 robusto y valide el comportamiento de la octava. El archivo README advierte que la predicción automática de F0 puede provocar un cambio sustancial en el tono del canto y, por lo general, no debería habilitarse allí. La recuperación o agrupación de funciones puede reducir la fuga de timbre de origen y, a veces, mejorar la articulación, pero una proporción de mezcla alta puede copiar artefactos del conjunto de datos y ralentizar la inferencia. Trate el ejemplo documentado de 0,5 como un punto de partida, no como un óptimo universal.
| controlar | Escuche | Síntoma de mal ajuste |
|---|---|---|
| extractor F0 | Melodía estable, vibrato y transiciones sonoras/sordas. | Saltos de octava, tono robótico o consonantes perdidas |
| cambio de tono | Cómodo rango objetivo sin colapso de formantes | Tono de ardilla/en auge y agudos inestables |
| Relación recuperación/clúster | Similitud de objetivos sin artefactos memorizados | Buzzing, ruido copiado o inteligibilidad reducida |
| Difusión superficial | Detalles más suaves sin sobreprocesamiento | Transitorios borrosos y cálculo adicional |
| Escala de ruido/corte | Textura natural y continuidad de la frase. | Ruido de respiración, costuras o tono inconsistente. |
Entrenar sin perseguir un solo valor de pérdida
Comience con una configuración pequeña y una línea base auditable. Guarde la configuración, la semilla, la confirmación del código, el bloqueo de dependencia, la GPU, el manifiesto de preprocesamiento y el hash del punto de control. Produzca periódicamente las mismas frases de validación consentidas. La pérdida de entrenamiento puede disminuir mientras la naturalidad percibida, la inteligibilidad o la similitud del objetivo se estancan o degradan.
Deténgase según la validación ciega y las tasas de artefactos, no según el recuento de pasos recomendado por la comunidad. Mantenga separados los puntos de control de inferencia de entrenamiento y publicables. El repositorio describe la compresión de modelos que elimina datos de solo entrenamiento y puede reducir sustancialmente el tamaño final; conservar el punto de control original sólo en un almacenamiento controlado si se autoriza la formación continua.
Evaluación: tres cualidades, ninguna puntuación que “suene bien”
| Dimensión | prueba humana | Métrica de soporte |
|---|---|---|
| Naturalidad | Calificación MOS ciega en frases invisibles | Recuentos de artefactos por tipo y duración. |
| Similitud de objetivos | Juicio A/B consciente del consentimiento contra el objetivo | Altavoz que incorpora similitud, nunca usado solo |
| Precisión del contenido | Transcribir letras y palabras críticas. | Error de fonema/palabra cuando corresponda |
| fidelidad de tono | El músico comprueba la melodía y la intención expresiva. | Correlación F0, RMSE y error sonoro |
| Fuga de fuente | ¿Pueden los oyentes aún identificar al cantante fuente? | Comparar la tendencia de incrustación de origen/destino |
| Costo operativo | Tiempo desde la entrada limpia hasta la raíz aceptada | Factor de tiempo real, VRAM y minutos de corrección |
Utilice múltiples cantantes y canciones de origen fuera del conjunto de entrenamiento. Incluye notas altas, notas bajas, secciones entrecortadas, letras rápidas, vibrato y silencio. Aleatorice muestras y oculte los nombres de los sistemas a los evaluadores. Informe los intervalos de confianza y los resultados rechazados, no solo la mejor demostración.
Postproducción y divulgación
Inspeccione el solo vocal convertido antes de mezclar. Repare solo artefactos localizados, alinee el tiempo donde el preprocesamiento introdujo deriva, controle las sibilancias y las respiraciones, luego mezcle con un instrumento obtenido legalmente. No utilice efectos intensos para ocultar el error del modelo en la evaluación.
Los términos del proyecto solicitan una atribución clara de la fuente de entrada vocal/audio para las cargas de la plataforma. Más allá de ese mínimo, etiquete el resultado como conversión de voz mediante IA, identifique al propietario autorizado de la voz/modelo cuando se acuerde, dé crédito a los derechos de la canción y la fuente, y describa la edición significativa. Conserve una hoja de producción privada que vincule el hash del modelo, la fuente, la configuración, los consentimientos y el maestro final.
Controles de seguridad y distribución.
- Almacene datos de entrenamiento y puntos de control cifrados con acceso basado en roles.
- Publicar sumas de verificación y un modelo de tarjeta; No distribuya clips de entrenamiento sin editar.
- Restringir el uso de un modelo publicado mediante contrato y control de acceso; una licencia de texto por sí sola no puede impedir la copia.
- Pruebe los puntos de control en un entorno desechable y restringido a la red antes de cargarlos.
- Defina la respuesta a incidentes para suplantación de identidad, modelos filtrados y retirada de consentimiento.
- Separe el uso compartido de la demostración del permiso de descarga; una muestra renderizada no necesita exponer pesos.
Alternativas
| Opción | Mejor ajuste | Compensación |
|---|---|---|
| So-VITS-SVC 4.1 | Reproducción de investigaciones antiguas de SVC con procesos conocidos | Dependencias heredadas y archivadas y mantenimiento propiedad del usuario |
| RVC | Flujos de trabajo de conversión de voz accesibles basados en recuperación | Ecosistema de arquitectura/modelo diferente y mismos riesgos de derechos |
| Difusión/investigación moderna de SVC | Equipos que evalúan la calidad actual o los métodos de tiro cero. | Mayor complejidad y reproducibilidad desigual. |
| Servicio de voz comercial con licencia | La producción necesita apoyo y términos explícitos del catálogo de artistas intérpretes o ejecutantes. | Costo, límites de plataforma y derechos de canciones originales aún requeridos |
| vocalista que consiente | Lanzamiento comercial, dirección expresiva y responsabilidad. | Programación y costo directo de producción. |
| Procesamiento vocal tradicional | Corrección de la ejecución autorizada original | No se puede cambiar la identidad, pero se preserva la relación con el artista. |
Preguntas frecuentes
¿Aún se mantiene So-VITS-SVC?
El repositorio original está archivado y es de solo lectura. Las bifurcaciones pueden estar activas pero deben evaluarse de forma independiente.
¿Genera canto a partir de letras?
No. Convierte una interpretación vocal existente. La síntesis de canto y TTS son tareas diferentes.
¿Incluye modelos de voz?
No. El proyecto oficial establece que los usuarios entrenan modelos de forma independiente; Los paquetes de terceros no cuentan con el respaldo de los contribuyentes principales.
¿Puedo entrenar con las canciones de una celebridad?
No simplemente porque las grabaciones sean públicas. Obtener los derechos apropiados de voz, interpretación, grabación, composición y uso.
¿Cuántos datos se requieren?
No existe un conteo universal de minutos. La cobertura limpia, representativa, autorizada y la validación independiente importan más que cobrar indiscriminadamente.
¿Por qué el resultado conserva al cantante original?
Las representaciones de contenido son imperfectas. Los datos más limpios, la elección del codificador y la recuperación/agrupación cuidadosamente ajustada pueden reducir las fugas, pero no pueden garantizar la eliminación.
¿Es seguro un punto de control descargado?
No automáticamente. Verifique la procedencia y los hashes y cárguelos solo en un entorno aislado porque la serialización del modelo puede conllevar riesgos ejecutables.
fuentes primarias
- Repositorio oficial archivado
- LÉAME oficial 4.1 estable, términos y flujo de trabajo
- LÉAME oficial chino
- Licencia de repositorio
- Plantillas de configuración oficiales
- Investigación SVC y DSPGAN basada en VITS
- Investigación susurrada y multiescala F0 SVC
- Investigación entre discursos que hace referencia a So-VITS-SVC
- Iniciativa de inteligencia artificial de la Oficina de derechos de autor de EE. UU. e informes actuales
Revisado por última vez el 25 de julio de 2026. Este es un proyecto de investigación archivado con términos README inusualmente importantes. Verifique la rama fijada, las dependencias, las licencias y todos los permisos de voz/música antes de cualquier experimento o publicación.



