So-VITS-SVC
So-VITS-SVC
Active

So-VITS-SVC

So-VITS-SVC 4.1 es un marco de investigación archivado de código abierto para la conversión de voz cantada, no de texto a voz. Esta guía independiente cubre consentimiento, licencias, conjuntos de datos limpios, F0 y codificadores, capacitación, inferencia, evaluación, divulgación, seguridad y alternativas.

136

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

so-vits-svcconversión de voz cantadavoice conversionAI singing voiceSoftVC VITSmodelo de voz open source

Product Preview

A quick visual look at So-VITS-SVC before you visit the official site.

Published 1/21/2026
So-VITS-SVC screenshot

Editorial Review

About So-VITS-SVC

So-VITS-SVC es un marco de investigación para la conversión de voz cantada (SVC): toma una interpretación vocal existente y presenta su contenido lingüístico y melodía con un timbre objetivo entrenado. No es conversión de texto a voz, no viene con un modelo de voz y no puede proporcionar legal o éticamente derechos sobre la identidad de un intérprete, la canción original o las grabaciones de entrenamiento.

el original svc-desarrollo-equipo/so-vits-svc El repositorio se archivó en noviembre de 2023 y es de solo lectura. Su rama 4.1-Stable sigue siendo ampliamente citada, pero su adopción ahora significa fijar dependencias antiguas, validar puntos de control de terceros y asumir la responsabilidad total del mantenimiento. El README describe el uso académico, enfatiza la intención del personaje ficticio, requiere que los usuarios resuelvan la autorización del conjunto de datos y establece términos adicionales de publicación/divulgación. Lea el archivo README y la licencia exactos del repositorio antes de usarlo.

Official So-VITS-SVC repository diagram and project media
Medios oficiales del proyecto. El artefacto mantenido es una base de código de investigación archivada, no un servicio alojado ni un catálogo de voces con licencia.

SVC no es TTS, ni un vocoder ni una separación de fuentes.

TecnologíaEntradaSalidaLo que no proporciona
So-VITS-SVCAudio fuente cantado/hablado + modelo objetivo entrenadoMisma interpretación renderizada hacia el timbre objetivoDerechos de uso o generación de letra a interpretación
Texto a vozTexto + voz/condicionamiento de estiloNueva forma de onda habladaTransferencia fiel de una interpretación cantada existente.
Síntesis de cantoControles de letras, notas y expresión.Nueva interpretación cantadaPermiso legal automático para imitar a un cantante.
codificador de vozrepresentación acústicaForma de ondaPolítica de conversión de contenido/timbre
Separación de fuentescancion mixtaTallos vocales/instrumentales estimadosLimpiar multipistas originales o conversión de voz.

El proceso completo y por dónde entran los artefactos

 grabaciones de destino consentidas
          |
          v
 limpiar -> segmento -> remuestrear -> características de contenido + F0
          |                           |
          '----------- entrenamiento ------'
                         |
                         v
                 modelo de voz objetivo
                         |
 fuente vocal -> F0/extracción de contenido -> generador -> difusión opcional
                         |                    |
                         '------ renderizar ------'
                                      |
                              audio humano + derechos de calidad

Los codificadores de contenido intentan representar información fonética mientras suprimen la identidad de la fuente. F0 transporta el tono; el generador y el vocoder reconstruyen el audio en el timbre objetivo. El desenredo imperfecto crea una “fuga tímbrica”, donde el cantante fuente permanece audible. Una mala separación añade instrumentos y reverberación a los datos de entrenamiento; la extracción inconsistente del tono produce saltos de octava; el recorte y las frecuencias de muestreo no coincidentes se convierten en artefactos metálicos.

Puerta de derechos antes de cualquier descarga o capacitación.

Una grabación técnicamente pública no es automáticamente un conjunto de datos de entrenamiento legal. Obtenga un permiso documentado del intérprete de voz identificable y de los titulares de derechos para la capacitación prevista, el almacenamiento del modelo, los colaboradores, los territorios, el estado comercial y la distribución de resultados. Licencia por separado la composición, la letra, la voz principal/fuente y la pista de acompañamiento utilizadas en una portada publicada.

Bien o derechoEvidencia a retenerSuposición errónea común
Grabaciones de voz de destinoConsentimiento del intérprete y derechos de grabación/master“Disponible en línea” significa entrenable
Identidad de voz/personaAlcance, duración, revocación y contextos permitidosUna licencia de software otorga derechos de imagen
fuente vocalPermiso de grabación y términos compatibles con herramientasUn tallo separado se vuelve tuyo
Canción/letraPermisos de composición/mecánicos/sincronización según correspondaUna portada elimina los derechos de publicación
Modelo/punto de controlProcedencia, licencia, declaración del conjunto de datos y suma de verificaciónUna página de descarga prueba los datos autorizados.
lanzamiento finalRevisión, divulgación y créditos de la política de la plataformaLa “IA generada” es una defensa legal completa

No cree suplantaciones engañosas, fraude, acoso, contenido sexual o mensajes políticos en la voz reconocible de otra persona. Para un proyecto de personaje de ficción, confirme que los derechos del personaje y de la interpretación original también estén autorizados. Cuando se retire el consentimiento, contar con un proceso práctico de eliminación y distribución del modelo.

Diseño de conjuntos de datos: la calidad supera la duración indiscriminada

Utilice grabaciones limpias, secas y aisladas del objetivo que haya dado su consentimiento. Elimine el sangrado de instrumentos, la reverberación intensa de la sala, las voces duplicadas, los efectos extremos, los recortes, los silencios prolongados y otros altavoces. Conserve la variedad expresiva que coincida con el resultado deseado (rango de tono, vocales, consonantes, registros y dinámica) sin mezclar ciegamente cadenas de grabación incompatibles.

Dividido por sesión o canción de origen contigua, no por clips adyacentes aleatorios, de modo que la validación no contenga casi duplicados del entrenamiento. Mantenga un equipo de prueba bloqueado que nunca se utilice para realizar ajustes. Mantenga un manifiesto con hash del archivo, origen, registro de consentimiento, frecuencia de muestreo, duración, pasos de preprocesamiento, transcripción/letra si están disponibles y motivo de exclusión.

Verificación del conjunto de datospasar señalArreglar
AislamientoSin acompañamiento audible ni corista.Utilice tallos originales o deséchelos; la separación es imperfecta
NivelSin recortes; señal utilizable consistenteNormalice con cuidado, nunca repare recortes severos por conjetura
IdentidadUn objetivo autorizado por etiqueta de altavozEliminar colaboradores y respuestas multitudinarias
Cobertura de campoCoincide con el rango de canto previstoRegistro de registros faltantes consentidos
Independencia de validaciónDiferentes sesiones/frases del entrenamientoVolver a dividir antes de medir
ProcedenciaCada clip se asigna a un registro de permisoPoner en cuarentena archivos no atribuidos

Versión y realidad de dependencia.

El archivo README 4.1-Stable informa Python 3.8.9 como su versión estable probada y requiere codificadores/vocoders previamente entrenados por separado. En 2026, este será un entorno heredado. Constrúyalo en un contenedor aislado o en una máquina virtual, fije hashes, escanee dependencias y niegue el acceso innecesario a la red. No debilite globalmente una estación de trabajo moderna para satisfacer paquetes antiguos CUDA o Python.

Las bifurcaciones, los cuadernos, las GUI y los paquetes de modelos de terceros son proyectos independientes. Pueden cambiar el código, las licencias, la telemetría o las descargas predeterminadas. Verifique la ascendencia, la confirmación, el contenido del instalador y la procedencia del modelo. Nunca cargue puntos de control PyTorch que no sean de confianza en una máquina que contenga secretos: los formatos de serialización heredados pueden ejecutar código durante la carga.

Codificador de contenido, F0 y opciones de recuperación

4.1 documenta múltiples codificadores de voz, con variantes ContentVec entre las opciones comunes. Las dimensiones y configuración del codificador deben coincidir con el punto de control; La compatibilidad 4.0 puede requerir agregar el correcto codificador de voz campo. Los modelos y activos preprocesados ​​de diferentes ramas no son universalmente intercambiables.

Para cantar, conserve la melodía de origen utilizando un extractor F0 robusto y valide el comportamiento de la octava. El archivo README advierte que la predicción automática de F0 puede provocar un cambio sustancial en el tono del canto y, por lo general, no debería habilitarse allí. La recuperación o agrupación de funciones puede reducir la fuga de timbre de origen y, a veces, mejorar la articulación, pero una proporción de mezcla alta puede copiar artefactos del conjunto de datos y ralentizar la inferencia. Trate el ejemplo documentado de 0,5 como un punto de partida, no como un óptimo universal.

controlarEscucheSíntoma de mal ajuste
extractor F0Melodía estable, vibrato y transiciones sonoras/sordas.Saltos de octava, tono robótico o consonantes perdidas
cambio de tonoCómodo rango objetivo sin colapso de formantesTono de ardilla/en auge y agudos inestables
Relación recuperación/clústerSimilitud de objetivos sin artefactos memorizadosBuzzing, ruido copiado o inteligibilidad reducida
Difusión superficialDetalles más suaves sin sobreprocesamientoTransitorios borrosos y cálculo adicional
Escala de ruido/corteTextura natural y continuidad de la frase.Ruido de respiración, costuras o tono inconsistente.

Entrenar sin perseguir un solo valor de pérdida

Comience con una configuración pequeña y una línea base auditable. Guarde la configuración, la semilla, la confirmación del código, el bloqueo de dependencia, la GPU, el manifiesto de preprocesamiento y el hash del punto de control. Produzca periódicamente las mismas frases de validación consentidas. La pérdida de entrenamiento puede disminuir mientras la naturalidad percibida, la inteligibilidad o la similitud del objetivo se estancan o degradan.

Deténgase según la validación ciega y las tasas de artefactos, no según el recuento de pasos recomendado por la comunidad. Mantenga separados los puntos de control de inferencia de entrenamiento y publicables. El repositorio describe la compresión de modelos que elimina datos de solo entrenamiento y puede reducir sustancialmente el tamaño final; conservar el punto de control original sólo en un almacenamiento controlado si se autoriza la formación continua.

Evaluación: tres cualidades, ninguna puntuación que “suene bien”

Dimensiónprueba humanaMétrica de soporte
NaturalidadCalificación MOS ciega en frases invisiblesRecuentos de artefactos por tipo y duración.
Similitud de objetivosJuicio A/B consciente del consentimiento contra el objetivoAltavoz que incorpora similitud, nunca usado solo
Precisión del contenidoTranscribir letras y palabras críticas.Error de fonema/palabra cuando corresponda
fidelidad de tonoEl músico comprueba la melodía y la intención expresiva.Correlación F0, RMSE y error sonoro
Fuga de fuente¿Pueden los oyentes aún identificar al cantante fuente?Comparar la tendencia de incrustación de origen/destino
Costo operativoTiempo desde la entrada limpia hasta la raíz aceptadaFactor de tiempo real, VRAM y minutos de corrección

Utilice múltiples cantantes y canciones de origen fuera del conjunto de entrenamiento. Incluye notas altas, notas bajas, secciones entrecortadas, letras rápidas, vibrato y silencio. Aleatorice muestras y oculte los nombres de los sistemas a los evaluadores. Informe los intervalos de confianza y los resultados rechazados, no solo la mejor demostración.

Postproducción y divulgación

Inspeccione el solo vocal convertido antes de mezclar. Repare solo artefactos localizados, alinee el tiempo donde el preprocesamiento introdujo deriva, controle las sibilancias y las respiraciones, luego mezcle con un instrumento obtenido legalmente. No utilice efectos intensos para ocultar el error del modelo en la evaluación.

Los términos del proyecto solicitan una atribución clara de la fuente de entrada vocal/audio para las cargas de la plataforma. Más allá de ese mínimo, etiquete el resultado como conversión de voz mediante IA, identifique al propietario autorizado de la voz/modelo cuando se acuerde, dé crédito a los derechos de la canción y la fuente, y describa la edición significativa. Conserve una hoja de producción privada que vincule el hash del modelo, la fuente, la configuración, los consentimientos y el maestro final.

Controles de seguridad y distribución.

  • Almacene datos de entrenamiento y puntos de control cifrados con acceso basado en roles.
  • Publicar sumas de verificación y un modelo de tarjeta; No distribuya clips de entrenamiento sin editar.
  • Restringir el uso de un modelo publicado mediante contrato y control de acceso; una licencia de texto por sí sola no puede impedir la copia.
  • Pruebe los puntos de control en un entorno desechable y restringido a la red antes de cargarlos.
  • Defina la respuesta a incidentes para suplantación de identidad, modelos filtrados y retirada de consentimiento.
  • Separe el uso compartido de la demostración del permiso de descarga; una muestra renderizada no necesita exponer pesos.

Alternativas

OpciónMejor ajusteCompensación
So-VITS-SVC 4.1Reproducción de investigaciones antiguas de SVC con procesos conocidosDependencias heredadas y archivadas y mantenimiento propiedad del usuario
RVCFlujos de trabajo de conversión de voz accesibles basados en recuperaciónEcosistema de arquitectura/modelo diferente y mismos riesgos de derechos
Difusión/investigación moderna de SVCEquipos que evalúan la calidad actual o los métodos de tiro cero.Mayor complejidad y reproducibilidad desigual.
Servicio de voz comercial con licenciaLa producción necesita apoyo y términos explícitos del catálogo de artistas intérpretes o ejecutantes.Costo, límites de plataforma y derechos de canciones originales aún requeridos
vocalista que consienteLanzamiento comercial, dirección expresiva y responsabilidad.Programación y costo directo de producción.
Procesamiento vocal tradicionalCorrección de la ejecución autorizada originalNo se puede cambiar la identidad, pero se preserva la relación con el artista.

Preguntas frecuentes

¿Aún se mantiene So-VITS-SVC?

El repositorio original está archivado y es de solo lectura. Las bifurcaciones pueden estar activas pero deben evaluarse de forma independiente.

¿Genera canto a partir de letras?

No. Convierte una interpretación vocal existente. La síntesis de canto y TTS son tareas diferentes.

¿Incluye modelos de voz?

No. El proyecto oficial establece que los usuarios entrenan modelos de forma independiente; Los paquetes de terceros no cuentan con el respaldo de los contribuyentes principales.

¿Puedo entrenar con las canciones de una celebridad?

No simplemente porque las grabaciones sean públicas. Obtener los derechos apropiados de voz, interpretación, grabación, composición y uso.

¿Cuántos datos se requieren?

No existe un conteo universal de minutos. La cobertura limpia, representativa, autorizada y la validación independiente importan más que cobrar indiscriminadamente.

¿Por qué el resultado conserva al cantante original?

Las representaciones de contenido son imperfectas. Los datos más limpios, la elección del codificador y la recuperación/agrupación cuidadosamente ajustada pueden reducir las fugas, pero no pueden garantizar la eliminación.

¿Es seguro un punto de control descargado?

No automáticamente. Verifique la procedencia y los hashes y cárguelos solo en un entorno aislado porque la serialización del modelo puede conllevar riesgos ejecutables.

fuentes primarias

Revisado por última vez el 25 de julio de 2026. Este es un proyecto de investigación archivado con términos README inusualmente importantes. Verifique la rama fijada, las dependencias, las licencias y todos los permisos de voz/música antes de cualquier experimento o publicación.

Ready to try So-VITS-SVC?

Visit the official website to get started

Visit So-VITS-SVC

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/3/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Vocal Remover

Vocal Remover

Separate voice from music out of a song free with powerful AI algorithms - Herramienta de IA inteligente para mejorar tu productividad.

voice-processingfree
850
Lalal.ai

Lalal.ai

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - Herramienta de IA inteligente para mejorar tu productividad.

voice-processingfree
1060
PollyReach

PollyReach

PollyReach es un producto de IA de la categoría voice-processing, pensado para usuarios que quieren llevar flujos reales a producción.

voice-processingherramienta IA
790
Klariqo

Klariqo

Klariqo es una plataforma de agentes de voz para call centers y equipos BPO que quieren que la IA precalifique llamadas, filtre leads muertos y transfiera solo conversaciones listas para venta a closers humanos.

agentes de voz IAautomatizacion de call centerdialer SIP
590