VoxCPM2 es el lanzamiento principal actual de la pila de generación de voz sin tokenizador de OpenBMB. El modelo de 2 mil millones de parámetros se describe como entrenado en más de dos millones de horas de habla multilingüe y admite 30 idiomas, nueve grupos de dialectos chinos enumerados, diseño de voz de solo texto, clonación de voz basada en referencias, continuación de referencia más transcripción, generación de streaming, adaptación SFT/LoRA y salida nativa de 48 kHz. El código y los pesos se publican en Apache-2.0.
Esas capacidades lo hacen relevante para la narración autohospedada, asistentes multilingües, personajes de juegos, prototipos de accesibilidad y voces de marca controladas. También hacen que la gobernanza de la identidad sea esencial. Un modelo técnicamente abierto no permite copiar la voz de una persona, engañar a los oyentes o utilizar grabaciones sin su consentimiento.
Cuatro modos de generación que resuelven diferentes trabajos
| Modo | Entrada | Mejor uso | Riesgo principal |
|---|---|---|---|
| Texto a voz | Configuración de texto y generación | Narración neutral y pruebas de inteligibilidad de referencia. | Identidad de voz incontrolada o prosodia larga inconsistente |
| Diseño de voz | Descripción en lenguaje natural antepuesta al texto | Crea una nueva voz sin audio de referencia. | Los atributos rápidos pueden variar entre semillas y pueden derivar en identidades reconocibles. |
| Clonación controlable | Clip de referencia breve; instrucción de estilo opcional | Preservar el timbre mientras controlas el ritmo, la emoción o la expresión. | Consentimiento, suplantación y conflicto entre el estilo de referencia y el mensaje de control. |
| Clonación definitiva | Audio de referencia más transcripción exacta, opcionalmente reutilizada como referencia de timbre. | Continuación de alta similitud que preserva el ritmo y el matiz vocal. | La transcripción incorrecta degrada la continuación y la gran similitud aumenta el impacto del uso indebido |
Elija un modo según los requisitos del producto, no según la demostración que suene más impresionante. Un personaje ficticio puede ser más seguro y controlable con el diseño de voz. Un actor contratado puede necesitar clonación para la continuidad, pero sólo dentro de los idiomas, guiones, medios, regiones y plazos acordados. La continuación de referencia más transcripción es útil cuando la similitud es importante y la transcripción se puede verificar exactamente.
Arquitectura y lo que significa "sin tokenizadores"
VoxCPM2 genera representaciones de voz continuas en lugar de convertir primero el audio en una secuencia de tokens de códec discretos. El material oficial describe un sistema autorregresivo de difusión que opera en el espacio latente AudioVAE V2 a través de las etapas LocEnc, TSLM, RALM y LocDiT, utilizando MiniCPM-4 como columna vertebral. La tasa de token del modelo de idioma aparece como 6,25 Hz.
La ausencia de Tokenizer no significa que el procesamiento de texto desaparezca, ni que la pronunciación sea automáticamente correcta. La normalización del texto, los números, las abreviaturas, los nombres, la puntuación, el cambio de código y las convenciones de lectura específicas del idioma todavía dan forma a la producción. El modelo puede inferir la prosodia a partir del contexto, pero los guiones de producción deben hacer explícitas la pronunciación y las pausas cuando los errores sean importantes.
Datos del modelo actual y sus límites.
| Especificación oficial | Valor reportado | como interpretarlo |
|---|---|---|
| Tamaño del modelo | Parámetros 2B, tarjeta modelo BF16 | Planifique la memoria del modelo más el tiempo de ejecución, VAE, caché y sobrecarga de solicitudes simultáneas |
| Idiomas | 30 idiomas listados más dialectos chinos listados | El apoyo no es igual en calidad; prueba cada idioma de destino, acento y dominio |
| Tasa de referencia/salida | Acepta referencia de 16 kHz; produce una salida de 48kHz | Una frecuencia de muestreo más alta no puede restaurar los detalles de identidad que faltan en el audio de una fuente ruidosa |
| VRAM | Aproximadamente 8 GB en la comparación oficial | Estimación específica de la configuración, no una garantía para cada entrada o pila de servicio |
| RTF en RTX 4090 | Aproximadamente 0,30 estándar; aproximadamente 0,13 con Nano-vLLM | Resultado de hardware único informado por el proveedor; simultaneidad de referencia y latencia del primer fragmento |
| Secuencia máxima | 8.192 fichas en la tarjeta modelo | Las entradas largas aún pueden volverse inestables y deben segmentarse por estructura lingüística |
| Licencia | Apache-2.0 | Permite el uso comercial de software/pesos; no otorga derechos de voz, guión o datos |
Inicio rápido
instalación de pip voxcpm
desde voxcpm importar VoxCPM
importar archivo de sonido como sf
modelo = VoxCPM.from_pretrained(
"openbmb/VoxCPM2",
load_denoiser=Falso,
)
wav = modelo.generar(
text="Una breve prueba de producción revisada.",
valor_cfg=2.0,
pasos_tiempo_inferencia=10,
semilla = 42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)
El repositorio enumera Python 3.10–3.12, PyTorch 2.5 o posterior y CUDA 12 o posterior para la ruta principal. También documenta las opciones de CPU, MPS y CUDA para la demostración, Nano-vLLM para rendimiento, vLLM-Omni para servicio multiinquilino y una ruta independiente llama.cpp-omni GGUF para CPU, Metal, CUDA o Vulkan. Trate cada tiempo de ejecución como una configuración de producto separada con su propia salida numérica, latencia, indicadores admitidos y estado de mantenimiento.
Lista de verificación de audio de referencia
- Obtenga un consentimiento por escrito que nombre al hablante, el uso permitido, los idiomas, los medios, la audiencia, la geografía, la duración, el modelo de capacitación/clonación y la ruta de revocación.
- Capture audio limpio con un solo altavoz sin música, eco ambiental, efectos, compresión u otra voz.
- Preserve la variación natural pero evite un clip cuya emoción entre en conflicto con la línea base de identidad neutral deseada.
- Para la clonación de continuación, transcriba exactamente cada palabra hablada, relleno y puntuación relevante; no “limpies” la transcripción.
- Haga un hash del archivo de origen, cifrelo, restrinja el acceso y mantenga los metadatos de consentimiento junto al flujo de trabajo de activos, no incrustados de manera ambigua.
- Pruebe si la referencia contiene declaraciones confidenciales, discursos privados o metadatos que deban eliminarse.
Cómo evaluar la calidad del habla
| Dimensión | Medición | Ejemplo de fracaso |
|---|---|---|
| Inteligibilidad | WER/CER de una sólida revisión de transcripción ASR más humana | Se cambiaron nombres, negaciones, números o términos de medicamentos. |
| Similitud del hablante | Calificación del oyente cegado y similitud de incorporación del hablante | El timbre se parece a la referencia pero la identidad se desplaza entre los párrafos. |
| Prosodia | Calificación humana del ritmo, estrés, pausa, emoción y adherencia al estilo. | Entrega alegre de contenido serio o saltos de frase poco naturales |
| Integridad del audio | Clics, recortes, ruido de fondo, repeticiones, abandonos y anomalías espectrales. | El archivo de 48 kHz contiene artefactos de alta frecuencia o sílabas repetidas |
| Estabilidad de formato largo | Error y deriva de identidad por minuto/segmento | La voz cambia después de varios párrafos. |
| Experiencia de transmisión | Tiempo hasta el primer audio, tasa de separación, continuidad del fragmento y RTF bajo carga | Generación media rápida pero costuras audibles o primer trozo retrasado |
| Seguridad | Pruebas de identidad no autorizadas, guiones no permitidos y procedencia | El servicio acepta cualquier clip público sin control de consentimiento. |
El repositorio publica Seed-TTS-eval, resultados multilingües y de control de instrucciones. Esas tablas son útiles para formular hipótesis, no reemplazan una evaluación privada. Algunos resultados son internos y utilizan transcripción automatizada o modelos de similitud; Los promedios de referencia públicos pueden ocultar acentos, números y dominios que son importantes para su producto.
Un protocolo de evaluación de la producción.
- Definir el contrato de voz. Especificar identidad, estilos permitidos, guía de pronunciación, divulgación y contenido prohibido.
- Cree un conjunto de pruebas multilingüe. Incluya revisores nativos, cambio de códigos, nombres, fechas, monedas, acrónimos, cambios emocionales y puntuación difícil.
- Ejecute semillas fijas y variadas. Una semilla fija admite pruebas de regresión; semillas variadas revelan variación generacional.
- Comparar modos. Pruebe el diseño de voz, la clonación básica y la continuación condicionada por transcripción solo cuando cada uno de ellos esté legalmente permitido.
- Segmentar guiones largos. Divida en límites semánticos, mantenga un estado de estilo y escuche entre uniones.
- Cargue la prueba del tiempo de ejecución elegido. Capture la memoria de la GPU, la latencia del primer fragmento, RTF, el rendimiento, las colas y la recuperación de fallas.
- Abuso de identidad del equipo rojo. Pruebe clips de figuras públicas, consentimientos no coincidentes, guiones prohibidos e intentos de eliminar la divulgación.
- Archivar evidencia. Almacenar modelo/revisión, tiempo de ejecución, aviso, semilla, configuración, hash de referencia, revisor, consentimiento y hash de salida.
Opciones de implementación
| Camino | Lo mejor para | Validar |
|---|---|---|
| Estándar PyTorch | Investigación, generación fuera de línea y exploración de funciones. | VRAM, reproducibilidad, versiones de paquetes y comportamiento por lotes |
| Nano-vLLM-VoxCPM | Servicio de GPU simultáneo y menor RTF informado | API madurez, procesamiento por lotes, transmisión, métricas y compatibilidad de versiones |
| vLLM-Omni | Punto final compatible con OpenAI, procesamiento por lotes continuo y operación multi-GPU | Instalación, autenticación, cuotas, aislamiento y paridad exacta de funciones en rápida evolución |
| llama.cpp-omni | CPU perimetral/en el dispositivo, Metal, CUDA o Vulkan con artefactos GGUF | Calidad después de la cuantificación, RTF, memoria, modos admitidos y mantenimiento de proyecto independiente |
| Voz gestionada API | Equipos que prefieren escala, moderación y soporte alojados | Derechos de voz, retención, procesamiento regional, costos y dependencia de proveedores |
Consentimiento, divulgación y respuesta a incidentes
Apache-2.0 rige el software y los pesos publicados. No otorga derechos de publicidad, derechos de autor sobre guiones o grabaciones, derechos laborales, consentimiento biométrico, permiso de marca ni derecho a engañar. Los requisitos difieren según la jurisdicción y el contexto, así que obtenga una revisión legal calificada para la clonación de personas reales y usos de alto impacto.
- Bloquee la clonación hasta que se verifique el alcance del consentimiento y la identidad del hablante.
- Etiquete el audio sintético en la interfaz de usuario y en el contenido donde los oyentes puedan ser razonablemente engañados.
- Utilice metadatos de procedencia o marcas de agua cuando estén disponibles, reconociendo que se pueden eliminar.
- Evite que los activos de voz se exporten o reutilicen fuera de proyectos autorizados.
- Cree un proceso rápido de eliminación, revocación e incidentes con procedencia de resultados con capacidad de búsqueda.
- Nunca utilice discursos clonados para autenticación, instrucciones de emergencia, persuasión política, autorización financiera o suplantación sin controles especializados y base legal.
Alternativas
| Opción | Ventaja potencial | Comparar cuidadosamente |
|---|---|---|
| VoxCPM2 | Pila abierta de 30 idiomas que combina diseño, clonación, ajuste y múltiples tiempos de ejecución | Calidad por idioma, madurez del tiempo de ejecución, gobernanza y computación |
| CosyVoice | Se estableció una familia multilingüe de habla abierta y flujos de trabajo de clonación. | Cobertura de idiomas, licencia/versión, streaming y control de estilo. |
| Fish Speech | Generación de discurso abierto expresivo con ecosistema activo. | Variante de modelo/licencia, hardware y paridad de evaluación |
| XTTS | Flujo de trabajo de clonación multilingüe familiar y amplio material comunitario. | Necesidades actuales de mantenimiento, licencia de modelo, calidad e idioma. |
| ElevenLabs | Gestionado API, herramientas del producto y conveniencia operativa | Costos recurrentes, controles de consentimiento, retención y necesidades de autohospedaje |
| Actor de doblaje profesional | Desempeño dirigido, contrato explícito y entrega larga y matizada | Programación y costo por proyecto, a menudo menor riesgo de identidad y calidad. |
Preguntas frecuentes
¿VoxCPM2 es gratuito para uso comercial?
El repositorio oficial y la tarjeta modelo utilizan Apache-2.0. El despliegue comercial aún necesita derechos de texto, grabaciones de referencia, identidad del hablante y uso previsto.
¿48kHz garantiza calidad de estudio?
No. La frecuencia de muestreo describe el ancho de banda de salida, no la pronunciación, el rendimiento, la limpieza de la grabación o la ausencia de artefactos. Escuche y mida la señal completa.
¿Cuánta memoria GPU se requiere?
La comparación oficial enumera alrededor de 8 GB para VoxCPM2. El tiempo de ejecución, la simultaneidad, la longitud de la entrada y el motor de servicio afectan el pico de memoria real; prueba con espacio libre.
¿Se puede ejecutar en Apple Silicon?
La demostración documenta la selección de MPS y llama.cpp-omni documenta la ejecución de Metal/GGUF. El repositorio informa un RTF ilustrativo de alrededor de 1,76 para Q8_0 en un Apple M4 Pro; reproducir en su máquina.
¿Cuánto audio de referencia se necesita?
El modelo admite la clonación a partir de un clip corto, mientras que la guía de ajuste fino indica que en 5 a 10 minutos se puede adaptar un hablante/dominio. El audio limpio, representativo y consentido importa más que una duración universal.
¿Son los 30 idiomas igualmente buenos?
No. Las limitaciones oficiales dicen explícitamente que el rendimiento varía según la disponibilidad de datos de entrenamiento. Utilice revisores nativos y scripts específicos de dominio para cada ubicación.
fuentes primarias
- Repositorio oficial VoxCPM, configuración, puntos de referencia y limitaciones
- Tarjeta oficial modelo VoxCPM2
- Documentación oficial VoxCPM
- VoxCPM informe técnico
- Muestras de audio oficiales y página del proyecto.
- Apache-2.0 archivo de licencia
- vLLM-Omni proyecto de servicio
- llama.cpp-omni proyecto de inferencia de bordes
Última revisión el 25 de julio de 2026. Las afirmaciones de hardware, pruebas comparativas y capacitación se atribuyen al proyecto oficial. Verifique la revisión actual, las dependencias, las leyes y el contrato de consentimiento antes del uso en producción.




