VoxCPM
VoxCPM

VoxCPM

VoxCPM2 es el modelo de conversión de texto a voz 2B sin tokenizador Apache-2.0 de OpenBMB para 30 idiomas, diseño de voz, clonación controlable, streaming, ajuste fino y salida de 48 kHz. Esta guía cubre modos, implementación, evaluación, consentimiento, procedencia y alternativas.

92

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

texto a vozclonacion de vozaudio multilinguecodigo abiertosintesis de voz

Product Preview

A quick visual look at VoxCPM before you visit the official site.

Published 6/16/2026
VoxCPM screenshot

Editorial Review

About VoxCPM

VoxCPM2 es el lanzamiento principal actual de la pila de generación de voz sin tokenizador de OpenBMB. El modelo de 2 mil millones de parámetros se describe como entrenado en más de dos millones de horas de habla multilingüe y admite 30 idiomas, nueve grupos de dialectos chinos enumerados, diseño de voz de solo texto, clonación de voz basada en referencias, continuación de referencia más transcripción, generación de streaming, adaptación SFT/LoRA y salida nativa de 48 kHz. El código y los pesos se publican en Apache-2.0.

Esas capacidades lo hacen relevante para la narración autohospedada, asistentes multilingües, personajes de juegos, prototipos de accesibilidad y voces de marca controladas. También hacen que la gobernanza de la identidad sea esencial. Un modelo técnicamente abierto no permite copiar la voz de una persona, engañar a los oyentes o utilizar grabaciones sin su consentimiento.

Hand-drawn consent-first VoxCPM2 workflow covering identity and consent, scoped reference audio, generation, human QA, provenance labeling and revocation
La calidad de la voz es sólo una puerta de producción. Un flujo de trabajo implementable necesita verificación de identidad, alcance escrito, datos controlados, escucha humana, divulgación, procedencia y una forma de revocar o responder al uso indebido.

Cuatro modos de generación que resuelven diferentes trabajos

ModoEntradaMejor usoRiesgo principal
Texto a vozConfiguración de texto y generaciónNarración neutral y pruebas de inteligibilidad de referencia.Identidad de voz incontrolada o prosodia larga inconsistente
Diseño de vozDescripción en lenguaje natural antepuesta al textoCrea una nueva voz sin audio de referencia.Los atributos rápidos pueden variar entre semillas y pueden derivar en identidades reconocibles.
Clonación controlableClip de referencia breve; instrucción de estilo opcionalPreservar el timbre mientras controlas el ritmo, la emoción o la expresión.Consentimiento, suplantación y conflicto entre el estilo de referencia y el mensaje de control.
Clonación definitivaAudio de referencia más transcripción exacta, opcionalmente reutilizada como referencia de timbre.Continuación de alta similitud que preserva el ritmo y el matiz vocal.La transcripción incorrecta degrada la continuación y la gran similitud aumenta el impacto del uso indebido

Elija un modo según los requisitos del producto, no según la demostración que suene más impresionante. Un personaje ficticio puede ser más seguro y controlable con el diseño de voz. Un actor contratado puede necesitar clonación para la continuidad, pero sólo dentro de los idiomas, guiones, medios, regiones y plazos acordados. La continuación de referencia más transcripción es útil cuando la similitud es importante y la transcripción se puede verificar exactamente.

Arquitectura y lo que significa "sin tokenizadores"

VoxCPM2 genera representaciones de voz continuas en lugar de convertir primero el audio en una secuencia de tokens de códec discretos. El material oficial describe un sistema autorregresivo de difusión que opera en el espacio latente AudioVAE V2 a través de las etapas LocEnc, TSLM, RALM y LocDiT, utilizando MiniCPM-4 como columna vertebral. La tasa de token del modelo de idioma aparece como 6,25 Hz.

La ausencia de Tokenizer no significa que el procesamiento de texto desaparezca, ni que la pronunciación sea automáticamente correcta. La normalización del texto, los números, las abreviaturas, los nombres, la puntuación, el cambio de código y las convenciones de lectura específicas del idioma todavía dan forma a la producción. El modelo puede inferir la prosodia a partir del contexto, pero los guiones de producción deben hacer explícitas la pronunciación y las pausas cuando los errores sean importantes.

Datos del modelo actual y sus límites.

Especificación oficialValor reportadocomo interpretarlo
Tamaño del modeloParámetros 2B, tarjeta modelo BF16Planifique la memoria del modelo más el tiempo de ejecución, VAE, caché y sobrecarga de solicitudes simultáneas
Idiomas30 idiomas listados más dialectos chinos listadosEl apoyo no es igual en calidad; prueba cada idioma de destino, acento y dominio
Tasa de referencia/salidaAcepta referencia de 16 kHz; produce una salida de 48kHzUna frecuencia de muestreo más alta no puede restaurar los detalles de identidad que faltan en el audio de una fuente ruidosa
VRAMAproximadamente 8 GB en la comparación oficialEstimación específica de la configuración, no una garantía para cada entrada o pila de servicio
RTF en RTX 4090Aproximadamente 0,30 estándar; aproximadamente 0,13 con Nano-vLLMResultado de hardware único informado por el proveedor; simultaneidad de referencia y latencia del primer fragmento
Secuencia máxima8.192 fichas en la tarjeta modeloLas entradas largas aún pueden volverse inestables y deben segmentarse por estructura lingüística
LicenciaApache-2.0Permite el uso comercial de software/pesos; no otorga derechos de voz, guión o datos

Inicio rápido

instalación de pip voxcpm

desde voxcpm importar VoxCPM
importar archivo de sonido como sf

modelo = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=Falso,
)
wav = modelo.generar(
    text="Una breve prueba de producción revisada.",
    valor_cfg=2.0,
    pasos_tiempo_inferencia=10,
    semilla = 42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)

El repositorio enumera Python 3.10–3.12, PyTorch 2.5 o posterior y CUDA 12 o posterior para la ruta principal. También documenta las opciones de CPU, MPS y CUDA para la demostración, Nano-vLLM para rendimiento, vLLM-Omni para servicio multiinquilino y una ruta independiente llama.cpp-omni GGUF para CPU, Metal, CUDA o Vulkan. Trate cada tiempo de ejecución como una configuración de producto separada con su propia salida numérica, latencia, indicadores admitidos y estado de mantenimiento.

Lista de verificación de audio de referencia

  • Obtenga un consentimiento por escrito que nombre al hablante, el uso permitido, los idiomas, los medios, la audiencia, la geografía, la duración, el modelo de capacitación/clonación y la ruta de revocación.
  • Capture audio limpio con un solo altavoz sin música, eco ambiental, efectos, compresión u otra voz.
  • Preserve la variación natural pero evite un clip cuya emoción entre en conflicto con la línea base de identidad neutral deseada.
  • Para la clonación de continuación, transcriba exactamente cada palabra hablada, relleno y puntuación relevante; no “limpies” la transcripción.
  • Haga un hash del archivo de origen, cifrelo, restrinja el acceso y mantenga los metadatos de consentimiento junto al flujo de trabajo de activos, no incrustados de manera ambigua.
  • Pruebe si la referencia contiene declaraciones confidenciales, discursos privados o metadatos que deban eliminarse.

Cómo evaluar la calidad del habla

DimensiónMediciónEjemplo de fracaso
InteligibilidadWER/CER de una sólida revisión de transcripción ASR más humanaSe cambiaron nombres, negaciones, números o términos de medicamentos.
Similitud del hablanteCalificación del oyente cegado y similitud de incorporación del hablanteEl timbre se parece a la referencia pero la identidad se desplaza entre los párrafos.
ProsodiaCalificación humana del ritmo, estrés, pausa, emoción y adherencia al estilo.Entrega alegre de contenido serio o saltos de frase poco naturales
Integridad del audioClics, recortes, ruido de fondo, repeticiones, abandonos y anomalías espectrales.El archivo de 48 kHz contiene artefactos de alta frecuencia o sílabas repetidas
Estabilidad de formato largoError y deriva de identidad por minuto/segmentoLa voz cambia después de varios párrafos.
Experiencia de transmisiónTiempo hasta el primer audio, tasa de separación, continuidad del fragmento y RTF bajo cargaGeneración media rápida pero costuras audibles o primer trozo retrasado
SeguridadPruebas de identidad no autorizadas, guiones no permitidos y procedenciaEl servicio acepta cualquier clip público sin control de consentimiento.

El repositorio publica Seed-TTS-eval, resultados multilingües y de control de instrucciones. Esas tablas son útiles para formular hipótesis, no reemplazan una evaluación privada. Algunos resultados son internos y utilizan transcripción automatizada o modelos de similitud; Los promedios de referencia públicos pueden ocultar acentos, números y dominios que son importantes para su producto.

Un protocolo de evaluación de la producción.

  1. Definir el contrato de voz. Especificar identidad, estilos permitidos, guía de pronunciación, divulgación y contenido prohibido.
  2. Cree un conjunto de pruebas multilingüe. Incluya revisores nativos, cambio de códigos, nombres, fechas, monedas, acrónimos, cambios emocionales y puntuación difícil.
  3. Ejecute semillas fijas y variadas. Una semilla fija admite pruebas de regresión; semillas variadas revelan variación generacional.
  4. Comparar modos. Pruebe el diseño de voz, la clonación básica y la continuación condicionada por transcripción solo cuando cada uno de ellos esté legalmente permitido.
  5. Segmentar guiones largos. Divida en límites semánticos, mantenga un estado de estilo y escuche entre uniones.
  6. Cargue la prueba del tiempo de ejecución elegido. Capture la memoria de la GPU, la latencia del primer fragmento, RTF, el rendimiento, las colas y la recuperación de fallas.
  7. Abuso de identidad del equipo rojo. Pruebe clips de figuras públicas, consentimientos no coincidentes, guiones prohibidos e intentos de eliminar la divulgación.
  8. Archivar evidencia. Almacenar modelo/revisión, tiempo de ejecución, aviso, semilla, configuración, hash de referencia, revisor, consentimiento y hash de salida.

Opciones de implementación

CaminoLo mejor paraValidar
Estándar PyTorchInvestigación, generación fuera de línea y exploración de funciones.VRAM, reproducibilidad, versiones de paquetes y comportamiento por lotes
Nano-vLLM-VoxCPMServicio de GPU simultáneo y menor RTF informadoAPI madurez, procesamiento por lotes, transmisión, métricas y compatibilidad de versiones
vLLM-OmniPunto final compatible con OpenAI, procesamiento por lotes continuo y operación multi-GPUInstalación, autenticación, cuotas, aislamiento y paridad exacta de funciones en rápida evolución
llama.cpp-omniCPU perimetral/en el dispositivo, Metal, CUDA o Vulkan con artefactos GGUFCalidad después de la cuantificación, RTF, memoria, modos admitidos y mantenimiento de proyecto independiente
Voz gestionada APIEquipos que prefieren escala, moderación y soporte alojadosDerechos de voz, retención, procesamiento regional, costos y dependencia de proveedores

Consentimiento, divulgación y respuesta a incidentes

Apache-2.0 rige el software y los pesos publicados. No otorga derechos de publicidad, derechos de autor sobre guiones o grabaciones, derechos laborales, consentimiento biométrico, permiso de marca ni derecho a engañar. Los requisitos difieren según la jurisdicción y el contexto, así que obtenga una revisión legal calificada para la clonación de personas reales y usos de alto impacto.

  • Bloquee la clonación hasta que se verifique el alcance del consentimiento y la identidad del hablante.
  • Etiquete el audio sintético en la interfaz de usuario y en el contenido donde los oyentes puedan ser razonablemente engañados.
  • Utilice metadatos de procedencia o marcas de agua cuando estén disponibles, reconociendo que se pueden eliminar.
  • Evite que los activos de voz se exporten o reutilicen fuera de proyectos autorizados.
  • Cree un proceso rápido de eliminación, revocación e incidentes con procedencia de resultados con capacidad de búsqueda.
  • Nunca utilice discursos clonados para autenticación, instrucciones de emergencia, persuasión política, autorización financiera o suplantación sin controles especializados y base legal.

Alternativas

OpciónVentaja potencialComparar cuidadosamente
VoxCPM2Pila abierta de 30 idiomas que combina diseño, clonación, ajuste y múltiples tiempos de ejecuciónCalidad por idioma, madurez del tiempo de ejecución, gobernanza y computación
CosyVoiceSe estableció una familia multilingüe de habla abierta y flujos de trabajo de clonación.Cobertura de idiomas, licencia/versión, streaming y control de estilo.
Fish SpeechGeneración de discurso abierto expresivo con ecosistema activo.Variante de modelo/licencia, hardware y paridad de evaluación
XTTSFlujo de trabajo de clonación multilingüe familiar y amplio material comunitario.Necesidades actuales de mantenimiento, licencia de modelo, calidad e idioma.
ElevenLabsGestionado API, herramientas del producto y conveniencia operativaCostos recurrentes, controles de consentimiento, retención y necesidades de autohospedaje
Actor de doblaje profesionalDesempeño dirigido, contrato explícito y entrega larga y matizadaProgramación y costo por proyecto, a menudo menor riesgo de identidad y calidad.

Preguntas frecuentes

¿VoxCPM2 es gratuito para uso comercial?

El repositorio oficial y la tarjeta modelo utilizan Apache-2.0. El despliegue comercial aún necesita derechos de texto, grabaciones de referencia, identidad del hablante y uso previsto.

¿48kHz garantiza calidad de estudio?

No. La frecuencia de muestreo describe el ancho de banda de salida, no la pronunciación, el rendimiento, la limpieza de la grabación o la ausencia de artefactos. Escuche y mida la señal completa.

¿Cuánta memoria GPU se requiere?

La comparación oficial enumera alrededor de 8 GB para VoxCPM2. El tiempo de ejecución, la simultaneidad, la longitud de la entrada y el motor de servicio afectan el pico de memoria real; prueba con espacio libre.

¿Se puede ejecutar en Apple Silicon?

La demostración documenta la selección de MPS y llama.cpp-omni documenta la ejecución de Metal/GGUF. El repositorio informa un RTF ilustrativo de alrededor de 1,76 para Q8_0 en un Apple M4 Pro; reproducir en su máquina.

¿Cuánto audio de referencia se necesita?

El modelo admite la clonación a partir de un clip corto, mientras que la guía de ajuste fino indica que en 5 a 10 minutos se puede adaptar un hablante/dominio. El audio limpio, representativo y consentido importa más que una duración universal.

¿Son los 30 idiomas igualmente buenos?

No. Las limitaciones oficiales dicen explícitamente que el rendimiento varía según la disponibilidad de datos de entrenamiento. Utilice revisores nativos y scripts específicos de dominio para cada ubicación.

fuentes primarias

Última revisión el 25 de julio de 2026. Las afirmaciones de hardware, pruebas comparativas y capacitación se atribuyen al proyecto oficial. Verifique la revisión actual, las dependencias, las leyes y el contrato de consentimiento antes del uso en producción.

Ready to try VoxCPM?

Visit the official website to get started

Visit VoxCPM

Quick Info

Category
Texto a voz
Added
6/2/2026
Published
6/16/2026
Updated
8/31/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Index TTS

Index TTS

IndexTTS es el sistema open source de Bilibili para síntesis de voz zero-shot, controlable y eficiente a nivel industrial. Es más útil para investigadores y desarrolladores de voz que para usuarios que buscan una app web pulida.

Index TTStext to speechzero-shot TTS
1330
Azure Text to Speech

Azure Text to Speech

The best and most realistic voice tools currently available - Herramienta de IA inteligente para mejorar tu productividad.

text-to-speech
1210
Hailuo AI TTS

Hailuo AI TTS

Hailuo AI TTS es una herramienta vinculada a MiniMax Audio para texto a voz multilingüe, voces IA y clonación de voz.

Hailuo AI TTSMiniMax Audiotext to speech
1110
Coqui TTS

Coqui TTS

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - Herramienta de IA inteligente para mejorar tu productividad.

text-to-speechfree
1310