VoxCPM2 est la version majeure actuelle de la pile de génération vocale sans tokenizer d'OpenBMB. Le modèle de 2 milliards de paramètres est décrit comme formé sur plus de deux millions d'heures de parole multilingue et prend en charge 30 langues, neuf groupes de dialectes chinois répertoriés, la conception vocale en texte uniquement, le clonage vocal basé sur des références, la continuation des références et de la transcription, la génération de streaming, l'adaptation SFT/LoRA et la sortie native à 48 kHz. Le code et les poids sont publiés sous Apache-2.0.
Ces capacités le rendent pertinent pour la narration auto-hébergée, les assistants multilingues, les personnages de jeux, les prototypes d'accessibilité et les voix de marque contrôlées. Ils rendent également la gouvernance des identités essentielle. Un modèle techniquement ouvert n'autorise pas à copier la voix d'une personne, à induire les auditeurs en erreur ou à utiliser des enregistrements sans son consentement.
Quatre modes de génération qui résolvent différents travaux
| Mode | Entrée | Meilleure utilisation | Risque principal |
|---|---|---|---|
| Synthèse vocale | Paramètres de texte et de génération | Narration neutre et tests d’intelligibilité de base | Identité vocale incontrôlée ou prosodie longue incohérente |
| Conception vocale | Description en langage naturel ajoutée au texte | Créer une nouvelle voix sans audio de référence | Les attributs d'invite peuvent varier selon les graines et peuvent dériver vers des identités reconnaissables |
| Clonage contrôlable | Court clip de référence ; instruction de style facultative | Préserver le timbre tout en pilotant le rythme, l’émotion ou l’expression | Consentement, usurpation d'identité et conflit entre le style de référence et l'invite de contrôle |
| Clonage ultime | Audio de référence plus transcription exacte, éventuellement réutilisée comme référence de timbre | Continuation à haute similarité qui préserve le rythme et les nuances vocales | Une transcription incorrecte dégrade la continuité et une forte similarité augmente l’impact des abus |
Choisissez un mode en fonction des exigences du produit, et non en fonction de la démo qui semble la plus impressionnante. Un personnage fictif peut être plus sûr et plus contrôlable grâce à la conception vocale. Un acteur sous contrat peut avoir besoin d'un clonage pour assurer la continuité, mais uniquement dans les langues, scripts, médias, régions et termes convenus. La continuation référence-plus-transcription est utile lorsque la similarité est importante et que la transcription peut être vérifiée exactement.
Architecture et ce que signifie « sans tokenizer »
VoxCPM2 génère des représentations vocales continues plutôt que de convertir d'abord l'audio en une séquence de jetons de codec discrets. Le matériel officiel décrit un système de diffusion-autorégressif fonctionnant dans l'espace latent AudioVAE V2 à travers les étapes LocEnc, TSLM, RALM et LocDiT, en utilisant MiniCPM-4 comme épine dorsale. Le taux de jetons du modèle de langage est indiqué à 6,25 Hz.
L’absence de tokenizer ne signifie pas que le traitement du texte disparaît, ni que la prononciation est automatiquement correcte. La normalisation du texte, les nombres, les abréviations, les noms, la ponctuation, le changement de code et les conventions de lecture spécifiques à la langue façonnent toujours le résultat. Le modèle peut déduire la prosodie à partir du contexte, mais les scripts de production doivent rendre explicites la prononciation et les pauses là où les erreurs comptent.
Faits du modèle actuel et leurs limites
| Spécification officielle | Valeur déclarée | Comment l'interpréter |
|---|---|---|
| Taille du modèle | Paramètres 2B, carte modèle BF16 | Planifiez la mémoire du modèle ainsi que la surcharge d'exécution, de VAE, de cache et de demandes simultanées |
| Langues | 30 langues répertoriées ainsi que des dialectes chinois répertoriés | Le support n’est pas de qualité égale ; tester chaque langue cible, accent et domaine |
| Débit de référence/sortie | Accepte la référence 16 kHz ; produit une sortie de 48 kHz | Une fréquence d'échantillonnage plus élevée ne peut pas restaurer les détails d'identité manquants dans la source audio bruyante |
| VRAM | Environ 8 Go dans le comparatif officiel | Estimation spécifique à la configuration, et non une garantie pour chaque pile d'entrée ou de service |
| RTF sur RTX 4090 | Environ 0,30 norme ; environ 0,13 avec Nano-vLLM | Résultat matériel unique signalé par le fournisseur ; concurrence de référence et latence du premier fragment |
| Séquence maximale | 8 192 jetons dans la carte modèle | Les entrées longues peuvent encore devenir instables et doivent être segmentées par structure linguistique |
| Licence | Apache-2.0 | Permet l'utilisation commerciale de logiciels/poids ; n'accorde pas de droits de voix, de script ou de données |
Démarrage rapide
pip installer voxcpm
depuis l'importation voxcpm VoxCPM
importer un fichier son en tant que SF
modèle = VoxCPM.from_pretrained(
"openbmb/VoxCPM2",
load_denoiser=Faux,
)
wav = modèle.generate(
text="Un test de production court et révisé.",
cfg_value=2.0,
inference_timesteps=10,
graine = 42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)
Le référentiel répertorie Python 3.10–3.12, PyTorch 2.5 ou plus récent et CUDA 12 ou plus récent pour le chemin principal. Il documente également les choix CPU, MPS et CUDA pour la démo, Nano-vLLM pour le débit, vLLM-Omni pour le service multi-tenant et un chemin indépendant llama.cpp-omni GGUF pour le CPU, Metal, CUDA ou Vulkan. Traitez chaque environnement d'exécution comme une configuration de produit distincte avec sa propre sortie numérique, sa propre latence, ses indicateurs pris en charge et son état de maintenance.
Liste de contrôle audio de référence
- Obtenez un consentement écrit indiquant le nom de l'orateur, l'utilisation autorisée, les langues, les médias, le public, la géographie, la durée, le modèle de formation/clonage et le chemin de révocation.
- Capturez un son clair sur un seul haut-parleur sans musique, sans écho dans la pièce, sans effets, sans pompage de compression ou autre voix.
- Préservez la variation naturelle mais évitez un clip dont l’émotion entre en conflit avec la ligne de base de l’identité neutre souhaitée.
- Pour le clonage continu, transcrivez exactement chaque mot prononcé, remplissage et ponctuation pertinente ; ne « nettoyez » pas la transcription.
- Hachez le fichier source, chiffrez-le, restreignez l'accès et conservez les métadonnées de consentement à côté (et non intégrées de manière ambiguë) du flux de travail des ressources.
- Testez si la référence contient des déclarations sensibles, des discours privés ou des métadonnées qui doivent être supprimées.
Comment évaluer la qualité de la parole
| Dimensions | Mesure | Exemple d'échec |
|---|---|---|
| Intelligibilité | WER/CER à partir d'un ASR fort et d'un examen de transcription humaine | Noms, négations, numéros ou termes de médicaments modifiés |
| Similitude des locuteurs | Évaluation des auditeurs en aveugle et similarité d'intégration des locuteurs | Le timbre ressemble à la référence mais l'identité dérive au fil des paragraphes |
| Prosodie | Évaluation humaine du rythme, du stress, de la pause, de l'émotion et de l'adhésion au style | Livraison joyeuse sur un contenu sérieux ou des coupures de phrases peu naturelles |
| Intégrité audio | Clics, coupures, bruit de fond, répétitions, pertes et anomalies spectrales | Le fichier 48 kHz contient des artefacts haute fréquence ou des syllabes répétées |
| Stabilité de forme longue | Erreur et dérive d'identité par minute/segment | La voix change après plusieurs paragraphes |
| Expérience de diffusion en continu | Temps jusqu'au premier audio, taux d'écart, continuité des fragments et RTF sous charge | Génération moyenne rapide mais coutures audibles ou premier morceau retardé |
| Sécurité | Tests d'identité non autorisés, de scripts et de provenance non autorisés | Le service accepte tout clip public sans contrôle du consentement |
Le référentiel publie des résultats Seed-TTS-eval, multilingues et de contrôle d'instructions. Ces tableaux sont utiles pour formuler des hypothèses et ne remplacent pas une évaluation privée. Certains résultats sont internes et utilisent des modèles de transcription ou de similarité automatisés ; les moyennes de référence publiques peuvent masquer les accents, les chiffres et les domaines importants pour votre produit.
Un protocole d’évaluation de la production
- Définir le contrat vocal. Spécifiez l'identité, les styles autorisés, le guide de prononciation, la divulgation et le contenu interdit.
- Créez un ensemble de tests multilingues. Incluez les réviseurs natifs, le changement de code, les noms, les dates, les devises, les acronymes, les changements émotionnels et la ponctuation difficile.
- Exécutez des graines fixes et variées. Une graine fixe prend en charge les tests de régression ; des graines variées révèlent une variance de génération.
- Comparez les modes. Testez la conception vocale, le clonage de base et la continuation conditionnée par la transcription uniquement là où chacun est légalement autorisé.
- Segmentez les longs scripts. Divisez aux limites sémantiques, conservez un état de style et écoutez à travers les jointures.
- Testez en charge le runtime choisi. Capturez la mémoire GPU, la latence du premier morceau, RTF, le débit, la mise en file d'attente et la récupération après échec.
- Abus d'identité de l'équipe rouge. Essayez les clips de personnalités publiques, les consentements incompatibles, les scripts interdits et les tentatives de suppression de divulgation.
- Archiver les preuves. Stockez le modèle/la révision, le temps d'exécution, l'invite, la graine, les paramètres, le hachage de référence, le réviseur, le consentement et le hachage de sortie.
Choix de déploiement
| Chemin | Idéal pour | Valider |
|---|---|---|
| Norme PyTorch | Recherche, génération hors ligne et exploration de fonctionnalités | VRAM, reproductibilité, versions de packages et comportement des lots |
| Nano-vLLM-VoxCPM | Service GPU simultané et rapport inférieur RTF | API maturité, batching, streaming, métriques et compatibilité des versions |
| vLLM-Omni | Point de terminaison compatible OpenAI, traitement par lots continu et fonctionnement multi-GPU | Installation, authentification, quotas, isolation et parité exacte des fonctionnalités en évolution rapide |
| llama.cpp-omni | Processeur Edge/sur appareil, Metal, CUDA ou Vulkan avec artefacts GGUF | Qualité après quantification, RTF, mémoire, modes pris en charge et maintenance indépendante du projet |
| Discours géré API | Équipes qui préfèrent l'évolutivité, la modération et le support hébergés | Droits vocaux, rétention, traitement régional, coûts et dépendance aux fournisseurs |
Consentement, divulgation et réponse aux incidents
Apache-2.0 régit le logiciel publié et les pondérations. Il n'accorde pas de droits de publicité, de droits d'auteur sur les scripts ou les enregistrements, de droits du travail, de consentement biométrique, d'autorisation de marque ou de droit de tromperie. Les exigences diffèrent selon la juridiction et le contexte, alors obtenez un avis juridique qualifié pour le clonage de personnes réelles et les utilisations à fort impact.
- Bloquez le clonage jusqu'à ce que la portée du consentement et l'identité du locuteur soient vérifiées.
- Étiquetez l’audio synthétique dans l’interface utilisateur et le contenu là où les auditeurs pourraient raisonnablement être induits en erreur.
- Utilisez des métadonnées de provenance ou un filigrane lorsqu'ils sont disponibles, tout en reconnaissant qu'ils peuvent être supprimés.
- Empêchez l’exportation ou la réutilisation des ressources vocales en dehors des projets autorisés.
- Créez un processus rapide de retrait, de révocation et d’incident avec une provenance des résultats consultable.
- Ne déployez jamais de discours cloné à des fins d’authentification, d’instructions d’urgence, de persuasion politique, d’autorisation financière ou d’usurpation d’identité sans contrôles spécialisés et base juridique.
Alternatives
| Options | Avantage potentiel | Comparez soigneusement |
|---|---|---|
| VoxCPM2 | Pile ouverte de 30 langues combinant conception, clonage, réglage fin et plusieurs environnements d'exécution | Qualité par langage, maturité d'exécution, gouvernance et calcul |
| CosyVoice | Établissement d'une famille de parole ouverte multilingue et de workflows de clonage | Couverture linguistique, licence/version, streaming et contrôle du style |
| Fish Speech | Génération de discours ouvert et expressif avec un écosystème actif | Variante de modèle/licence, matériel et parité d'évaluation |
| XTTS | Flux de travail de clonage multilingue familier et matériel communautaire étendu | Maintenance actuelle, licence de modèle, besoins en matière de qualité et de langue |
| ElevenLabs | Gestion de API, outils produits et commodité opérationnelle | Coûts récurrents, contrôles de consentement, besoins de rétention et d'auto-hébergement |
| Acteur vocal professionnel | Performance dirigée, contrat explicite et prestation longue et nuancée | Planification et coût par projet, risques d'identité et de qualité souvent inférieurs |
Questions fréquemment posées
VoxCPM2 est-il gratuit pour un usage commercial ?
Le référentiel officiel et la carte modèle utilisent Apache-2.0. Le déploiement commercial nécessite toujours des droits sur le texte, les enregistrements de référence, l'identité du locuteur et l'utilisation prévue.
Le 48 kHz garantit-il la qualité studio ?
Non. La fréquence d'échantillonnage décrit la bande passante de sortie, et non la prononciation, les performances, la propreté de l'enregistrement ou l'absence d'artefacts. Écoutez et mesurez le signal complet.
Quelle quantité de mémoire GPU est requise ?
La comparaison officielle répertorie environ 8 Go pour VoxCPM2. Le temps d'exécution, la concurrence, la longueur d'entrée et le moteur de service affectent la mémoire maximale réelle ; test avec marge.
Peut-il fonctionner sur Apple Silicon ?
La démo documente la sélection MPS et llama.cpp-omni documente l'exécution de Metal/GGUF. Le référentiel rapporte un RTF illustratif autour de 1,76 pour Q8_0 sur un Apple M4 Pro ; reproduire sur votre machine.
Quelle quantité d’audio de référence est nécessaire ?
Le modèle prend en charge le clonage à partir d'un court clip, tandis que les conseils de réglage précis indiquent que 5 à 10 minutes peuvent adapter un haut-parleur/un domaine. Un son propre, représentatif et consenti compte plus qu’une durée universelle.
Les 30 langues sont-elles toutes aussi bonnes ?
Non. Les limitations officielles indiquent explicitement que les performances varient en fonction de la disponibilité des données d'entraînement. Utilisez des réviseurs natifs et des scripts spécifiques au domaine pour chaque paramètre régional.
Sources primaires
- Dépôt officiel VoxCPM, configuration, benchmarks et limitations
- Carte modèle officielle VoxCPM2
- Documentation officielle VoxCPM
- VoxCPM rapport technique
- Échantillons audio officiels et page du projet
- Fichier de licence Apache-2.0
- vLLM-Omni au service du projet
- Projet d'inférence de bord llama.cpp-omni
Dernière révision le 25 juillet 2026. Les réclamations concernant le matériel, les tests de référence et la formation sont attribuées au projet officiel. Vérifiez la révision actuelle, les dépendances, les lois et le contrat de consentement avant l'utilisation en production.




