VoxCPM
VoxCPM

VoxCPM

VoxCPM2 est le modèle de synthèse vocale 2B sans tokenizer Apache-2.0 d'OpenBMB pour 30 langues, conception vocale, clonage contrôlable, streaming, réglage fin et sortie 48 kHz. Ce guide couvre les modes, le déploiement, l'évaluation, le consentement, la provenance et les alternatives.

87

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

synthese vocaleclonage de voixaudio multilingueopen sourceTTS

Product Preview

A quick visual look at VoxCPM before you visit the official site.

Published 6/16/2026
VoxCPM screenshot

Editorial Review

About VoxCPM

VoxCPM2 est la version majeure actuelle de la pile de génération vocale sans tokenizer d'OpenBMB. Le modèle de 2 milliards de paramètres est décrit comme formé sur plus de deux millions d'heures de parole multilingue et prend en charge 30 langues, neuf groupes de dialectes chinois répertoriés, la conception vocale en texte uniquement, le clonage vocal basé sur des références, la continuation des références et de la transcription, la génération de streaming, l'adaptation SFT/LoRA et la sortie native à 48 kHz. Le code et les poids sont publiés sous Apache-2.0.

Ces capacités le rendent pertinent pour la narration auto-hébergée, les assistants multilingues, les personnages de jeux, les prototypes d'accessibilité et les voix de marque contrôlées. Ils rendent également la gouvernance des identités essentielle. Un modèle techniquement ouvert n'autorise pas à copier la voix d'une personne, à induire les auditeurs en erreur ou à utiliser des enregistrements sans son consentement.

Hand-drawn consent-first VoxCPM2 workflow covering identity and consent, scoped reference audio, generation, human QA, provenance labeling and revocation
La qualité de la voix n’est qu’une porte de production. Un flux de travail déployable nécessite une vérification de l'identité, une portée écrite, des données contrôlées, une écoute humaine, une divulgation, une provenance et un moyen de révoquer ou de répondre à une utilisation abusive.

Quatre modes de génération qui résolvent différents travaux

ModeEntréeMeilleure utilisationRisque principal
Synthèse vocaleParamètres de texte et de générationNarration neutre et tests d’intelligibilité de baseIdentité vocale incontrôlée ou prosodie longue incohérente
Conception vocaleDescription en langage naturel ajoutée au texteCréer une nouvelle voix sans audio de référenceLes attributs d'invite peuvent varier selon les graines et peuvent dériver vers des identités reconnaissables
Clonage contrôlableCourt clip de référence ; instruction de style facultativePréserver le timbre tout en pilotant le rythme, l’émotion ou l’expressionConsentement, usurpation d'identité et conflit entre le style de référence et l'invite de contrôle
Clonage ultimeAudio de référence plus transcription exacte, éventuellement réutilisée comme référence de timbreContinuation à haute similarité qui préserve le rythme et les nuances vocalesUne transcription incorrecte dégrade la continuité et une forte similarité augmente l’impact des abus

Choisissez un mode en fonction des exigences du produit, et non en fonction de la démo qui semble la plus impressionnante. Un personnage fictif peut être plus sûr et plus contrôlable grâce à la conception vocale. Un acteur sous contrat peut avoir besoin d'un clonage pour assurer la continuité, mais uniquement dans les langues, scripts, médias, régions et termes convenus. La continuation référence-plus-transcription est utile lorsque la similarité est importante et que la transcription peut être vérifiée exactement.

Architecture et ce que signifie « sans tokenizer »

VoxCPM2 génère des représentations vocales continues plutôt que de convertir d'abord l'audio en une séquence de jetons de codec discrets. Le matériel officiel décrit un système de diffusion-autorégressif fonctionnant dans l'espace latent AudioVAE V2 à travers les étapes LocEnc, TSLM, RALM et LocDiT, en utilisant MiniCPM-4 comme épine dorsale. Le taux de jetons du modèle de langage est indiqué à 6,25 Hz.

L’absence de tokenizer ne signifie pas que le traitement du texte disparaît, ni que la prononciation est automatiquement correcte. La normalisation du texte, les nombres, les abréviations, les noms, la ponctuation, le changement de code et les conventions de lecture spécifiques à la langue façonnent toujours le résultat. Le modèle peut déduire la prosodie à partir du contexte, mais les scripts de production doivent rendre explicites la prononciation et les pauses là où les erreurs comptent.

Faits du modèle actuel et leurs limites

Spécification officielleValeur déclaréeComment l'interpréter
Taille du modèleParamètres 2B, carte modèle BF16Planifiez la mémoire du modèle ainsi que la surcharge d'exécution, de VAE, de cache et de demandes simultanées
Langues30 langues répertoriées ainsi que des dialectes chinois répertoriésLe support n’est pas de qualité égale ; tester chaque langue cible, accent et domaine
Débit de référence/sortieAccepte la référence 16 kHz ; produit une sortie de 48 kHzUne fréquence d'échantillonnage plus élevée ne peut pas restaurer les détails d'identité manquants dans la source audio bruyante
VRAMEnviron 8 Go dans le comparatif officielEstimation spécifique à la configuration, et non une garantie pour chaque pile d'entrée ou de service
RTF sur RTX 4090Environ 0,30 norme ; environ 0,13 avec Nano-vLLMRésultat matériel unique signalé par le fournisseur ; concurrence de référence et latence du premier fragment
Séquence maximale8 192 jetons dans la carte modèleLes entrées longues peuvent encore devenir instables et doivent être segmentées par structure linguistique
LicenceApache-2.0Permet l'utilisation commerciale de logiciels/poids ; n'accorde pas de droits de voix, de script ou de données

Démarrage rapide

pip installer voxcpm

depuis l'importation voxcpm VoxCPM
importer un fichier son en tant que SF

modèle = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=Faux,
)
wav = modèle.generate(
    text="Un test de production court et révisé.",
    cfg_value=2.0,
    inference_timesteps=10,
    graine = 42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)

Le référentiel répertorie Python 3.10–3.12, PyTorch 2.5 ou plus récent et CUDA 12 ou plus récent pour le chemin principal. Il documente également les choix CPU, MPS et CUDA pour la démo, Nano-vLLM pour le débit, vLLM-Omni pour le service multi-tenant et un chemin indépendant llama.cpp-omni GGUF pour le CPU, Metal, CUDA ou Vulkan. Traitez chaque environnement d'exécution comme une configuration de produit distincte avec sa propre sortie numérique, sa propre latence, ses indicateurs pris en charge et son état de maintenance.

Liste de contrôle audio de référence

  • Obtenez un consentement écrit indiquant le nom de l'orateur, l'utilisation autorisée, les langues, les médias, le public, la géographie, la durée, le modèle de formation/clonage et le chemin de révocation.
  • Capturez un son clair sur un seul haut-parleur sans musique, sans écho dans la pièce, sans effets, sans pompage de compression ou autre voix.
  • Préservez la variation naturelle mais évitez un clip dont l’émotion entre en conflit avec la ligne de base de l’identité neutre souhaitée.
  • Pour le clonage continu, transcrivez exactement chaque mot prononcé, remplissage et ponctuation pertinente ; ne « nettoyez » pas la transcription.
  • Hachez le fichier source, chiffrez-le, restreignez l'accès et conservez les métadonnées de consentement à côté (et non intégrées de manière ambiguë) du flux de travail des ressources.
  • Testez si la référence contient des déclarations sensibles, des discours privés ou des métadonnées qui doivent être supprimées.

Comment évaluer la qualité de la parole

DimensionsMesureExemple d'échec
IntelligibilitéWER/CER à partir d'un ASR fort et d'un examen de transcription humaineNoms, négations, numéros ou termes de médicaments modifiés
Similitude des locuteursÉvaluation des auditeurs en aveugle et similarité d'intégration des locuteursLe timbre ressemble à la référence mais l'identité dérive au fil des paragraphes
ProsodieÉvaluation humaine du rythme, du stress, de la pause, de l'émotion et de l'adhésion au styleLivraison joyeuse sur un contenu sérieux ou des coupures de phrases peu naturelles
Intégrité audioClics, coupures, bruit de fond, répétitions, pertes et anomalies spectralesLe fichier 48 kHz contient des artefacts haute fréquence ou des syllabes répétées
Stabilité de forme longueErreur et dérive d'identité par minute/segmentLa voix change après plusieurs paragraphes
Expérience de diffusion en continuTemps jusqu'au premier audio, taux d'écart, continuité des fragments et RTF sous chargeGénération moyenne rapide mais coutures audibles ou premier morceau retardé
SécuritéTests d'identité non autorisés, de scripts et de provenance non autorisésLe service accepte tout clip public sans contrôle du consentement

Le référentiel publie des résultats Seed-TTS-eval, multilingues et de contrôle d'instructions. Ces tableaux sont utiles pour formuler des hypothèses et ne remplacent pas une évaluation privée. Certains résultats sont internes et utilisent des modèles de transcription ou de similarité automatisés ; les moyennes de référence publiques peuvent masquer les accents, les chiffres et les domaines importants pour votre produit.

Un protocole d’évaluation de la production

  1. Définir le contrat vocal. Spécifiez l'identité, les styles autorisés, le guide de prononciation, la divulgation et le contenu interdit.
  2. Créez un ensemble de tests multilingues. Incluez les réviseurs natifs, le changement de code, les noms, les dates, les devises, les acronymes, les changements émotionnels et la ponctuation difficile.
  3. Exécutez des graines fixes et variées. Une graine fixe prend en charge les tests de régression ; des graines variées révèlent une variance de génération.
  4. Comparez les modes. Testez la conception vocale, le clonage de base et la continuation conditionnée par la transcription uniquement là où chacun est légalement autorisé.
  5. Segmentez les longs scripts. Divisez aux limites sémantiques, conservez un état de style et écoutez à travers les jointures.
  6. Testez en charge le runtime choisi. Capturez la mémoire GPU, la latence du premier morceau, RTF, le débit, la mise en file d'attente et la récupération après échec.
  7. Abus d'identité de l'équipe rouge. Essayez les clips de personnalités publiques, les consentements incompatibles, les scripts interdits et les tentatives de suppression de divulgation.
  8. Archiver les preuves. Stockez le modèle/la révision, le temps d'exécution, l'invite, la graine, les paramètres, le hachage de référence, le réviseur, le consentement et le hachage de sortie.

Choix de déploiement

CheminIdéal pourValider
Norme PyTorchRecherche, génération hors ligne et exploration de fonctionnalitésVRAM, reproductibilité, versions de packages et comportement des lots
Nano-vLLM-VoxCPMService GPU simultané et rapport inférieur RTFAPI maturité, batching, streaming, métriques et compatibilité des versions
vLLM-OmniPoint de terminaison compatible OpenAI, traitement par lots continu et fonctionnement multi-GPUInstallation, authentification, quotas, isolation et parité exacte des fonctionnalités en évolution rapide
llama.cpp-omniProcesseur Edge/sur appareil, Metal, CUDA ou Vulkan avec artefacts GGUFQualité après quantification, RTF, mémoire, modes pris en charge et maintenance indépendante du projet
Discours géré APIÉquipes qui préfèrent l'évolutivité, la modération et le support hébergésDroits vocaux, rétention, traitement régional, coûts et dépendance aux fournisseurs

Consentement, divulgation et réponse aux incidents

Apache-2.0 régit le logiciel publié et les pondérations. Il n'accorde pas de droits de publicité, de droits d'auteur sur les scripts ou les enregistrements, de droits du travail, de consentement biométrique, d'autorisation de marque ou de droit de tromperie. Les exigences diffèrent selon la juridiction et le contexte, alors obtenez un avis juridique qualifié pour le clonage de personnes réelles et les utilisations à fort impact.

  • Bloquez le clonage jusqu'à ce que la portée du consentement et l'identité du locuteur soient vérifiées.
  • Étiquetez l’audio synthétique dans l’interface utilisateur et le contenu là où les auditeurs pourraient raisonnablement être induits en erreur.
  • Utilisez des métadonnées de provenance ou un filigrane lorsqu'ils sont disponibles, tout en reconnaissant qu'ils peuvent être supprimés.
  • Empêchez l’exportation ou la réutilisation des ressources vocales en dehors des projets autorisés.
  • Créez un processus rapide de retrait, de révocation et d’incident avec une provenance des résultats consultable.
  • Ne déployez jamais de discours cloné à des fins d’authentification, d’instructions d’urgence, de persuasion politique, d’autorisation financière ou d’usurpation d’identité sans contrôles spécialisés et base juridique.

Alternatives

OptionsAvantage potentielComparez soigneusement
VoxCPM2Pile ouverte de 30 langues combinant conception, clonage, réglage fin et plusieurs environnements d'exécutionQualité par langage, maturité d'exécution, gouvernance et calcul
CosyVoiceÉtablissement d'une famille de parole ouverte multilingue et de workflows de clonageCouverture linguistique, licence/version, streaming et contrôle du style
Fish SpeechGénération de discours ouvert et expressif avec un écosystème actifVariante de modèle/licence, matériel et parité d'évaluation
XTTSFlux de travail de clonage multilingue familier et matériel communautaire étenduMaintenance actuelle, licence de modèle, besoins en matière de qualité et de langue
ElevenLabsGestion de API, outils produits et commodité opérationnelleCoûts récurrents, contrôles de consentement, besoins de rétention et d'auto-hébergement
Acteur vocal professionnelPerformance dirigée, contrat explicite et prestation longue et nuancéePlanification et coût par projet, risques d'identité et de qualité souvent inférieurs

Questions fréquemment posées

VoxCPM2 est-il gratuit pour un usage commercial ?

Le référentiel officiel et la carte modèle utilisent Apache-2.0. Le déploiement commercial nécessite toujours des droits sur le texte, les enregistrements de référence, l'identité du locuteur et l'utilisation prévue.

Le 48 kHz garantit-il la qualité studio ?

Non. La fréquence d'échantillonnage décrit la bande passante de sortie, et non la prononciation, les performances, la propreté de l'enregistrement ou l'absence d'artefacts. Écoutez et mesurez le signal complet.

Quelle quantité de mémoire GPU est requise ?

La comparaison officielle répertorie environ 8 Go pour VoxCPM2. Le temps d'exécution, la concurrence, la longueur d'entrée et le moteur de service affectent la mémoire maximale réelle ; test avec marge.

Peut-il fonctionner sur Apple Silicon ?

La démo documente la sélection MPS et llama.cpp-omni documente l'exécution de Metal/GGUF. Le référentiel rapporte un RTF illustratif autour de 1,76 pour Q8_0 sur un Apple M4 Pro ; reproduire sur votre machine.

Quelle quantité d’audio de référence est nécessaire ?

Le modèle prend en charge le clonage à partir d'un court clip, tandis que les conseils de réglage précis indiquent que 5 à 10 minutes peuvent adapter un haut-parleur/un domaine. Un son propre, représentatif et consenti compte plus qu’une durée universelle.

Les 30 langues sont-elles toutes aussi bonnes ?

Non. Les limitations officielles indiquent explicitement que les performances varient en fonction de la disponibilité des données d'entraînement. Utilisez des réviseurs natifs et des scripts spécifiques au domaine pour chaque paramètre régional.

Sources primaires

Dernière révision le 25 juillet 2026. Les réclamations concernant le matériel, les tests de référence et la formation sont attribuées au projet officiel. Vérifiez la révision actuelle, les dépendances, les lois et le contrat de consentement avant l'utilisation en production.

Ready to try VoxCPM?

Visit the official website to get started

Visit VoxCPM

Quick Info

Added
6/2/2026
Published
6/16/2026
Updated
8/31/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Index TTS

Index TTS

IndexTTS est le système open source de Bilibili pour synthèse vocale zero-shot, contrôlable et efficace à niveau industriel. Il vise plutôt chercheurs et développeurs speech qu’une app web vocale clé en main.

Index TTStext to speechzero-shot TTS
1080
Azure Text to Speech

Azure Text to Speech

The best and most realistic voice tools currently available - Outil IA intelligent pour améliorer votre productivité.

text-to-speech
870
Hailuo AI TTS

Hailuo AI TTS

Hailuo AI TTS est un outil lié à MiniMax Audio pour la synthèse vocale multilingue, les voix IA et le clonage vocal.

Hailuo AI TTSMiniMax Audiotext to speech
1060
Coqui TTS

Coqui TTS

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - Outil IA intelligent pour améliorer votre productivité.

text-to-speechfree
910