VoxCPM
VoxCPM

VoxCPM

VoxCPM2 ist das tokenizerfreie 2B-Text-to-Speech-Modell Apache-2.0 von OpenBMB für 30 Sprachen, Sprachdesign, steuerbares Klonen, Streaming, Feinabstimmung und 48-kHz-Ausgabe. Dieser Leitfaden behandelt Modi, Bereitstellung, Bewertung, Einwilligung, Herkunft und Alternativen.

77

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

Text to SpeechVoice Cloningmehrsprachige AudioOpen SourceSprachsynthese

Product Preview

A quick visual look at VoxCPM before you visit the official site.

Published 6/16/2026
VoxCPM screenshot

Editorial Review

About VoxCPM

VoxCPM2 ist die aktuelle Hauptversion des tokenizerfreien Sprachgenerierungsstapels von OpenBMB. Es wird beschrieben, dass das 2-Milliarden-Parameter-Modell auf mehr als zwei Millionen Stunden mehrsprachiger Sprache trainiert wurde und 30 Sprachen, neun aufgelistete chinesische Dialektgruppen, reines Text-Sprachdesign, referenzbasiertes Stimmenklonen, Referenz-plus-Transkript-Fortsetzung, Streaming-Generierung, SFT/LoRA-Anpassung und native 48-kHz-Ausgabe unterstützt. Code und Gewichte werden unter Apache-2.0 veröffentlicht.

Diese Fähigkeiten machen es für selbst gehostete Erzählungen, mehrsprachige Assistenten, Spielfiguren, Barrierefreiheitsprototypen und kontrollierte Markenstimmen relevant. Sie machen auch Identity Governance unerlässlich. Ein technisch offenes Modell ist keine Erlaubnis, die Stimme einer Person zu kopieren, Zuhörer in die Irre zu führen oder Aufnahmen ohne deren Zustimmung zu verwenden.

Hand-drawn consent-first VoxCPM2 workflow covering identity and consent, scoped reference audio, generation, human QA, provenance labeling and revocation
Die Sprachqualität ist nur ein Produktionstor. Ein einsetzbarer Workflow erfordert Identitätsüberprüfung, schriftlichen Umfang, kontrollierte Daten, menschliches Zuhören, Offenlegung, Herkunft und eine Möglichkeit, Missbrauch zu widerrufen oder darauf zu reagieren.

Vier Generationsmodi, die unterschiedliche Aufgaben lösen

ModusEingabeBeste VerwendungHauptrisiko
Text-zu-SpracheText- und GenerierungseinstellungenNeutrale Erzählung und grundlegende VerständlichkeitsprüfungUnkontrollierte Stimmidentität oder inkonsistente lange Prosodie
SprachdesignDem Text vorangestellte Beschreibung in natürlicher SpracheErstellen Sie eine neue Stimme ohne ReferenzaudioPrompt-Attribute können je nach Seed unterschiedlich sein und zu erkennbaren Identitäten führen
Kontrollierbares KlonenKurzer Referenzclip; optionale StilanweisungBehalten Sie die Klangfarbe bei, während Sie Tempo, Emotion oder Ausdruck steuernEinwilligung, Identitätswechsel und Konflikt zwischen Referenzstil und Kontrollaufforderung
Ultimatives KlonenReferenzaudio plus genaues Transkript, optional als Klangfarbenreferenz wiederverwendetFortsetzung mit hoher Ähnlichkeit, die Rhythmus und Stimmnuancen bewahrtEine falsche Transkription beeinträchtigt die Fortsetzung und eine starke Ähnlichkeit erhöht die Auswirkungen von Missbrauch

Wählen Sie einen Modus entsprechend der Produktanforderung und nicht danach, welche Demo am beeindruckendsten klingt. Eine fiktive Figur kann mit der Stimmgestaltung sicherer und kontrollierbarer sein. Ein vertraglich vereinbarter Schauspieler muss möglicherweise aus Gründen der Kontinuität geklont werden, jedoch nur innerhalb der vereinbarten Sprachen, Skripte, Medien, Regionen und Laufzeiten. Die Fortsetzung von Referenz plus Transkript ist nützlich, wenn Ähnlichkeit wichtig ist und das Transkript genau überprüft werden kann.

Architektur und was „tokenizerfrei“ bedeutet

VoxCPM2 generiert kontinuierliche Sprachdarstellungen, anstatt Audio zunächst in eine Folge diskreter Codec-Tokens umzuwandeln. Das offizielle Material beschreibt ein diffusionsautoregressives System, das im latenten Raum AudioVAE V2 über die Stufen LocEnc, TSLM, RALM und LocDiT arbeitet und MiniCPM-4 als Rückgrat verwendet. Die Sprachmodell-Token-Rate wird mit 6,25 Hz angegeben.

Ohne Tokenizer bedeutet das nicht, dass die Textverarbeitung verschwindet oder dass die Aussprache automatisch korrekt ist. Textnormalisierung, Zahlen, Abkürzungen, Namen, Zeichensetzung, Codeumschaltung und sprachspezifische Lesekonventionen prägen weiterhin die Ausgabe. Das Modell kann Prosodie aus dem Kontext ableiten, Produktionsskripte sollten jedoch die Aussprache und Pausen deutlich machen, wenn Fehler wichtig sind.

Aktuelle Modellfakten und ihre Grenzen

Offizielle SpezifikationGemeldeter WertWie man es interpretiert
Modellgröße2B-Parameter, BF16-ModellkartePlanen Sie Modellspeicher plus Laufzeit, VAE, Cache und Overhead für gleichzeitige Anforderungen
Sprachen30 gelistete Sprachen plus gelistete chinesische DialekteSupport ist nicht von gleicher Qualität; Testen Sie jede Zielsprache, jeden Akzent und jede Domäne
Referenz-/AusgaberateAkzeptiert 16-kHz-Referenz; erzeugt eine 48-kHz-AusgabeEine höhere Abtastrate kann keine Identitätsdetails wiederherstellen, die in verrauschten Audioquellen fehlen
VRAMEtwa 8 GB im offiziellen VergleichKonfigurationsspezifische Schätzung, keine Garantie für jeden Eingabe- oder Bereitstellungsstapel
RTF auf RTX 4090Ungefähr 0,30 Standard; etwa 0,13 mit Nano-vLLMVom Anbieter gemeldetes Einzelhardware-Ergebnis; Benchmark-Parallelität und First-Chunk-Latenz
Maximale Reihenfolge8.192 Token in der ModellkarteLange Eingaben können immer noch instabil werden und sollten nach sprachlicher Struktur segmentiert werden
LizenzApache-2.0Erlaubt die kommerzielle Nutzung von Software/Gewichten; gewährt keine Sprach-, Skript- oder Datenrechte

Schnellstart

pip voxcpm installieren

aus voxcpm-Import VoxCPM
Sounddatei als SF importieren

model = VoxCPM.from_pretrained(
    „openbmb/VoxCPM2“,
    load_denoiser=False,
)
wav = model.generate(
    text="Ein kurzer, überprüfter Produktionstest.",
    cfg_value=2.0,
    inference_timesteps=10,
    Samen=42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)

Das Repository listet Python 3.10–3.12, PyTorch 2.5 oder neuer und CUDA 12 oder neuer für den primären Pfad auf. Es dokumentiert außerdem CPU-, MPS- und CUDA-Auswahlmöglichkeiten für die Demo, Nano-vLLM für den Durchsatz, vLLM-Omni für die mandantenfähige Bereitstellung und einen unabhängigen llama.cpp-omni GGUF Pfad für CPU, Metal, CUDA oder Vulkan. Behandeln Sie jede Laufzeit als separate Produktkonfiguration mit eigener numerischer Ausgabe, Latenz, unterstützten Flags und Wartungsstatus.

Referenz-Audio-Checkliste

  • Holen Sie eine schriftliche Einwilligung ein, in der der Sprecher, die erlaubte Nutzung, die Sprachen, die Medien, das Publikum, die Geografie, die Dauer, das Training/Klonen des Modells und der Widerrufspfad genannt werden.
  • Nehmen Sie sauberes Audio über einen einzigen Lautsprecher auf, ohne Musik, Raumecho, Effekte, Kompressionspumpen oder eine andere Stimme.
  • Behalten Sie die natürliche Variation bei, vermeiden Sie jedoch einen Clip, dessen Emotion im Widerspruch zur gewünschten neutralen Identitätsgrundlinie steht.
  • Für das Fortsetzungsklonen transkribieren Sie jedes gesprochene Wort, alle Füllwörter und alle relevanten Satzzeichen genau. „bereinigen“ Sie das Transkript nicht.
  • Hashen Sie die Quelldatei, verschlüsseln Sie sie, beschränken Sie den Zugriff und bewahren Sie die Einwilligungsmetadaten neben dem Asset-Workflow auf – nicht mehrdeutig darin eingebettet.
  • Testen Sie, ob die Referenz vertrauliche Aussagen, private Hintergrundreden oder Metadaten enthält, die entfernt werden sollten.

So bewerten Sie die Sprachqualität

DimensionMessungBeispiel für einen Fehler
VerständlichkeitWER/CER aus einer starken ASR plus menschlicher TranskriptprüfungNamen, Verneinungen, Nummern oder Arzneimittelbezeichnungen geändert
SprecherähnlichkeitBewertung der verblindeten Zuhörer und Ähnlichkeit beim Einbetten des SprechersDie Klangfarbe ähnelt der Referenz, aber die Identität verschwimmt zwischen den Absätzen
ProsodieMenschliche Bewertung von Rhythmus, Stress, Pause, Emotionen und StiltreueFröhlicher Vortrag ernster Inhalte oder unnatürlicher Phrasenumbrüche
AudiointegritätKlickgeräusche, Clipping, Grundrauschen, Wiederholungen, Aussetzer und spektrale AnomalienDie 48-kHz-Datei enthält hochfrequente Artefakte oder wiederholte Silben
LangformstabilitätFehler- und Identitätsdrift pro Minute/SegmentDie Stimme ändert sich nach mehreren Absätzen
Streaming-ErlebnisZeit bis zum ersten Audio, Lückenrate, Chunk-Kontinuität und RTF unter LastSchnelle durchschnittliche Erzeugung, aber hörbare Nähte oder verzögerter erster Teil
SicherheitUnautorisierte Identitäts-, unzulässige Skript- und HerkunftstestsDer Dienst akzeptiert alle öffentlichen Clips ohne Zustimmungskontrolle

Das Repository veröffentlicht Seed-TTS-eval, mehrsprachige und befehlsgesteuerte Ergebnisse. Diese Tabellen dienen der Hypothesenbildung und ersetzen nicht eine private Bewertung. Einige Ergebnisse sind intern und verwenden automatisierte Transkriptions- oder Ähnlichkeitsmodelle. Öffentliche Benchmark-Durchschnitte können Akzente, Zahlen und Domänen verbergen, die für Ihr Produkt wichtig sind.

Ein Produktionsbewertungsprotokoll

  1. Definieren Sie den Sprachvertrag. Geben Sie Identität, zulässige Stile, Aussprachehinweise, Offenlegung und verbotene Inhalte an.
  2. Erstellen Sie ein mehrsprachiges Testset. Beziehen Sie native Rezensenten, Code-Switching, Namen, Daten, Währungen, Akronyme, emotionale Veränderungen und schwierige Zeichensetzung ein.
  3. Führen Sie feste und abwechslungsreiche Samen aus. Ein fester Startwert unterstützt Regressionstests; Verschiedene Samen offenbaren Generationsunterschiede.
  4. Vergleichen Sie die Modi. Testen Sie Stimmdesign, einfaches Klonen und transkriptbedingte Fortsetzung nur dort, wo dies gesetzlich zulässig ist.
  5. Segmentieren Sie lange Skripte. Teilen Sie an semantischen Grenzen, behalten Sie einen Stilstatus bei und überwachen Sie über Joins hinweg.
  6. Testen Sie die ausgewählte Laufzeit unter Last. Erfassen Sie GPU-Speicher, First-Chunk-Latenz, RTF, Durchsatz, Warteschlangen und Wiederherstellung nach Fehlern.
  7. Identitätsmissbrauch durch das Rote Team. Versuchen Sie es mit Clips von Persönlichkeiten des öffentlichen Lebens, nicht übereinstimmenden Einwilligungen, verbotenen Skripten und Versuchen, die Offenlegung zu verhindern.
  8. Archivbeweise. Speichern Sie Modell/Revision, Laufzeit, Eingabeaufforderung, Seed, Einstellungen, Referenz-Hash, Prüfer, Zustimmung und Ausgabe-Hash.

Bereitstellungsoptionen

PfadAm besten fürValidieren
Standard PyTorchRecherche, Offline-Generierung und Feature-ExplorationVRAM, Reproduzierbarkeit, Paketversionen und Batch-Verhalten
Nano-vLLM-VoxCPMGleichzeitige GPU-Bereitstellung und niedriger gemeldete RTFAPI Reifegrad, Stapelverarbeitung, Streaming, Metriken und Versionskompatibilität
vLLM-OmniOpenAI-kompatibler Endpunkt, kontinuierliches Batching und Multi-GPU-BetriebSich schnell weiterentwickelnde Installation, Authentifizierung, Kontingente, Isolierung und genaue Funktionsparität
llama.cpp-omniEdge-/Geräte-CPU, Metal, CUDA oder Vulkan mit GGUF-ArtefaktenQualität nach Quantisierung, RTF, Speicher, unterstützte Modi und unabhängige Projektwartung
Gemanagte Rede APITeams, die gehostete Größe, Moderation und Support bevorzugenSprachrechte, Aufbewahrung, regionale Verarbeitung, Kosten und Anbieterabhängigkeit

Einwilligung, Offenlegung und Reaktion auf Vorfälle

Apache-2.0 regelt die freigegebene Software und Gewichte. Es gewährt keine Veröffentlichungsrechte, Urheberrechte an Skripten oder Aufzeichnungen, Arbeitsrechte, biometrische Zustimmung, Markenerlaubnis oder das Recht zur Täuschung. Die Anforderungen unterscheiden sich je nach Gerichtsbarkeit und Kontext. Holen Sie sich daher eine qualifizierte rechtliche Prüfung für das Klonen realer Personen und für wirkungsvolle Anwendungen ein.

  • Blockieren Sie das Klonen, bis der Einwilligungsbereich und die Sprecheridentität überprüft wurden.
  • Kennzeichnen Sie synthetisches Audio in der Benutzeroberfläche und im Inhalt dort, wo Zuhörer vernünftigerweise in die Irre geführt werden könnten.
  • Verwenden Sie Herkunftsmetadaten oder Wasserzeichen, sofern verfügbar, und beachten Sie, dass diese entfernt werden können.
  • Verhindern Sie, dass Sprachressourcen exportiert oder außerhalb autorisierter Projekte wiederverwendet werden.
  • Erstellen Sie einen schnellen Deaktivierungs-, Widerrufs- und Vorfallprozess mit durchsuchbarer Ausgabeherkunft.
  • Setzen Sie geklonte Sprache niemals ohne spezielle Kontrollen und Rechtsgrundlage zur Authentifizierung, für Notfallanweisungen, zur politischen Überzeugung, zur finanziellen Autorisierung oder zum Identitätswechsel ein.

Alternativen

OptionPotenzieller VorteilVergleichen Sie sorgfältig
VoxCPM2Offener 30-Sprachen-Stack, der Design, Klonen, Feinabstimmung und mehrere Laufzeiten kombiniertQualität, Laufzeitreife, Governance und Rechenleistung pro Sprache
CosyVoiceEtablierung mehrsprachiger Open-Speech-Familien- und Klon-WorkflowsSprachabdeckung, Lizenz/Version, Streaming und Stilkontrolle
Fish SpeechAusdrucksstarke offene Spracherzeugung mit aktivem ÖkosystemModell-/Lizenzvariante, Hardware- und Evaluierungsparität
XTTSVertrauter mehrsprachiger Klon-Workflow und umfangreiches Community-MaterialAktuelle Wartungs-, Modelllizenz-, Qualitäts- und Sprachanforderungen
ElevenLabsVerwaltet API, Produkttools und BedienkomfortWiederkehrende Kosten, Einwilligungskontrollen, Aufbewahrung und Selbsthosting-Anforderungen
Professioneller SynchronsprecherGezielte Leistung, klarer Vertrag und differenzierte, langfristige LieferungTerminplanung und Kosten pro Projekt, oft geringeres Identitäts- und Qualitätsrisiko

Häufig gestellte Fragen

Ist VoxCPM2 für die kommerzielle Nutzung kostenlos?

Das offizielle Repository und die Modellkarte verwenden Apache-2.0. Für die kommerzielle Nutzung sind weiterhin Rechte an Text, Referenzaufnahmen, Sprecheridentität und Verwendungszweck erforderlich.

Garantiert 48 kHz Studioqualität?

Nein. Die Abtastrate beschreibt die Ausgabebandbreite, nicht die Aussprache, die Leistung, die Sauberkeit der Aufnahme oder das Fehlen von Artefakten. Hören Sie zu und messen Sie das gesamte Signal.

Wie viel GPU-Speicher wird benötigt?

Der offizielle Vergleich listet etwa 8 GB für VoxCPM2 auf. Laufzeit, Parallelität, Eingabelänge und Serving-Engine wirken sich auf den tatsächlichen Spitzenspeicher aus; Test mit Headroom.

Kann es auf Apple Silicon ausgeführt werden?

Die Demo dokumentiert die MPS-Auswahl und llama.cpp-omni dokumentiert die Ausführung Metal/GGUF. Das Repository meldet einen beispielhaften RTF um 1,76 für Q8_0 auf einem Apple M4 Pro; auf Ihrem Computer reproduzieren.

Wie viel Referenzaudio wird benötigt?

Das Modell unterstützt das Klonen aus einem kurzen Clip, während die Feinabstimmungsanleitung besagt, dass 5–10 Minuten einen Sprecher/eine Domäne anpassen können. Sauberer, repräsentativer und konsistenter Ton ist wichtiger als eine einheitliche Dauer.

Sind alle 30 Sprachen gleich gut?

Nein. Die offiziellen Einschränkungen besagen ausdrücklich, dass die Leistung je nach Verfügbarkeit der Trainingsdaten variiert. Verwenden Sie native Prüfer und domänenspezifische Skripte für jedes Gebietsschema.

Primärquellen

Zuletzt überprüft am 25. Juli 2026. Hardware-, Benchmark- und Schulungsansprüche werden dem offiziellen Projekt zugeordnet. Überprüfen Sie vor dem Produktionseinsatz die aktuelle Revision, Abhängigkeiten, Gesetze und den Zustimmungsvertrag.

Ready to try VoxCPM?

Visit the official website to get started

Visit VoxCPM

Quick Info

Added
6/2/2026
Published
6/16/2026
Updated
8/31/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Index TTS

Index TTS

IndexTTS ist Bilibili’s Open-Source-System für industrielle, steuerbare und effiziente Zero-Shot-Text-to-Speech-Synthese. Es richtet sich eher an Speech-Forscher und Entwickler als an Nutzer einer fertigen Web-App.

Index TTStext to speechzero-shot TTS
920
Azure Text to Speech

Azure Text to Speech

The best and most realistic voice tools currently available - Intelligentes KI-Tool für mehr Produktivität.

text-to-speech
740
Hailuo AI TTS

Hailuo AI TTS

Hailuo AI TTS ist ein mit MiniMax Audio verbundenes Tool für mehrsprachige Text-to-Speech-Erzeugung, KI-Stimmen und Voice Cloning.

Hailuo AI TTSMiniMax Audiotext to speech
920
Coqui TTS

Coqui TTS

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - Intelligentes KI-Tool für mehr Produktivität.

text-to-speechfree
930