VoxCPM2 ist die aktuelle Hauptversion des tokenizerfreien Sprachgenerierungsstapels von OpenBMB. Es wird beschrieben, dass das 2-Milliarden-Parameter-Modell auf mehr als zwei Millionen Stunden mehrsprachiger Sprache trainiert wurde und 30 Sprachen, neun aufgelistete chinesische Dialektgruppen, reines Text-Sprachdesign, referenzbasiertes Stimmenklonen, Referenz-plus-Transkript-Fortsetzung, Streaming-Generierung, SFT/LoRA-Anpassung und native 48-kHz-Ausgabe unterstützt. Code und Gewichte werden unter Apache-2.0 veröffentlicht.
Diese Fähigkeiten machen es für selbst gehostete Erzählungen, mehrsprachige Assistenten, Spielfiguren, Barrierefreiheitsprototypen und kontrollierte Markenstimmen relevant. Sie machen auch Identity Governance unerlässlich. Ein technisch offenes Modell ist keine Erlaubnis, die Stimme einer Person zu kopieren, Zuhörer in die Irre zu führen oder Aufnahmen ohne deren Zustimmung zu verwenden.
Vier Generationsmodi, die unterschiedliche Aufgaben lösen
| Modus | Eingabe | Beste Verwendung | Hauptrisiko |
|---|---|---|---|
| Text-zu-Sprache | Text- und Generierungseinstellungen | Neutrale Erzählung und grundlegende Verständlichkeitsprüfung | Unkontrollierte Stimmidentität oder inkonsistente lange Prosodie |
| Sprachdesign | Dem Text vorangestellte Beschreibung in natürlicher Sprache | Erstellen Sie eine neue Stimme ohne Referenzaudio | Prompt-Attribute können je nach Seed unterschiedlich sein und zu erkennbaren Identitäten führen |
| Kontrollierbares Klonen | Kurzer Referenzclip; optionale Stilanweisung | Behalten Sie die Klangfarbe bei, während Sie Tempo, Emotion oder Ausdruck steuern | Einwilligung, Identitätswechsel und Konflikt zwischen Referenzstil und Kontrollaufforderung |
| Ultimatives Klonen | Referenzaudio plus genaues Transkript, optional als Klangfarbenreferenz wiederverwendet | Fortsetzung mit hoher Ähnlichkeit, die Rhythmus und Stimmnuancen bewahrt | Eine falsche Transkription beeinträchtigt die Fortsetzung und eine starke Ähnlichkeit erhöht die Auswirkungen von Missbrauch |
Wählen Sie einen Modus entsprechend der Produktanforderung und nicht danach, welche Demo am beeindruckendsten klingt. Eine fiktive Figur kann mit der Stimmgestaltung sicherer und kontrollierbarer sein. Ein vertraglich vereinbarter Schauspieler muss möglicherweise aus Gründen der Kontinuität geklont werden, jedoch nur innerhalb der vereinbarten Sprachen, Skripte, Medien, Regionen und Laufzeiten. Die Fortsetzung von Referenz plus Transkript ist nützlich, wenn Ähnlichkeit wichtig ist und das Transkript genau überprüft werden kann.
Architektur und was „tokenizerfrei“ bedeutet
VoxCPM2 generiert kontinuierliche Sprachdarstellungen, anstatt Audio zunächst in eine Folge diskreter Codec-Tokens umzuwandeln. Das offizielle Material beschreibt ein diffusionsautoregressives System, das im latenten Raum AudioVAE V2 über die Stufen LocEnc, TSLM, RALM und LocDiT arbeitet und MiniCPM-4 als Rückgrat verwendet. Die Sprachmodell-Token-Rate wird mit 6,25 Hz angegeben.
Ohne Tokenizer bedeutet das nicht, dass die Textverarbeitung verschwindet oder dass die Aussprache automatisch korrekt ist. Textnormalisierung, Zahlen, Abkürzungen, Namen, Zeichensetzung, Codeumschaltung und sprachspezifische Lesekonventionen prägen weiterhin die Ausgabe. Das Modell kann Prosodie aus dem Kontext ableiten, Produktionsskripte sollten jedoch die Aussprache und Pausen deutlich machen, wenn Fehler wichtig sind.
Aktuelle Modellfakten und ihre Grenzen
| Offizielle Spezifikation | Gemeldeter Wert | Wie man es interpretiert |
|---|---|---|
| Modellgröße | 2B-Parameter, BF16-Modellkarte | Planen Sie Modellspeicher plus Laufzeit, VAE, Cache und Overhead für gleichzeitige Anforderungen |
| Sprachen | 30 gelistete Sprachen plus gelistete chinesische Dialekte | Support ist nicht von gleicher Qualität; Testen Sie jede Zielsprache, jeden Akzent und jede Domäne |
| Referenz-/Ausgaberate | Akzeptiert 16-kHz-Referenz; erzeugt eine 48-kHz-Ausgabe | Eine höhere Abtastrate kann keine Identitätsdetails wiederherstellen, die in verrauschten Audioquellen fehlen |
| VRAM | Etwa 8 GB im offiziellen Vergleich | Konfigurationsspezifische Schätzung, keine Garantie für jeden Eingabe- oder Bereitstellungsstapel |
| RTF auf RTX 4090 | Ungefähr 0,30 Standard; etwa 0,13 mit Nano-vLLM | Vom Anbieter gemeldetes Einzelhardware-Ergebnis; Benchmark-Parallelität und First-Chunk-Latenz |
| Maximale Reihenfolge | 8.192 Token in der Modellkarte | Lange Eingaben können immer noch instabil werden und sollten nach sprachlicher Struktur segmentiert werden |
| Lizenz | Apache-2.0 | Erlaubt die kommerzielle Nutzung von Software/Gewichten; gewährt keine Sprach-, Skript- oder Datenrechte |
Schnellstart
pip voxcpm installieren
aus voxcpm-Import VoxCPM
Sounddatei als SF importieren
model = VoxCPM.from_pretrained(
„openbmb/VoxCPM2“,
load_denoiser=False,
)
wav = model.generate(
text="Ein kurzer, überprüfter Produktionstest.",
cfg_value=2.0,
inference_timesteps=10,
Samen=42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)
Das Repository listet Python 3.10–3.12, PyTorch 2.5 oder neuer und CUDA 12 oder neuer für den primären Pfad auf. Es dokumentiert außerdem CPU-, MPS- und CUDA-Auswahlmöglichkeiten für die Demo, Nano-vLLM für den Durchsatz, vLLM-Omni für die mandantenfähige Bereitstellung und einen unabhängigen llama.cpp-omni GGUF Pfad für CPU, Metal, CUDA oder Vulkan. Behandeln Sie jede Laufzeit als separate Produktkonfiguration mit eigener numerischer Ausgabe, Latenz, unterstützten Flags und Wartungsstatus.
Referenz-Audio-Checkliste
- Holen Sie eine schriftliche Einwilligung ein, in der der Sprecher, die erlaubte Nutzung, die Sprachen, die Medien, das Publikum, die Geografie, die Dauer, das Training/Klonen des Modells und der Widerrufspfad genannt werden.
- Nehmen Sie sauberes Audio über einen einzigen Lautsprecher auf, ohne Musik, Raumecho, Effekte, Kompressionspumpen oder eine andere Stimme.
- Behalten Sie die natürliche Variation bei, vermeiden Sie jedoch einen Clip, dessen Emotion im Widerspruch zur gewünschten neutralen Identitätsgrundlinie steht.
- Für das Fortsetzungsklonen transkribieren Sie jedes gesprochene Wort, alle Füllwörter und alle relevanten Satzzeichen genau. „bereinigen“ Sie das Transkript nicht.
- Hashen Sie die Quelldatei, verschlüsseln Sie sie, beschränken Sie den Zugriff und bewahren Sie die Einwilligungsmetadaten neben dem Asset-Workflow auf – nicht mehrdeutig darin eingebettet.
- Testen Sie, ob die Referenz vertrauliche Aussagen, private Hintergrundreden oder Metadaten enthält, die entfernt werden sollten.
So bewerten Sie die Sprachqualität
| Dimension | Messung | Beispiel für einen Fehler |
|---|---|---|
| Verständlichkeit | WER/CER aus einer starken ASR plus menschlicher Transkriptprüfung | Namen, Verneinungen, Nummern oder Arzneimittelbezeichnungen geändert |
| Sprecherähnlichkeit | Bewertung der verblindeten Zuhörer und Ähnlichkeit beim Einbetten des Sprechers | Die Klangfarbe ähnelt der Referenz, aber die Identität verschwimmt zwischen den Absätzen |
| Prosodie | Menschliche Bewertung von Rhythmus, Stress, Pause, Emotionen und Stiltreue | Fröhlicher Vortrag ernster Inhalte oder unnatürlicher Phrasenumbrüche |
| Audiointegrität | Klickgeräusche, Clipping, Grundrauschen, Wiederholungen, Aussetzer und spektrale Anomalien | Die 48-kHz-Datei enthält hochfrequente Artefakte oder wiederholte Silben |
| Langformstabilität | Fehler- und Identitätsdrift pro Minute/Segment | Die Stimme ändert sich nach mehreren Absätzen |
| Streaming-Erlebnis | Zeit bis zum ersten Audio, Lückenrate, Chunk-Kontinuität und RTF unter Last | Schnelle durchschnittliche Erzeugung, aber hörbare Nähte oder verzögerter erster Teil |
| Sicherheit | Unautorisierte Identitäts-, unzulässige Skript- und Herkunftstests | Der Dienst akzeptiert alle öffentlichen Clips ohne Zustimmungskontrolle |
Das Repository veröffentlicht Seed-TTS-eval, mehrsprachige und befehlsgesteuerte Ergebnisse. Diese Tabellen dienen der Hypothesenbildung und ersetzen nicht eine private Bewertung. Einige Ergebnisse sind intern und verwenden automatisierte Transkriptions- oder Ähnlichkeitsmodelle. Öffentliche Benchmark-Durchschnitte können Akzente, Zahlen und Domänen verbergen, die für Ihr Produkt wichtig sind.
Ein Produktionsbewertungsprotokoll
- Definieren Sie den Sprachvertrag. Geben Sie Identität, zulässige Stile, Aussprachehinweise, Offenlegung und verbotene Inhalte an.
- Erstellen Sie ein mehrsprachiges Testset. Beziehen Sie native Rezensenten, Code-Switching, Namen, Daten, Währungen, Akronyme, emotionale Veränderungen und schwierige Zeichensetzung ein.
- Führen Sie feste und abwechslungsreiche Samen aus. Ein fester Startwert unterstützt Regressionstests; Verschiedene Samen offenbaren Generationsunterschiede.
- Vergleichen Sie die Modi. Testen Sie Stimmdesign, einfaches Klonen und transkriptbedingte Fortsetzung nur dort, wo dies gesetzlich zulässig ist.
- Segmentieren Sie lange Skripte. Teilen Sie an semantischen Grenzen, behalten Sie einen Stilstatus bei und überwachen Sie über Joins hinweg.
- Testen Sie die ausgewählte Laufzeit unter Last. Erfassen Sie GPU-Speicher, First-Chunk-Latenz, RTF, Durchsatz, Warteschlangen und Wiederherstellung nach Fehlern.
- Identitätsmissbrauch durch das Rote Team. Versuchen Sie es mit Clips von Persönlichkeiten des öffentlichen Lebens, nicht übereinstimmenden Einwilligungen, verbotenen Skripten und Versuchen, die Offenlegung zu verhindern.
- Archivbeweise. Speichern Sie Modell/Revision, Laufzeit, Eingabeaufforderung, Seed, Einstellungen, Referenz-Hash, Prüfer, Zustimmung und Ausgabe-Hash.
Bereitstellungsoptionen
| Pfad | Am besten für | Validieren |
|---|---|---|
| Standard PyTorch | Recherche, Offline-Generierung und Feature-Exploration | VRAM, Reproduzierbarkeit, Paketversionen und Batch-Verhalten |
| Nano-vLLM-VoxCPM | Gleichzeitige GPU-Bereitstellung und niedriger gemeldete RTF | API Reifegrad, Stapelverarbeitung, Streaming, Metriken und Versionskompatibilität |
| vLLM-Omni | OpenAI-kompatibler Endpunkt, kontinuierliches Batching und Multi-GPU-Betrieb | Sich schnell weiterentwickelnde Installation, Authentifizierung, Kontingente, Isolierung und genaue Funktionsparität |
| llama.cpp-omni | Edge-/Geräte-CPU, Metal, CUDA oder Vulkan mit GGUF-Artefakten | Qualität nach Quantisierung, RTF, Speicher, unterstützte Modi und unabhängige Projektwartung |
| Gemanagte Rede API | Teams, die gehostete Größe, Moderation und Support bevorzugen | Sprachrechte, Aufbewahrung, regionale Verarbeitung, Kosten und Anbieterabhängigkeit |
Einwilligung, Offenlegung und Reaktion auf Vorfälle
Apache-2.0 regelt die freigegebene Software und Gewichte. Es gewährt keine Veröffentlichungsrechte, Urheberrechte an Skripten oder Aufzeichnungen, Arbeitsrechte, biometrische Zustimmung, Markenerlaubnis oder das Recht zur Täuschung. Die Anforderungen unterscheiden sich je nach Gerichtsbarkeit und Kontext. Holen Sie sich daher eine qualifizierte rechtliche Prüfung für das Klonen realer Personen und für wirkungsvolle Anwendungen ein.
- Blockieren Sie das Klonen, bis der Einwilligungsbereich und die Sprecheridentität überprüft wurden.
- Kennzeichnen Sie synthetisches Audio in der Benutzeroberfläche und im Inhalt dort, wo Zuhörer vernünftigerweise in die Irre geführt werden könnten.
- Verwenden Sie Herkunftsmetadaten oder Wasserzeichen, sofern verfügbar, und beachten Sie, dass diese entfernt werden können.
- Verhindern Sie, dass Sprachressourcen exportiert oder außerhalb autorisierter Projekte wiederverwendet werden.
- Erstellen Sie einen schnellen Deaktivierungs-, Widerrufs- und Vorfallprozess mit durchsuchbarer Ausgabeherkunft.
- Setzen Sie geklonte Sprache niemals ohne spezielle Kontrollen und Rechtsgrundlage zur Authentifizierung, für Notfallanweisungen, zur politischen Überzeugung, zur finanziellen Autorisierung oder zum Identitätswechsel ein.
Alternativen
| Option | Potenzieller Vorteil | Vergleichen Sie sorgfältig |
|---|---|---|
| VoxCPM2 | Offener 30-Sprachen-Stack, der Design, Klonen, Feinabstimmung und mehrere Laufzeiten kombiniert | Qualität, Laufzeitreife, Governance und Rechenleistung pro Sprache |
| CosyVoice | Etablierung mehrsprachiger Open-Speech-Familien- und Klon-Workflows | Sprachabdeckung, Lizenz/Version, Streaming und Stilkontrolle |
| Fish Speech | Ausdrucksstarke offene Spracherzeugung mit aktivem Ökosystem | Modell-/Lizenzvariante, Hardware- und Evaluierungsparität |
| XTTS | Vertrauter mehrsprachiger Klon-Workflow und umfangreiches Community-Material | Aktuelle Wartungs-, Modelllizenz-, Qualitäts- und Sprachanforderungen |
| ElevenLabs | Verwaltet API, Produkttools und Bedienkomfort | Wiederkehrende Kosten, Einwilligungskontrollen, Aufbewahrung und Selbsthosting-Anforderungen |
| Professioneller Synchronsprecher | Gezielte Leistung, klarer Vertrag und differenzierte, langfristige Lieferung | Terminplanung und Kosten pro Projekt, oft geringeres Identitäts- und Qualitätsrisiko |
Häufig gestellte Fragen
Ist VoxCPM2 für die kommerzielle Nutzung kostenlos?
Das offizielle Repository und die Modellkarte verwenden Apache-2.0. Für die kommerzielle Nutzung sind weiterhin Rechte an Text, Referenzaufnahmen, Sprecheridentität und Verwendungszweck erforderlich.
Garantiert 48 kHz Studioqualität?
Nein. Die Abtastrate beschreibt die Ausgabebandbreite, nicht die Aussprache, die Leistung, die Sauberkeit der Aufnahme oder das Fehlen von Artefakten. Hören Sie zu und messen Sie das gesamte Signal.
Wie viel GPU-Speicher wird benötigt?
Der offizielle Vergleich listet etwa 8 GB für VoxCPM2 auf. Laufzeit, Parallelität, Eingabelänge und Serving-Engine wirken sich auf den tatsächlichen Spitzenspeicher aus; Test mit Headroom.
Kann es auf Apple Silicon ausgeführt werden?
Die Demo dokumentiert die MPS-Auswahl und llama.cpp-omni dokumentiert die Ausführung Metal/GGUF. Das Repository meldet einen beispielhaften RTF um 1,76 für Q8_0 auf einem Apple M4 Pro; auf Ihrem Computer reproduzieren.
Wie viel Referenzaudio wird benötigt?
Das Modell unterstützt das Klonen aus einem kurzen Clip, während die Feinabstimmungsanleitung besagt, dass 5–10 Minuten einen Sprecher/eine Domäne anpassen können. Sauberer, repräsentativer und konsistenter Ton ist wichtiger als eine einheitliche Dauer.
Sind alle 30 Sprachen gleich gut?
Nein. Die offiziellen Einschränkungen besagen ausdrücklich, dass die Leistung je nach Verfügbarkeit der Trainingsdaten variiert. Verwenden Sie native Prüfer und domänenspezifische Skripte für jedes Gebietsschema.
Primärquellen
- Offizielles VoxCPM-Repository, Einrichtung, Benchmarks und Einschränkungen
- Offizielle Modellkarte VoxCPM2
- Offizielle VoxCPM-Dokumentation
- VoxCPM technischer Bericht
- Offizielle Hörbeispiele und Projektseite
- Apache-2.0 Lizenzdatei
- vLLM-Omni dienendes Projekt
- llama.cpp-omni Kanteninferenzprojekt
Zuletzt überprüft am 25. Juli 2026. Hardware-, Benchmark- und Schulungsansprüche werden dem offiziellen Projekt zugeordnet. Überprüfen Sie vor dem Produktionseinsatz die aktuelle Revision, Abhängigkeiten, Gesetze und den Zustimmungsvertrag.




