VoxCPM
VoxCPM

VoxCPM

VoxCPM2 是 OpenBMB 的 Apache-2.0 无分词器的 2B 文本转语音模型,适用于 30 种语言、语音设计、可控克隆、流式传输、微调和 48kHz 输出。本指南涵盖模式、部署、评估、同意、来源和替代方案。

93

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

文本转语音声音克隆多语言音频开源语音生成

Product Preview

A quick visual look at VoxCPM before you visit the official site.

Published 6/16/2026
VoxCPM screenshot

Editorial Review

About VoxCPM

VoxCPM2 是 OpenBMB 的无标记器语音生成堆栈的当前主要版本。该模型拥有 20 亿个参数,经过超过 200 万小时的多语言语音训练,支持 30 种语言、九种列出的中国方言组、纯文本语音设计、基于参考的语音克隆、参考加转录延续、流生成、SFT/LoRA 适应和原生 48kHz 输出。代码和权重在 Apache-2.0 下发布。

这些功能使其与自托管旁白、多语言助手、游戏角色、可访问性原型和受控品牌声音相关。它们还使身份治理变得至关重要。技术上的开放模式不允许复制一个人的声音、误导听众或在未经他们同意的情况下使用录音。

Hand-drawn consent-first VoxCPM2 workflow covering identity and consent, scoped reference audio, generation, human QA, provenance labeling and revocation
语音质量只是生产关卡之一。可部署的工作流程需要身份验证、书面范围、受控数据、人工监听、披露、出处以及撤销或响应滥用的方法。

解决不同工作的四种生成模式

模式输入最佳使用主要风险
文字转语音文本和生成设置中性叙述和基线清晰度测试不受控制的语音识别或不一致的长式韵律
声音设计文本前的自然语言描述创建没有参考音频的新声音提示属性可能因种子而异,并且可能会转变为可识别的身份
可控克隆简短的参考剪辑;可选风格说明在控制节奏、情感或表达的同时保持音色参考风格与控制提示之间的同意、模仿和冲突
终极克隆参考音频加上精确的转录,可选择重新用作音色参考高度相似的延续,保留节奏和声音的细微差别不正确的转录会降低连续性,强烈的相似性会增加误用影响

根据产品要求选择一种模式,而不是根据哪种演示听起来最令人印象深刻。通过声音设计,虚构的角色可能会更安全、更可控。签约演员可能需要克隆以保证连续性,但仅限于商定的语言、脚本、媒体、地区和术语范围内。当相似性很重要并且可以准确验证转录本时,参考文献加转录本延续非常有用。

架构和“无标记器”的含义

VoxCPM2 生成连续的语音表示,而不是首先将音频转换为一系列离散的编解码器标记。官方材料描述了一个在 AudioVAE V2 潜在空间中通过 LocEnc、TSLM、RALM 和 LocDiT 阶段运行的扩散自回归系统,使用 MiniCPM-4 作为其主干。语言模型标记率列为 6.25 Hz。

无分词器并不意味着文本处理消失,也不意味着发音会自动正确。文本规范化、数字、缩写、名称、标点符号、代码转换和特定语言的阅读约定仍然影响着输出。该模型可以从上下文中推断韵律,但制作脚本应该在重要的错误处明确发音和停顿。

当前模型事实及其局限性

官方规格报告值如何解读它
型号尺寸2B参数,BF16型号卡规划模型内存以及运行时、VAE、缓存和并发请求开销
语言列出的 30 种语言以及列出的中国方言支持并不等同于质量;测试每种目标语言、口音和领域
参考/输出率接受16kHz参考;产生 48kHz 输出较高的采样率无法恢复噪声源音频中丢失的身份细节
显存官方对比8GB左右特定于配置的估计,不能保证每个输入或服务堆栈
RTX 4090 上的 RTF约0.30标准; Nano-vLLM 约为 0.13供应商报告的单一硬件结果;基准并发和第一个块延迟
最大序列模型卡中有 8,192 个标记长输入仍然可能变得不稳定,应按语言结构进行分段
许可证Apache-2.0允许软件/权重的商业用途;不授予语音、脚本或数据权利

快速启动

pip 安装 voxcpm

从 voxcpm 导入 VoxCPM
将声音文件导入为 sf

模型 = VoxCPM.from_pretrained(
    “openbmb/VoxCPM2”,
    load_denoiser=假,
)
wav = 模型.生成(
    text="简短的、经过审查的生产测试。",
    cfg_value=2.0,
    inference_timesteps=10,
    种子=42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)

存储库列出了主路径的 Python 3.10–3.12、PyTorch 2.5 或更高版本以及 CUDA 12 或更高版本。它还记录了演示的 CPU、MPS 和 CUDA 选择、用于吞吐量的 Nano-vLLM、用于多租户服务的 vLLM-Omni 以及用于 CPU 的独立 llama.cpp-omni GGUF 路径、Metal、CUDA 或Vulkan。将每个运行时视为一个单独的产品配置,具有自己的数字输出、延迟、支持的标志和维护状态。

参考音频清单

  • 获得书面同意,其中注明演讲者的姓名、允许的用途、语言、媒体、受众、地理位置、持续时间、模型训练/克隆和撤销路径。
  • 捕捉干净的单扬声器音频,没有音乐、房间回声、效果、压缩泵或其他声音。
  • 保留自然变化,但避免情感与所需的中性身份基线相冲突的剪辑。
  • 对于连续克隆,准确转录每个口语单词、填充词和相关标点符号;不要“清理”成绩单。
  • 对源文件进行哈希处理、加密、限制访问并将同意元数据保留在资产工作流程旁边(而不是模糊地嵌入到资产工作流程中)。
  • 测试引用是否包含敏感语句、私人背景言论或应删除的元数据。

如何评价语音质量

尺寸测量失败例子
清晰度WER/CER 来自强大的 ASR 加人工转录审查名称、否定、数字或药物术语发生变化
说话者相似度盲听者评级和说话者嵌入相似性音色与参考文献相似,但段落之间的身份有所不同
韵律对节奏、压力、停顿、情绪和风格依从性的人类评级愉快地表达严肃的内容或不自然的断句
音频完整性咔嗒声、削波、本底噪声、重复、丢失和频谱异常48kHz 文件包含高频伪影或重复音节
长形稳定性每分钟/段的错误和身份漂移几段后声音发生变化
串流体验负载下的第一个音频的时间、间隙率、块连续性和 RTF平均生成速度快,但可听到接缝或第一个块延迟
安全未经授权的身份、不允许的脚本和出处测试服务接受任何没有同意控制的公共剪辑

该存储库发布 Seed-TTS-eval、多语言和指令控制结果。这些表格对于形成假设很有用,但不能取代私人评估。有些结果是内部的,并使用自动转录或相似性模型;公共基准平均值可以隐藏对您的产品重要的重音、数字和域。

生产评估协议

  1. 定义语音合约。 明确身份、允许的风格、发音指南、披露和禁止的内容。
  2. 构建多语言测试集。 包括母语审阅者、语码转换、姓名、日期、货币、缩写词、情绪变化和困难的标点符号。
  3. 运行固定和变化的种子。 固定种子支持回归测试;不同的种子揭示了世代差异。
  4. 比较模式。 仅在法律允许的情况下测试语音设计、基本克隆和转录条件延续。
  5. 对长脚本进行分段。 在语义边界处拆分、维护样式状态并跨连接进行侦听。
  6. 对所选运行时进行负载测试。 捕获 GPU 内存、第一个块延迟、RTF、吞吐量、排队和故障恢复。
  7. 红队身份滥用。 尝试使用公众人物剪辑、不匹配的同意、禁止的脚本以及尝试消除披露。
  8. 归档证据。 存储模型/修订、运行时、提示、种子、设置、参考哈希、审阅者、同意和输出哈希。

部署选择

路径最适合验证
标准 PyTorch研究、离线生成和特征探索VRAM、再现性、软件包版本和批次行为
Nano-vLLM-VoxCPM并发 GPU 服务和报告的 RTF 较低API 成熟度、批处理、流式传输、指标和版本兼容性
vLLM-OmniOpenAI 兼容端点、连续批处理和多 GPU 操作快速发展的安装、身份验证、配额、隔离和精确的功能对等
llama.cpp-omni边缘/设备上 CPU、Metal、CUDA 或 Vulkan 以及 GGUF 工件量化后的质量、RTF、内存、支持的模式和独立项目维护
受控语音 API喜欢托管规模、适度和支持的团队话语权、保留、区域处理、成本和供应商依赖性

同意、披露和事件响应

Apache-2.0 管理已发布的软件和权重。它不授予宣传权、脚本或录音的版权、劳动权、生物识别同意、商标许可或欺骗权。要求因司法管辖区和环境而异,因此请针对真人克隆和高影响力用途获得合格的法律审查。

  • 阻止克隆,直到验证同意范围和说话者身份。
  • 在用户界面和内容中标记合成音频,以免听众被合理误导。
  • 在可用的情况下使用出处元数据或水印,同时认识到它可以被剥离。
  • 防止语音资产在授权项目之外导出或重复使用。
  • 创建具有可搜索输出来源的快速删除、撤销和事件流程。
  • 在没有专门控制和法律依据的情况下,切勿将克隆语音用于身份验证、紧急指示、政治说服、财务授权或冒充。

替代方案

选项潜在优势仔细比较
VoxCPM2开放 30 种语言堆栈,结合设计、克隆、微调和多个运行时每种语言的质量、运行时成熟度、治理和计算
CosyVoice建立多语言开放语音家族和克隆工作流程语言覆盖、许可证/版本、流媒体和风格控制
Fish Speech具有活跃生态系统的富有表现力的开放式语音生成型号/许可证变体、硬件和评估同等性
XTTS熟悉的多语言克隆工作流程和广泛的社区材料当前维护、型号许可、质量和语言需求
ElevenLabs托管API、产品工具和操作便利性经常性成本、同意控制、保留和自托管需求
专业配音演员定向绩效、明确合同和细致入微的长格式交付调度和每个项目的成本,通常会降低身份和质量风险

常见问题

VoxCPM2 可以免费用于商业用途吗?

官方存储库和模型卡使用Apache-2.0。商业部署仍然需要文本、参考录音、说话者身份和预期用途的权利。

48kHz能保证录音室音质吗?

不。采样率描述的是输出带宽,而不是发音、性能、录音清洁度或是否存在伪影。聆听并测量完整的信号。

需要多少 GPU 内存?

官方比较列出了 VoxCPM2 大约 8 GB。运行时、并发、输入长度和服务引擎影响实际峰值内存;测试净空。

它可以在 Apple Silicon 上运行吗?

该演示记录了 MPS 选择,以及 llama.cpp-omni 记录了 Metal/GGUF 执行。该存储库报告了 Apple M4 Pro 上 Q8_0 的说明性 RTF 约为 1.76;在您的机器上重现。

需要多少参考音频?

该模型支持从短片进行克隆,而微调指南表示 5-10 分钟就可以适应说话者/域。干净、有代表性、得到认可的音频比普遍的持续时间更重要。

所有 30 种语言都同样优秀吗?

不会。官方限制明确表示性能随训练数据可用性的不同而变化。为每个区域设置使用本地审阅者和特定于域的脚本。

主要来源

上次审核日期为 2026 年 7 月 25 日。硬件、基准测试和培训声明均来自官方项目。在生产使用之前验证当前修订版、依赖项、法律和同意合同。

Ready to try VoxCPM?

Visit the official website to get started

Visit VoxCPM

Quick Info

Added
6/2/2026
Published
6/16/2026
Updated
8/31/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Index TTS

Index TTS

IndexTTS 是 Bilibili 开源的工业级、可控、高效零样本文本转语音系统。它更适合语音研究者和开发者做可控 TTS 实验,而不是普通用户寻找成品网页配音工具。

Index TTStext to speechzero-shot TTS
5010
Azure Text to Speech

Azure Text to Speech

The best and most realistic voice tools currently available - 智能 AI 工具,助力您的工作效率。

text-to-speech
1310
Hailuo AI TTS

Hailuo AI TTS

Hailuo AI TTS 与 MiniMax Audio 相关,是面向多语种 AI 语音、声音克隆和音频内容工作流的文本转语音产品。

Hailuo AI TTSMiniMax Audiotext to speech
2610
Coqui TTS

Coqui TTS

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - 智能 AI 工具,助力您的工作效率。

text-to-speechfree
1590