VoxCPM2 是 OpenBMB 的无标记器语音生成堆栈的当前主要版本。该模型拥有 20 亿个参数,经过超过 200 万小时的多语言语音训练,支持 30 种语言、九种列出的中国方言组、纯文本语音设计、基于参考的语音克隆、参考加转录延续、流生成、SFT/LoRA 适应和原生 48kHz 输出。代码和权重在 Apache-2.0 下发布。
这些功能使其与自托管旁白、多语言助手、游戏角色、可访问性原型和受控品牌声音相关。它们还使身份治理变得至关重要。技术上的开放模式不允许复制一个人的声音、误导听众或在未经他们同意的情况下使用录音。
解决不同工作的四种生成模式
| 模式 | 输入 | 最佳使用 | 主要风险 |
|---|---|---|---|
| 文字转语音 | 文本和生成设置 | 中性叙述和基线清晰度测试 | 不受控制的语音识别或不一致的长式韵律 |
| 声音设计 | 文本前的自然语言描述 | 创建没有参考音频的新声音 | 提示属性可能因种子而异,并且可能会转变为可识别的身份 |
| 可控克隆 | 简短的参考剪辑;可选风格说明 | 在控制节奏、情感或表达的同时保持音色 | 参考风格与控制提示之间的同意、模仿和冲突 |
| 终极克隆 | 参考音频加上精确的转录,可选择重新用作音色参考 | 高度相似的延续,保留节奏和声音的细微差别 | 不正确的转录会降低连续性,强烈的相似性会增加误用影响 |
根据产品要求选择一种模式,而不是根据哪种演示听起来最令人印象深刻。通过声音设计,虚构的角色可能会更安全、更可控。签约演员可能需要克隆以保证连续性,但仅限于商定的语言、脚本、媒体、地区和术语范围内。当相似性很重要并且可以准确验证转录本时,参考文献加转录本延续非常有用。
架构和“无标记器”的含义
VoxCPM2 生成连续的语音表示,而不是首先将音频转换为一系列离散的编解码器标记。官方材料描述了一个在 AudioVAE V2 潜在空间中通过 LocEnc、TSLM、RALM 和 LocDiT 阶段运行的扩散自回归系统,使用 MiniCPM-4 作为其主干。语言模型标记率列为 6.25 Hz。
无分词器并不意味着文本处理消失,也不意味着发音会自动正确。文本规范化、数字、缩写、名称、标点符号、代码转换和特定语言的阅读约定仍然影响着输出。该模型可以从上下文中推断韵律,但制作脚本应该在重要的错误处明确发音和停顿。
当前模型事实及其局限性
| 官方规格 | 报告值 | 如何解读它 |
|---|---|---|
| 型号尺寸 | 2B参数,BF16型号卡 | 规划模型内存以及运行时、VAE、缓存和并发请求开销 |
| 语言 | 列出的 30 种语言以及列出的中国方言 | 支持并不等同于质量;测试每种目标语言、口音和领域 |
| 参考/输出率 | 接受16kHz参考;产生 48kHz 输出 | 较高的采样率无法恢复噪声源音频中丢失的身份细节 |
| 显存 | 官方对比8GB左右 | 特定于配置的估计,不能保证每个输入或服务堆栈 |
| RTX 4090 上的 RTF | 约0.30标准; Nano-vLLM 约为 0.13 | 供应商报告的单一硬件结果;基准并发和第一个块延迟 |
| 最大序列 | 模型卡中有 8,192 个标记 | 长输入仍然可能变得不稳定,应按语言结构进行分段 |
| 许可证 | Apache-2.0 | 允许软件/权重的商业用途;不授予语音、脚本或数据权利 |
快速启动
pip 安装 voxcpm
从 voxcpm 导入 VoxCPM
将声音文件导入为 sf
模型 = VoxCPM.from_pretrained(
“openbmb/VoxCPM2”,
load_denoiser=假,
)
wav = 模型.生成(
text="简短的、经过审查的生产测试。",
cfg_value=2.0,
inference_timesteps=10,
种子=42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)
存储库列出了主路径的 Python 3.10–3.12、PyTorch 2.5 或更高版本以及 CUDA 12 或更高版本。它还记录了演示的 CPU、MPS 和 CUDA 选择、用于吞吐量的 Nano-vLLM、用于多租户服务的 vLLM-Omni 以及用于 CPU 的独立 llama.cpp-omni GGUF 路径、Metal、CUDA 或Vulkan。将每个运行时视为一个单独的产品配置,具有自己的数字输出、延迟、支持的标志和维护状态。
参考音频清单
- 获得书面同意,其中注明演讲者的姓名、允许的用途、语言、媒体、受众、地理位置、持续时间、模型训练/克隆和撤销路径。
- 捕捉干净的单扬声器音频,没有音乐、房间回声、效果、压缩泵或其他声音。
- 保留自然变化,但避免情感与所需的中性身份基线相冲突的剪辑。
- 对于连续克隆,准确转录每个口语单词、填充词和相关标点符号;不要“清理”成绩单。
- 对源文件进行哈希处理、加密、限制访问并将同意元数据保留在资产工作流程旁边(而不是模糊地嵌入到资产工作流程中)。
- 测试引用是否包含敏感语句、私人背景言论或应删除的元数据。
如何评价语音质量
| 尺寸 | 测量 | 失败例子 |
|---|---|---|
| 清晰度 | WER/CER 来自强大的 ASR 加人工转录审查 | 名称、否定、数字或药物术语发生变化 |
| 说话者相似度 | 盲听者评级和说话者嵌入相似性 | 音色与参考文献相似,但段落之间的身份有所不同 |
| 韵律 | 对节奏、压力、停顿、情绪和风格依从性的人类评级 | 愉快地表达严肃的内容或不自然的断句 |
| 音频完整性 | 咔嗒声、削波、本底噪声、重复、丢失和频谱异常 | 48kHz 文件包含高频伪影或重复音节 |
| 长形稳定性 | 每分钟/段的错误和身份漂移 | 几段后声音发生变化 |
| 串流体验 | 负载下的第一个音频的时间、间隙率、块连续性和 RTF | 平均生成速度快,但可听到接缝或第一个块延迟 |
| 安全 | 未经授权的身份、不允许的脚本和出处测试 | 服务接受任何没有同意控制的公共剪辑 |
该存储库发布 Seed-TTS-eval、多语言和指令控制结果。这些表格对于形成假设很有用,但不能取代私人评估。有些结果是内部的,并使用自动转录或相似性模型;公共基准平均值可以隐藏对您的产品重要的重音、数字和域。
生产评估协议
- 定义语音合约。 明确身份、允许的风格、发音指南、披露和禁止的内容。
- 构建多语言测试集。 包括母语审阅者、语码转换、姓名、日期、货币、缩写词、情绪变化和困难的标点符号。
- 运行固定和变化的种子。 固定种子支持回归测试;不同的种子揭示了世代差异。
- 比较模式。 仅在法律允许的情况下测试语音设计、基本克隆和转录条件延续。
- 对长脚本进行分段。 在语义边界处拆分、维护样式状态并跨连接进行侦听。
- 对所选运行时进行负载测试。 捕获 GPU 内存、第一个块延迟、RTF、吞吐量、排队和故障恢复。
- 红队身份滥用。 尝试使用公众人物剪辑、不匹配的同意、禁止的脚本以及尝试消除披露。
- 归档证据。 存储模型/修订、运行时、提示、种子、设置、参考哈希、审阅者、同意和输出哈希。
部署选择
| 路径 | 最适合 | 验证 |
|---|---|---|
| 标准 PyTorch | 研究、离线生成和特征探索 | VRAM、再现性、软件包版本和批次行为 |
| Nano-vLLM-VoxCPM | 并发 GPU 服务和报告的 RTF 较低 | API 成熟度、批处理、流式传输、指标和版本兼容性 |
| vLLM-Omni | OpenAI 兼容端点、连续批处理和多 GPU 操作 | 快速发展的安装、身份验证、配额、隔离和精确的功能对等 |
| llama.cpp-omni | 边缘/设备上 CPU、Metal、CUDA 或 Vulkan 以及 GGUF 工件 | 量化后的质量、RTF、内存、支持的模式和独立项目维护 |
| 受控语音 API | 喜欢托管规模、适度和支持的团队 | 话语权、保留、区域处理、成本和供应商依赖性 |
同意、披露和事件响应
Apache-2.0 管理已发布的软件和权重。它不授予宣传权、脚本或录音的版权、劳动权、生物识别同意、商标许可或欺骗权。要求因司法管辖区和环境而异,因此请针对真人克隆和高影响力用途获得合格的法律审查。
- 阻止克隆,直到验证同意范围和说话者身份。
- 在用户界面和内容中标记合成音频,以免听众被合理误导。
- 在可用的情况下使用出处元数据或水印,同时认识到它可以被剥离。
- 防止语音资产在授权项目之外导出或重复使用。
- 创建具有可搜索输出来源的快速删除、撤销和事件流程。
- 在没有专门控制和法律依据的情况下,切勿将克隆语音用于身份验证、紧急指示、政治说服、财务授权或冒充。
替代方案
| 选项 | 潜在优势 | 仔细比较 |
|---|---|---|
| VoxCPM2 | 开放 30 种语言堆栈,结合设计、克隆、微调和多个运行时 | 每种语言的质量、运行时成熟度、治理和计算 |
| CosyVoice | 建立多语言开放语音家族和克隆工作流程 | 语言覆盖、许可证/版本、流媒体和风格控制 |
| Fish Speech | 具有活跃生态系统的富有表现力的开放式语音生成 | 型号/许可证变体、硬件和评估同等性 |
| XTTS | 熟悉的多语言克隆工作流程和广泛的社区材料 | 当前维护、型号许可、质量和语言需求 |
| ElevenLabs | 托管API、产品工具和操作便利性 | 经常性成本、同意控制、保留和自托管需求 |
| 专业配音演员 | 定向绩效、明确合同和细致入微的长格式交付 | 调度和每个项目的成本,通常会降低身份和质量风险 |
常见问题
VoxCPM2 可以免费用于商业用途吗?
官方存储库和模型卡使用Apache-2.0。商业部署仍然需要文本、参考录音、说话者身份和预期用途的权利。
48kHz能保证录音室音质吗?
不。采样率描述的是输出带宽,而不是发音、性能、录音清洁度或是否存在伪影。聆听并测量完整的信号。
需要多少 GPU 内存?
官方比较列出了 VoxCPM2 大约 8 GB。运行时、并发、输入长度和服务引擎影响实际峰值内存;测试净空。
它可以在 Apple Silicon 上运行吗?
该演示记录了 MPS 选择,以及 llama.cpp-omni 记录了 Metal/GGUF 执行。该存储库报告了 Apple M4 Pro 上 Q8_0 的说明性 RTF 约为 1.76;在您的机器上重现。
需要多少参考音频?
该模型支持从短片进行克隆,而微调指南表示 5-10 分钟就可以适应说话者/域。干净、有代表性、得到认可的音频比普遍的持续时间更重要。
所有 30 种语言都同样优秀吗?
不会。官方限制明确表示性能随训练数据可用性的不同而变化。为每个区域设置使用本地审阅者和特定于域的脚本。
主要来源
- 官方 VoxCPM 存储库、设置、基准和限制
- 官方 VoxCPM2 型号卡
- 官方 VoxCPM 文档
- VoxCPM 技术报告
- 官方音频样本和项目页面
- Apache-2.0 许可证文件
- vLLM-Omni 服务项目
- llama.cpp-omni 边缘推理项目
上次审核日期为 2026 年 7 月 25 日。硬件、基准测试和培训声明均来自官方项目。在生产使用之前验证当前修订版、依赖项、法律和同意合同。




