VoxCPM
VoxCPM

VoxCPM

VoxCPM2은 30개 언어, 음성 디자인, 제어 가능한 복제, 스트리밍, 미세 조정 및 48kHz 출력을 위한 OpenBMB의 Apache-2.0 토크나이저가 없는 2B 텍스트 음성 변환 모델입니다. 이 가이드에서는 모드, 배포, 평가, 동의, 출처 및 대안을 다룹니다.

93

Views

0

Likes

Jun 2026

Added

github.com

Website

Tags

음성 합성음성 클론다국어 오디오오픈소스TTS

Product Preview

A quick visual look at VoxCPM before you visit the official site.

Published 6/16/2026
VoxCPM screenshot

Editorial Review

About VoxCPM

VoxCPM2 OpenBMB의 토크나이저가 없는 음성 생성 스택의 현재 주요 릴리스입니다. 20억 매개변수 모델은 200만 시간 이상의 다국어 음성에 대해 훈련된 것으로 설명되며 30개 언어, 9개 나열된 중국어 방언 그룹, 텍스트 전용 음성 디자인, 참조 기반 음성 복제, 참조 및 대본 연속, 스트리밍 생성, SFT/LoRA 적응 및 기본 48kHz 출력을 지원합니다. 코드와 가중치는 Apache-2.0에 따라 공개됩니다.

이러한 기능은 자체 호스팅 내레이션, 다국어 지원, 게임 캐릭터, 접근성 프로토타입 및 제어된 브랜드 음성과 관련이 있습니다. 또한 ID 거버넌스를 필수적으로 만듭니다. 기술적으로 개방적인 모델은 사람의 목소리를 복사하거나, 청취자를 오도하거나, 동의 없이 녹음을 사용하는 것을 허용하지 않습니다.

Hand-drawn consent-first VoxCPM2 workflow covering identity and consent, scoped reference audio, generation, human QA, provenance labeling and revocation
음성 품질은 하나의 생산 관문일 뿐입니다. 배포 가능한 워크플로에는 신원 확인, 서면 범위, 제어된 데이터, 사람의 청취, 공개, 출처 및 오용을 취소하거나 대응하는 방법이 필요합니다.

다양한 작업을 해결하는 4세대 모드

모드입력최고의 사용주요 위험
텍스트 음성 변환텍스트 및 생성 설정중립 내레이션 및 기본 명료도 테스트통제되지 않은 음성 정체성 또는 일관되지 않은 긴 형식의 운율
음성 디자인텍스트 앞에 자연어 설명 추가참조 오디오 없이 새 음성 만들기프롬프트 속성은 시드에 따라 다를 수 있으며 인식 가능한 ID로 표류할 수 있습니다.
제어 가능한 복제짧은 참조 클립; 선택적 스타일 지침속도, 감정, 표현을 조정하면서 음색을 보존하세요.참조 스타일과 제어 프롬프트 간의 동의, 가장 및 충돌
궁극적인 복제참조 오디오와 정확한 대본, 선택적으로 음색 참조로 재사용리듬과 보컬의 뉘앙스를 보존하는 높은 유사성 연속성잘못된 기록은 지속성을 저하시키고 강한 유사성은 오용 영향을 증가시킵니다.

데모가 가장 인상적인 것이 아니라 제품 요구 사항에 따라 모드를 선택하십시오. 가상의 캐릭터는 음성 디자인을 통해 더 안전하고 더 잘 제어할 수 있습니다. 계약된 행위자는 연속성을 위해 복제가 필요할 수 있지만 합의된 언어, 스크립트, 미디어, 지역 및 용어 내에서만 복제가 필요할 수 있습니다. 참조 + 성적 증명서 연속은 유사성이 중요하고 성적 증명서를 정확하게 확인할 수 있는 경우 유용합니다.

아키텍처와 "토크나이저가 필요하지 않음"의 의미

VoxCPM2은 먼저 오디오를 일련의 개별 코덱 토큰으로 변환하는 대신 연속 음성 표현을 생성합니다. 공식 자료에서는 MiniCPM-4를 백본으로 사용하여 LocEnc, TSLM, RALM 및 LocDiT 단계를 통해 AudioVAE V2 잠재 공간에서 작동하는 확산-자동회귀 시스템을 설명합니다. 언어 모델 토큰 속도는 6.25Hz로 나열됩니다.

토크나이저가 없다고 해서 텍스트 처리가 사라지거나 발음이 자동으로 정확하다는 의미는 아닙니다. 텍스트 정규화, 숫자, 약어, 이름, 구두점, 코드 전환 및 언어별 읽기 규칙은 여전히 ​​출력을 형성합니다. 모델은 맥락에서 운율을 추론할 수 있지만 제작 스크립트는 실수가 중요한 경우 발음과 일시 중지를 명시적으로 지정해야 합니다.

현재 모델 사실과 그 한계

공식 사양보고된 값그것을 해석하는 방법
모델 크기2B 매개변수, BF16 모델 카드모델 메모리와 런타임, VAE, 캐시 및 동시 요청 오버헤드 계획
언어30개의 나열된 언어와 나열된 중국어 방언지원은 품질이 동일하지 않습니다. 각 대상 언어, 악센트 및 도메인을 테스트하십시오.
참조/출력 속도16kHz 참조를 허용합니다. 48kHz 출력을 생성합니다샘플링 속도가 높을수록 잡음이 있는 소스 오디오에서 누락된 신원 세부정보를 복원할 수 없습니다.
VRAM공식 비교에서는 약 8GB모든 입력 또는 제공 스택에 대한 보장이 아닌 구성별 추정치
RTX 4090의 RTF약 0.30 표준; Nano-vLLM의 경우 약 0.13공급업체가 보고한 단일 하드웨어 결과 벤치마크 동시성 및 첫 번째 청크 지연 시간
최대 시퀀스모델 카드 내 토큰 8,192개긴 입력은 여전히 불안정할 수 있으므로 언어 구조에 따라 분류해야 합니다.
라이센스Apache-2.0소프트웨어/가중치의 상업적 사용을 허용합니다. 음성, 스크립트 또는 데이터 권한을 부여하지 않습니다.

빠른 시작

pip 설치 voxcpm

voxcpm 가져오기에서 VoxCPM
SF로 사운드 파일 가져오기

모델 = VoxCPM.from_pretrained(
    "openbmb/VoxCPM2",
    load_denoiser=거짓,
)
wav = 모델.생성(
    text="짧고 검토된 생산 테스트입니다.",
    cfg_값=2.0,
    추론_시간단계=10,
    시드=42,
)
sf.write("test.wav", wav, model.tts_model.sample_rate)

저장소에는 기본 경로로 Python 3.10–3.12, PyTorch 2.5 이상 및 CUDA 12 이상이 나열됩니다. 또한 데모를 위한 CPU, MPS 및 CUDA 선택 항목, 처리량을 위한 Nano-vLLM, 다중 테넌트 서비스를 위한 vLLM-Omni 및 CPU를 위한 독립적인 llama.cpp-omni GGUF 경로, Metal, CUDA 또는 Vulkan. 각 런타임을 고유한 숫자 출력, 대기 시간, 지원되는 플래그 및 유지 관리 상태가 포함된 별도의 제품 구성으로 처리합니다.

참조 오디오 체크리스트

  • 화자, 허용된 사용, 언어, 미디어, 청중, 지리, 기간, 모델 훈련/복제 및 철회 경로를 명시하는 서면 동의를 얻습니다.
  • 음악, 실내 에코, 효과, 압축 펌핑 또는 다른 음성 없이 깨끗한 단일 스피커 오디오를 캡처합니다.
  • 자연스러운 변형을 유지하되 원하는 중립적 정체성 기준과 감정이 충돌하는 클립은 피하세요.
  • 연속 복제를 위해 모든 음성 단어, 필러 및 관련 구두점을 정확하게 기록합니다. 성적표를 "정리"하지 마십시오.
  • 소스 파일을 해시하고, 암호화하고, 액세스를 제한하고, 동의 메타데이터를 자산 워크플로우 내부에 모호하게 포함되지 않은 상태로 유지합니다.
  • 참조에 삭제해야 하는 민감한 설명, 비공개 배경 음성 또는 메타데이터가 포함되어 있는지 테스트하세요.

음성 품질을 평가하는 방법

차원측정실패 사례
명료성강력한 ASR과 사람의 성적표 검토를 통해 얻은 WER/CER이름, 부정, 숫자 또는 약물 용어가 변경됨
화자 유사성맹인 청취자 평가 및 스피커 임베딩 유사성음색은 참조와 유사하지만 정체성은 문단 전체에 걸쳐 표류합니다.
운율리듬, 스트레스, 일시 중지, 감정 및 스타일 준수에 대한 인간의 평가진지한 내용이나 부자연스러운 문구 나누기에 대한 유쾌한 전달
오디오 무결성클릭, 클리핑, 노이즈 플로어, 반복, 드롭아웃 및 스펙트럼 이상48kHz 파일에 고주파 아티팩트나 반복되는 음절이 포함되어 있습니다.
긴 형태의 안정성분/세그먼트별 오류 및 ID 드리프트여러 단락 후에 음성이 변경됨
스트리밍 경험첫 번째 오디오까지의 시간, 간격 비율, 청크 연속성 및 로드 시 RTF평균 생성 속도는 빠르지만 이음새가 들리거나 첫 번째 청크가 지연됨
안전무단 신원, 허용되지 않는 스크립트 및 출처 테스트서비스는 동의 제어 없이 모든 공개 클립을 허용합니다.

저장소는 Seed-TTS-eval, 다국어 및 지침 제어 결과를 게시합니다. 이러한 테이블은 개인 평가를 대체하는 것이 아니라 가설을 형성하는 데 유용합니다. 일부 결과는 내부적이며 자동화된 전사 또는 유사성 모델을 사용합니다. 공개 벤치마크 평균은 제품에 중요한 악센트, 숫자 및 도메인을 숨길 수 있습니다.

생산 평가 프로토콜

  1. 음성 계약을 정의합니다. 신원, 허용 스타일, 발음 안내, 공개 및 금지 내용을 지정합니다.
  2. 다국어 테스트 세트를 구축합니다. 기본 리뷰어, 코드 전환, 이름, 날짜, 통화, 약어, 감정적 변화 및 어려운 구두점을 포함합니다.
  3. 고정되고 다양한 시드를 실행하십시오. 고정 시드는 회귀 테스트를 지원합니다. 다양한 씨앗은 세대 차이를 드러냅니다.
  4. 모드를 비교하세요. 법적으로 허용되는 경우에만 음성 디자인, 기본 복제 및 기록 조건 지속을 테스트하십시오.
  5. 긴 스크립트를 세그먼트화합니다. 의미론적 경계에서 분할하고 스타일 상태를 유지하며 조인 전체를 수신합니다.
  6. 선택한 런타임을 로드 테스트합니다. GPU 메모리, 첫 번째 청크 대기 시간, RTF, 처리량, 대기열 및 오류 복구를 캡처합니다.
  7. 레드팀 신원 남용. 공인 클립, 일치하지 않는 동의, 금지된 스크립트 및 공개 제거 시도를 시도해 보세요.
  8. 증거를 보관하세요. 모델/개정, 런타임, 프롬프트, 시드, 설정, 참조 해시, 검토자, 동의 및 출력 해시를 저장합니다.

배포 선택

경로다음에 가장 적합검증
표준 PyTorch연구, 오프라인 생성 및 기능 탐색VRAM, 재현성, 패키지 버전 및 배치 동작
Nano-vLLM-VoxCPM동시 GPU 제공 및 더 낮은 보고 RTFAPI 성숙도, 일괄 처리, 스트리밍, 지표 및 버전 호환성
vLLM-OmniOpenAI 호환 엔드포인트, 연속 일괄 처리 및 다중 GPU 작업빠르게 발전하는 설치, 인증, 할당량, 격리 및 정확한 기능 패리티
llama.cpp-omni에지/온디바이스 CPU, Metal, CUDA 또는 Vulkan(GGUF 아티팩트 포함)양자화 후 품질, RTF, 메모리, 지원 모드 및 독립 프로젝트 유지 관리
관리형 음성 API호스팅된 규모, 조정 및 지원을 선호하는 팀음성 권리, 보존, 지역별 처리, 비용 및 공급업체 종속성

동의, 공개 및 사고 대응

Apache-2.0은 출시된 소프트웨어와 가중치를 관리합니다. 퍼블리시티권, 대본이나 녹음물에 대한 저작권, 노동권, 생체 동의, 상표 허가 또는 속일 권리를 부여하지 않습니다. 요구 사항은 관할권과 상황에 따라 다르므로 실제 복제 및 영향력이 큰 사용에 대한 적격한 법적 검토를 받으십시오.

  • 동의 범위와 화자 신원이 확인될 때까지 복제를 차단합니다.
  • 청취자가 합리적으로 오해할 수 있는 사용자 인터페이스 및 콘텐츠의 합성 오디오에 라벨을 지정합니다.
  • 가능한 경우 출처 메타데이터나 워터마킹을 사용하되 제거될 수 있다는 점을 인식하세요.
  • 승인된 프로젝트 외부로 음성 자산을 내보내거나 재사용하는 것을 방지합니다.
  • 검색 가능한 출력 출처를 통해 신속한 게시 중단, 취소 및 사고 프로세스를 만듭니다.
  • 특별한 통제와 법적 근거 없이 인증, 긴급 지시, 정치적 설득, 재정적 승인 또는 사칭을 위해 복제된 음성을 배포하지 마십시오.

대안

옵션잠재적 이점잘 비교해 보세요
VoxCPM2설계, 복제, 미세 조정 및 다중 런타임을 결합한 개방형 30개 언어 스택언어별 품질, 런타임 성숙도, 거버넌스 및 컴퓨팅
CosyVoice다국어 개방형 음성 제품군 및 복제 워크플로우 구축언어 범위, 라이센스/버전, 스트리밍 및 스타일 제어
Fish Speech활성 생태계를 통한 표현력 있는 개방형 음성 생성모델/라이선스 변형, 하드웨어 및 평가 패리티
XTTS친숙한 다국어 복제 작업흐름과 광범위한 커뮤니티 자료현재 유지 관리, 모델 라이센스, 품질 및 언어 요구 사항
ElevenLabs관리형 API, 제품 툴링 및 운영 편의성반복되는 비용, 동의 제어, 보존 및 자체 호스팅 요구 사항
전문 성우지시된 성능, 명시적인 계약 및 미묘한 장기 전달일정 관리 및 프로젝트당 비용으로 인해 신원 및 품질 위험이 낮아지는 경우가 많습니다.

자주 묻는 질문

VoxCPM2은 상업적 용도로 무료인가요?

공식 저장소와 모델 카드는 Apache-2.0을 사용합니다. 상업적 배포에는 여전히 텍스트, 참조 녹음, 화자 신원 및 사용 목적에 대한 권한이 필요합니다.

48kHz가 스튜디오 품질을 보장하나요?

아니요. 샘플 속도는 발음, 성능, 녹음의 청결성 또는 아티팩트 부재가 아닌 출력 대역폭을 나타냅니다. 전체 신호를 듣고 측정합니다.

얼마나 많은 GPU 메모리가 필요합니까?

공식 비교에는 VoxCPM2에 대해 약 8GB가 나와 있습니다. 런타임, 동시성, 입력 길이 및 서비스 엔진은 실제 최대 메모리에 영향을 미칩니다. 헤드룸으로 테스트해보세요.

Apple Silicon에서 실행할 수 있나요?

데모에서는 MPS 선택을 문서화하고 llama.cpp-omni에서는 Metal/GGUF 실행을 문서화합니다. 저장소는 Apple M4 Pro의 Q8_0에 대해 약 1.76의 예시적인 RTF을 보고합니다. 귀하의 컴퓨터에서 재현하십시오.

얼마나 많은 참조 오디오가 필요합니까?

이 모델은 짧은 클립의 복제를 지원하며 미세 조정 지침에 따르면 5~10분이면 스피커/도메인을 조정할 수 있다고 나와 있습니다. 깨끗하고 대표적이며 동의된 오디오는 보편적인 지속 시간보다 더 중요합니다.

30개 언어 모두 똑같이 좋은가요?

아니요. 공식적인 제한 사항에는 훈련 데이터 가용성에 따라 성능이 달라진다고 명시되어 있습니다. 각 로캘에 대해 기본 검토자와 도메인별 스크립트를 사용합니다.

1차 소스

최종 검토일: 2026년 7월 25일. 하드웨어, 벤치마크 및 교육 관련 주장은 공식 프로젝트에 귀속됩니다. 프로덕션에 사용하기 전에 현재 개정판, 종속성, 법률 및 동의 계약을 확인하세요.

Ready to try VoxCPM?

Visit the official website to get started

Visit VoxCPM

Quick Info

Added
6/2/2026
Published
6/16/2026
Updated
8/31/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool
Index TTS

Index TTS

IndexTTS는 Bilibili의 오픈소스 산업급 제어 가능 고효율 제로샷 TTS 시스템입니다. 완성형 웹 음성 앱이 아니라 음성 연구자와 개발자를 위한 실험 프로젝트에 가깝습니다.

Index TTStext to speechzero-shot TTS
1220
Azure Text to Speech

Azure Text to Speech

The best and most realistic voice tools currently available - 스마트 AI 도구로 생산성 향상.

text-to-speech
1160
Hailuo AI TTS

Hailuo AI TTS

Hailuo AI TTS는 MiniMax Audio와 연결된 다국어 텍스트 음성 변환, AI 음성, 음성 복제 도구입니다.

Hailuo AI TTSMiniMax Audiotext to speech
1400
Coqui TTS

Coqui TTS

A deep learning toolkit for Text-to-Speech, battle-tested in research and production - 스마트 AI 도구로 생산성 향상.

text-to-speechfree
1100