So-VITS-SVC
So-VITS-SVC
Active

So-VITS-SVC

So-VITS-SVC 4.1은 텍스트 음성 변환이 아닌 노래 음성 변환을 위한 보관된 오픈 소스 연구 프레임워크입니다. 이 독립 가이드에서는 동의, 라이선스, 클린 데이터 세트, F0 및 인코더, 교육, 추론, 평가, 공개, 보안 및 대안을 다룹니다.

114

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

so-vits-svc노래 음성 변환음성 변환AI 커버SoftVC VITS오픈소스 음성 모델

Product Preview

A quick visual look at So-VITS-SVC before you visit the official site.

Published 1/21/2026
So-VITS-SVC screenshot

Editorial Review

About So-VITS-SVC

So-VITS-SVC SVC(가창 음성 변환)를 위한 연구 프레임워크입니다. 기존 보컬 연주를 가져와 훈련된 대상 음색으로 언어 콘텐츠와 멜로디를 렌더링합니다. 텍스트를 음성으로 변환하는 기능이 아니며 음성 모델과 함께 제공되지 않으며 연주자의 신원, 소스 노래 또는 교육 녹음에 대한 권리를 법적으로나 윤리적으로 제공할 수 없습니다.

원본 svc-develop-team/so-vits-svc 저장소는 2023년 11월에 보관되었으며 읽기 전용입니다. 4.1-Stable 분기는 여전히 널리 참조되고 있지만 이제 채택은 이전 종속성을 고정하고 타사 체크포인트를 검증하며 유지 관리에 대한 전적인 책임을 지는 것을 의미합니다. README는 학문적 사용을 설명하고, 가상의 인물 의도를 강조하며, 사용자에게 데이터 세트 인증을 해결하도록 요구하고 추가 출판/공개 조건을 설정합니다. 사용하기 전에 저장소의 정확한 README와 라이센스를 함께 읽으십시오.

Official So-VITS-SVC repository diagram and project media
Official project media. 유지 관리되는 아티팩트는 호스팅된 서비스나 라이선스가 부여된 음성 카탈로그가 아닌 보관된 연구 코드베이스입니다.

SVC는 TTS, 보코더 또는 소스 분리가 아닙니다.

기술입력출력제공하지 않는 것
So-VITS-SVC노래/음성 소스 오디오 + 훈련된 대상 모델타겟 음색에 대해 동일한 성능 제공Lyrics-to-performance generation or usage rights
텍스트 음성 변환Text + voice/style conditioningNew spoken waveform기존 가창 연주를 충실히 옮겨오다
Singing synthesis가사, 메모 및 표현 제어신곡 퍼포먼스가수 흉내내기 자동 법적 허가
VocoderAcoustic representation파형Content/timbre conversion policy
Source separationMixed song예상 보컬/악기 스템원본 멀티트랙 또는 음성 변환을 정리하세요.

전체 파이프라인 및 아티팩트가 입력되는 위치

 동의된 대상 녹음
          |
          v
 정리 -> 세그먼트 -> 리샘플 -> 콘텐츠 기능 + F0
          |                           |
          '------------ 훈련 ------'
                         |
                         v
                 target voice model
                         |
 소스 보컬 -> F0/컨텐츠 추출 -> 제너레이터 -> 선택적 확산
                         |                    |
                         '------ render ------'
                                      |
                              human audio + rights QA

콘텐츠 인코더는 소스 ID를 억제하면서 음성 정보를 나타내려고 합니다. F0은 피치를 전달합니다. 생성기와 보코더는 대상 음색으로 오디오를 재구성합니다. 불완전한 분리는 소스 가수가 계속 들리는 "음색 누출"을 생성합니다. 분리가 잘못되면 훈련 데이터에 악기와 잔향이 추가됩니다. 일관성 없는 피치 추출로 인해 옥타브 점프가 발생합니다. 클리핑과 일치하지 않는 샘플 속도는 금속성 인공물이 됩니다.

다운로드 또는 교육 전 권리 게이트

기술적으로 공개 녹음은 자동으로 합법적인 교육 데이터 세트가 아닙니다. 의도된 교육, 모델 저장, 협력자, 지역, 상업적 상태 및 출력 배포에 대해 식별 가능한 성우 및 권리 보유자로부터 문서화된 허가를 얻습니다. 공개된 커버에 사용된 작곡, 가사, 마스터/소스 보컬 및 백킹 트랙에 대해 별도로 라이선스를 부여합니다.

자산 또는 권리보유할 증거일반적인 잘못된 가정
대상 음성 녹음출연자 동의 및 녹음/마스터 권한"온라인 사용 가능"은 훈련 가능함을 의미합니다.
음성 ID/페르소나범위, 기간, 해지 및 허용되는 컨텍스트소프트웨어 라이센스는 초상권을 부여합니다
소스보컬녹음 권한 및 도구 호환 조건분리된 줄기가 당신의 것이 됩니다
노래/가사해당되는 경우 구성/기계적/동기화 권한표지로 인해 출판 권한이 제거됩니다.
모델/체크포인트출처, 라이선스, 데이터세트 설명 및 체크섬다운로드 페이지는 승인된 데이터를 증명합니다.
최종 릴리스플랫폼 정책 검토, 공개 및 크레딧“AI 생성”은 완전한 법적 방어입니다

다른 사람의 알아볼 수 있는 목소리로 기만적인 명의 도용, 사기, 괴롭힘, 성적인 콘텐츠 또는 정치적 메시지를 작성하지 마십시오. 가상 캐릭터 프로젝트의 경우 캐릭터 및 원작 공연 권한도 삭제되었는지 확인하세요. 동의를 철회하는 경우 실질적인 모델 삭제 및 배포 중단 프로세스를 갖습니다.

데이터 세트 설계: 품질이 무분별한 기간을 능가합니다

동의한 대상의 깨끗하고 건조하며 격리된 녹음을 사용하십시오. 악기 블리드, 헤비 룸 리버브, 더블 보컬, 극단적인 효과, 클리핑, 긴 침묵 및 기타 스피커를 제거합니다. 호환되지 않는 녹음 체인을 맹목적으로 혼합하지 않고도 의도한 출력(음높이 범위, ​​모음, 자음, 성구 및 강약)과 일치하는 다양한 표현을 보존할 수 있습니다.

임의의 인접한 클립이 아닌 인접한 소스 세션 또는 노래로 분할되므로 검증에는 훈련에서 거의 중복된 항목이 포함되지 않습니다. 튜닝에 사용되지 않는 잠긴 테스트 세트를 유지하십시오. 파일 해시, 원본, 동의 기록, 샘플링 속도, 기간, 전처리 단계, 대본/가사(사용 가능한 경우) 및 제외 이유가 포함된 매니페스트를 유지관리합니다.

데이터세트 확인통과 신호수정
격리반주나 백킹 싱어가 들리지 않습니다.원래 줄기를 사용하거나 폐기하십시오. 분리는 불완전하다
레벨클리핑 없음; 일관되게 사용 가능한 신호신중하게 정규화하고 추측으로 심각한 클리핑을 수정하지 마세요.
아이덴티티화자 라벨당 하나의 승인된 대상공동작업자 및 군중 응답 제거
피치 범위의도한 노래 범위와 일치동의된 누락 레지스터 기록
검증 독립성교육과 다른 세션/구문측정하기 전에 다시 분할
출처모든 클립은 권한 기록에 매핑됩니다.특성이 없는 파일 격리

버전 및 종속성 현실

4.1-Stable README에서는 테스트된 안정 버전으로 Python 3.8.9를 보고하며 별도의 사전 훈련된 인코더/보코더 자산이 필요합니다. 2026년에는 이는 레거시 환경입니다. 격리된 컨테이너나 가상 머신에 구축하고, 해시를 고정하고, 종속성을 검색하고, 불필요한 네트워크 액세스를 거부하세요. 이전 CUDA 또는 Python 패키지를 충족하기 위해 최신 워크스테이션을 전체적으로 약화시키지 마십시오.

타사 포크, 노트북, GUI 및 모델 팩은 별도의 프로젝트입니다. 코드, 라이센스, 원격 측정 또는 기본 다운로드를 변경할 수 있습니다. 업스트림 상위 항목, 커밋, 설치 프로그램 콘텐츠 및 모델 출처를 확인합니다. 비밀이 포함된 머신에서 신뢰할 수 없는 PyTorch 체크포인트를 로드하지 마세요. 레거시 직렬화 형식은 로드 중에 코드를 실행할 수 있습니다.

콘텐츠 인코더, F0 및 검색 선택

4.1에서는 일반적인 선택 사항 중 ContentVec 변형을 사용하여 여러 음성 인코더를 문서화합니다. 인코더 크기 및 구성은 체크포인트와 일치해야 합니다. 4.0 호환성을 위해서는 올바른 추가가 필요할 수 있습니다. speech_encoder 필드. 다양한 지점의 모델과 전처리된 자산은 보편적으로 상호 교환이 불가능합니다.

노래를 부르려면 강력한 F0 추출기를 사용하여 소스 멜로디를 보존하고 옥타브 동작을 검증하세요. README에서는 자동 F0 예측이 노래할 때 상당한 음조 변화를 일으킬 수 있으므로 일반적으로 이 예측을 활성화해서는 안 된다고 경고합니다. 기능 검색 또는 클러스터링은 소스 음색 누출을 줄이고 때로는 표현을 향상시킬 수 있지만 혼합 비율이 높으면 데이터 세트 아티팩트가 복사되고 추론이 느려질 수 있습니다. 문서화된 0.5 예제를 보편적인 최적이 아닌 시작점으로 취급하십시오.

제어듣기잘못된 설정 증상
F0 추출기안정적인 멜로디, 비브라토 및 유성/무성 전환옥타브 점프, 로봇 피치 또는 자음 손실
피치 시프트포먼트 붕괴 없이 편안한 목표 범위다람쥐/호황 톤 및 불안정한 고음
검색/클러스터 비율기억된 아티팩트 없이 대상 유사성Buzzing, 소음 복사 또는 명료도 감소
얕은 확산과도한 처리 없이 더욱 부드러운 디테일흐릿한 과도 현상 및 추가 컴퓨팅
노이즈 스케일/슬라이싱자연스러운 질감과 문구의 연속성숨소리, 솔기 또는 일관되지 않은 톤

단일 손실 값을 쫓지 않고 학습

작은 구성과 감사 가능한 기준으로 시작하세요. 구성, 시드, 코드 커밋, 종속성 잠금, GPU, 전처리 매니페스트 및 체크포인트 해시를 저장합니다. 동의된 동일한 검증 문구를 주기적으로 렌더링합니다. 인지된 자연성, 명료성 또는 목표 유사성이 정체되거나 저하되는 동안 훈련 손실은 감소할 수 있습니다.

커뮤니티에서 권장하는 걸음 수가 아닌 블라인드 검증 및 아티팩트 비율을 기준으로 중지하세요. 훈련 체크포인트와 게시 가능한 추론 체크포인트를 별도로 유지하세요. 저장소는 교육 전용 데이터를 제거하고 최종 크기를 크게 줄일 수 있는 모델 압축을 설명합니다. 지속적인 교육이 승인된 경우 원래 체크포인트를 통제된 저장소에만 보관하십시오.

평가: 하나의 특성이 아닌 세 가지 특성 "좋을 것 같다" 점수

차원인간 테스트지원 측정항목
자연스러움보이지 않는 문구에 대한 블라인드 MOS 평가유형 및 기간별 아티팩트 수
타겟 유사성타겟에 대한 동의 기반 A/B 판단스피커 임베딩 유사성, 단독으로 사용되지 않음
내용의 정확성가사와 중요한 단어를 전사하세요.해당하는 경우 음소/단어 오류
피치 충실도연주자는 멜로디와 표현 의도를 확인합니다.F0 상관관계, RMSE 및 음성 오류
소스 누출청취자는 여전히 소스 가수를 식별할 수 있습니까?소스/타겟 임베딩 경향 비교
운영 비용깨끗한 입력부터 승인된 스템까지의 시간실시간 요소, VRAM 및 수정 시간(분)

훈련 세트 외부의 여러 소스 가수와 노래를 사용합니다. 높은 음, 낮은 음, 숨소리가 나는 부분, 빠른 가사, 비브라토 및 침묵을 포함합니다. 샘플을 무작위로 지정하고 평가자로부터 시스템 이름을 숨깁니다. 최고의 데모뿐만 아니라 신뢰 구간과 거부된 출력도 보고합니다.

후반 작업 및 공개

믹싱하기 전에 변환된 보컬 솔로를 검사하십시오. 국부적인 아티팩트만 수리하고, 전처리로 드리프트가 발생하는 타이밍을 맞추고, 치찰음과 숨결을 제어한 다음, 합법적으로 획득한 악기와 혼합합니다. 평가 시 모델 실패를 숨기기 위해 과도한 효과를 사용하지 마십시오.

프로젝트 조건에서는 플랫폼 업로드에 대한 입력 소스 보컬/오디오의 명확한 귀속을 요구합니다. 최소값 이상으로 결과를 AI 음성 변환으로 표시하고, 동의한 경우 승인된 음성/모델 소유자를 식별하고, 노래 및 소스 권한을 명시하고, 의미 있는 편집을 설명합니다. 모델 해시, 소스, 설정, 동의 및 최종 마스터를 연결하는 비공개 생산 시트를 보존합니다.

보안 및 배포 제어

  • 역할 기반 액세스로 훈련 데이터와 체크포인트를 암호화하여 저장합니다.
  • 체크섬 및 모델 카드를 게시합니다. 원시 교육 클립을 배포하지 마십시오.
  • 계약 및 액세스 제어를 통해 출시된 모델의 사용을 제한합니다. 텍스트 라이센스만으로는 복사를 방지할 수 없습니다.
  • 로드하기 전에 네트워크가 제한된 일회용 환경에서 체크포인트를 테스트하세요.
  • 사칭, 모델 유출, 동의 철회에 대한 사고 대응을 정의합니다.
  • 다운로드 권한과 데모 공유를 분리하세요. 렌더링된 샘플은 가중치를 노출할 필요가 없습니다.

대안

옵션최적의 핏트레이드오프
So-VITS-SVC 4.1알려진 파이프라인을 사용하여 이전 SVC 연구 재현보관된 레거시 종속성 및 사용자 소유 유지 관리
RVC접근 가능한 검색 기반 음성 변환 워크플로서로 다른 아키텍처/모델 생태계와 동일한 권리 위험
확산/현대 SVC 연구현재 품질 또는 제로샷 방법을 평가하는 팀더 높은 복잡성과 고르지 못한 재현성
라이센스가 있는 상용 음성 서비스지원이 필요한 프로덕션 및 명시적인 출연자 카탈로그 용어비용, 플랫폼 제한 및 여전히 필요한 음원 권리
동의한 보컬리스트상업적 출시, 표현 방향 및 책임스케줄링 및 직접 제작비
전통적인 보컬 프로세싱원래 승인된 성능을 수정합니다.신원은 변경할 수 없지만 수행자 관계는 유지됩니다.

자주 묻는 질문

So-VITS-SVC이 계속 유지되나요?

원본 저장소는 보관되어 있으며 읽기 전용입니다. 포크는 활성화될 수 있지만 독립적으로 평가되어야 합니다.

가사에서 노래를 생성하나요?

아니요. 기존 보컬 연주를 변환합니다. 노래 합성과 TTS는 다른 작업입니다.

음성 모델도 포함되어 있나요?

아니요. 공식 프로젝트에서는 사용자가 모델을 독립적으로 학습한다고 명시합니다. 타사 팩은 업스트림 기여자가 보증하지 않습니다.

연예인 노래로 트레이닝할 수 있나요?

단지 녹음 내용이 공개되었기 때문만은 아닙니다. 적절한 음성, 연주, 녹음, 작곡 및 사용 권한을 얻습니다.

얼마나 많은 데이터가 필요합니까?

보편적인 분 계산은 없습니다. 무분별하게 수집하는 것보다 깨끗하고 대표적이며 승인된 적용 범위와 독립적인 검증이 더 중요합니다.

결과에 소스 가수가 유지되는 이유는 무엇입니까?

콘텐츠 표현이 불완전합니다. 더 깨끗한 데이터, 인코더 선택 및 신중하게 조정된 검색/클러스터링을 통해 누출을 줄일 수 있지만 제거를 보장할 수는 없습니다.

다운로드한 체크포인트는 안전한가요?

자동으로 아닙니다. 모델 직렬화는 실행 가능한 위험을 초래할 수 있으므로 출처와 해시를 확인하고 격리된 환경에서만 로드하세요.

1차 소스

2026년 7월 25일에 마지막으로 검토되었습니다. 이것은 매우 중요한 README 용어가 포함된 보관된 연구 프로젝트입니다. 실험이나 출판 전에 고정된 분기, 종속성, 라이선스 및 모든 음성/음악 권한을 확인하세요.

Ready to try So-VITS-SVC?

Visit the official website to get started

Visit So-VITS-SVC

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/1/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Vocal Remover

Vocal Remover

Separate voice from music out of a song free with powerful AI algorithms - 스마트 AI 도구로 생산성 향상.

voice-processingfree
870
Lalal.ai

Lalal.ai

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - 스마트 AI 도구로 생산성 향상.

voice-processingfree
740
PollyReach

PollyReach

PollyReach는 voice-processing 분야의 AI 제품으로, 실제 업무 흐름에 적용하려는 사용자에게 적합합니다.

voice-processingAI 도구
710
Klariqo

Klariqo

Klariqo는 콜센터와 BPO 팀을 위한 음성 에이전트 플랫폼으로, AI가 먼저 통화를 선별해 무가치한 리드를 걸러 내고 실제 전환 가능성이 있는 대화만 사람 상담원에게 넘기는 데 초점을 둡니다。

AI 음성 에이전트콜센터 자동화SIP 다이얼러
750