So-VITS-SVC
So-VITS-SVC
Active

So-VITS-SVC

So-VITS-SVC 4.1 是一个存档的开源研究框架,用于歌声转换,而不是文本到语音的转换。该独立指南涵盖同意、许可、干净数据集、F0 和编码器、培训、推理、评估、披露、安全和替代方案。

125

Views

0

Likes

Jan 2026

Added

github.com

Website

Tags

so-vits-svc歌声转换声音转换AI翻唱SoftVC VITS开源声音模型语音处理

Product Preview

A quick visual look at So-VITS-SVC before you visit the official site.

Published 1/21/2026
So-VITS-SVC screenshot

Editorial Review

About So-VITS-SVC

So-VITS-SVC 是一个歌声转换(SVC)的研究框架:它采用现有的声乐表演,并用经过训练的目标音色呈现其语言内容和旋律。它不是文本转语音,不附带语音模型,也不能合法或合乎道德地提供对表演者身份、源歌曲或训练录音的权利。

原来的 svc-开发团队/so-vits-svc 存储库于 2023 年 11 月存档,并且是只读的。它的 4.1-Stable 分支仍然被广泛引用,但现在采用意味着固定旧的依赖项、验证第三方检查点并承担维护的全部责任。自述文件描述了学术用途,强调虚构人物意图,要求用户解决数据集授权问题并设置其他发布/披露条款。使用前请先阅读存储库的确切自述文件和许可证。

Official So-VITS-SVC repository diagram and project media
官方项目媒体。维护的工件是存档的研究代码库,而不是托管服务或许可的语音目录。

SVC 不是 TTS、声码器或源分离

技术输入输出它不提供什么
So-VITS-SVC歌唱/口语源音频+经过训练的目标模型针对目标音色呈现相同的性能歌词到表演的生成或使用权
文字转语音文本+语音/风格调节新的语音波形忠实地传承现有的演唱表演
歌唱合成歌词、音符和表情控制新唱表演自动获得模仿歌手的法律许可
声码器声学表现波形内容/音色转换政策
源头分离混合歌曲估计声乐/器乐主干清理原始多轨或语音转换

完整的管道和工件进入的位置

 同意的目标录音
          |
          v
 清理 -> 分段 -> 重新采样 -> 内容特征 + F0
          |                           |
          '------------培训------'
                         |
                         v
                 目标语音模型
                         |
 源声乐 -> F0/内容提取 -> 生成器 -> 可选扩散
                         |                    |
                         '------ 渲染 ------'
                                      |
                              真人音频 + 权利 QA

内容编码器尝试在抑制源身份的同时表示语音信息。 F0 携带音调;生成器和声码器以目标音色重建音频。不完美的解开会造成“音色泄漏”,源歌手仍然可以听到。不良的分离会在训练数据中添加乐器和混响;不一致的音高提取会产生八度跳跃;削波和不匹配的采样率成为金属伪影。

任何下载或培训之前的权限门

从技术上讲,公共记录并不自动成为合法的训练数据集。从可识别的配音者和权利持有者那里获得有关预期培训、模型存储、合作者、区域、商业状态和输出分发的书面许可。单独许可已发行翻唱中使用的作曲、歌词、主唱/源声乐和背景音轨。

资产或权利保留证据常见的错误假设
目标录音表演者同意和录音/母带权利“在线可用”意味着可培训
语音身份/角色范围、持续时间、撤销和允许的上下文软件许可证授予肖像权
源声乐记录许可和工具兼容条款分离的茎变成你的
歌曲/歌词适用的合成/机械/同步权限封面消除了出版权
型号/检查点出处、许可证、数据集声明和校验和下载页面证明授权数据
最终版本平台政策审查、披露和信用“AI生成”是完整的法律辩护

请勿以他人可识别的声音制造欺骗性冒充、欺诈、骚扰、性内容或政治信息。对于虚构角色项目,请确认角色和原创表演权也已获得许可。如果撤回同意,请制定实用的模型删除和分发删除流程。

数据集设计:质量胜过不加区别的持续时间

使用来自同意目标的干净、干燥、隔离的录音。消除乐器出血、沉重的房间混响、双声、极端效果、削波、长时间静音和其他扬声器。保留与预期输出相匹配的表现力多样性(音高范围、元音、辅音、音域和动态),而不会盲目混合不兼容的录音链。

按连续的源会话或歌曲(而不是随机的相邻剪辑)分割,因此验证不包含训练中的近似重复项。保留一个永远不会用于调整的锁定测试集。维护清单,其中包含文件哈希、来源、同意记录、采样率、持续时间、预处理步骤、文字记录/歌词(如果有)以及排除原因。

数据集检查通过信号修复
隔离没有伴奏或伴唱使用原始茎或丢弃;分离是不完美的
等级无剪裁;一致的可用信号仔细规范化,切勿凭猜测修复严重削波
身份每个发言者标签有一个授权目标删除协作者和人群响应
球场覆盖范围符合预期的演唱范围记录同意的缺失寄存器
验证独立性培训中的不同课程/短语测量前重新分割
出处每个剪辑都映射到一个权限记录隔离未归属的文件

版本和依赖现实

4.1-Stable README 将 Python 3.8.9 报告为经过测试的稳定版本,并且需要单独的预训练编码器/声码器资产。到 2026 年,这将是一个遗留环境。在隔离的容器或虚拟机中构建它,固定哈希值,扫描依赖项并拒绝不需要的网络访问。不要在全局范围内削弱现代工作站来满足旧的 CUDA 或 Python 软件包。

第三方 fork、notebook、GUI 和模型包是单独的项目。他们可能会更改代码、许可、遥测或默认下载。验证上游祖先、提交、安装程序内容和模型来源。切勿在包含机密的计算机上加载不受信任的 PyTorch 检查点:旧序列化格式可以在加载期间执行代码。

内容编码器、F0 和检索选择

4.1 记录了多个语音编码器,其中常见选择有 ContentVec 变体。编码器尺寸和配置必须与检查点匹配; 4.0 兼容性可能需要添加正确的 语音编码器 场。来自不同分支的模型和预处理资产不能普遍互换。

对于歌唱,使用强大的 F0 提取器保留源旋律并验证八度行为。自述文件警告说,自动 F0 预测可能会导致歌唱时音高发生大幅变化,因此通常不应在此处启用。特征检索或聚类可以减少源音色泄漏,有时可以改善清晰度,但高混合比可能会复制数据集伪影并减慢推理速度。将记录的 0.5 示例视为起点,而不是通用最优值。

控制听听不良设置症状
F0提取器稳定的旋律、颤音和浊音/清音过渡八度跳跃、机械音高或丢失辅音
变调舒适的目标范围,无共振峰塌陷花栗鼠/轰鸣的音调和不稳定的高音
检索/聚类比率没有记忆工件的目标相似度Buzzing、复制噪音或清晰度降低
浅扩散细节更平滑,无需过度处理模糊的瞬态和额外的计算
噪声标度/切片自然的纹理和短语的连续性呼吸噪音、接缝或不一致的音调

不追求单一损失值的训练

从小型配置和可审核的基线开始。保存配置、种子、代码提交、依赖锁、GPU、预处理清单和检查点哈希。定期呈现相同的同意验证短语。训练损失可能会下降,而感知的自然性、可理解性或目标相似性会停滞或下降。

根据盲态验证和工件率停止,而不是社区推荐的步数。将训练和可发布的推理检查点分开。该存储库描述了模型压缩,该模型压缩删除了仅训练数据,并可以大大减少最终大小;如果授权继续训练,则仅将原始检查点保留在受控存储中。

评价:三个品质,不是一个“听起来不错”的分数

尺寸人体测试支持指标
自然性对未见过的短语进行盲 MOS 评级按类型和持续时间划分的工件计数
目标相似度针对目标的同意感知 A/B 判断扬声器嵌入相似,从未单独使用
内容准确性转录歌词和批评词适当的音素/单词错误
音调保真度音乐家检查旋律和表达意图F0 相关性、RMSE 和浊音误差
源漏电听众还能识别源歌手吗?比较源/目标嵌入趋势
运营成本从干净的输入到接受的时间实时因子、VRAM 和校正分钟

使用训练集之外的多个源歌手和歌曲。包括高音、低音、呼吸部分、快速歌词、颤音和静音。随机化样本并对评估者隐藏系统名称。报告置信区间和拒绝的输出,而不仅仅是最好的演示。

后期制作和披露

混音前检查转换后的人声独奏。仅修复局部伪影,调整预处理引入漂移的时间,控制齿音和呼吸,然后与合法获得的乐器混合。不要使用重效应来隐藏评估中的模型失败。

该项目的条款要求平台上传的输入源声音/音频的明确归属。超出该最低限度,将结果标记为人工智能语音转换,在同意时识别授权的语音/模型所有者,注明歌曲和源代码权利,并描述有意义的编辑。保留链接模型哈希、来源、设置、同意和最终主控的私人生产表。

安全和分发控制

  • 存储通过基于角色的访问进行加密的训练数据和检查点。
  • 发布校验和和模型卡;请勿分发原始训练剪辑。
  • 通过合约和访问控制限制已发布模型的使用;仅凭文本许可证无法防止复制。
  • 加载前在一次性、网络受限的环境中测试检查点。
  • 定义针对假冒、泄露模型和撤回同意的事件响应。
  • 将演示共享与下载权限分开;渲染的样本不需要暴露权重。

替代方案

选项最适合权衡
So-VITS-SVC 4.1使用已知管道重现较早的 SVC 研究存档的遗留依赖项和用户拥有的维护
RVC易于访问的基于检索的语音转换工作流程架构/模型生态不同,权益风险相同
扩散/现代SVC研究评估当前质量或零样本方法的团队更高的复杂性和不均匀的再现性
获得许可的商业语音服务制作需要支持和明确的表演者目录条款成本、平台限制和仍然需要的源歌曲权利
同意歌手商业发布、表达方向和责任调度和直接生产成本
传统的声音处理更正原授权履行无法更改身份,但保留表演者关系

常见问题

So-VITS-SVC 是否仍然保留?

原始存储库已存档且只读。分叉可能处于活动状态,但必须独立评估。

它会根据歌词生成歌声吗?

不。它会转换现有的声乐表演。歌唱合成和 TTS 是不同的任务。

它包括语音模型吗?

不会。官方项目规定用户独立训练模型;第三方包未得到上游贡献者的认可。

我可以根据名人的歌曲进行训练吗?

不仅仅是因为录音是公开的。获得适当的声音、表演、录音、作曲和使用权。

需要多少数据?

没有通用的分钟数。干净、有代表性、经过授权的报道和独立验证比不加区别地收集更重要。

为什么结果保留了源歌手?

内容表示不完善。更干净的数据、编码器选择和仔细调整的检索/聚类可能会减少泄漏,但不能保证删除。

下载的检查点安全吗?

不是自动的。验证来源和哈希值并仅在隔离环境中加载它,因为模型序列化可能会带来可执行风险。

主要来源

上次审核日期为 2026 年 7 月 25 日。这是一个存档研究项目,其中包含异常重要的自述文件术语。在进行任何实验或发布之前,请验证固定分支、依赖项、许可证和所有语音/音乐权限。

Ready to try So-VITS-SVC?

Visit the official website to get started

Visit So-VITS-SVC

Quick Info

Added
1/21/2026
Published
1/21/2026
Updated
9/3/2026

Share This Tool

Have an AI tool to share?

Submit it to AI Dreamhub

Get your product in front of people actively exploring AI tools.

Submit Your Tool

Related Tools

Vocal Remover

Vocal Remover

Separate voice from music out of a song free with powerful AI algorithms - 智能 AI 工具,助力您的工作效率。

voice-processingfree
950
Lalal.ai

Lalal.ai

Split vocal and instrumental tracks quickly and accurately with LALAL.AI. Upload any audio file and receive high-quality extracted tracks in a few seconds. - 智能 AI 工具,助力您的工作效率。

voice-processingfree
1050
PollyReach

PollyReach

PollyReach 是一款 voice-processing 方向的 AI 产品,适合希望把真实工作流落到生产环境的用户。

voice-processingAI 工具
1250
Klariqo

Klariqo

Klariqo 是一个面向呼叫中心和 BPO 团队的语音代理平台,主打让 AI 先完成来电预筛选、过滤无效线索,再把真正有成交价值的通话转给人工销售。

AI 语音代理呼叫中心自动化SIP 拨号
900