So-VITS-SVC 是一个歌声转换(SVC)的研究框架:它采用现有的声乐表演,并用经过训练的目标音色呈现其语言内容和旋律。它不是文本转语音,不附带语音模型,也不能合法或合乎道德地提供对表演者身份、源歌曲或训练录音的权利。
原来的 svc-开发团队/so-vits-svc 存储库于 2023 年 11 月存档,并且是只读的。它的 4.1-Stable 分支仍然被广泛引用,但现在采用意味着固定旧的依赖项、验证第三方检查点并承担维护的全部责任。自述文件描述了学术用途,强调虚构人物意图,要求用户解决数据集授权问题并设置其他发布/披露条款。使用前请先阅读存储库的确切自述文件和许可证。

SVC 不是 TTS、声码器或源分离
| 技术 | 输入 | 输出 | 它不提供什么 |
|---|---|---|---|
| So-VITS-SVC | 歌唱/口语源音频+经过训练的目标模型 | 针对目标音色呈现相同的性能 | 歌词到表演的生成或使用权 |
| 文字转语音 | 文本+语音/风格调节 | 新的语音波形 | 忠实地传承现有的演唱表演 |
| 歌唱合成 | 歌词、音符和表情控制 | 新唱表演 | 自动获得模仿歌手的法律许可 |
| 声码器 | 声学表现 | 波形 | 内容/音色转换政策 |
| 源头分离 | 混合歌曲 | 估计声乐/器乐主干 | 清理原始多轨或语音转换 |
完整的管道和工件进入的位置
同意的目标录音
|
v
清理 -> 分段 -> 重新采样 -> 内容特征 + F0
| |
'------------培训------'
|
v
目标语音模型
|
源声乐 -> F0/内容提取 -> 生成器 -> 可选扩散
| |
'------ 渲染 ------'
|
真人音频 + 权利 QA
内容编码器尝试在抑制源身份的同时表示语音信息。 F0 携带音调;生成器和声码器以目标音色重建音频。不完美的解开会造成“音色泄漏”,源歌手仍然可以听到。不良的分离会在训练数据中添加乐器和混响;不一致的音高提取会产生八度跳跃;削波和不匹配的采样率成为金属伪影。
任何下载或培训之前的权限门
从技术上讲,公共记录并不自动成为合法的训练数据集。从可识别的配音者和权利持有者那里获得有关预期培训、模型存储、合作者、区域、商业状态和输出分发的书面许可。单独许可已发行翻唱中使用的作曲、歌词、主唱/源声乐和背景音轨。
| 资产或权利 | 保留证据 | 常见的错误假设 |
|---|---|---|
| 目标录音 | 表演者同意和录音/母带权利 | “在线可用”意味着可培训 |
| 语音身份/角色 | 范围、持续时间、撤销和允许的上下文 | 软件许可证授予肖像权 |
| 源声乐 | 记录许可和工具兼容条款 | 分离的茎变成你的 |
| 歌曲/歌词 | 适用的合成/机械/同步权限 | 封面消除了出版权 |
| 型号/检查点 | 出处、许可证、数据集声明和校验和 | 下载页面证明授权数据 |
| 最终版本 | 平台政策审查、披露和信用 | “AI生成”是完整的法律辩护 |
请勿以他人可识别的声音制造欺骗性冒充、欺诈、骚扰、性内容或政治信息。对于虚构角色项目,请确认角色和原创表演权也已获得许可。如果撤回同意,请制定实用的模型删除和分发删除流程。
数据集设计:质量胜过不加区别的持续时间
使用来自同意目标的干净、干燥、隔离的录音。消除乐器出血、沉重的房间混响、双声、极端效果、削波、长时间静音和其他扬声器。保留与预期输出相匹配的表现力多样性(音高范围、元音、辅音、音域和动态),而不会盲目混合不兼容的录音链。
按连续的源会话或歌曲(而不是随机的相邻剪辑)分割,因此验证不包含训练中的近似重复项。保留一个永远不会用于调整的锁定测试集。维护清单,其中包含文件哈希、来源、同意记录、采样率、持续时间、预处理步骤、文字记录/歌词(如果有)以及排除原因。
| 数据集检查 | 通过信号 | 修复 |
|---|---|---|
| 隔离 | 没有伴奏或伴唱 | 使用原始茎或丢弃;分离是不完美的 |
| 等级 | 无剪裁;一致的可用信号 | 仔细规范化,切勿凭猜测修复严重削波 |
| 身份 | 每个发言者标签有一个授权目标 | 删除协作者和人群响应 |
| 球场覆盖范围 | 符合预期的演唱范围 | 记录同意的缺失寄存器 |
| 验证独立性 | 培训中的不同课程/短语 | 测量前重新分割 |
| 出处 | 每个剪辑都映射到一个权限记录 | 隔离未归属的文件 |
版本和依赖现实
4.1-Stable README 将 Python 3.8.9 报告为经过测试的稳定版本,并且需要单独的预训练编码器/声码器资产。到 2026 年,这将是一个遗留环境。在隔离的容器或虚拟机中构建它,固定哈希值,扫描依赖项并拒绝不需要的网络访问。不要在全局范围内削弱现代工作站来满足旧的 CUDA 或 Python 软件包。
第三方 fork、notebook、GUI 和模型包是单独的项目。他们可能会更改代码、许可、遥测或默认下载。验证上游祖先、提交、安装程序内容和模型来源。切勿在包含机密的计算机上加载不受信任的 PyTorch 检查点:旧序列化格式可以在加载期间执行代码。
内容编码器、F0 和检索选择
4.1 记录了多个语音编码器,其中常见选择有 ContentVec 变体。编码器尺寸和配置必须与检查点匹配; 4.0 兼容性可能需要添加正确的 语音编码器 场。来自不同分支的模型和预处理资产不能普遍互换。
对于歌唱,使用强大的 F0 提取器保留源旋律并验证八度行为。自述文件警告说,自动 F0 预测可能会导致歌唱时音高发生大幅变化,因此通常不应在此处启用。特征检索或聚类可以减少源音色泄漏,有时可以改善清晰度,但高混合比可能会复制数据集伪影并减慢推理速度。将记录的 0.5 示例视为起点,而不是通用最优值。
| 控制 | 听听 | 不良设置症状 |
|---|---|---|
| F0提取器 | 稳定的旋律、颤音和浊音/清音过渡 | 八度跳跃、机械音高或丢失辅音 |
| 变调 | 舒适的目标范围,无共振峰塌陷 | 花栗鼠/轰鸣的音调和不稳定的高音 |
| 检索/聚类比率 | 没有记忆工件的目标相似度 | Buzzing、复制噪音或清晰度降低 |
| 浅扩散 | 细节更平滑,无需过度处理 | 模糊的瞬态和额外的计算 |
| 噪声标度/切片 | 自然的纹理和短语的连续性 | 呼吸噪音、接缝或不一致的音调 |
不追求单一损失值的训练
从小型配置和可审核的基线开始。保存配置、种子、代码提交、依赖锁、GPU、预处理清单和检查点哈希。定期呈现相同的同意验证短语。训练损失可能会下降,而感知的自然性、可理解性或目标相似性会停滞或下降。
根据盲态验证和工件率停止,而不是社区推荐的步数。将训练和可发布的推理检查点分开。该存储库描述了模型压缩,该模型压缩删除了仅训练数据,并可以大大减少最终大小;如果授权继续训练,则仅将原始检查点保留在受控存储中。
评价:三个品质,不是一个“听起来不错”的分数
| 尺寸 | 人体测试 | 支持指标 |
|---|---|---|
| 自然性 | 对未见过的短语进行盲 MOS 评级 | 按类型和持续时间划分的工件计数 |
| 目标相似度 | 针对目标的同意感知 A/B 判断 | 扬声器嵌入相似,从未单独使用 |
| 内容准确性 | 转录歌词和批评词 | 适当的音素/单词错误 |
| 音调保真度 | 音乐家检查旋律和表达意图 | F0 相关性、RMSE 和浊音误差 |
| 源漏电 | 听众还能识别源歌手吗? | 比较源/目标嵌入趋势 |
| 运营成本 | 从干净的输入到接受的时间 | 实时因子、VRAM 和校正分钟 |
使用训练集之外的多个源歌手和歌曲。包括高音、低音、呼吸部分、快速歌词、颤音和静音。随机化样本并对评估者隐藏系统名称。报告置信区间和拒绝的输出,而不仅仅是最好的演示。
后期制作和披露
混音前检查转换后的人声独奏。仅修复局部伪影,调整预处理引入漂移的时间,控制齿音和呼吸,然后与合法获得的乐器混合。不要使用重效应来隐藏评估中的模型失败。
该项目的条款要求平台上传的输入源声音/音频的明确归属。超出该最低限度,将结果标记为人工智能语音转换,在同意时识别授权的语音/模型所有者,注明歌曲和源代码权利,并描述有意义的编辑。保留链接模型哈希、来源、设置、同意和最终主控的私人生产表。
安全和分发控制
- 存储通过基于角色的访问进行加密的训练数据和检查点。
- 发布校验和和模型卡;请勿分发原始训练剪辑。
- 通过合约和访问控制限制已发布模型的使用;仅凭文本许可证无法防止复制。
- 加载前在一次性、网络受限的环境中测试检查点。
- 定义针对假冒、泄露模型和撤回同意的事件响应。
- 将演示共享与下载权限分开;渲染的样本不需要暴露权重。
替代方案
| 选项 | 最适合 | 权衡 |
|---|---|---|
| So-VITS-SVC 4.1 | 使用已知管道重现较早的 SVC 研究 | 存档的遗留依赖项和用户拥有的维护 |
| RVC | 易于访问的基于检索的语音转换工作流程 | 架构/模型生态不同,权益风险相同 |
| 扩散/现代SVC研究 | 评估当前质量或零样本方法的团队 | 更高的复杂性和不均匀的再现性 |
| 获得许可的商业语音服务 | 制作需要支持和明确的表演者目录条款 | 成本、平台限制和仍然需要的源歌曲权利 |
| 同意歌手 | 商业发布、表达方向和责任 | 调度和直接生产成本 |
| 传统的声音处理 | 更正原授权履行 | 无法更改身份,但保留表演者关系 |
常见问题
So-VITS-SVC 是否仍然保留?
原始存储库已存档且只读。分叉可能处于活动状态,但必须独立评估。
它会根据歌词生成歌声吗?
不。它会转换现有的声乐表演。歌唱合成和 TTS 是不同的任务。
它包括语音模型吗?
不会。官方项目规定用户独立训练模型;第三方包未得到上游贡献者的认可。
我可以根据名人的歌曲进行训练吗?
不仅仅是因为录音是公开的。获得适当的声音、表演、录音、作曲和使用权。
需要多少数据?
没有通用的分钟数。干净、有代表性、经过授权的报道和独立验证比不加区别地收集更重要。
为什么结果保留了源歌手?
内容表示不完善。更干净的数据、编码器选择和仔细调整的检索/聚类可能会减少泄漏,但不能保证删除。
下载的检查点安全吗?
不是自动的。验证来源和哈希值并仅在隔离环境中加载它,因为模型序列化可能会带来可执行风险。
主要来源
- 官方存档存储库
- 官方 4.1-Stable README、条款和工作流程
- 官方中文README
- 存储库许可证
- 官方配置模板
- 基于VITS的SVC和DSPGAN研究
- Whisper 和多尺度 F0 SVC 研究
- 语音间研究参考 So-VITS-SVC
- 美国版权局人工智能计划和最新报告
上次审核日期为 2026 年 7 月 25 日。这是一个存档研究项目,其中包含异常重要的自述文件术语。在进行任何实验或发布之前,请验证固定分支、依赖项、许可证和所有语音/音乐权限。



