免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

RVC 变声器指南:10 分钟语音数据训练出可用 AI 音色模型

RVC 变声器指南:10 分钟语音数据训练出可用 AI 音色模型 RVC 变声器指南10 分钟语音数据训练出可用 AI 音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI手上只有 10 分钟录音也能把任意歌声或配音换成目标音色。开源语音转换框架 RVC 基于 VITS 底模加检索式特征匹配在普通显卡上就能完成训练。下面从装环境到出第一个模型全部可照抄。 项目名片基于 VITS 的开源变声语音转换框架网页界面覆盖训练、推理、人声分离与模型管理。✅ 低数据门槛官方推荐至少 10 分钟低底噪语音10–50 分钟更佳数据精炼且有特色时 5–10 分钟也能训✅ 显存门槛低4GB 显存即可训练小显存显卡会强制 fp32 并自动降推理参数✅ 实时变声端到端延迟 170ms接 ASIO 声卡可压到 90ms✅ 防音色泄漏top1 检索用训练集特征顶替输入源特征底模音色不易串入✅ 底模版权干净约 50 小时开源 VCTK 数据集训练MIT 协议️ 跑起来环境检查与最少安装命令环境检查清单Python 大于 3.8用 poetry 装依赖建议 3.7–3.10ffmpeg/ffprobeUbuntu 用sudo apt install ffmpegmacOS 用brew install ffmpegWindows 把 ffmpeg.exe 和 ffprobe.exe 放根目录依赖按显卡选N 卡requirements.txtA/I 卡 DirectML 用requirements-dml.txtLinux ROCm 用requirements-amd.txt预模型assets/hubert/hubert_base.pt、assets/pretrained、assets/uvr5_weightsv2 模型再加assets/pretrained_v2想用 RMVPE 音高算法需根目录放rmvpe.pttools/下有下载脚本最少安装命令git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txt首次运行自检python infer-web.py浏览器会自动打开 7865 端口可用--port改Windows 直接双击go-web.bat。自检三点训练页签的显卡信息栏能识别到 GPU识别不到会切 CPU 并强制 fp32功能可用但慢首次启动会把configs/下 v1/v2 共 5 个采样率配置复制到configs/inuse/实际生效的是 inuse 里的副本。⚙️ 核心机制速览检索式变声怎么防音色泄漏训练流水线把音频转成 16k wav存 0_gt_wavs/1_16k_wavs4 秒片段、0.3 秒重叠提取音高存 2a_f0/2b-f0nsf再用 HuBERT 转成 256 维特征存 3_feature256中间目录全在logs/实验名/下。模型不从零学而是加载f0G40k.pth/f0D40k.pth预训练权重起步这是 10 分钟数据也能收敛的原因。“检索式”体现在推理训练时把全部 256 维特征灌进 faiss 建索引added_*.index推理时输入音频的特征会找 top1 最近邻换成训练集里那条特征再进模型。这样底模50 小时 VCTK和推理源原本的音色就不容易串进结果也就是常说的“音色泄漏”。index_rate 滑杆控制这条检索线的占比调高音色更死忠训练集但音质上限被训练集锁住调低音质可能更好音色会往底模和推理源靠。训练集干净且足量时这个参数不敏感。 用它做什么三个最常见任务任务一训一个自己的音色模型目标10 分钟录音 → 可分享的 pth index“训练”页签填实验名音频放进logs/实验名/ffmpeg 支持的格式都行采样率选 48k、勾选音高唱歌必须勾、f0 方法选 rmvpe填 total_epoch点“一键训练”自动完成切分、提 f0、训练、建索引产出weights/实验名.pth60MB分享用这份加 logs 下的added_*.index。任务二把任意音频转成目标音色目标wav 模型 → 变声 wav“模型推理”页签点刷新音色选刚训好的模型“单次推理”填变调半音数0 为原调、输入音频路径、选 index 文件index_rate 从 0.6 起调点转换输出 wav 可直接试听整目录转换走“批量推理”不用界面的命令行参数见 docs/cn/faq.md Q7。任务三从歌曲里分离人声目标拿干净人声做训练集或推理输入打开“伴奏人声分离去混响去回声”页签选 UVR5 模型权重在assets/uvr5_weights/输入歌曲输出人声轨与伴奏轨 踩坑速查八个高频问题现象Cuda out of memory 原因显存不够4GB 显存可跑4GB 以下基本无解 解法训练把 batch_size 降到 1推理调小 configs/config.py 末尾的 x_pad/x_query/x_center/x_max4G 以下显存档为 1/5/30/32现象ffmpeg error 或 utf8 error 原因音频路径含空格、括号或中文不是 ffmpeg 本身的问题 解法把数据移到纯英文、无空格路径现象一键训练结束后没有 added_ 开头的 index 原因训练集太大建索引步骤卡住 解法再点一次“训练索引”长音频先手工切短再训现象训练完了推理列表找不到新音色 原因没点刷新或训练实际报错 解法点“刷新音色”仍没有就看logs/实验名/下的 log现象浏览器显示 Connection Error 原因控制台黑色窗口被关了服务已停 解法保持终端运行重新python infer-web.py现象WebUI 弹 “Expecting value: line 1 column 1 (char 0)” 原因局域网/全局代理拦截本地请求服务端代理也算 解法关闭代理服务器设过 http_proxy 的要 unset 掉现象RuntimeError: The expanded size of the tensor (17280) 原因wavs16k 文件夹里混进明显偏小的坏音频 解法删掉这些文件重训流程中断后记得补点“训练索引”现象Windows 报 llvmlite.dll 加载失败 原因缺 VC 运行时组件 解法安装 VC_redist.x64 后重启 WebUI 进阶路线与参数速查新手先用 10 分钟干净录音跑通 48k 音高 rmvpe 全流程底噪大的数据 total_epoch 给 20–30 即可别贪多进阶ckpt 处理页签的 ckpt-merge 融合两个模型调音色中途加数据用“新实验名 拷贝 G/D 文件”续训中间 checkpoint 走“ckpt 小模型提取”后再推理熟练用 index_rate 平衡音色与音质批量推理 命令行跑批“Onnx 导出”页签做部署档位显存参考数据量total_epoch 建议备注新手4GB10 分钟低底噪底噪大 20–30干净可到 200fp16 自动开启进阶6GB10–50 分钟100–200推理参数 3/10/60/65config.py 的 6G 档熟练12GB50 分钟以上200batch_size 加大提速收尾数据干净加参数克制就是 RVC 出好音色的全部诀窍。先备齐 ffmpeg 与预模型目录hubert_base.pt / pretrained / uvr5_weights再启动第一段训练用 48k rmvpe 音高开启index_rate 从 0.6 试起分享只发 weights/ 下 60MB 的 pth加 index别发 logs/ 里几百 MB 的 checkpointOOM 先降 batch_size再动 config.py 的四个 x_* 参数项目名称Retrieval-based-Voice-Conversion-WebUI开源MIT 协议【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表