RVC 声音克隆完整指南:从 RVC 搭建到首次语音转换
RVC 声音克隆完整指南从 RVC 搭建到首次语音转换【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是基于 VITS一种语音合成框架的 RVC 语音转换工具用约 10 分钟的录音即可训练出目标音色实现 AI 声音克隆也支持实时变声。本文面向无编程基础的新手覆盖 RVC 搭建、模型下载与首次转换全流程全程约 1–2 小时。你能拿到什么四个核心卖点️少量数据可训练官方推荐收集 10–50 分钟低底噪语音录音质量高、音色有辨识度时5–10 分钟也能得到可用模型。低显存可运行程序启动时会自动检测显存相应降低精度、缩短切片长度4GB 显存的显卡即可训练与推理。显存低于 4GB 的卡如 3G 的 GTX 1060基本跑不动这就是 RVC 显存要求的底线。约 90ms 的实时变声实时变声界面默认端到端延迟约 170ms搭配 ASIO 声卡驱动可压到 90ms 左右适合直播和游戏语音。双界面分工明确训练推理界面负责训练、索引、批量转换与模型处理实时变声界面负责麦克风到扬声器的即时变声。部署流程检查清单与最小命令RVC 显存要求与系统准备动手前先对照这份清单操作系统Windows 10/11、Linux 或 macOSPython3.8 及以上显卡N 卡、A 卡或 I 卡均可显存 4GB 起步磁盘预留 10GB 以上空间依赖库和预训练模型都不小获取代码与安装依赖把代码拉到本地并进入项目目录git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI然后安装 PyTorch 和对应显卡的依赖pip install torch torchvision torchaudio pip install -r requirements.txt依赖文件按显卡选择N 卡用 requirements.txtA 卡/I 卡改用 requirements-dml.txtA 卡 ROCM 用户仅 Linux用 requirements-amd.txtI 卡 IPEX 用户仅 Linux用 requirements-ipex.txt。Windows 且是 RTX30xxAmpere 架构的按 PyTorch 官方指引安装对应 CUDA 11.7 的版本。macOS 用户可以直接运行项目自带的 run.sh 脚本完成安装。FFmpeg 与预训练模型怎么下载程序加载、切分音频依赖 FFmpegUbuntu/Debian 用 apt 安装macOS 用 brew 安装Windows 用户下载 ffmpeg.exe 与 ffprobe.exe 两个文件放进项目根目录即可。预训练模型用项目自带的 tools/dlmodels.sh 一键下载sh tools/dlmodels.sh该命令要求先装好 aria2Windows 用户直接双击 tools/dlmodels.bat 即可。脚本会把 hubert把语音转成神经网络可学习特征的提取模型、pretrained 底模v1 版、pretrained_v2v2 版可选和 uvr5_weights人声分离权重统一放进 assets/ 目录。音高提取默认推荐 RMVPE 算法InterSpeech 2023 的人声音高提取算法负责从音频里提取音高曲线能显著减少哑音和跳音需要把 rmvpe.pt 单独下载到项目根目录A 卡/I 卡用户可以另下载 rmvpe.onnx。首次跑通启动 WebUI 并完成第一次转换装好环境只是走完 RVC 教程的一半真正拿到第一个转换结果才算跑通。两个界面的区别在项目根目录启动python infer-web.py浏览器会自动打开 http://localhost:7865Windows 用户也可以直接双击 go-web.bat 启动训练推理界面或双击 go-realtime-gui.bat 启动实时变声界面。两个界面对比训练推理界面标签页式的批量工作流适合录音、训练、转换文件这类离线任务。实时变声界面麦克风输入、扬声器输出适合直播、游戏、语音通话等需要即时反馈的场景。完成第一次转换准备 10–30 分钟低底噪的干声纯人声、无伴奏推荐 WAV 格式放在纯英文路径的目录里。在训练选项卡填写音频目录与实验名点击一键训练程序会依次完成音高提取、特征提取、模型训练和索引建立中途无需干预。训练完成后到推理选项卡点刷新音色就能看到新训练的音色。选中训练出的模型weights 目录下 60MB 以上的 .pth 文件与对应索引文件added_ 开头的 .index选择输入音频设定变调值0 为不变调点击推理即可得到结果。几个影响效果的参数音高算法选 RMVPE 通常最稳索引比例index rate用来抑制音色泄漏结果音色被原音或底模带偏底模音质高于训练集时适当调高它训练集底噪大时 epoch 设 20–30 就够音质好、时长足可以加到 200。模型可以分享给别人但注意只分享 weights 里 60MB 以上的 .pth 文件可连同索引一起打包不要分享 logs 目录下几百 MB 的 .pth——那是保存训练状态、用于续训的文件直接拿去推理会报 key 缺失错误。训练中途被打断也没关系重新启动程序用相同的实验名和参数点训练模型会从上次检查点继续网页上的参数需要重新填写。避坑速查Cuda out of memory 等问题的解决办法症状ffmpeg error 或 utf8 error原因大概率不是 FFmpeg 的问题而是音频路径包含空格、括号等特殊符号或训练集路径带中文导致写入 filelist.txt 时编码出错。 解决把音频挪到纯英文、无特殊字符的目录确认文件编码为 UTF-8。症状一键训练结束没有 added_ 开头的索引文件原因训练集过大添加索引这一步卡住内存占用过高。 解决多等一会儿仍无反应就再次点击训练索引按钮训练集特别大时建议分批处理。症状Cuda out of memory原因显存不足。 解决训练时把 batch size 调小到 1推理时按 推理参数配置 文件末尾调小 x_pad、x_query、x_center、x_max 四个值显存低于 4GB 的显卡建议更换硬件。症状Windows 报 OSError: llvmlite.dll 找不到原因缺少 Visual C 运行库。 解决安装微软官方的 vc_redist.x64.exe重启电脑后再启动 RVC。症状训练时报内存 error或 tensor 尺寸不匹配的 RuntimeError原因前者是提取音高和处理数据使用的 CPU 进程数开得太高、内存被占满后者是 wavs16k 文件夹里混入了体积异常小的损坏音频。 解决前者调低 CPU 进程数并把过长的训练集音频手动切短后者删掉异常小的文件后重新训练再补点一次训练索引。更多细节可查 常见问题文档。上手路线分三个阶段推进第 1 周 · 跑通第一个模型用 10–30 分钟自己的录音完成一次一键训练和推理熟悉音频目录、训练、索引、转换的完整链路先求跑通不追求音质。第 1 个月 · 实时变声与参数调优接上麦克风体验 RVC 实时变声系统尝试变调、索引比例、total epoch 等参数想提高音色还原度时优先优化训练集降噪、剔除杂音而不是猛调参数。进阶 · 模型融合与协作用 ckpt 选项卡里的 ckpt-merge 按权重混合两个音色创造新的声音参考 训练技巧文档 打磨训练集把自己的模型和经验分享到社区交流。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考