RVC 变声器完整实操指南10 分钟语音训练并跑通你的第一个音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI社区通称 RVC是一个开源的语音音色转换框架用不超过 10 分钟的低噪语音就能训练出可复用的变声模型。它的思路是训练一个轻量模型推理时通过 top1 检索把输入音频的音色特征替换为训练集特征从机制上避免音色泄漏同时附带实时变声程序README 标注端到端延迟约 170msASIO 设备可低至 90ms。本教程面向想把自己的声音或目标人物声音变成可批量使用的音色模型的你按检查环境 → 启动界面 → 训练 → 推理验证的任务顺序展开。 前置检查RVC 环境与硬件检查清单检查项要求说明操作系统Ubuntu 24.04 x86_64 或 Windows两者均在 README 中给出完整步骤Python3.12 x64必须用虚拟环境隔离依赖显卡NVIDIA 卡或 CPU / DirectML显存 4GB 或 SM 5.3 的卡会被自动降级到 CPUPascal SM 6.1 与 GTX 16 系强制 fp32音频工具FFmpeg解码训练音频必需显存参考≥4GB 体验更好≤4GB 显存会自动切换到更省的检索参数NVIDIA 用户采用两阶段安装先装匹配 CUDA 版本的 Torch再装项目依赖。RTX 50 系用 cu128 包更早的卡用 cu118 包CPU / AMD / Intel 直接装requirments_cpu_py312.txt。# Ubuntu 24.04系统依赖 虚拟环境 sudo apt update sudo apt install -y python3.12 python3.12-venv python3.12-dev ffmpeg unzip libsndfile1 libportaudio2 python3.12 -m venv .venv source .venv/bin/activate# NVIDIARTX 50 系以前两阶段安装RTX 50 系把 cu118 换成 cu128 python -m pip install torch2.7.1cu118 torchaudio2.7.1cu118 --index-url https://download.pytorch.org/whl/cu118 python -m pip install -r requirments_cu118_py312.txt装完后跑一行命令验证python -c import torch; print(torch.__version__, torch.cuda.is_available())第二项应为True。若显示False通常是驱动或 CUDA 版本没对上优先解决这一步再往下走。 首次启动从源码到可操作的浏览器界面获取源码并进入仓库根目录git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI准备底模文件底模基于约 50 小时的开源 VCTK 数据集训练无版权问题。用huggingface_hub从官方模型仓库下载hubert_base/、rmvpe/rmvpe.pt、pretrained/、pretrained_v2/、uvr5_weights/并放入assets/训练静音样本解压到logs/mute/路径以 README 中模型与运行目录一节为准一个文件都不要放错位置。启动 WebUIpython webui.py。默认监听端口7865并自动打开浏览器无桌面的服务器加--noautoopen想固定端口用--port端口被占用时程序会自动向上找空闲端口并打印提示。实时变声单独入口python realtime_gui.pyWindows 下对应go-realtime_gui.bat。启动后你会看到四个页签模型推理含单次/批量推理、伴奏人声分离去混响去回声调用 UVR5、训练、ckpt 处理含 ckpt-merge 模型融合。️ 核心工作流训练并跑通你的第一个变声音色第 1 步准备数据并切片归一化把同一说话人的低噪语音集中到一个文件夹当前只支持单人训练README 建议至少 10 分钟。进入训练页签step1 实验配置填实验名日志和模型都生成在logs/下对应目录、目标采样率40k / 48k、模型是否带音高指导唱歌必须勾选纯语音可不勾、版本v1 / v2。step2a 处理数据填训练文件夹路径点处理数据。程序会遍历所有可解码音频做切片和归一化在实验目录下生成两个 wav 文件夹。现象 → 原因 → 解法个别文件处理失败 → 编码器不受支持 → 先统一转成 wav/flac带伴奏的素材可先用伴奏人声分离页签提取人声。第 2 步提取音高与特征step2b选择音高提取算法pm/rmvpe默认rmvpe它是 Interspeech 2023 方案速度快且不易漏音点特征提取。音高用 CPU 提取、特征用 GPU 提取多卡可用0-1-2这种格式指定卡号。现象 → 原因 → 解法这一步明显慢 → CPU 进程数给少了 → 调大提取音高和处理数据使用的 CPU 进程数。第 3 步训练模型与特征索引step3的关键参数save_every_epoch默认 5、total_epoch默认 20上限 1200、每张卡的batch_size预训练底模 G/D 路径会随采样率和版本自动指向assets/pretrained_v2/。可以分别点训练模型和训练特征索引也可以直接一键训练。勾选在每次保存时间点将最终小模型保存至 weights 文件夹训练出的.pth会自动落到assets/weights/.index索引文件用于推理时检索。现象 → 原因 → 解法训练炸显存 → 勾了缓存所有训练集至显存且数据量大 → 大数据取消勾选该选项只建议 10 分钟以下的小数据使用。现象 → 原因 → 解法小显存卡上索引检索阶段内存紧张 → 参数没降档 → 无需手改configs/config.py对 ≤4GB 显存会自动采用低配检索参数如x_query5、x_center30。第 4 步推理页签验证效果点刷新音色列表从推理音色下拉框选中刚训练的模型索引文件会自动匹配也可手动指定.index路径。上传待转换音频设置参数后点转换。现象 → 原因 → 解法下拉框里看不到你的模型 →.pth没放对目录 → 确认它在assets/weights/再刷新。现象 → 原因 → 解法输出有电音撕裂 → 清辅音/呼吸声被破坏 → 调低protect滑块默认 0.33调低保护力度更大但可能削弱索引效果。现象 → 原因 → 解法听感不够像目标人物 → 检索特征占比不足 → 提高检索特征占比index_rate默认 0.75不想用检索则设为 0。需要批量处理时切到批量推理输入文件夹或多个文件输出格式可选 wav / flac / mp3 / m4a默认写到opt/。️ 调优与排错RVC 参数怎么调常见现象速查参数默认值什么时候调变调0半音数升八度 12男转女一般 12女转男 -12音高提取算法rmvpe备选 pm / fcpe训练带音高的模型推理时务必有音高提取检索特征占比 index_rate0.75音色不像就调高音质毛糙就调低protect0.33出现撕裂/电音时调低后处理重采样0不重采样需要统一输出采样率时拉到 48000rms_mix_rate0.25输出音量起伏不自然时调整音量包络融合比例其余高频问题的速查端口 7865 打不开→ 端口被占时程序自动顺延取下一个可用端口看终端日志确认实际端口或--port指定。A 卡 / I 卡跑得慢→ Windows 用 DirectML 方案--dmlLinux 走 CPU两者均在 README 的依赖表中给出。输出没有音调、唱歌跑调→ 训练时没勾模型是否带音高指导或推理没选音高提取算法两者必须配套。界面是外语→ 界面资源在 i18n/locale/含中文、日语、韩语等 13 种语言启动时按环境自动切换。 资源速览文档、源码模块与配套工具中文常见问题docs/cn/faq.md更新日志docs/cn/Changelog_CN.md各语言目录en / jp / kr / fr / tr / pt下另有 training_tips 与 faiss_tips讲训练技巧与索引调法推理流水线infer/vc/音高与特征提取算法infer/rmvpe.py、infer/hubert.py训练系统train/UVR5 人声分离tools/uvr5/模型融合train/process_ckpt.py实时变声realtime_gui.py采样率配置configs/收尾建议先保证数据同一人、低噪、≥10 分钟质量优先于时长这比任何参数都重要。第一次训练全部用默认参数跑通处理数据 → 特征提取 → 一键训练 → 推理全流程之后再每次只改一个变量做对比。.index索引和.pth模型同等重要训练完记得把索引也保留下来再评估音色相似度。大数据集取消缓存所有训练集至显存小显存卡把batch_size降到 1 优先保稳定。需要低延迟在线变声时改用realtime_gui.pyWindows 上配 ASIO 输入输出设备可进一步压低延迟。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
