尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

RVC 变声器实战指南:10 分钟录音做出可用 AI 音色模型

发布时间:2026/9/25 11:22:52

资讯中心
01
ARTICLE

RVC 变声器实战指南:10 分钟录音做出可用 AI 音色模型

RVC 变声器实战指南:10 分钟录音做出可用 AI 音色模型
RVC 变声器实战指南10 分钟录音做出可用 AI 音色模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想让游戏角色说出像你本人的声音Retrieval-based-Voice-Conversion-WebUI社区通称 RVC能把一段待处理音频换成另一个音色而训出这个音色只需要 10 分钟低底噪录音。代价提前说清N 卡显存至少4GB低于 4GB 代码会自动放弃 GPU 退回 CPU外加约 1 小时环境准备和一段干净录音。本文按先出声 → 再训练 → 后调优的路径走一遍差哪条就回哪节。动手前十秒确认地基先花十秒确认两件事后面 90% 的环境问题能避开。python --version # 本分支要求 Python 3.12 x64 ffmpeg -version # 音频解码全靠它判断标准Python 必须是3.12这是本分支的硬性要求不是老教程里的 3.8~3.10FFmpeg 能打印版本号即可。克隆仓库git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI要求项具体值为什么Python3.12 x64 venv 虚拟环境分支按 3.12 锁定依赖版本混装系统 Python 易冲突系统Ubuntu24.04x86_64 或 WindowsREADME 官方推荐组合显卡N 卡显存≥4GB、SM≥5.3configs/config.py 按此规则选卡不达标自动降级 CPU/DirectMLPyTorch2.7.1cu118 / cu128 两套必须与 CUDA 版本匹配RTX 50 系用 cu128更早的卡用 cu118FFmpeg任意能跑通的版本Windows 用户可把ffmpeg.exe放项目根目录目标 1先出声确认整条链路是通的按显卡挑依赖包两阶段安装根目录有三份依赖清单CPU/AMD/Intel 用requirments_cpu_py312.txtN 卡按 CUDA 选requirments_cu118_py312.txt或requirments_cu128_py312.txt。N 卡必须先装 Torch 再装清单顺序反了装不上python -m venv .venv source .venv/bin/activate python -m pip install torch2.7.1cu118 torchaudio2.7.1cu118 \ --index-url https://download.pytorch.org/whl/cu118 python -m pip install -r requirments_cu118_py312.txt python -c import torch; print(torch.__version__, torch.cuda.is_available())最后一条输出True才算过关False说明 Torch 与 CUDA 没对上先修这里再谈别的。补齐预训练权重缺一个都会罢工推理和训练都依赖assets/下的底模文件按 README 的 hf 命令下载即可最少三组hf download lj1995/VoiceConversionWebUI --include hubert_base/* --local-dir assets hf download lj1995/VoiceConversionWebUI rmvpe.pt --local-dir assets/rmvpe hf download lj1995/VoiceConversionWebUI --include pretrained/* pretrained_v2/* --local-dir assets为什么是这几个hubert_base/负责提取音色的 256 维特征rmvpe.pt是音高提取模型效果最好、最省资源pretrained/与pretrained_v2/是 v1/v2 训练的起点权重。只想推理不想用 UVR5 分离人声的话uvr5_weights/可以先跳过。启动 WebUI 并确认端口python webui.py默认监听7865端口换端口用--port传参无桌面环境的服务器加--noautoopen。Windows 双击 go-webui.bat 也行但它指定的是7897端口注意别混。判断标准终端打印当前设备一行且浏览器自动打开页面设备显示cuda:0说明走 GPU。目标 2把 10 分钟录音变成音色模型录音先达到低底噪标准官方 FAQ 给出的口径总时长10~50 分钟最稳底噪低、音色统一的话多多益善精简到 5~10 分钟的高质量素材也有人训成功。两个易踩的细节音频要放在训练文件夹根目录子文件夹里的文件不会被读取采样率训练全程统一界面默认40kv1 可选 40k/48kv2 多一个 32k中途改采样率等于白训。一键训练的四个阶段填好实验名数据全部落在logs/实验名/下、训练文件夹路径后点一键训练它按固定顺序跑四步数据切分 → F0 与 HuBERT 特征提取 → 模型训练 → 索引训练。切分逻辑是静默检测 约 4 秒一段自动切片所以长录音不用手切。参数默认值怎么调为什么带音高指导开唱歌必开纯语音可关关则模型更轻但无法跟旋律走音高提取rmvpe一般不用动速度最快、占用最小batch_size最小显存 ÷2如 12GB →6爆显存就往下降最低1由 webui.py 按显卡显存自动算出total_epoch按数据定低质20~30高质到200底模带不动低质训练集拉高只会过拟合版本v2新手默认 v2底模参数更大、需要数据更少训练配置的底稿在 configs/ 下比如 configs/v2/48k.json 里learning_rate为1e-4。另外 configs/config.py 末尾的x_pad/x_query/x_center/x_max会按显存自动收缩6G 以上一组、5G 一组、4G 及以下最保守一组你不用手动动知道它存在即可。提取 60MB 小模型与索引训练完有两个产物logs/实验名/下的几百 MB pth 是实验状态不能直接分享或推理真正用于推理和分享的是在 ckpt 选项卡里从 G 开头文件提取出的60MB小模型会出现在assets/weights/。索引文件added_*.index落在assets/indices/与模型配套使用。关键数字推理时最值钱的三个滑杆模型选好后单次推理页有三个滑杆决定听感默认值分别是滑杆默认调节逻辑检索特征占比 index_rate0.75越高越杜绝推理源音色泄露但音质越贴训练集训练集音质低于推理源时拉高只会更糊保护清辅音 protect0.33调低加大保护力度、防电音撕裂代价是索引效果下降音量包络融合 rms_mix_rate0.25越靠近1输出越采用输出包络听感更稳训练集优质且时长多时模型本身不怎么会泄露音色index_rate 反而不关键——优质数据比参数重要。可选目标 3游戏里实时变声离线 WebUI 之外realtime_gui.pyWindows 下双击 go-realtime_gui.bat提供端到端170ms延迟的实时变声换 ASIO 设备可压到90ms。它读取 configs/config.json 里的block_time默认0.25秒与静音阈值默认-60dB等参数选好 pth 与 index 文件即可用麦克风实时转换。跑不通时症状对照速查别乱试按表对号入座症状先查这个解法优先级连不上 / Connection Error黑色控制台窗口被关了吗保持终端存活端口被占就--port换端口高Expecting value (char 0)本地/远端代理关掉系统全局代理和学术加速的 http_proxy 再试中ffmpeg error / utf8 error路径带空格、中文训练集放纯英文无空格路径高llvmlite.dll缺失VC 运行库装 VC 2015-2022 运行库后重启高Cuda out of memory显存训练降 batch_size 到 1推理收缩 config.py 末尾 x_*高tensor size 不匹配1_16k_wavs里有异常小的音频删掉那几个小文件重跑训练模型 训练索引中推理页看不到新音色没刷新 / 用了 logs 大 pth点刷新音色并用 ckpt 选项卡提取小模型高误区对照五个容易翻车的地方❌ 数据越多越好 / ✅ 精选 10~50 分钟低底噪音频胜在质量1 分钟以下基本不可复现❌ 轮数拉满更稳 / ✅ 低质 20~30 轮就够高质才值得往 200 走❌ 把 logs 下几百 MB 的 pth 发给别人 / ✅ 分享assets/weights/的 60MB pth 配 index❌ 中途改采样率继续训 / ✅ 换新实验名从头训可拷贝旧特征加速❌ 拿系统 Python 直接装 / ✅ venv 隔离依赖清单一次装全完整走查从录音到出声的剧本假设条件15 分钟清嗓录音、12GB 显存的 N 卡、Ubuntu 24.04。阶段动作预估耗时数据剪掉静音与底噪文件平铺进一个英文路径文件夹~30 分钟环境克隆仓库、venv、两阶段装依赖、下 assets 权重~1 小时训练v2 / 40k / 带音高batch_size6epoch100起数小时验收提取小模型、训练索引、推理试听~30 分钟跑通的三条判定标准差哪条回哪节assets/weights/下新增 60MB 的.pth—— 没有就回提取小模型一节assets/indices/下有对应added_*.index—— 没有就重新点一次训练索引推理页刷新音色后选中新模型出声且音色对得上 —— 听感不对就回三个滑杆一节调 index_rate 与 protect。资源去向官方文档与 FAQdocs/中文 docs/cn/faq.md、训练技巧 docs/en/training_tips_en.md推理核心infer/vc/pipeline 与检索逻辑都在里面训练核心train/预处理、F0/特征提取、训练与索引配置入口configs/采样率配置与显存自适应规则社区项目 Issue 与 Wiki 是报错求助的第一站报错时把logs/实验名/下的日志一起带上【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。