10 分钟语音训练 AI 变声模型RVC 语音转换快速上手【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI下称 RVC是一个基于 VITS 的开源变声框架只要 10 分钟的目标人物语音你就能在自己电脑上训练出一个 AI 变声模型用来配音、翻唱或实时变声普通显卡也够用。全文按先跑通、再搭建、后调优的顺序讲3 条命令就能走到网页界面。三分钟跑通先看效果最省事的路径是整合包或一键脚本不需要你理解任何依赖。Windows下载整合包RVC-beta.7z解压后双击go-web.bat浏览器会自动打开训练/推理界面。Mac / Linux克隆仓库后一条命令run.sh会自动建虚拟环境、装依赖、下载预模型并启动sh ./run.sh打开网页后在推理选项卡选一个模型、传一段音频你就能听到变声结果。效果满意了再回头按下面的步骤搭自己的训练环境。它到底能做什么能力对你的实际好处一键训练载入→提音高→训练→建索引不用手动按顺序跑 4 个阶段一个按钮走完top1 检索保护音色变声结果不会被你输入音频的原始音色带跑出来就是目标音色UVR5 人声分离从完整歌曲里直接抠出干声省去手动找清唱素材RMVPE 音高提取唱歌场景下的哑音听不出音高片段也能处理速度比传统算法快、占资源少ckpt-merge 模型融合两个音色按比例混合调出介于两人之间的新音色实时变声界面go-realtime-gui.bat端到端 170ms 延迟ASIO 设备可压到 90ms能直播能用A 卡 / I 卡加速没有 N 卡也能训练和推理正式搭建3 步走完1. 装依赖前提是 Python 版本大于 3.8。先装 PyTorch若已装可跳过再按你的显卡选一份 requirementspip install torch torchvision torchaudio你的设备安装命令N 卡pip install -r requirements.txtA 卡 / I 卡pip install -r requirements-dml.txtA 卡 ROCm仅 Linuxpip install -r requirements-amd.txtI 卡 IPEX仅 Linuxpip install -r requirements-ipex.txt一个例外Windows RTX 30 系显卡时装 PyTorch 要指定 CUDA 11.7 源--index-url https://download.pytorch.org/whl/cu117否则可能装到不匹配的版本。2. 备好预模型和 ffmpegRVC 训练推理依赖一批预模型文件放在assets/下assets/hubert/hubert_base.ptassets/pretrainedv2 模型还需assets/pretrained_v2assets/uvr5_weights根目录的rmvpe.ptRMVPE 音高提取用仓库 tools/ 目录提供了下载脚本直接运行即可自动拉取上述文件python tools/download_models.py另外确认 ffmpeg 可用Ubuntu/Debian 用sudo apt install ffmpegMac 用brew install ffmpegWindows 则把ffmpeg.exe、ffprobe.exe放到仓库根目录。3. 启动python infer-web.py浏览器自动打开后所有操作切分、提取、训练、推理都在网页上点完。Linux 上用 I 卡 IPEX 的话先执行source /opt/intel/oneapi/setvars.sh再启动。练出好效果的关键数据量怎么选推荐 10~50 分钟。数据干净低底噪、音色统一的话5~10 分钟精简素材就够用1~2 分钟偶尔有人成功但基本不可复现1 分钟以下不建议试。理由底模已经提供了通用语音能力你只需要让它记住这一个音色样本太少记不住太多则收益递减。训练轮数total_epoch素材底噪大就 20~30 轮停手——底模音质带不动你的低质数据练再多只是放大噪音素材音质高且时长多可以放到 200 轮反正训练速度很快。index rate 为什么重要可以把它理解成先对齐声音指纹再换音色。推理时系统从你的训练集索引里找最接近当前片段的一条特征top1 检索替换输入源特征你的原始音色就进不来了。index rate 调 1 时保护最强但音质会向训练集靠拢训练集本身音质比推理源差时调太高反而降质。训练集质量高、轮数足够时模型自带音色的能力强index rate 调不调都无所谓。想换音色细节用 ckpt 选项卡的 ckpt-merge 融合两个模型比例从 0 到 1 慢慢试比重训快得多。训练前处理完整歌曲先过一遍 UVR5 抽人声assets/uvr5_weights里自带权重比混着伴奏训练干净得多。避坑清单按现象 → 大概率原因 → 一条解法自查载入音频时报 ffmpeg error 或 utf8 error大概率不是 ffmpeg 的锅而是路径里有空格、括号或中文 把音频挪到纯英文、无空格的目录再试一键训练结束没看到added_开头的索引文件显示Training is done说明模型已训完紧邻的报错是假的索引步骤是训练集太大时卡住了 手动再点一次训练索引按钮训练完了推理时选不到这个音色模型列表没刷新或训练过程实际有报错 先点刷新音色还没有就打开logs/实验名下的日志看训练是否成功CUDA out of memory显存不够4G 以下基本没救4G 可以试试 训练就把 batch size 往小调最低到 1推理就缩小 configs/config.py 结尾的x_pad、x_query、x_center、x_maxWebUI 弹 Expecting value: line 1 column 1 (char 0)系统开了局域网/全局代理连本地端口也被代理劫持了 关掉代理服务端设过 http_proxy 的也一并 unset再打开Windows 报llvmlite.dll加载失败缺 VC 运行库 安装微软官方 VC 运行包x64后重启 WebUI收尾一句话总结RVC 把少数据 检索防泄漏 网页操作拼在一起让你用 10 分钟素材和一条启动命令就得到属于自己的 AI 变声模型。遇到问题和想深入调参时先看仓库自带文档中文 FAQ、训练流程详解、faiss 索引调参说明、中文更新日志。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考