尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

OpenVoice教程:3分钟跑通即时语音克隆

发布时间:2026/9/1 9:39:27

资讯中心
01
ARTICLE

OpenVoice教程:3分钟跑通即时语音克隆

OpenVoice教程:3分钟跑通即时语音克隆
OpenVoice教程3分钟跑通即时语音克隆【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 是 MIT 与 MyShell 联合开源的即时语音克隆项目几秒参考音频就能克隆一个人音色并让这声音说多种语言MIT 协议、可免费商用。本教程带你装环境、提取参考音色、跑通第一次跨语言克隆适合想把语音克隆能力接入产品或副项目的开发者。上手安装配置环境与下载模型环境要求一行清单LinuxWindows/macOS 可参考 docs 里的社区指南、Python 3.9、conda、PyTorch有 NVIDIA GPU 更好CPU 也能跑只是慢。conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完后下载预训练模型包官方 README 提供了 V1 包checkpoints_1226.zip和 V2 包checkpoints_v2_0417.zip分别解压到仓库的 checkpoints/ 与 checkpoints_v2/ 目录。 模型包体积在 GB 级建议用支持断点续传的下载工具。第一次跑通的最短路径模型解压后在仓库根目录执行python -m openvoice_app --share官方自带的 Gradio 网页界面会打开——选择基础说话人、粘贴文本、上传参考音频点生成。看到 outputs 目录里产出 WAV 文件、播放时音色接近参考音频说明链路已经打通。能跑通之后再往下看它内部到底做了什么。原理速览几秒音频如何变成音色把它想象成配音流程基础说话人 TTS 模型是演员先用固定嗓音和情绪把台词念出来音色转换器是后期只把演员的嗓音换成参考音频里那个人的嗓音台词内容和表演方式不变。你的参考音频经过 VAD 切出有效语音段后被模型里的参考编码器压成一个音色向量SE——它编码的是谁在说而不是说了什么。对照架构图读左侧基础说话人模型根据文本和风格参数口音、情绪、语调生成音频右侧参考音频进入音色提取器中间编码器—Flow—解码器结构负责在 IPA 对齐特征上剥离源音色、保留节奏与语调等风格再融合目标音色。这种音色与风格分离正是 OpenVoice 的核心也是零样本跨语言语音克隆成立的原因参考音频和目标文本可以完全是两种语言。下面挑三个最有代表性的场景演示这两个模块的实际用法。跨语言克隆让英文参考音频说中文你会遇到这种情况手上只有 5 秒英文录音却需要中文配音。做法分两步先对参考音频调用se_extractor.get_se拿到目标音色向量再让基础说话人 TTS 生成中文底音最后送进转换器的 convert 函数换嗓音。核心就三行完整代码见 demo_part1.ipynbtarget_se, _ se_extractor.get_se(ref_audio, tone_color_converter, vadTrue) base_speaker_tts.tts(text, src_path, speakerdefault, languageChinese) tone_color_converter.convert(audio_src_pathsrc_path, src_sesource_se, tgt_setarget_se, output_pathsave_path)注意 convert 里的 source_se 是基础说话人模型的默认音色向量随模型包提供如 checkpoints/base_speakers/EN/en_default_se.pth转换的本质是减去基础说话人的嗓音、加上目标嗓音。拿到什么结果一句听起来是参考音频里那个人在说的中文。参考语言或目标语言即使不在训练集内也能做demo_part2.ipynb 展示了用外部 TTS 作基础说话人的九种语言示例myshell.ai 官方平台上也把这个能力做成了在线小部件。如果你的参考音频或目标语言不在 V1 内置模型覆盖范围内直接看下一节的 V2 方案。风格微调一个参数控制情绪和语速克隆成功了但读起来平淡你想要低语感、慢半拍的版本。做法是调base_speaker_tts.tts的两个参数speaker 可选 9 种内置风格——default、friendly、cheerful、excited、sad、angry、terrified、shouting、whisperingspeed 控制语速传 0.9 就是放慢 10%。切换风格时记得同步加载对应的风格音色向量如 en_style_se.pth作为 source_se否则减嗓音那一步会对不上。拿到什么结果同一文本、同一参考人得到不同情绪和语速的版本音色始终指向参考人。 想要更多风格比如其他口音基础说话人模型是可替换的换模型即可接入同一条流水线。V2六语言原生MeloTTS多口音生成V1 内置基础说话人只覆盖英语和中文音质也略逊。当你需要同一个人讲英、西、法、中、日、韩六种语言时切到 V2用 checkpoints_v2 模型包并以 MeloTTS 多语言 TTS 引擎作为基础说话人安装命令在 docs/USAGE.md 的 V2 一节。每种语言加载对应语言模型生成底音目标音色向量复用之前提取的结果各基础说话人的音色向量在 checkpoints_v2/base_speakers/ses/ 目录demo_part3.ipynb 用循环跑了六语言多说话人网格。拿到什么结果一段参考音频驱动六种语言输出且 V2 采用更强数据增广训练音质更稳。还要知道一件事V2 的 convert 默认内嵌水印message 参数官方保留检测能力面向公众部署时请保持开启。跑通场景后下面这几类坑基本都会遇到先过一遍速查表。排错速查6个常见现象一次过现象原因对策克隆声音的口音/情绪不像参考人OpenVoice 只克隆音色口音与情绪由基础说话人模型决定换目标口音的基础说话人或按风格微调一节调整参数生成音频有杂音、音色不稳参考音频有背景噪声、过短、含多人或长静音段换 5–15 秒干净单人录音重复克隆却得到旧结果se_extractor 按文件名缓存processed 目录未清理给参考音频改名或清空 processed 缓存调用 get_vad_segments 报 silero-vad 下载失败网络无法访问 Silero VAD 模型仓库手动下载 zip 并解压到 ~/.cache/torch/hub详见 docs/QA.md提示 language 不支持V1 内置基础说话人仅支持英语与中文用 V2 MeloTTS或自行替换基础说话人Gradio demo 行为异常模型路径或版本不匹配先逐步跑通 demo_part1.ipynb再对照官方问答排查以上覆盖了部署前最常碰到的六类问题其余边缘情况以官方问答为准。延伸导航接下来去哪看docs/USAGE.md — 官方安装与使用指南含 V2/MeloTTS 安装命令docs/QA.md — 官方问答音质与安装问题的第一站openvoice/api.py — BaseSpeakerTTS 与 ToneColorConverter 实现水印逻辑也在这里openvoice/se_extractor.py — 参考音频切分与音色提取的完整实现demo_part2.ipynb — 跨语言克隆的完整 Notebook从 Gradio 界面建立手感再顺着 api.py 的两个类读一遍源码即时语音克隆的完整链路就全部在你手里了。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。