尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

如何用 SadTalker 10 分钟让照片“开口说话“:从下载到会说话的完整新手指南

发布时间:2026/9/12 5:56:03

资讯中心
01
ARTICLE

如何用 SadTalker 10 分钟让照片“开口说话“:从下载到会说话的完整新手指南

如何用 SadTalker 10 分钟让照片“开口说话“:从下载到会说话的完整新手指南
如何用 SadTalker 10 分钟让照片开口说话从下载到会说话的完整新手指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker给 SadTalker 一张照片和一段录音它输出的是一段口型对得上、头部自然摆动的说话人视频。这个 CVPR 2023 的开源项目解决的正是语音驱动说话头动画这件事——过去只在影视制作里才能做现在一条命令就行。这篇文章不按安装流程平铺而是围绕新手最容易卡住的 3 个地方来写。你只要记住整体路径备好环境 → 拿齐模型权重 → 跑一条推理命令。卡得越明白跑得越快。开始前2 分钟过一遍环境清单先确认硬件有 NVIDIA 显卡体验最好显存偏小的话后面会教你怎么调没有独显也能用 CPU 跑只是慢。先在终端把项目代码拉到本地。这条命令执行完当前目录下会多出SadTalker文件夹进去能看到 README 和examples/目录——里面自带了一组可直接用的音频和样图后面演示就用它们git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker然后建一个独立的 Python 3.8 环境装 PyTorch 和项目依赖。依赖安装是全程最耗时的一步做完的反馈是终端不再刷新的报错结尾正常返回命令提示符conda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio pip install -r requirements.txt还有一个最容易被忽略的SadTalker 靠 ffmpeg 把帧拼成视频。顺手装一个conda install ffmpeg再用ffmpeg -version验证——能打印出版本信息就对了如果提示不是内部或外部命令说明还没装好此时再往下跑一定会报解码错误。卡点一模型文件没就位一启动就报错就算环境齐了大多数人第一次运行仍会失败报错几乎都指向同一个地方checkpoints/。预训练权重不随代码一起提供这一步漏了后面全是文件不存在。在项目根目录执行下面这条命令它会把表情模型、姿态模型、渲染生成器和面部增强权重一次性下全。跑完后checkpoints/里应该有若干.safetensors和.pth.tar大文件gfpgan/weights/里有 4 个增强用权重文件。以后再遇到ModuleNotFoundError或No such file or directory: checkpoints/...回来重跑一遍这个脚本缺什么会补什么bash scripts/download_models.sh权重就位之后顺手记住两个小坑能省你很多排查时间音频只支持 wav 或 mp3其他格式喂进去会报解码错先转码如果看到 CUDA out of memory先设置内存分配策略再跑Linux/macOS 执行export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用set PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128。卡点二脸生成得不对劲先选对素材再选对模式跑通之后更常见的烦恼是视频出来了但脸糊、背景撕裂或身体变形。这通常不是模型不行是输入没选对。先看素材。模型对写实人像最稳脸要清晰、尽量正面。examples/source_image/里就备着不同类型的例子比如这张写实头肩照是最不容易翻车的输入而下面这种全身照背景占比大直接跑默认模式就容易出撕裂感需要换模式项目用--preprocess提供三种预处理模式直接决定输出形态crop默认只动画脸部区域输出头部特写表情和头部动作最真实resize整图缩放到固定分辨率适合证件照式、脸占满画面的素材全身照不要用full脸部动画完再贴回原图适合全身照建议配--still保持原有头部姿态。来跑一条验证命令用仓库示例音频驱动上面那张全身图结果会存进results/目录。跑完打开它里面有一个按时间戳命名的子目录最终的 mp4 就在里面python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/full_body_1.png --result_dir results --still --preprocess full想换头部特写把--preprocess改回crop、素材换成那张头肩照即可。三种模式的效果差异和更多参数说明见 最佳实践文档。卡点三头太呆板让头部活起来的三个开关前两步过了视频里的人一定会动但常显得呆头部几乎不摆、表情平淡、口型发虚。这里是参数能产生最大差异的环节。第一加面部增强。在命令后追加--enhancer gfpgan让修复模型在生成后把面部细节修一遍口型区域会明显变清晰。第二调表情强度。--expression_scale 1.5让表情更夸张0.8则更沉稳。活泼的素材可以调高一点严肃的新闻播报类素材调低。第三借参考视频的头部运动。用--ref_pose指定一段真人视频模型会借它的头部姿态--ref_eyeblink还能借眨眼动作顺带解决死鱼眼。仓库的examples/ref_video/里就有现成的两段参考视频比音频短时会自动循环。艺术风格的素材同样能跑但脸尽量大、细节尽量清楚。下面这类绘画风头像就属于比较稳的输入不想敲命令打开 WebUI 试试如果命令行操作让你觉得繁琐项目自带了一个 Gradio 的本地网页界面所有参数都变成了按钮和下拉框。Linux/macOS 执行bash webui.shWindows 直接双击webui.bat脚本会自动补齐它需要的依赖浏览器打开本地页面后上传图片、音频选模式点生成即可。如果你更习惯把它作为 Stable Diffusion WebUI 的插件使用可以看 WebUI 扩展文档。接下来可以试什么一份按顺序的变体清单跑通之后建议按下面的顺序逐个加变量玩一次只改一个才能看清变化来自哪里同一张图配两段不同音频——听感上的情绪差异会直接映射到脸上同一素材跑crop和full --still——感受两种输出形态的边界加一段参考视频与不加对比——你会立刻明白头部运动是怎么借来的更进一步试试 4D 自由视角用--input_yaw等参数让单张照片生成转头方向的视频效果如下结果图、自由视角、新视角的对比想看到 3D 渲染的脸和 3D 关键点可以加--face3dvis配置方法在 face3d 文档。中途遇到问题先查 FAQ它覆盖了大部分常见报错macOS 和 Windows 原生环境的细节则在 安装文档 里。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。