尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Wan2.2-Animate-2-14B 实战指南:Wan-Animate-2 端到端角色动画模型的架构解析与推理部署

发布时间:2026/9/29 15:55:26

资讯中心
01
ARTICLE

Wan2.2-Animate-2-14B 实战指南:Wan-Animate-2 端到端角色动画模型的架构解析与推理部署

Wan2.2-Animate-2-14B 实战指南:Wan-Animate-2 端到端角色动画模型的架构解析与推理部署
人工智能大模型计算机视觉媒体生成【免费下载链接】Wan2.2-Animate-2-14B项目地址https://ai.gitcode.com/hf_mirrors/Wan-AI/Wan2.2-Animate-2-14B点击查看免费下载Wan-Animate-2 是万兴科技 Wan-AI 团队提出的端到端角色动画Character Animation框架其核心思路是在重新设计的 Diffusion Transformer 中直接消费驱动视频driving video从而彻底消除传统方案中中间运动提取器intermediate motion extractor带来的信息损失兼顾高保真动作生成与强身份保持identity preservation。本指南以仓库根目录的 README.md 为骨架结合仓库内的模型文件与组件目录系统讲解 Wan2.2-Animate-2-14B 的环境搭建、权重下载、CLI 推理、Diffusers 集成与 Gradio 演示帮助你从零开始跑通 Base 与 Distillation 两套模型的完整推理流程。模型概览端到端角色动画的核心设计Wan-Animate-2 通过重构 Diffusion Transformer 的输入与条件注入方式实现了两项关键能力直接消费驱动视频不再依赖姿态估计、关键点提取等中间模块驱动视频以原始形式进入网络由模型端到端学习动作与外观的耦合关系从而获得高保真运动生成和更强的身份保持能力文本驱动的视角控制text-driven viewpoint control新增文本驱动的镜头视角控制使输出画面的相机视角与驱动视频解耦创作者可以通过文本描述独立指定生成画面的拍摄角度。此外官方还发布了Wan-Animate-2-Lite高效变体据 README 官方表述其将推理延迟降低到实时门槛real-time thresholds面向流式角色动画场景。Release Notes 与完成度README 中的发布记录显示本项目在 2026 年 8 月 7 日一次性发布了Wan-Animate-2 推理脚本Wan-Animate-2 Base 模型权重Wan-Animate-2 Distillation 模型权重。在 Todo List 中推理代码、模型 Checkpoints、Diffusers 集成、DiffSynth-Studio 集成与 ComfyUI 集成均标记为已完成[x]说明该镜像仓库对应的开源实现已具备从原生脚本到主流生态的全链路使用能力。仓库构成与模型文件说明当前镜像仓库的文件布局与官方 README 的推理流程一一对应主要包括三部分路径内容作用wan_animate_2/wan_animate_2_bf16.safetensorsWan-Animate-2 Base 主模型权重bf16原生 CLI 推理Basewan_animate_2/wan_animate_2_bf16_distillation.safetensorsWan-Animate-2 Distillation 蒸馏模型权重bf16原生 CLI 推理Distillation10 步videomodel/Wan-AI/配套的文本编码器、VAE 与分词器多模态条件输入组件assets/pipeline-v2.png官方架构示意图理解端到端设计从videomodel/Wan-AI/目录中的文件名可以推断推理时加载的辅助组件包括models_t5_umt5-xxl-enc-bf16.pthUMT5-XXL 文本编码器bf16 精度负责将中文提示词编码为文本条件models_clip_open-clip-xlm-roberta-large-vit-huge-14.pth基于 OpenCLIP 的 XLM-RoBERTa-large ViT-huge-14 文本编码器用于图像/文本对齐的 CLIP 条件vae.pth视频/图像变分自编码器负责像素空间与潜空间的双向转换umt5-xxl/与xlm-roberta-large/两个文本编码器对应的分词器目录。分词器目录中的配置文件提供了可确认的细节xlm-roberta-large/tokenizer_config.json声明其tokenizer_class为XLMRobertaTokenizer、model_max_length为 512umt5-xxl/special_tokens_map.json声明了pad、s、/s、unk四个特殊 token以及 300 个extra_id_0至extra_id_299的扩展 token。这些组件在原生脚本中会被按路径逐一加载组装成完整的文生视频/角色动画模型。环境安装从零搭建推理环境1. 克隆仓库git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git--recursive用于同步拉取仓库引用的子模块例如依赖的第三方组件。2. 创建 Python 环境并安装 PyTorch官方默认使用 Python 3.11 与 CUDA 12.6 的 PyTorch 2.7 组合conda create -n wan_animate_2 python3.11 -y pip install torch2.7.0 torchvision0.22.0 torchaudio2.7.0 --index-url https://download.pytorch.org/whl/cu126--index-url指定了 CUDA 12.6 专属的 wheel 源这是保证后续flash_attn与算子兼容性的关键前提。如果你的 GPU 驱动支持的 CUDA 版本不同需替换为对应的 wheel 源。3. 安装依赖依赖清单以仓库根目录的 requirements.txt 为准pip install -r requirements.txt4. 安装 flash_attnWan-Animate-2 的 Transformer 结构依赖 Flash Attention 加速注意力计算、降低显存占用pip install flash-attn --no-build-isolation--no-build-isolation让编译复用当前环境中已有的构建依赖避免重复下载编译工具链。5. 以可编辑模式安装本仓库pip install -e .这样可以将仓库内的 Python 包注册进当前环境便于后续在任意位置 import 相关模块也方便跟随源码改动即时生效。模型下载两种渠道任选模型下载渠道Wan-Animate-2即本镜像对应的 Wan2.2-Animate-2-14BHuggingFace 或 ModelScope使用huggingface-cli下载建议先安装 CLI 工具pip install huggingface_hub[cli] huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/使用modelscopeCLI 下载pip install modelscope modelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/下载完成后./ckpts/中应包含与当前镜像仓库一致的主模型权重wan_animate_2/下的两个.safetensors与videomodel/辅助组件。注意仓库内的权重文件以 Git LFS 指针形式托管实际权重需通过上述 CLI 拉取完整内容。推理前置步骤用 LLM 生成结构化的中文图像描述Wan-Animate-2 的提示词并非自由发挥的文本而是需要遵循固定范式的结构化中文描述——它被拆分为人物外观描述与背景描述两部分且明确不描述动作行为。官方建议先用一个 LLM例如 Qwen3.7-Plus配合以下 Prompt 生成图像 caption再将其作为 Wan-Animate-2 的输入用中文客观描述图片中的内容包括以下要点人物外观描述不描述动作行为。 背景描述忽略主观评价和情绪推测。 下面给出描述范例必须遵循这个范式不要输出额外的符号 人物外观描述穿着一件浅蓝色的校服衬衫领口和袖口有白色边饰。胸前有一个圆形徽章。 背景描述背景为明亮、整洁的教室或办公室氛围安静有序。这一步骤的意义在于人物外观描述驱动模型的身份保持模块而背景描述则为视角控制与背景重建提供条件。官方 Demo 中使用的提示词模板可以直接复用见下文示例它同时覆盖了服装细节、配饰、发型等外观要素与场景要素。CLI 推理Base 与 Distillation 两套命令推理脚本位于infer/wan_animate_2_demo.py配置文件为infer/wan_animate_2.yamlBase与infer/wan_animate_2_distillation.yamlDistillation。执行前需先将仓库根目录加入PYTHONPATHWan-Animate-2 Baseexport PYTHONPATH$(pwd) cd infer python wan_animate_2_demo.py \ --prompt 人物外观描述一只银灰色虎斑纹的小猫拥有圆润的脸庞、竖立的耳朵和巨大的圆形眼睛。它身穿一套深蓝色的制服套装包括一件带有金色纽扣的西装外套和一条百褶裙。外套里面搭配着白色衬衫领口处系着一个红色的蝴蝶结袖口露出白色的衬衫边缘。背景描述背景为纯白色光线均匀明亮无其他杂物或装饰。 \ --refer-img-file ../examples/demo1/reference.png \ --refer-video-file ../examples/demo1/template.mp4 \ --config ./wan_animate_2.yamlWan-Animate-2 Distillation10 步无 CFGexport PYTHONPATH$(pwd) cd infer python wan_animate_2_demo.py \ --prompt 人物外观描述一只银灰色虎斑纹的小猫拥有圆润的脸庞、竖立的耳朵和巨大的圆形眼睛。它身穿一套深蓝色的制服套装包括一件带有金色纽扣的西装外套和一条百褶裙。外套里面搭配着白色衬衫领口处系着一个红色的蝴蝶结袖口露出白色的衬衫边缘。背景描述背景为纯白色光线均匀明亮无其他杂物或装饰。 \ --refer-img-file ../examples/demo1/reference.png \ --refer-video-file ../examples/demo1/template.mp4 \ --config ./wan_animate_2_distillation.yaml \ --sample_guide_scale 1.0 \ --step 10说明--sample_guide_scale 1.0表示关闭 classifier-free guidanceCFG1 即不放大无条件/有条件差值--step 10将采样步数压缩到 10 步这是蒸馏模型的核心加速设定。注意原文档中--step 10一行缺少续行符\实际粘贴运行时应补齐如上所示。关键命令行参数速查参数含义备注--prompt遵循结构化范式的提示词由 LLM 生成分为人物外观描述与背景描述--refer-img-file参考角色图片路径提供需保持的角色外观身份--refer-video-file驱动视频路径提供动作/运动信号模型端到端消费--configYAML 推理配置Base 用wan_animate_2.yaml蒸馏用wan_animate_2_distillation.yaml--sample_guide_scale引导强度Base 默认大于 1.0蒸馏模型建议 1.0无 CFG--step去噪采样步数蒸馏模型典型值为 10远少于 Base硬件与并行配置注意事项README 明确说明仓库默认配置针对8× A800 GPU调优支持720P视频生成官方同时测试过2× A800 GPU上的480P生成。如果你的硬件配置不同需要相应调整 YAML 文件中的并行配置parallel configs。这一点在部署到更小显存或不同卡型的集群时尤为关键。Diffusers 集成三行代码跑通推理Wan-Animate-2 已被 diffusers 库官方支持README 中标注的 PR #14412。在下一个正式 release 之前需要从源码安装最新版 diffuserspip install githttps://github.com/huggingface/diffusers.git pip install flash-attn --no-build-isolationWan-Animate-2 Baseimport torch from diffusers import WanAnimate2Pipeline from diffusers.utils import export_to_video, load_image pipe WanAnimate2Pipeline.from_pretrained( Wan-AI/Wan2.2-Animate-2-14B-Diffusers, torch_dtypetorch.bfloat16 ).to(cuda) output pipe( imageload_image(../examples/demo1/reference.png), driving_video../examples/demo1/template.mp4, prompt人物外观描述一只银灰色虎斑纹的小猫拥有圆润的脸庞、竖立的耳朵和巨大的圆形眼睛。它身穿一套深蓝色的制服套装包括一件带有金色纽扣的西装外套和一条百褶裙。外套里面搭配着白色衬衫领口处系着一个红色的蝴蝶结袖口露出白色的衬衫边缘。背景描述背景为纯白色光线均匀明亮无其他杂物或装饰。, height800, width640, num_inference_steps40, ) export_to_video(output.frames[0], output.mp4, fps24)Wan-Animate-2 Distillation10 步、无 CFG、Euler 求解器pipe WanAnimate2Pipeline.from_pretrained( Wan-AI/Wan2.2-Animate-2-14B-Distilled-Diffusers, torch_dtypetorch.bfloat16 ).to(cuda) output pipe( imageload_image(../examples/demo1/reference.png), driving_video../examples/demo1/template.mp4, prompt人物外观描述一只银灰色虎斑纹的小猫拥有圆润的脸庞、竖立的耳朵和巨大的圆形眼睛。它身穿一套深蓝色的制服套装包括一件带有金色纽扣的西装外套和一条百褶裙。外套里面搭配着白色衬衫领口处系着一个红色的蝴蝶结袖口露出白色的衬衫边缘。背景描述背景为纯白色光线均匀明亮无其他杂物或装饰。, num_inference_steps10, guidance_scale1.0, # no classifier-free guidance flow_solvereuler, # Euler scheduler for distilled model ) export_to_video(output.frames[0], output.mp4, fps24)关键参数对照参数Base 示例Distillation 示例说明torch_dtypetorch.bfloat16torch.bfloat16与wan_animate_2_bf16*.safetensors的精度一致height / width800 / 640默认输出分辨率受显存约束num_inference_steps4010蒸馏模型步数大幅压缩guidance_scale默认1.0蒸馏模型关闭 CFGflow_solver默认euler蒸馏模型需配 Euler 调度器export_to_video以指定fps将帧序列导出为output.mp4示例为 24 fps。需要注意的是load_image中的路径是相对脚本执行目录的请按实际文件位置调整。Gradio 本地演示官方在 ModelScope Studio 提供了在线 Demo也可以本地一键启动 WebUIWan-Animate-2 Basecd infer python wan_animate_2_gradio.pyWan-Animate-2 Distillationcd infer python wan_animate_2_gradio_distillation.py两套脚本分别封装了上文 CLI 推理的核心逻辑适合快速验证效果或做交互式参数调试。引用与许可如果本工作对你的研究或产品有帮助建议引用官方论文README 中给出的 BibTeX 如下其中 arXiv 编号目前仍是占位符TODO正式版本请以官方公开发布为准article{wang2026wananimate2, title {Wan-Animate-2: Real-Time End-to-End Character Animation via Diffusion Transformer}, author {Wang, Guangyuan and Hu, Li and Meng, Dechao and Zhang, Zhongyi and Zhang, Peng and Huang, Mingyang and Zhang, Ruoshi and Sun, Ke and Zhang, Zhe and Wang, Xingjun and Cheng, Gang and Zhang, Bang}, journal {arXiv preprint arXiv:TODO.06009}, year {2026}, url {https://arxiv.org/abs/TODO.06009} }本项目基于 Apache License 2.0 开源允许商用与自由分发具体权利义务以许可证原文为准。小结围绕 README.md 提供的完整链路你可以依次完成环境搭建Python 3.11 PyTorch 2.7 cu126 flash_attn→ 权重下载huggingface-cli / modelscope→ LLM 生成结构化提示词 → 原生 CLI 推理Base 40 步 / Distillation 10 步→ Diffusers 或 Gradio 集成。其中蒸馏模型的10 步采样 CFG1 Euler 求解器是一组关键的加速组合而 720P/8×A800 与 480P/2×A800 的官方默认配置则提示我们不同分辨率需要按硬件调整 YAML 并行参数。结合仓库内wan_animate_2/与videomodel/Wan-AI/的文件布局可以清晰地看到 bf16 主模型与 UMT5-XXL、XLM-RoBERTa CLIP 文本编码器、VAE 组成的完整多模态推理链路。赞分享人工智能大模型计算机视觉媒体生成【免费下载链接】Wan2.2-Animate-2-14B项目地址https://ai.gitcode.com/hf_mirrors/Wan-AI/Wan2.2-Animate-2-14B点击查看免费下载相关推荐Wan2.2-Animate14B模型实现角色动画与替换Wan2.2 Animate14B模型实现角色动画与替换 导语 Wan2.2 Animate 14B模型正式发布通过单模型实现角色动画生成与替换两大核心功能基础模型计算机视觉Wan2.2-Animate14B模型让角色动画更生动Wan2.2 Animate14B模型让角色动画更生动 导语 Wan2.2 Animate 14B模型正式发布通过创新的角色动画与替换技术实现了角色动作基础模型计算机视觉Wan2.2-Animate14B模型让角色动画动起来Wan2.2 Animate14B模型让角色动画动起来 导语 Wan2.2 Animate 14B模型的发布标志着AI角色动画生成技术实现重大突破可通过单基础模型计算机视觉创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。