SadTalker 数字人视频部署与上手完整指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker跑 SadTalker 时最容易踩的坑是模型文件下载失败、ffmpeg命令找不到、生成时 CUDA 显存不足。本文按从零开始的视角讲清 SadTalker 部署全流程克隆仓库、配置环境、下载模型直到生成第一段音频驱动的人像说话视频。读完你可以一次性完成环境配置与模型下载用 inference.py 跑出第一个会说话的人像视频快速定位并修复最高频的 7 类报错调出全身动画、人脸增强等进阶效果快速概览项目要求系统Linux / macOSM1/M2 已验证/ Windows建议 WSL依赖软件Python 3.8、Conda、Git、FFmpeg必装磁盘空间模型约 2 GB建议预留 5–10 GB 装环境与模型硬件推荐 NVIDIA GPU无显卡可加--cpu参数用 CPU 跑速度较慢预计耗时10–30 分钟含模型下载视网速而定代码环境克隆仓库并安装依赖以下命令统一在项目根目录下执行。git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker # 用 conda 建隔离环境避免污染系统 Python conda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio conda install ffmpeg pip install -r requirements.txt各系统只需关注差异macOSM1/M2在上述命令后追加pip install dlib否则运行时会报Illegal Hardware Error。Windows在 WSL 或 PowerShell 里执行同样命令FFmpeg 需自行安装并加入 PATH装完重启终端。Linux 的 NVIDIA 显卡官方 README 中固定了 CUDA 11.3 的 PyTorch 版本若出现 CUDA 版本报错可参考 README.md 的 Linux/Unix 小节换装指定版本。 模型文件下载清单所有模型由脚本 scripts/download_models.sh 自动下载内容如下文件用途checkpoints/mapping_00109-model.pth.tar音频到表情的 MappingNetcheckpoints/mapping_00229-model.pth.tar音频到姿态的 MappingNetcheckpoints/SadTalker_V0.0.2_256.safetensors256 分辨率人脸生成器checkpoints/SadTalker_V0.0.2_512.safetensors512 分辨率人脸生成器gfpgan/weights/*.pth人脸检测、关键点与 GFPGAN 人脸增强模型总量约 2 GB视网络情况约 5–30 分钟bash scripts/download_models.sh # 脚本内置 -nc断点续传Windows 请在 WSL 中执行。成功后确认checkpoints/与gfpgan/weights/目录下的文件与上表一一对应缺少任何一个首次运行都会报错。 环境验证与自检在 sadtalker 环境中执行 3 条命令对照判据即可python -c import torch; print(torch.__version__, torch.cuda.is_available()) python -c import dlib; print(dlib.__version__) ffmpeg -version输出判据torch 版本号 TrueGPU 可用通过torch 版本号 False无可用 GPU请检查 PyTorch 安装源或改用--cpuFFmpeg 版本头部信息FFmpeg 配置通过另外确认checkpoints/下文件数量与下载清单一致即可开工。SadTalker 首次运行仓库自带示例素材一条最短命令就能跑通python inference.py \ --driven_audio examples/driven_audio/deyu.wav \ --source_image examples/source_image/full_body_1.png产物保存在results/时间戳/目录下是一个 mp4 文件。用播放器打开应看到图中人像的嘴型与头部随音频动。若只有画面没有口型先确认音频文件不是静音且格式为 wav 或 mp3。 故障排查7 个高频报错报错原因解法ffmpeg: command not found未安装或不在 PATHLinux 用conda install ffmpegmacOS 用brew install ffmpegWindows 把 FFmpeg 加入 PATHModuleNotFoundError: No module named aicheckpoint 下载不完整重跑bash scripts/download_models.sh并核对checkpoints/内每个文件FileNotFoundError: checkpoints\BFM_Fitting\similarity_Lm3D_all.mat模型文件没放到正确位置对照 README 的目录结构检查checkpoints/与gfpgan/weights/CUDA out of memory显存不足运行前设置export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128显存小可降--size 256或加--cpuRuntimeError: unexpected EOF ... corrupted模型文件损坏网络稳定后重新下载脚本支持续传Illegal Hardware Error: Mac M1dlib 架构不匹配单独执行pip install dlib重装Error while decoding stream #0:0 ... mp3float音频格式不支持输入只支持 wav 或 mp3先转格式再运行更多细节见 docs/FAQ.md。进阶调优inference.py 参数速查参数作用建议值 / 适用场景--expression_scale表情强度倍数默认 1.0调大后表情更夸张--still保持原始姿态不转头配合--preprocess full做全身动画--preprocess预处理模式 crop / resize / full人像特写用 crop全身图用 full--enhancer人脸增强 gfpgan / RestoreFormergfpgan模型已含在下载脚本中--ref_pose/--ref_eyeblink从参考视频借用姿态 / 眨眼配合examples/ref_video/使用--size人脸生成分辨率256 流畅512 细节更好但更吃显存--result_dir结果输出目录按需自定义示例一用参考视频控制头部姿态python inference.py \ --driven_audio examples/driven_audio/chinese_poem1.wav \ --source_image examples/source_image/art_0.png \ --ref_pose examples/ref_video/WDA_AlexandriaOcasioCortez_000.mp4 \ --result_dir results_with_ref示例二全身图动画并启用人脸增强python inference.py \ --driven_audio examples/driven_audio/imagine.wav \ --source_image examples/source_image/full_body_1.png \ --still --preprocess full --enhancer gfpgan \ --result_dir results_enhanced更多参数说明与效果对比图见 docs/best_practice.md。后续学习方向WebUI 图形界面python app_sadtalker.py启动本地 Gradio 演示SD WebUI 扩展参考 docs/webui_extension.md3D 人脸重建与关键点按 docs/face3d.md 安装requirements3d.txt依赖平台专项安装Docker、WSL、macOSdocs/install.md 与 docs/FAQ.md【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
