尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

SadTalker 从0到1部署:环境·权重·排错全指南

SadTalker 从0到1部署:环境·权重·排错全指南 SadTalker 从0到1部署环境·权重·排错全指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 的音频驱动说话人脸动画生成项目给它一张静态人像 一段音频它就输出一段口型、表情、头姿同步的说话视频。整套部署就四步建 conda 环境 → 装框架和依赖 → 拉权重 → 跑一条命令验证。下面按执行顺序讲每个坑都标了替代方案省得你来回翻。硬件速查SadTalker 部署最低配置与推荐配置先对一下你的机器决定后面选哪组参数组件最低门槛推荐值备注Python3.83.8.x3.9 会碰 face_alignment/numba 编译问题显卡4GB 显存的 N 卡8GB 显存无 N 卡可走 CPU但慢一个数量级内存8GB16GB增强器GFPGAN会额外吃内存磁盘10GB 空闲15GB权重本体约 3.4GB还要留输出空间FFmpeg✅ 必须装✅ 必须装视频读写全靠它缺了直接报错跑出来的效果大致是这样源图是仓库自带的示例人像conda 环境一键创建与依赖安装四步顺序执行整个安装链是有顺序依赖的别打乱环境 → 框架 → FFmpeg → 依赖包。四步走1. 建环境并拉代码conda create -n sadtalker python3.8 -y conda activate sadtalker git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker预期done后提示符变成(sadtalker)。失败替代没有 conda 就直接装 Python 3.8 解释器跳过前两条。2. 装 PyTorch# 有 NVIDIA 卡装匹配你 CUDA 版本的 1.12.x 轮子没有卡就装 CPU 版 pip install torch1.12.1 torchvision0.13.1 torchaudio0.12.1预期Successfully installed torch-1.12.1 ...。失败替代网络受限就先装 CPU 版跑通流程之后再换 GPU 轮子。3. 装 FFmpeg这步最容易踩坑conda install ffmpeg -y # 验证应输出 ffmpeg version 4.x/5.x ffmpeg -version预期能打印版本号。失败替代Linux 可sudo apt install ffmpegWindows 装好后确认ffmpeg.exe目录在%PATH%里不然后面ffmpeg is not recognized。4. 装项目依赖pip install -r requirements.txt预期最后一行Successfully installed basicsr-1.4.2 facexlib-0.3.0 gfpgan-...。失败替代个别包编译失败时单独pip install 包名重试Gradio 网页演示用到 TTS 才需要pip install TTS纯命令行推理不用。safetensors 权重下载与目录校验权重不会随代码自动下载必须手动就位。最省事是跑仓库自带脚本# 在项目根目录下执行自动建目录并下载全部权重 bash scripts/download_models.sh预期6 个文件下载完成最后两个约 300MB。脚本跑不动就手动wget对应 release 包目录结构照下面放——代码是按固定文件名和路径去读的放错位置 直接FileNotFoundErrorSadTalker/ ├── checkpoints/ │ ├── SadTalker_V0.0.2_256.safetensors # 约 1.2GB--size 256 用 │ ├── SadTalker_V0.0.2_512.safetensors # 约 1.2GB--size 512 用 │ ├── mapping_00109-model.pth.tar # 约 200MBfull 模式用 │ └── mapping_00229-model.pth.tar # 约 200MB默认 crop 模式用 └── gfpgan/ └── weights/ ├── GFPGANv1.4.pth # 约 330MB ├── alignment_WFLW_4HG.pth ├── detection_Resnet50_Final.pth └── parsing_parsenet.pth 下载完花 30 秒核对体积ls -lh checkpoints/ gfpgan/weights/两个 safetensors 各约 1.1~1.3GB、mapping 各约 200MB、GFPGANv1.4 约 330MB。数字对得上就完整明显偏小就是断了用wget -c断点续传重拉。注意选 512 分辨率时 src/utils/init_path.py 会去读SadTalker_V0.0.2_512.safetensors只下了 256 的就会报文件不存在。GPU 与 CPU 部署对比及参数调优硬件显存/内存速度量级推荐参数RTX 3060 12GB 及以上8~24GB 显存分钟级内出片--size 512 --batch_size 2 --enhancer gfpgan4~6GB 显存老卡8GB 内存略慢256 稳--size 256 --batch_size 1 --enhancer gfpgan无 N 卡纯 CPU16GB 内存3~8 分钟/短音频--cpu --batch_size 1 --size 256别开增强器直接复制三组启动命令占位符换掉即可# GPU 常规512 高清 GFPGAN 增强 python inference.py --driven_audio your_audio.wav --source_image your_image.png \ --size 512 --batch_size 2 --enhancer gfpgan --result_dir ./results # CPU 模式降分辨率、关增强保证能跑完 python inference.py --driven_audio your_audio.wav --source_image your_image.png \ --cpu --size 256 --batch_size 1 # 低配 GPU4~6GB256 batch 1显存吃紧再设环境变量 export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128 python inference.py --driven_audio your_audio.wav --source_image your_image.png \ --size 256 --batch_size 1场景对号入座你的卡 12GB → 直接上第一组 5126GB 显存 → 第二组低配版OOM 就先export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128纯 CPU → 用--cpu组预期等待几分钟属正常。另外整人动画要加--preprocess full此时会自动切换mapping_00109权重和 still 配置这也是为什么两个 mapping 都要下载。SadTalker 常见报错速查手册报错关键词根因修复命令ffmpeg is not recognizedFFmpeg 没装或不在 PATHconda install ffmpeg验证ffmpeg -versionNo module named aiepoch_20 等旧权重下不完整facexlib 加载异常删掉该文件重新下载核对ls -lh体积No such file: .../similarity_Lm3D_all.mat权重/BFM 目录没按上节结构放好重跑bash scripts/download_models.shunexpected EOF, expected ... bytes权重文件损坏或没下完删掉损坏文件wget -c断点续传重下CUDA out of memory. Tried to allocate显存不够512增强器最吃--size 256 --batch_size 1或设PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Error while decoding stream #0:0 ... mp3float音频不是 wav/mp3ffmpeg -i in.m4a -ar 16000 -ac 1 out.wavIllegal Hardware InstructionM1/M2 Macdlib 预编译包架构不匹配单独重装pip uninstall dlib -y pip install dlibImportError: numpy.core.multiarray装了比 1.23.4 新的 numpy 顶掉了旧版pip install numpy1.23.4前三种基本都在权重这一层No module named ai看着像缺包其实和 ai 库无关——之所以误报是因为权重加载异常时 Python 把内层堆栈吐成了顶层错误先查文件大小再谈装包。部署验证与下一步操作环境是否真的就绪用这几条命令逐个确认# 1. 框架与设备CUDA available 应为 TrueCPU 机为 False 也正常 python -c import torch; print(torch.__version__, torch.cuda.is_available()) # 2. 核心依赖能导入且版本对 python -c import numpy, librosa, face_alignment; print(numpy.__version__) # 预期: 1.23.4 # 3. FFmpeg 可用 ffmpeg -version # 4. 权重齐全两个 safetensors 两个 mapping 4 个 GFPGAN 文件 ls -lh checkpoints/ gfpgan/weights/最后用仓库自带的示例素材做一次冒烟测试输出会落在./results/python inference.py --driven_audio ./examples/driven_audio/chinese_poem1.wav \ --source_image ./examples/source_image/full_body_1.png --size 256能拿到一段 mp4就说明从环境、权重到推理链路全部通了——把示例文件换成你自己的音频和照片就可以正式跑批了。更多模式参考视频眨眼--ref_eyeblink、全身动画--preprocess full、Gradio 网页界面 app_sadtalker.py可以接着在 docs/FAQ.md 和 README.md 里对照着开。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表