三步完成 Duix.Avatar 本地部署:从零克隆你的数字人生成第一条口播视频
三步完成 Duix.Avatar 本地部署从零克隆你的数字人生成第一条口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar你有一段现成文案想用自己的脸和声音做口播视频但又不想每次对着镜头重拍。Duix.Avatar 是一款免费开源的数字人视频项目提交一段 10 秒左右视频即可完成形象与声音克隆输入文本或音频就能自动生成口型对齐的播报视频。全程基于 Docker 本地部署跟着做完你就能产出第一条数字人视频。一句话看懂开源数字人视频工具能帮你做什么Duix.Avatar 由服务端和客户端两部分组成服务端是三个 Docker 容器分别负责语音识别ASR、声音克隆合成TTS和视频合成客户端是图形化桌面程序负责上传素材和查看成片。所有算力都在你自己机器上离线完成不联网也能跑。它最适合内容创作者、培训视频制作者以及想通过 API 做二次集成的开发者。能力对你的意义10 秒视频克隆形象 声音不用 3D 建模、不用摄影棚人人都能拥有数字分身文本 / 音频驱动口型写完文案直接出片支持中、英、日、韩等 8 种语言全离线本地计算视频和声音数据不出内网隐私自己可控开源免费商用个人和小团队零授权成本见 LICENSE部署前检查硬件与软件要求先花两分钟核对配置这是后面所有报错的源头。不满足最低配置时容器会起不来或训练中途失败装好也白装。硬件要求项目最低配置推荐配置不满足的后果显卡NVIDIA 显卡显存 ≥8GBRTX 4070 及以上无 NVIDIA 显卡时三个容器全部无法启动内存16GB32GB 及以上16GB 时 ASR 服务可能直接启动失败磁盘100GB 空闲存镜像150GB 以上70GB 镜像下载到一半中断前功尽弃Windows 数据盘D 盘 ≥30GB存数字人数据50GB 以上训练素材和成片无处落盘软件要求项目要求说明系统Windows 10 19042.1526 或 Ubuntu 22.04 桌面版其他 Linux 版本官方未做兼容验证DockerDocker DesktopWindows或 Docker Engine composeLinux服务端完全靠容器运行显卡驱动nvidia-smi能看到显卡信息Linux 还需额外安装 NVIDIA Container ToolkitWindows 用户注意Docker 镜像默认存在 C 盘。如果 C 盘不足 100GB安装 Docker 后进入 Settings → Resources → Advanced把 Disk image location 改到空间充足的磁盘再点 Apply restart。部署 三步完成 Duix.Avatar 本地部署第一步克隆源码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar成功标志目录里能看到deploy/内含 4 个 compose 文件和src/客户端源码。你不做客户端开发的话真正要用到的只有deploy/目录。第二步启动服务端容器cd deploy docker-compose up -d这一步会拉取三个镜像合计约 70GB下载期间终端基本无输出持续十几到三十分钟属正常现象耐心等。RTX 5090 显卡改用docker-compose -f docker-compose-5090.yml up -dUbuntu 用-f docker-compose-linux.yml只要口型驱动、不做克隆就用轻量版-f docker-compose-lite.yml up -d只起视频合成一个服务。下载完成后用这两条命令验证nvidia-smi docker ps --format {{.Names}}: {{.Status}}成功标志nvidia-smi能打出显卡信息驱动没问题docker ps输出三行且状态都是Upduix-avatar-tts18180 端口、duix-avatar-asr10095 端口、duix-avatar-gen-video8383 端口。看到这三个服务 Running服务端就部署成功了。第三步安装并启动客户端Windows 用户从项目发布页下载Duix.Avatar-x.x.x-setup.exe双击按向导安装Ubuntu 用户下载 Linux 版AppImage后执行chmod x Duix.Avatar-x.x.x.AppImage ./Duix.Avatar-x.x.x.AppImage --no-sandbox成功标志客户端打开后看到 Home 主页顶部是 Create VideoAI 视频生成和 Create Avatar创建数字人两个入口说明客户端已能连上本地服务端。动手实践产出你的第一条数字人视频现在做一条完整任务线先创建一个数字人再用文本驱动生成第一条视频最后用音频驱动生成第二条。全程只在客户端里点不需要碰代码。创建数字人Home → 点 Create Avatar → 上传一段 10 秒左右的视频。要求人脸居中清晰、光线均匀、全程有人说话声音会被用来克隆音色。提交后等待训练视显卡不同约 1~3 分钟。成功后 My Avatars 列表出现新模型缩略图取自你的视频。训练视频没有音轨会直接报错这是新手最高频的坑。文本驱动生成第一条视频Home → 点 Create Video → 选中刚建好的数字人 → 输入文案支持 8 种语言→ 确认音色与语速 → 开始生成。进度条走完需要几十秒到几分钟取决于显卡和文案长度。完成后在 My Works 列表下载播放重点听口型是否跟着语音走。音频驱动生成第二条视频再次进入 Create Video → 这次改用音频上传入口选一段你自己的录音或从任意成品视频里抽出的音频→ 提交。系统会按音频的节奏和语调对齐口型产出的第二条视频用的就是你的原声音色比文本驱动更自然。素材决定上限10 秒左右、正脸、均匀光线、纯色背景、连续自然说话克隆效果会明显更稳定背景复杂或人脸过暗时先换素材再怀疑软件。服务端刚启动完的几分钟内别急着训练ASR 服务就绪偏慢遇到Connection refused等几分钟重试即可不是部署失败。想做批量或二次开发直接读 src/main/service/ 下 model.js、video.js、voice.js就是模型训练、音频合成、视频合成的完整调用流程。进阶素材质量、GPU 加速与 API 集成素材要点训练视频记住四个字——清晰、稳定音频记住两个词——安静、自然。10 秒足够但别为了凑时长录进停顿和杂音。GPU 与存储三个容器都声明了runtime: nvidia部署前先跑nvidia-smi确认显卡可用否则容器起不来。RTX 5090以及 30/40 系 CUDA 12.8 环境走deploy/docker-compose-5090.yml。生成速度主要受显存限制8GB 显存可跑12GB 以上更从容。API 集成服务端起来后会在本机暴露三个端口最常用的是 8383 的视频合成。最短的一次提交 一次查询curl -X POST http://127.0.0.1:8383/easy/submit -H Content-Type: application/json \ -d {audio_url:D:/duix_avatar_data/face2face/audio.wav,video_url:D:/duix_avatar_data/face2face/video.mp4,code:task-001,chaofen:0,watermark_switch:0,pn:1} curl http://127.0.0.1:8383/easy/query?codetask-001code是你自定义的任务唯一标识提交后用同一个 code 轮询进度直到完成。声音克隆合成18180 端口/v1/invoke和模特训练接口的完整参数参考 src/main/service/voice.js 与 src/main/service/model.js无需自己拼协议。常见问题数字人视频生成避坑清单现象原因解决与关键排查命令docker-compose up -d十几秒即超时报context canceledDocker Hub 官方源连接不稳定镜像拉不下来在 Docker 设置中配置 registry-mirrors 镜像源见下图后重试再用docker images确认三个镜像齐全服务起不来或反复重启NVIDIA 驱动未装或未生效容器拿不到 GPU装好驱动nvidia-smi能显示显卡信息后再docker-compose up -d定制模特训练报Connection refusedASR 服务启动慢调用时还没就绪服务端启动后等 5 分钟再重试先docker ps确认三个服务均 Running新增模特报错提示视频必须有声音上传的训练视频无音轨或无人说话重录 10 秒左右有人连续说话的视频可用ffmpeg -i 视频.mp4确认存在音频流客户端显示无法连接本地服务服务未全部 Running或 18180/10095/8383 端口被占用docker ps看状态docker logs duix-avatar-gen-video看日志定位见下图三个容器都 Running 之后你的 Duix.Avatar 本地部署就真正完成了后续每次产出数字人视频只是在客户端里点几下数据全程不出内网。遇到问题先查 doc/常见问题.md 这份官方排错清单容器参数和硬件适配方案看 deploy/ 下的四个 compose 文件版本更新与社区动态以 README_zh.md 为准。现在就打开终端跑一遍nvidia-smi把第一个 70GB 的镜像拉下来吧。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考