ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Duix.Avatar 本地部署:10 秒视频克隆数字人,RTX 4070 即可跑

Duix.Avatar 本地部署:10 秒视频克隆数字人,RTX 4070 即可跑 Duix.Avatar 本地部署10 秒视频克隆数字人RTX 4070 即可跑【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar运营、讲师或企业主想批量做口播视频常卡在录制、剪辑和高昂的制作费上。Duix.Avatar 是一款可本地部署的数字人克隆工具10 秒视频素材就能完成形象与声音克隆输入文案即可生成口播视频。这篇带你从装环境到出第一条视频全流程跑通读完你能独立完成数字人分身和视频合成。它到底能干什么Duix.Avatar 把数字人视频生产拆成两段上传约 10 秒的视频 → 本地服务克隆人脸与声音、再用文案或音频驱动口型 → 输出口播成片。整个链路跑在本机的 Docker 服务里桌面客户端负责操作和进度管理。指标数据硬件门槛推荐 RTX 4070、32G 内存必要、N 卡驱动Windows 需 C 盘空闲 ≥100G、D 盘 ≥30G素材要求约 10 秒视频画面清晰且必须有人声支持语言8 种英、日、韩、中、法、德、阿拉伯语、西班牙语部署方式Docker Compose 三个服务 桌面客户端Windows 10 19042.1526 / Ubuntu 22.04授权模式支持全球免费商用用户量超 10 万或年营收超 1000 万美元的企业需签商业许可协议 跑通全流程装好环境这一步是确认机器满足条件有英伟达显卡并装好驱动Windows 需有 D 盘存数字人与作品数据空闲 ≥30G和足够空间存镜像C 盘空闲 ≥100G不足可改 Docker 镜像存储位置。推荐配置为 i5-13400F、32G 内存、RTX 4070。装好后终端能正常输显卡信息即通过nvidia-smi拉起服务在 deploy/ 目录下用 docker-compose 启动三个服务duix-avatar-tts声音合成、duix-avatar-asr语音识别、duix-avatar-gen-video视频合成。首次拉取镜像会消耗约 70G 流量耗时半小时左右建议连 WiFi。cd deploy docker-compose up -dC 盘空间不足时按上图路径在 Docker Desktop 的 Settings → Resources → Advanced 里用 Browse 把磁盘镜像位置改到剩余空间大于 100G 的磁盘。如果这里卡住了镜像拉取报Client.Timeout exceeded是 Docker Hub 直连不稳定。去 Docker Desktop 的 Docker Engine 配置里加registry-mirrors国内镜像源Apply restart 后重新执行up -d。看到 Docker 中出现三个服务且均为 Running服务端就部署成功了。装上客户端从项目 Release 页面下载安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 22.04 下载 AppImage 直接启动root 用户桌面运行时需在终端加--no-sandbox参数./Duix.Avatar-x.x.x.AppImage --no-sandbox。启动后进入主界面两个入口就是全部核心功能Create Video生成视频和 Create Avatar创建分身。建第一个分身点 Create Avatar上传一段 10 秒左右的视频。要求正面拍摄、光线充足、视频里必须是人在说话——服务端要用这段声音做克隆纯静音视频会直接报错。提交后客户端自动完成音视频分离、语音识别ASR和声音克隆进度在界面上推进完成后 My Avatars 里出现一张新的分身卡片即模型训练完成。出第一条视频回到主界面点 Create Video选择刚建好的分身粘贴文案或上传音频提交合成。文案模式由 TTS 服务先转成你克隆的声音再驱动口型音频模式直接用你的音频驱动。合成完成后视频进入 My Works 列表可在线播放或导出。遇到合成异常时点右上角 Setting 菜单里的 Open Log 能直接打开客户端日志文件排查和反馈都靠它。拆开看看里面是什么人脸和声音怎么克隆的声音上传的视频先被分离出音轨FunASR 把音轨转写成文字音轨与转写文本一起作为参考音频 参考文本之后任意文案都按这个参考合成同音色语音底层基于 fish-speech人脸克隆服务保留你视频里的人脸画面作为驱动底片不需要你单独导出人脸模型文件视频怎么合成的合成服务接收参考视频 待驱动音频逐帧驱动人脸口型与音轨对齐后输出成片客户端通过本地接口提交任务并轮询进度ASR、TTS、合成分别跑在三个独立容器里互不阻塞离线架构意味着什么三个 Docker 服务加桌面客户端构成完整链路素材、中间产物、成片全部落盘在本机Windows 默认在D:\duix_avatar_data全程不经过公网企业内训素材和未公开内容不出内网客户端与这三个服务的所有交互都封装在 src/main/service/ 目录里看这一层就能理解整条链路。拿它解决你的事给企业做内训的人原来找讲师录播、剪辑一条培训视频半天起步。现在专家录 10 秒说话视频克隆一次之后每份培训文案直接进 Create Video 出片新人入职材料可以按人头批量生成。做网课或知识付费的讲师原来改一次课程内容就要重进直播间录制一遍。现在课件更新只改文案用已建好的分身重新生成对应片段再拼回课程不用反复录。日更短视频的自媒体人原来每天对着镜头口播加剪辑产一条耗几个小时。现在形象只克隆一次按天把文案丢进客户端批量合成口播视频录制的成本从每天摊薄为一次性。跑顺之后还能折腾什么换部署档位deploy/docker-compose.yml 旁边还有docker-compose-lite.yml单容器精简版、docker-compose-5090.ymlRTX 50 系显卡走 torch 预览版 CUDA、docker-compose-linux.ymlUbuntu按硬件挑一个up -d即可多模型管理客户端支持建多个分身My Avatars 列表里可搜索、切换不同场景用不同形象API 直调服务端启动后在本地暴露端口声音合成走http://127.0.0.1:18180/v1/invoke视频合成走http://127.0.0.1:8383/easy/submit进度查询用http://127.0.0.1:8383/easy/query适合接到自己的脚本或流程里⚠️ 遇到问题先查这里镜像拉不下来报 Timeout→ Docker Hub 直连不稳定 → Docker Desktop 的 Docker Engine 配置加registry-mirrors国内镜像源Apply restart 后重跑docker-compose up -d创建分身报错→ 上传的视频里没有说话声克隆拿不到声音样本 → 换一段 10 秒左右、人在持续说话的视频重新提交克隆时报 Connection refused→ asr 服务启动慢还没就绪16G 内存机器可能起不来 → 服务端启动后等几分钟再操作并确认 32G 内存达标结尾Duix.Avatar 把数字人克隆和口播视频合成整条链路搬进了本地10 秒素材、8 种语言、全离线。现在就可以做的下一步git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar克隆完成后进入deploy/目录执行docker-compose up -d半小时后你的第一条数字人视频就能出片。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进