免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

Duix.Avatar 本地部署完整指南:10 秒视频克隆数字人,普通电脑零门槛跑通

Duix.Avatar 本地部署完整指南:10 秒视频克隆数字人,普通电脑零门槛跑通 Duix.Avatar 本地部署完整指南10 秒视频克隆数字人普通电脑零门槛跑通【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar一台普通电脑能不能跑 AI 数字人能。我把 Duix.Avatar 本地部署完整跑通了——这是开源数字人项目丢一段 10 秒视频就能克隆形象和声音之后输入文案直接出口播视频全程离线。它到底能干什么本地部署图什么打开客户端只有两条主线点Create Avatar上传一段你出镜的视频系统克隆你的脸和声音点Create Video选一个已建好的数字人输入文案或上传音频它就自动生成口型对得上的口播视频。生成的数字人和作品都保存在自己机器上本地目录里随时可查。选本地部署主要是图三点。素材不经过任何第三方服务器形象、声音这些生物特征数据留在自己电脑里一次部署后生成不限次数没有按条计费的账单服务就在 localhost 上接口直接可调想接进自己的系统也不受外部限制。技术上它是三个服务的组合语音识别ASR、语音合成TTS和口型视频渲染各自跑在独立容器里端口分别是 10095、18180 和 8383。合成语音支持中、英、日、韩、法、德、阿拉伯、西八种语言。原理细节不展开本文只关心怎么把它跑起来。部署前先确认这 4 件事检查项要求系统Windows 1019042.1526 及以上或 Ubuntu 22.04 Desktop显卡必须英伟达显卡且装好官方驱动AMD 卡跑不起来内存推荐 32GB16GB 可能连识别服务都起不来硬盘C 盘空闲 100G存 Docker 镜像D 盘空闲 30G存数字人和作品驱动没装或版本太旧是后面所有问题的第一嫌疑建议先用 GeForce Experience 把驱动更到新版用nvidia-smi能看到显卡信息就算通过。从装环境到服务全部 Running一共 5 步第 1 步把 WSL 和 Docker 装好命令行里跑wsl --list --verbose没装过 WSL 就先执行wsl --install装完再wsl --update更新内核。然后从 Docker 官网下载 Docker Desktop 安装首次启动时接受协议、选择跳过登录确认设置里已启用 WSL 2 集成重启 Docker 即可。第 2 步把代码拉下来git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar第 3 步一条命令起服务进入deploy目录执行docker-compose up -d首次会自动拉取三个镜像大约半小时流量约 70G建议连 WiFi。C 盘空间不够的话可以在 Docker 设置里把镜像磁盘位置挪到别的盘设置 → Resources → Advanced → Disk image location点 Browse 重新选目录。三种变体按环境选用显存紧张可跑精简版docker-compose -f docker-compose-lite.yml up -d只起视频渲染一个服务50 系列显卡如 5090用docker-compose -f docker-compose-5090.yml up -dUbuntu 上则执行docker-compose -f docker-compose-linux.yml up -dLinux 下需先装好 docker、显卡驱动和 nvidia-container-toolkit。第 4 步确认三个容器都 Runningdocker ps看到下面三个服务状态都是 Running服务端就就绪了服务镜像端口职责duix-avatar-asrguiji2025/fun-asr10095把素材音频识别成文本duix-avatar-ttsguiji2025/fish-speech-ziming18180文案转语音、克隆音色duix-avatar-gen-videoguiji2025/duix.avatar8383口型对齐、合成视频第 5 步装客户端打开就能用最省事的办法是直接下官方构建的安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 双击.AppImage即可启动。开发者也可以自己构建代码依赖 Node.js 18npm install后执行npm run build系列命令即可。启动客户端My Avatars / 我的数字人和我的作品页面能正常加载说明前后端已打通报连接错误就回到第 4 步检查容器状态。10 秒视频怎么变成你的数字分身先备一段合格素材录制 1015 秒人正对镜头说话光线均匀、面部无遮挡脸尽量占满画面。注意素材必须带声音且是人在说话声音克隆直接用它静音视频过不了这一关。创建数字人在Create Avatar页上传视频系统自动分离音频轨道随后依次完成形象克隆和声音克隆。等待时间与硬件有关通常几十分钟。建好的数字人会出现在首页列表里多个形象可以并存生成时按需切换。生成口播视频在Create Video里选中数字人输入文案或上传音频点生成。TTS 先把文本变成你的音色渲染服务再把音频和形象合成、对齐口型。1 分钟时长的成片一般要几分钟渲染时间以 GPU 性能为准。不想点界面两个接口直接调Docker 起来后服务在127.0.0.1上直接可 HTTP 调用最适合接进自己的系统。语音侧18180 端口先 POST/v1/preprocess_and_tran提交素材音频返回参考音频地址和识别文本两个值再 POST/v1/invoke带上一个自定义的唯一speakerUUID 即可、要合成的text以及上一步返回的两个值就拿到合成音频。视频侧8383 端口POST/easy/submit传audio_url、video_url和一个唯一code然后用 GET/easy/query?codexxx轮询进度完成即出成片。调用细节可直接翻客户端源码里现成的请求实现src/main/service/voice.js、src/main/service/video.js。三类人怎么用出差别内容创作者和电商卖家把精力花在写文案上。同一个数字人形象反复使用换不同的脚本和背景批量出口播视频一条形象克隆成本摊薄到几乎为零。教育工作者适合做标准化课程播报。先克隆一个固定数字人之后每期课程只需替换文案语音、口型、风格完全一致系列内容的观感比真人分批录制更统一。开发者把三个容器当成常驻服务用上面的接口搭自己的流水线例如知识库问答后直接输出视频回复。这类场景建议放在服务器上 7×24 跑注意内存给足 32G。遇到问题先按这个顺序查排查前先会看日志客户端右上角设置菜单里有 Open Log服务端则在 Docker 里点开对应容器的 Logs关键报错直接截图复制。拉镜像一直超时、报 request canceledDocker Hub 官方源在国内不稳定。在 Docker 设置 → Docker Engine 里加上国内镜像源registry-mirrors再 Apply restart或开全局代理。三个服务起不来、状态异常先nvidia-smi确认显卡和驱动正常本项目全部算力依赖英伟达显卡驱动没装服务一定起不来Ubuntu 上再确认 nvidia-container-toolkit 已装。新增模特直接报错素材视频里没有声音或声音不是人在说话。换一个带清晰人声的素材重来。克隆形象报 Connection refused识别服务冷启动比较慢服务端刚拉起来时等几分钟再操作内存只有 16G 的机器可能直接不够用。渲染时报 CUDA 显存不足降低输出分辨率关掉其他占 GPU 的程序浏览器硬件加速、游戏等再试。更完整的自查清单和报错对照见项目自带的常见问题文档。顺利的话第一条视频多久能出来镜像拉取半小时 客户端安装部署本身一个小时内能收工。之后录一段 10 秒素材、等克隆完成、生成第一条口播视频全程顺利的话从开电脑到出片大约一个多小时。跑通之后素材、音色和成片都留在本地之后每生成一条视频就只是几分钟渲染时间的事。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表