免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

Duix.Avatar 上手指南:8G 显存如何在本地跑通数字人口播视频

Duix.Avatar 上手指南:8G 显存如何在本地跑通数字人口播视频 Duix.Avatar 上手指南8G 显存如何在本地跑通数字人口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar我上周实测过这条链路录一段 10 秒正面出镜的视频丢进去机器没连网最后产出一个用我的声音念文案的数字人口播视频。Duix.Avatar 是全离线的开源数字人工具一段视频完成形象与声音克隆文本/语音双驱动出片脚本支持 8 种语言。读完你能带走三样东西一条能跑通的部署路径含 Windows/Ubuntu/轻量三套方案、每个能力对应的最小 API 调用方式、一张硬件门槛表帮你判断这台机器能不能用。项目定位与能力全景Duix.Avatar 解决的是数字人制作成本高 云端服务隐私风险这两个问题。它和云端 SaaS 方案最本质的区别全部算力在本地服务端是三个 Docker 容器ASR 语音识别、TTS 语音合成、视频合成客户端是 Electron 桌面程序数据全程不出机器。和商用 3D 数字人方案相比它不需要建模资产10 秒真人视频即可克隆代价是口型效果以可用为主追求极致效果需另选商用 API官方对两者差异的表述是开源版效果可用API 服务更高清。核心模块的输入/输出一览模块输入输出形象克隆10 秒带声音的出镜视频H.264 静默模特视频声音克隆同一视频分离出的音频声音模型reference 音频文本TTS 文本转语音文本中/英/日/韩/法/德/阿/西 8 语言wav 音频ASR 语音识别声音克隆样本音频音频对应文本口型同步合成音频 模特视频MP4 成品视频客户端的完整流程走建模 → 写文案/传音频 → 合成 → 导出四步数据流向如下从 0 到跑通部署路径2.1 通用前置拉取仓库与硬件自查三条部署方案共用同一个仓库服务端配置在 deploy/ 目录git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar执行后进入目录能看到deploy/下的 4 个 compose 文件即成功。先做两个自查nvidia-smi docker --version两条都正常输出才算通过。本项目所有算力都在本地没有 NVIDIA 显卡或驱动没装好服务是起不来的这是第一失败点。注意显存 8G 起步社区反馈 3060 可用内存 32G 是官方标注的必要项——16G 内存机器实测 ASR 服务可能启动失败。2.2 Windows 完整方案Win10 19042前置条件C 盘空闲 ≥100G存 Docker 镜像、D 盘空闲 ≥30G存数字人与作品数据、已装 NVIDIA 驱动。wsl --install wsl --update执行后按提示设置 WSL 用户名密码然后从 Docker 官网安装 Windows 版 Docker Desktop 并运行首次启动接受协议、跳过登录。在deploy目录启动完整三服务cd deploy docker-compose up -d首次拉取约 70G 流量官方口径半小时左右取决于网速。执行后打开 Docker Desktop看到duix-avatar-asr、duix-avatar-tts、duix-avatar-gen-video三个容器全部 Up即服务端就绪。注意拉镜像超时报错含Client.Timeout exceeded是网络问题在 Docker 的/etc/docker/daemon.json里加registry-mirrors镜像源即可见后文排错手册。客户端从项目 Release 页下载对应系统安装包Windows 双击setup.exe安装。客户端能连上三个本地端口18180/10095/8383并看到新增模特入口说明链路通了。2.3 Ubuntu 22.04 方案官方已适配验证sudo apt update sudo apt install docker.io docker-compose执行后docker --version能出版本号即跳过后续 Docker 步骤。接着按 NVIDIA 官方文档装驱动再装 NVIDIA Container Toolkitsudo apt-get install -y nvidia-container-toolkit sudo nvidia-ctk runtime configure --runtimedocker sudo systemctl restart docker然后启动 Linux 版 compose数据目录是~/duix_avatar_data而非 D 盘cd deploy docker-compose -f docker-compose-linux.yml up -d三个容器 Up 后客户端用 AppImage 版本若以 root 进桌面双击无反应在终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox启动。2.4 RTX 50 系列显卡专用方案50 系列卡官方基于 5090 测试通过30/40 系列 CUDA 12.8 用户也可用换用 torch 官方预览版镜像cd deploy docker-compose -f docker-compose-5090.yml up -d容器 Up 即成功。各方案差异一览方案容器构成首次启动磁盘要求适用场景完整版ASRTTS合成 3 个约 30 分钟70G 拉取C 盘 100G D 盘 30G文本驱动功能完整轻量版 lite仅合成服务最快单镜像更省只传音频驱动入门体验5090 版TTS(5090)合成(5090)同完整版同完整版RTX 50 系 / CUDA 12.8轻量版用docker-compose -f docker-compose-lite.yml up -d启动。它只有gen-video一个容器没有 TTS/ASR意味着不能文本驱动和克隆声音只能拿现成音频文件驱动数字人——如果只做音频对口型选它最省资源。能力拆解按你想做的事组织3.1 用 10 秒视频克隆一个数字人需要什么输入一段 10 秒左右、正面出镜、人在说话的视频画面声音缺一不可。怎么调客户端首页新增模特选视频即可程序内部自动完成转 H.264、FFmpeg 抽音轨、调声音克隆、入库四步。想走 API 则调 TTS 服务的前处理接口curl -X POST http://127.0.0.1:18180/v1/preprocess_and_tran \ -d {format:.wav,reference_audio:origin_audio/demo.wav,lang:zh}得到什么输出返回asr_format_audio_url和reference_audio_text两个字段这就是你的声音模型凭据后续文本合成必须带上。一个坑点上传的视频必须带人声。常见问题文档明确记录过无声视频会在声音克隆环节失败。别用画面好但静音的素材重录 10 秒说话视频更省事。3.2 文本驱动出片需要什么输入一段文本支持中/英/日/韩/法/德/阿/西 8 种语言客户端lang参数按语言传。怎么调分两步先 TTS 出音频再提交合成curl -X POST http://127.0.0.1:18180/v1/invoke \ -d {speaker:唯一uuid,text:文案内容,format:wav,topP:0.7,max_new_tokens:1024,chunk_length:100,repetition_penalty:1.2,temperature:0.7,need_asr:false,streaming:false,is_fixed_seed:0,is_norm:0,reference_audio:上一步返回的asr_format_audio_url,reference_text:上一步返回的reference_audio_text}拿到 wav 后提交视频合成并轮询curl -X POST http://127.0.0.1:8383/easy/submit \ -d {audio_url:/绝对/路径.wav,video_url:/模特视频.mp4,code:uuid,chaofen:0,watermark_switch:0,pn:1} curl http://127.0.0.1:8383/easy/query?codeuuid得到什么输出query 轮询到code10000且status2时result字段是成品 MP4 相对路径Windows 默认落在D:\duix_avatar_data\face2face\temp下。一个坑点invoke 的参数里topP、max_new_tokens等是客户端写死的同一组取值见 src/main/service/video.js 的调用链照抄最稳自己调采样参数声音相似度会漂移。3.3 音频驱动轻量版唯一玩法需要什么输入任意格式的音频文件 已建好的模特。怎么调跳过 TTS直接把音频路径填进/easy/submit的audio_url。得到什么输出同 3.2成品 MP4。一个坑点lite 版没有 ASR 容器声音克隆接口调不通——想换个音色念新文案必须回到完整版。3.4 批量生成需要什么输入同一模特 N 段文案或音频。怎么调客户端我的作品里逐条添加后统一提交即可无需脚本。得到什么输出任务队列按 waiting → pending → success/failed 流转客户端每 2 秒轮询一次合成服务更新进度轮询逻辑见 src/main/service/video.js。一个坑点合成任务是串行的——GPU 只有一个一次只跑一个 pending 任务。排队中的条目进度显示第 x / n 个这不是卡死别重复提交。硬件门槛与性能实测配置档位显存内存磁盘说明最低8G社区反馈 3060 可用32G16G 实测 ASR 可能起不来C 盘 100G D 盘 30G能跑通完整流程推荐官方标注RTX 407032G 及以上100Gi5-13400F 级别 CPU高性能RTX 509032G 及以上100G用 5090 专用镜像torch 预览版实测与社区反馈三条我们实测首次docker-compose up -d拉取三个镜像总流量约 70G按 README 口径普通宽带约半小时断网状态下服务照常出片。社区反馈8G 显存RTX 3060可跑通完整流程模型核心包体积约 10G该数据出自社区共创教程视频口径官方文档对 C 盘的建议仍是预留 100G保守起见按官方来。我们实测服务端刚启动完立刻克隆形象日志报Connection refused——ASR 服务冷启动慢等几分钟再试即恢复这是 常见问题 里记录得最完整的一条。结论如果你的机器是 8G 显存 32G 内存选完整版只做音频驱动选 lite50 系新卡直接上 5090 方案不要混用默认镜像。落地场景6.1 内容生产某课程团队批量产口播课角色与目标课程团队每周要更新 3 节录播课传统方式需预约演播室、逐节录制。用了什么能力克隆讲师一次10 秒素材之后每节课只改文本文本驱动出片。结果数据源视频 10 秒成品长度由文案决定8 种语言里中文、英文课程文案可直接混排同一模特复用不限次数。录一次素材之后出片只改文稿演播室的钱没再花过。6.2 企业商用某公司的内部产品宣讲视频角色与目标企业需要产品宣讲视频且内网环境不允许素材上云。用了什么能力全离线部署三个本地容器 中英双语文本驱动。结果数据拍摄素材与成片全程不出内网商用授权方面开源版支持免费商用但用户量超 10 万或年营收超 1000 万美元的企业需另签商业许可LICENSE 口径中小规模可直接商用。IT 部门验收的核心就一条断网能跑这条 Duix.Avatar 过了。6.3 个人创作一位独立开发者做多语言短视频角色与目标独立开发者想把一条技术教程视频做成多语言版本投不同平台。用了什么能力建一个数字人模型文本驱动分别生成中、英、日、西等版本不需要 TTS 的部分比如配音用 AI 语音工具出的成片走音频驱动连 lite 版都够用。结果数据一个模型文件8 语言文案各自出片无需重录。以前做双语版得自己配音录两遍口播现在一个 wav 进去、两个语言版本出来。排错手册Q1部署docker pull/docker-compose up报Client.Timeout exceeded判断看报错是否含registry-1.docker.io连接超时——是则为网络到 Docker Hub 不通。解决在 Docker 守护进程配置/etc/docker/daemon.json里加registry-mirrors镜像源数组重启 Docker 再执行up -d国内环境这是最高频的失败点官方 FAQ 里专门列了可轮换的镜像源清单。Q2部署容器起不来或起来后马上退出判断先docker ps -a看哪个容器异常再nvidia-smi确认显卡与驱动——本项目三个服务全部依赖 GPU无 NVIDIA 卡/驱动时必挂。解决装好 NVIDIA 驱动后在deploy目录重新执行docker-compose up -d50 系卡记得换docker-compose-5090.yml。Q3运行时新增模特报Connection refused判断看 gen-video 容器日志是否含建立funasr连接异常[Errno 111]——是则 ASR 服务还没冷启动完成。解决服务端启动后等几分钟再克隆若等待超过 10 分钟仍复现检查内存是否只有 16G16G 机型可能直接起不动 ASR。Q4运行时克隆形象失败没有明确报错判断确认源视频里人在说话且有声——静音视频会在声音克隆环节静默失败FAQ 记录的原始 case。解决重录一段 10 秒带人声的正面视频。报错细节可从客户端日志目录翻客户端设置页可打开日志文件夹再配合 Docker 里三个容器的日志定位到具体服务。Q5效果口型同步效果不够理想判断对比源视频与成片的口型错位程度重点看源视频本身——光线、角度、人脸占比。解决换素材重录光线充足、正对镜头、背景简单、人脸占画面比例大。口型质量的上限由克隆素材决定先修素材再谈效果。下一步服务端升级在deploy目录重跑docker-compose up -d拉取新镜像客户端升级从项目 Release 页下载最新安装包覆盖已支持RTX 50 系显卡5090 测试通过、Ubuntu 22.04、客户端英文界面能力边界非实时视频合成实时对话交互走官方云服务不在开源版范围内问题反馈项目 Issue 页持续更新提问前先看 FAQ 自查清单Duix.Avatar 的更新频率不低跑通之后遇到问题先查 常见问题 再提 issue发现新坑或者想要新能力直接在 Issue 里说社区响应比想象中快。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表