免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

如何 30 分钟拥有自己的数字人:Duix.Avatar 开源本地部署完整教程

如何 30 分钟拥有自己的数字人:Duix.Avatar 开源本地部署完整教程 如何 30 分钟拥有自己的数字人Duix.Avatar 开源本地部署完整教程【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想出镜却没空拍或担心外包数字人报价动辄上万、资料还要交给第三方Duix.Avatar 是一款免费开源、完全在本地运行的数字人工具你只需提供一段 10 秒的真人视频它就能克隆你的形象和声音输入文案即可生成口型对齐的口播视频全程离线素材和成片都不会离开你的电脑。下文按查硬件 → 起服务 → 造数字人 → 排故障的顺序带你走一遍跟着做完你就能在自己机器上产出第一条数字人口播视频。30 分钟快速部署让 Duix.Avatar 跑起来先查硬件与磁盘空间你的机器能跑吗先看这四项CPU 推荐 13 代 Intel i5-13400F 起步内存 32GB 是硬性要求显卡需要 NVIDIA 并装好驱动推荐 RTX 4070。驱动装完后在终端敲nvidia-smi能显示显卡信息就过关。⚠️ 没有 NVIDIA 显卡或没装驱动三个核心服务根本起不来——这个项目的所有算力都跑在你本地显卡上。磁盘是第二容易踩的坑数据盘Windows 下就是 D 盘存模型、音色和作品需要 30GB 以上空闲存放 Docker 镜像的盘需要 100GB 以上。C 盘不够时可在 Docker Desktop 的 Settings → Resources 里把 Disk image location 挪到空闲空间充足的磁盘。一键启动 Docker 服务Windows 先装好 WSL 和 Docker Desktop装 WSL 只需要两条命令wsl --install wsl --updateUbuntu 22.04 则用 apt 安装docker.io和docker-compose再装好 NVIDIA 显卡驱动与 NVIDIA Container Toolkit。然后拉取仓库、一行命令启动服务端git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d这一步会下载约 70GB 镜像全程半小时左右建议连着 WiFi 等待。✅ 成功标志Docker 里出现三个服务且全部 Running——duix-avatar-asr语音识别端口 10095、duix-avatar-tts声音合成端口 18180、duix-avatar-gen-video视频合成端口 8383。你可以把它们理解成一家小饭馆的三个岗位一个负责听、一个负责说、一个负责做菜缺任何一个都上不了桌。安装客户端并验证从官方 releases 下载构建好的安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Linux 直接双击 AppImage 运行即可。客户端打开后能正常显示服务状态就算部署完成。Ubuntu 下如果以 root 用户双击 AppImage 无法启动改到终端执行并加--no-sandbox参数。数字人克隆与口播视频核心功能怎么用克隆模特10 秒视频做出你的数字分身素材要录多长10 秒就够。在客户端首页点 Create Avatar上传一段正面说话的视频系统会把它拆成无声画面 声音两部分画面用来训练你的面部形象声音用来训练音色。⚠️ 注意这段素材视频必须有人声且在说话程序要靠这个声音做音色克隆传一段纯 BGM 或静音视频会直接报错。声音克隆与文本转语音训练完成后相当于你给自己留了一份声音样本今后任何文字都能用你的语气读出来。在客户端输入文案系统调用本地 TTS 服务合成语音也支持直接上传自己的音频文件。脚本支持中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语 8 种语言同一段稿子可以轻松做出多语言版本。生成口播视频选好已克隆的数字人 音频合成的或上传的系统自动对齐口型并输出成片作品会出现在 My Works 列表里随时回放、继续管理。整个过程就像在家自拍自拍剪片素材从头到尾没有出门这也是它和云端服务最大的区别。如果你想把它接进自己的产品而不是用图形界面项目把训练与合成能力做成了本地接口视频合成走http://127.0.0.1:8383/easy/submit语音合成走http://127.0.0.1:18180/v1/invoke调用示例可直接参考 src/main/service/video.js 和 src/main/service/voice.js。进阶调优按硬件选版本与参数三档部署组合怎么选不是人人都有高端配置deploy 目录里备好了三套方案你的情况配置文件启动命令说明完整体验形象声音克隆合成deploy/docker-compose.ymldocker-compose up -d3 个服务下载约 70GB只要视频合成配置较低deploy/docker-compose-lite.ymldocker-compose -f docker-compose-lite.yml up -d仅 1 个服务音频需自备RTX 50 系显卡5090 实测30/40 系 CUDA 12.8 也可用deploy/docker-compose-5090.ymldocker-compose -f docker-compose-5090.yml up -d基于 torch 预览版三个值得动的旋钮内存16GB 内存的机器 ASR 服务可能直接起不来32GB 是官方红线显存吃紧时这是第一嫌疑端口8383 / 18180 / 10095 若与本地其他软件冲突直接在对应 compose 文件里改端口映射即可数据目录模型与音色产物默认落在D:\duix_avatar_dataWindows或~/duix_avatar_dataLinux目录约定写在 src/main/config/config.js 里 服务端升级很简单拉取新代码后回到 deploy 目录重新执行docker-compose up -d无需卸载重装。落地场景谁在用它解决了什么问题个人创作者形象克隆一次后续口播全由你完成不用出镜、不用补拍账号人设保持一致拍摄成本趋近于零多语言内容分发同一份文案用 8 种语言合成语音再搭配克隆好的形象批量出口播视频一个人顶一个多语言内容小组企业内训与产品文档把长文档变成数字人讲解视频员工看视频比啃文档效率高由于全程本地部署内部资料不出内网合规压力小很多高频问题速查四个常见报错怎么解遇到报错别慌先对照下表症状原因解法docker-compose up -d报 request canceled / 超时Docker Hub 官方源不稳定开全局网络或给 Docker 配置国内镜像源见下图新增模特时报错素材视频没有人声重拍一段人在说话的视频声音是音色克隆的原料定制模特报 Connection refusedASR 服务启动慢操作太早服务端起来后等几分钟再克隆客户端连不上服务 / 效果异常版本过旧或服务未全部 Running回 deploy 目录重跑docker-compose up -d确认三个服务均 Running排查时记得先收集两份日志客户端日志在首页右上角设置里点 Open Log服务端日志在 Docker 中点开对应服务复制。其中 TTS 服务日志里的 file not exists 最常见多半是音频没落到约定的voice/data目录先检查该目录完整的问题清单与自查步骤见 doc/常见问题.md。写在最后Duix.Avatar 的价值可以概括成一句话用一台带 NVIDIA 显卡的电脑和 10 秒视频换一个长得像你说得像你的本地数字人。现在就动手对照第一节的配置表检查机器用一行docker-compose up -d拉起三个服务今晚你就能生成第一条属于自己的数字人口播视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表