
Duix.Avatar 开源数字人实测:本地克隆形象和声音,免费生成口播视频的完整指南【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar我手上有一段对着镜头讲产品功能的 10 秒视频,想让它换着文案一直播下去——每次都重新录口播不现实,而商用数字人 SaaS 按分钟计费,还要把人脸素材传到云端,总觉得不踏实。于是我装上了 Duix.Avatar。它是一套全离线、完全开源的数字人视频生成工具:提交一段带声音的短视频,本地服务就能完成形象和声音克隆,之后用文字或音频驱动数字人口型,免费生成口播视频。全程不联网、数据不出机器,商用免费(用户量超 10 万或年营收超千万美元的企业需签商业许可协议),只跑 lite 版本的话社区实测 8G 显存也能带动。快速上手:三个 Docker 容器拉起本地数字人服务环境要求一句话:Windows 10(19042.1526 及以上)或 Ubuntu 22.04,一块装好驱动的 NVIDIA 显卡,加上 Docker;官方推荐配置是 i5-13400F / 32G 内存 / RTX 4070,硬盘是最容易被低估的部分。项目要求系统Windows 10 19042.1526 / Ubuntu 22.04显卡NVIDIA 显卡 驱动(硬性要求,全部算力在本地)内存推荐 32G,ASR 服务较吃内存硬盘镜像下载约 70G 流量;Windows 下 D 盘需 30G 放数据,C 盘 100G 放镜像拉仓库、起服务就下面几条命令:git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d首次执行会下载约 70G 的镜像,视网速等待半小时左右。在 Docker 里看到三个服务全部 Running,服务端就算就绪了:服务端口职责duix-avatar-tts18180声音克隆与文本转语音(基于 Fish-Speech)duix-avatar-asr10095语音识别(基于 FunASR)duix-avatar-gen-video8383口型匹配与视频合成硬盘紧张可以只起视频合成这一个服务(lite 版):docker-compose -f docker-compose-lite.yml up -dLinux 用户用 deploy/ 下的docker-compose-linux.yml,RTX 50 系列显卡(30/40 系列 CUDA 12.8 也可)则用docker-compose-5090.yml,内容都是一条命令的事。客户端下载官方构建的安装包(Windows 为 setup.exe,Linux 为 AppImage,免安装直接启动)即可;想自己构建的话,仓库里 Node 18 环境跑npm run build:win或build:linux也行。打开客户端就是开头那张图:左侧两个入口,「Create Video」做视频、「Create Avatar」克隆形象,下方是「我的作品」和「我的数字模特」。功能拆解:一次讲清它能做什么10 秒视频克隆形象和声音素材要求很明确:视频必须有声音,且是人在说话。程序先把视频拆成「静音视频 音频」两部分——静音视频作为外貌模型,音频进入克隆流程:FunASR 先把音频内容识别成参考文本,Fish-Speech 再据此学习你的音色。10 秒左右即可,人声越清晰稳定,克隆效果越好。整个过程本地完成,素材不上传任何地方。文字驱动口型:脚本贴进去,MP4 出来做视频时直接粘贴文案:本地 TTS 服务先把文字转成你的「克隆音色」,合成服务再让静音视频逐帧对嘴型,最后输出 MP4。脚本支持八种语言:中、英、日、韩、法、德、阿拉伯、西语。日常口播场景,这条路径基本就是「贴字 → 等 → 下载」。上传音频驱动:保留原声节奏如果文案已经录好(或在音频软件里精修过),直接上传音频驱动,跳过 TTS,数字人对原声做口型。适合想保留原始语气、停顿和呼吸感的场合,比如访谈摘录、配音稿。多模型管理 本地 API:批量生成的入口客户端支持导入和管理多个模型,按用途切换不同的「数字人」。更值得说的是:三个服务都在本机 127.0.0.1 上暴露接口,可以完全绕开界面,按「模特训练 → 音频合成 → 视频合成」的顺序自己串流程。请求的参数实现都写在 src/main/service/ 下的model.js、voice.js、video.js,照抄就能搭一条批量出片管线。场景实操:用一条自我介绍批量出口播视频我做的:用手机录了 15 秒自我介绍,清晰人声、无 BGM;在客户端「Create Avatar」里上传,克隆完成后「我的数字模特」里多出模型卡片,预览确认脸和克隆音色都对了。然后新写一段 300 字文案走「Create Video」,生成的 MP4 里口型与音节对得上,正常语速下看不出明显违和。接着换文案又生成了两条,同一个模型出了三种口播视频。花了多久:真正的大头在第一次——70G 镜像加半小时下载,这是绕不开的前置成本。之后的克隆和每次合成都是本地等待,不产生按量费用。对比按分钟计费的云端方案,量越大账越好算;这套方案的钱换成了硬盘和等待时间。选型建议:谁适合,谁要谨慎适合你,如果你满足:有一块 NVIDIA 显卡,要批量产出口播类视频(课程、产品介绍、公告),且希望人脸素材不出本地——隐私敏感的公司、法务、医疗场景尤其如此。要谨慎的情况:没有 NVIDIA 显卡:三个服务依赖本地 GPU,没有就起不来,这是硬门槛,没有妥协方案。16G 内存的机器:官方 FAQ 明确提示内存太小时 ASR 服务可能起不来,32G 更稳。想要实时交互式数字人(一问一答、实时对嘴):本项目做的是非实时视频合成,实时交互属于官网的另一个产品,别混为一谈。与云端商业 SaaS 相比,一句话取舍:云端口型细节更好、零硬件投入,但按分钟收费且素材要上云;Duix.Avatar 反着来——免费商用、完全离线,代价是自己管硬件和硬盘。如果既想要免维护、又不想放弃能力,官方也提供了 API 服务作为中间选项,见 README_zh.md 中的方案对比。避坑笔记:拉镜像、C 盘空间、克隆报错坑一:docker-compose up -d拉取失败,报context canceled或 registry-1.docker.io 超时。Docker Hub 官方源不稳定。Windows 上在 Docker Desktop → Settings → Docker Engine 里加registry-mirrors镜像源,Apply restart 后重拉:Ubuntu 则往/etc/docker/daemon.json加同样的registry-mirrors配置。镜像源时效性强,失效了换一批最新的即可。坑二:C 盘不足 100G,镜像下载失败或系统卡死。在 Docker Desktop 的 Settings → Resources → Advanced 里,把 Disk image location 指到一个剩余空间 100G 的磁盘文件夹,这是官方文档给出的做法:坑三:新增模特时报file not exists或Connection refused。三个原因按概率排:素材视频没有声音、或不是人在说话(程序要拿素材里的声音做克隆,这是硬性要求);ASR 服务启动较慢,服务端刚起来就点克隆容易失败,等服务几分钟再操作;音频目录没对齐——compose 文件里约定了D:\duix_avatar_data\voice\data,实际路径不一致时 TTS 日志里会刷出 file not exists:拿不准错在哪时,去三个 Docker 服务的 Logs 面板找线索,客户端日志可从界面右上角「设置 → 打开日志」打开,具体案例可翻 doc/常见问题.md。写在最后Duix.Avatar 目前是「数字人克隆 声音克隆 口型合成」这条链路上最完整的开源本地方案:10 秒视频搞定形象和声音,文字、音频双驱动,免费商用,全程离线。如果你手里有一块 NVIDIA 显卡,想批量产出口播视频又坚决不想把人脸素材传上云,值得给它腾出 100G 硬盘试一次——成本都在前端的下载和等待,之后的每一条视频都是免费的。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考