免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

ComfyUI 文生视频、图生视频:一条能跑通的实战路线

ComfyUI 文生视频、图生视频:一条能跑通的实战路线 ComfyUI 文生视频、图生视频一条能跑通的实战路线【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapperComfyUI-WanVideoWrapper 是 WanVideo 系列模型在 ComfyUI 里的官方包装器把 AI 视频生成——文生视频、图生视频、音频驱动——接进了你熟悉的节点界面。读完这篇你会装好环境、跑通第一条 81 帧短片并知道显存吃紧时该拧哪个旋钮。装好环境一条主线就够仓库克隆到custom_nodes目录、装依赖两步完成git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper ComfyUI/custom_nodes/ComfyUI-WanVideoWrapper cd ComfyUI/custom_nodes/ComfyUI-WanVideoWrapper pip install -r requirements.txt便携版用户不用额外操作装依赖那一步换成python_embeded\python.exe -m pip install -r ComfyUI\custom_nodes\ComfyUI-WanVideoWrapper\requirements.txt即可。模型文件按类型放进三个目录模型放置位置文本编码器umt5-xxlmodels/text_encoders视频主模型T2V / I2V transformermodels/diffusion_modelsVAEmodels/vae图生视频还需要 clip vision 模型放models/clip_vision。新手第一站建议从 1.3B 规格起步模型小、出片快先把流程走顺再上 14B 谈质量。 跑通第一条 81 帧短片导入 wanvideo_2_1_14B_I2V_example_03.json 这条图生视频工作流。它自带一张人像素材把 LoadImage 节点换成你自己的照片就行其余全部保持默认。只需要动的参数WanVideoEmptyEmbeds决定分辨率和帧数默认 832x480x81 帧直接保留steps工作流里设了 4是因为挂了 Lightx2v 加速 LoRA你不挂 LoRA 就拉回 30。点 Queue Promptoutputs 目录会出一个 16fps、81 帧的 mp4。首帧几乎不动、整体幅度小是正常的——I2V 默认把运动压得很克制留到打磨阶段再放开。按你的目的选路三条主路按目的挑一条手里没有素材想凭描述出片→ 走文生视频导入 wanvideo_2_1_14B_T2V_example_03.json。关键参数是 WanVideoEmptyEmbeds 的分辨率与帧数832x480x81 是默认起点提示词写进 WanVideoTextEncode 节点。避坑T2V 出静止画面的概率明显更高提示词里点明运动主体和方向负面提示保留模板里静止不动那几句。有照片想让它动起来→ 走图生视频就是上一条工作流。想生成更长内容就在 81 帧之上接上下文窗口节点分段。避坑输入图和目标宽高比差太远时首帧会出现拉伸先裁图再喂。要角色说话、音画同步→ 走音频驱动导入 wanvideo_2_2_5B_Ovi_image_to_video_audio_example_01.json提示词里用S台词内容E标出要说的话。这条流挂 50 步、992x512x121 帧是三条里最重的。避坑除主模型外还要下 Ovi 音频模型和 MMAudio VAE缺哪个节点就报哪个。显存吃紧时的三张牌现象通常是两种跑到一半 OOM或者换输入尺寸后第一次运行显存暴涨。第一张牌块交换。WanVideoSetBlockSwap 节点把部分 transformer 层留在内存、按需换入显存用速度换显存。参考数字512x512、81 帧交换 20/40 块14B 模型大约 16GB 显存能跑。卡越小换得越多速度相应往下掉。第二张牌清编译缓存。现象新尺寸首跑显存暴涨再跑一次就正常。原因旧 triton / torchinductor 缓存。动作清掉C:\Users\用户名\.triton和C:\Users\用户名\AppData\Local\Temp\torchinductor_用户名里的内容Windows 上最常见。第三张牌挂 LoRA 后多换两块。现象加 LoRA 之后显存变多。原因新版把未合并的 LoRA 权重绑进块里一起交换。动作补交换块。例1GB LoRA、换 20 块时单块增大 25MB20 块共多占 500MB交换块数加 2 就能拉平。一个可对照的实数据RTX 5090 上 1.3B T2V 模型、窗口 81 帧、重叠 16 帧生成 1025 帧用了不到 5GB 显存、耗时 10 分钟。把结果打磨得更好压步数上 TeaCache阈值设 0.25-0.30新版阈值是旧数值的 10 倍start step 从 0 开始再激进就可能跳步毁掉前几帧的运动。先小后大512x512 验证构图和运动满意了再上 832x480 或 720P省下的都是完整的生成时间。同参数多跑几次diffusion 本身有随机性固定提示词换 2-3 个种子挑一条比反复调参数更划算。长片别硬生超过 81 帧就用上下文窗口分段窗口 81、重叠 16别一口气拉几百帧。接下来试什么下一步从 example_workflows/ 目录里的wanvideo_1_3B_EchoShot_example.json开始换场景试1.3B 出片快适合试错。卡住时先看 readme.md显存说明和 LoRA 换块计算都是第一手资料比到处搜帖子省事。【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表