免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

ComfyUI + MiniMax-H3 + 加速LoRAs + SageAttention

ComfyUI + MiniMax-H3 + 加速LoRAs + SageAttention 文章目录一简介1.1MiniMax-H31.2对比 LTX-2.51.3lightx2v 的 Turbo LoRA1.4alibaba-pai 的 PDD LoRA二实际运行2.1质量2.2速度2.2.15秒视频不同LoRAs和分辨率2.2.215秒视频不同分辨率2.2.310秒视频PDD不同步数2.2.3Attention Backend三总结一简介1.1MiniMax-H3MiniMax-H3是中国AI公司 MiniMax稀宇科技推出的新一代全模态音视频生成模型。英文名称里的 H3 对应 Hailuo 3.0。目前 H3 的开源权重已于2026年8月发布。它把文本、图片、视频、音频理解以及视频音频生成尽可能塞进同一个 Omni Transformer 体系里。视频和音频 latent 被放进同一个多模态序列中由同一个 Transformer 联合预测而不是“先生成视频再另外生成音频”。另外它的文本理解部分直接使用 Qwen3-VL-32B 的预训练能力并取其中间层表示作为 H3 的条件输入。而且它支持了参考生视频可以选择多个图片甚至视频音频进行参考参考生视频和图生视频是不同的模型文件。新旧LTX和之前比较火爆的Wan开源在ComfyUI官方的工作流里似乎都没有这个功能。和之前的各种生成模型类似ComfyUI官方早已发布了MiniMax-H3的整套量化模型和工作流。1.2对比 LTX-2.5LTX-2.5 来自以色列公司 Lightricks也就是 LTX-Video / LTX-2 背后的团队。其系列最大的特点一直是速度非常快 开源 尽可能把视频生成做成真正可以本地运行、实时交互的系统。LTX-2 开始加入原生 AudioVideo而 LTX-2.5 是后续版本主要升级了文本编码器从 Gemma 3 换成了 Gemma 4 Unified。PSLTX-2.5也是最近发布的生态更成熟可用大多数2.3工作流且也有多主体参考但效果更接近AI网剧就是多人物整体一致性可以保证但细节不如MiniMax-H3的参考而且大家一看就知道是AI做的。PS2这个参考真标准啊……它们的区别在于H3多模态理解、复杂指令、参考素材组合真正的 Omni Transformer让它理解一切然后一起生成。简单点质量高生成慢硬件要求偏高。LTX-2.5速度、效率、编辑控制、本地生态视频和音频虽然要联合生成但它们毕竟是两种完全不同的信号因此让它们各自拥有自己的 stream再通过 attention 交流。简单点生成快硬件要求相对低所以能生成更高分辨率生态丰富。1.3lightx2v 的 TurboLoRA更新后的官方工作流已经默认带有lightx2v 的 TurboLoRA节点了。如果不用加速LoRA那么H3是非常慢的毕竟大家都是20步起步。所以lightx2v提供了图生视频和参考生视频的几个TurboLoRA能大幅减少步数缩短时间。但用了早期的TurboLoRA后画质和生成会略微受到影响。如果是图生视频可能稍好但是参考生视频的4步LoRA有时会出现莫名其妙的其它物体或纹路或变色等。更新目前(2026-09-05)最新的模型是图生视频minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16。图生视频minimax_h3_fl2v_turbo_8step_v1.0_768p_comfyui_bf16。参考生视频minimax_h3_ref2v_turbo_8step_v1.0_768p_comfyui_bf16。更早的版本不推荐了后面我们会用参考生视频的LoRA来对比一下PDD毕竟都是8步。举个例子参考生视频的部分工作流程见图这里可能比官方的流程简化了一点就是没有TurboLoRA的开关流程如下1.4alibaba-pai 的PDDLoRA和上面的用普通LoRA加载器串到模型后面采样器前面就行的Turbo LoRA不一样。这个拼多多……咳咳我是说 PDDLoRA并不是单纯的LoRA。因为它的权重里除了LoRAtrunk还有PDD的 head bank。官方实现中这个 head bank 是按照不同 denoising interval 专门训练的。ComfyUI节点会根据当前 sigma选择/融合对应的 head。这和普通 TurboLoRA有一个很重要的区别TurboLoRA主要是在模型内部改变行为PDD进一步针对“某一个采样区间应该输出什么”进行专门蒸馏。所以除了PDD模型你需要安装相关的拼多多节点到ComfyUI中。如果从官方工作流出发需要稍微修改一点点流程删除TurboLoRA所用的LoRA加载器节点左上。增加Sigma Shift节点左上。删除原有的基本调度器节点右下。增加MiniMax-H3-PDD-Acc节点右下。如下正中间那坨棕色的是说明不是工作流的一部分。实在没地方放正好中间比较空而已。企图乱调参数之前可以很方便的先看到说明。二实际运行大家都知道我已经好些年没钱升级电脑了硬件配置总是不变的i9-12900f64GB4060-Ti16-GB。2.1质量试了好几次PDDLoRA换了不同的素材结果比较稳定。当开4步的时候画面偶尔会出些问题——虽然4步也是官方认可的 regrouping。但开8步则几乎每次生成的结果都很不错。当然也有偶尔参考不准确的情况但是抽卡成功率已经大大提升了。最关键的是没有出现之前尝试 TurboLoRA带来的无关图案乱入莫名出现纹理或特效突然大面积变色背景物体诡异移动……等等问题。更新TurboLoRA新的8步参考模型未出现之前旧版4步的问题。目前观察到的提示词和画面质量等似乎是同一个水平。本文中没有视频例子T_T。2.2速度2.2.15秒视频不同LoRAs和分辨率首先更新个短时间的看看原版20步和两个LoRA的速度差异都是5张参考图。参考生视频24帧/秒x5秒生成时长格式是时:分:秒。目测两者生成质量区别很小并且和预料的一样PDD要慢些。加速LoRA960x5441376 x 7681664 x 9281920 x 1088turbo_8step_v1.0_768p5:2915:2529:1948:21PDD8步6:0216:14--无LoRA 20步11:47---2.2.215秒视频不同分辨率再看看PDD的长视频和分辨率情况。参考生视频24帧/秒x15秒加速LoRA分辨率时长PDD8步960x54422:35PDD8步1056 x 60831:42PDD8步1152 x 64039:552.2.310秒视频PDD不同步数最后试试PDD的步数。不过意义不太大因为实测4步和6步的成功率都不太靠谱只能8步。参考生视频960x544x24帧/秒x10秒加速LoRA4步6步8步PDD6:449:4712:00总的来说速度确实比LTX慢不少。在同样硬件和提示词下影响生成速度的主要3方面。视频时长非等比例增加比如1376 x 7685秒只需15分钟7秒22分钟15秒则120分钟。分辨率非等比例增加这个从上表看得出来。参考图片数量影响较小但是较多的参考会让速度更加慢一点。生成速度的增加明显不是简单线性关系而是受到 attention 和显存/内存系统共同影响的超线性函数。看资料说首个开源版本目前只有 full-attention inference稀疏 attention 实现尚未随首个开源版本发布。反正硬件变不了可能咱需要继续关注SageAttention/ VSA / 官方新模型是否有稀疏注意力机制这类优化。2.2.3Attention Backend更新既然提到了注意力机制。那就补充一个SageAttention的测试吧。偶然发现我目前的硬件CUDAPythonTorch条件下SageAttention官方是有wheel的。工作流也仅需要增加Patch Sage Attention KJ一个节点如图。因为本次测试的参考素材和提示词和之前测试不同所以请别和上面的测试结果进行对比。参考生视频turbo_8step_v1.0_768p24帧/秒x5秒分辨率SagePyTorch(默认)整体加速采样阶段加速960x544201 秒244 秒17.6%≈21%1376×768543 秒707 秒23.2%27.5%1664×9281075 秒1444 秒25.5%28.7%可以看到随着分辨率提高采样阶段时间变长SageAttention带来的加速效果也越明显。不过比较遗憾的是在分辨率稍高生成10秒视频时SageAttention的速度变得飘忽不定。而生成15秒视频时则会卡死在denoise阶段进度条永远都是0%。研究了相关的节点后发现无论是KJ的Minimax Sage节点还是第三方的Sage内存相关节点只要加入工作流就会造成CUDA无法显示原因的报错。确认 Pytorch 和 Flash Attention 都没这个问题与GPT讨论也无果。所以只能暂且搁置。呃再严谨一点并不是单独的时长而是分辨率x时长超出某个范围或阈值时会出问题低分辨率比如960x540 15秒就是OK的。三总结阿里巴巴的人工智能平台带来的拼多多……PDDAcc LoRAs在保证了质量的情况下进行提速。大幅增加了抽卡成功几率速度也过得去值得用。新的参考生视频的lightx2v的 8步 TurboLoRA质量也明显提高了值得进一步关注和对比。在Windows下安装SageAttention变得很容易加速效果明显且画面质量和提示词遵从等无明显影响。
返回列表