
ComfyUI-KJNodes让 ComfyUI 更快更省心的完整教程【免费下载链接】ComfyUI-KJNodesVarious custom nodes for ComfyUI项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-KJNodes如果你用 ComfyUI 有一段时间多半遇到过这些糟心事批量处理上百张图很慢、显存VRAM即显卡显存占用摸不着头脑、工作流越长线越乱、模型加载的参数散得找不着。ComfyUI-KJNodes 是 ComfyUI 的一个自定义节点包把这些常见痛点做成了一个系列现成节点批量图像处理、模型编译加速、注意力优化、显存监控、子图数据传递Set/Get 节点。装好之后直接在界面里拖出来就能用。这篇文章带你走一遍装好它 → 跑通第一个小例子 → 调性能 → 避坑。它到底能干什么核心功能先扫一眼装之前先看看工具箱里有什么批量图像处理ImageBatchMulti、ImageConcatFromBatch这类节点会把大批次图片自动拆开分批处理适合数据集预处理和批量出图模型加载与组件分离CheckpointLoaderKJ、DiffusionModelLoaderKJ支持 SDXL 多组件分离加载有限显存下也能跑模型编译加速TorchCompileModelFluxAdvancedV2、TorchCompileVAE、TorchCompileControlNet把模型的不同部分分别编译支持多种编译后端显存监控StartRecordCUDAMemoryHistory/EndRecordCUDAMemoryHistory/VisualizeCUDAMemoryHistory三件套可以录制并回放显存使用曲线ModelMemoryUseReportPatch给你实时报告注意力优化SAGE 注意力PathchSageAttentionKJ、NABLA 稀疏注意力NABLA_AttentionKJ主要面向长序列视频生成工作流整理2026 年 3 月重写的 Set/Get 节点系统支持跨子图边界取数还带一批快捷键WidgetToString能把任意节点的参数值读成字符串方便显示和传递更完整的更新记录可以看项目根目录的 README.md里面也有官方安装说明。KJNodes 安装教程3 步装完安装过程本身很简单三步把仓库克隆到 ComfyUI 的custom_nodes目录安装依赖重启 ComfyUI在节点菜单里搜 KJNodes 相关节点命令行版git clone https://gitcode.com/gh_mirrors/co/ComfyUI-KJNodes ComfyUI/custom_nodes/ComfyUI-KJNodes pip install -r ComfyUI/custom_nodes/ComfyUI-KJNodes/requirements.txt如果你用的是 Windows 便携版要改用自带 Python 装依赖在 portable 目录里执行python_embeded\python.exe -m pip install -r ComfyUI\custom_nodes\ComfyUI-KJNodes\requirements.txt。3 分钟跑通第一个工作流装完之后先跑个最小例子确认环境没问题。用 Get Model Name 读出模型信息以加载 SDXL 模型为例。把加载节点的输出接到Get Model Name节点就能拿到工作流里任意节点的 ID 和参数名比如base_ckpt_name再喂给 Show Text 显示出来。调试的时候特别好用一眼看出当前实际生效的是哪个 checkpoint。上图是 Eff. Loader SDXL 节点左侧来自另一个插件加载 SDXL 模型基础模型、refiner、VAE 等参数一目了然右侧Get Model Name按 ID193读出了 #193 节点的base_ckpt_name取值Show Text 把结果直接打在画布上。WidgetToString把参数值变成字符串WidgetToString解决更麻烦的场景你想读的不是节点 ID而是某个非字符串参数比如下拉框选项。填上目标节点的 id 和参数名widget_name输出就是一个 STRING可以接到任意显示节点。图中WidgetToStringid2读出 Load Checkpoint 节点的ckpt_name参数Show Text 里直接显示 1_5\photon_v1.safetensors——核对加载的文件对不对比反复点开参数框快得多。Set/Get长工作流的生命线工作流一旦超过几十个节点线多到打架就难免。KJNodes 的 Set/Get 系统就是干这个的数据放进 Set 节点从 Get 节点取出来物理连线不用横穿全屏。2026 年 3 月的更新还支持跨子图边界——父图里 Set子图里 Get。常用快捷键CtrlShiftS给选中节点添加 SetCtrlShiftG在光标处添加 GetCtrlShiftL临时显示全部虚拟连线双击 Get 节点直接跳到对应的 Set 节点显存不够时这样配性能调优实战这是 KJNodes 最能体现价值的部分。参考文章给出的测试环境是 RTX 4090、24GB 显存几个有出处的数字图像批处理处理 100 张 512×512 图片速度快 42%显存占用降 28%视频生成生成 30 秒 1080p 视频推理时间少 35%显存峰值低 31%模型编译首次编译比平时慢 15% 左右之后的推理速度快 48%三类优化的大致收益对比优化策略显存降低速度提升最适合模型编译15–25%30–50%大规模批处理注意力算法20–35%25–40%长序列视频生成内存管理30–45%10–20%显存有限的环境批量处理25–40%40–60%数据集预处理编译后端选对才算数TorchCompileModelFluxAdvancedV2支持多种编译后端选择逻辑很简单InductorNVIDIA RTX 系列用性能最好NNCAMD 和 Intel 显卡用跨平台兼容性好AOT-Eager调试和开发环境用注意力算法按任务挑SAGE 注意力追求出图质量时用NABLA 稀疏注意力长序列视频显存占用明显更低Flash 注意力实时场景推理速度最快先监控再动手调不确定显存在哪被吃掉时先在待测段落前后各放一个StartRecordCUDAMemoryHistory和EndRecordCUDAMemoryHistory再用VisualizeCUDAMemoryHistory回放曲线。视频类工作流还可以试试WanVideoTeaCacheKJ它做时间缓存跳过重复计算。KJNodes 和原生节点的区别 常见坑一句话总结区别原生节点是功能积木KJNodes 是积木之上的工程工具——批量、编译、监控、工作流组织这些在原生 ComfyUI 里点不出来。容易踩的坑提前说别把编译当瞬时的第一次运行要做完整编译比不编译还慢后面的运行才快。别拿一次性测试下结论。编译后端别选错生产环境用 AOT-Eager、NVIDIA 卡上选 NNC都是白亏性能。批量节点不是万能加速ImageBatchMulti是分块处理的批次越大收益越明显只处理两张图原生节点照样快。Set/Get 复制粘贴后注意命名粘贴 SetGet 对时 Get 节点会跟着 Set 的改名走比如MODEL变MODEL_0避免重名冲突想转回普通连线右键 Set/Get 节点即可。显存监控节点有开销录制回放本身占一点资源测完记得摘掉。收尾把要点带走ComfyUI-KJNodes 解决三类事大批量图跑得快、推理提速、长工作流可读。建议路径是先装好跑通一次模型信息读取的例子再按你的硬件挑编译或监控节点。等工作流越长Set/Get 和子图支持会成为你最高频的功能——这也是 KJNodes 和原生节点最大的差异所在。【免费下载链接】ComfyUI-KJNodesVarious custom nodes for ComfyUI项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-KJNodes创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考