
3步把视频背景换干净这个7MB的开源人像抠图工具居然还是实时的【免费下载链接】MODNetA Trimap-Free Portrait Matting Solution in Real Time [AAAI 2022]项目地址: https://gitcode.com/gh_mirrors/mo/MODNet凌晨一点我还坐在剪辑软件前跟一撮怎么抠都抠不干净的发丝死磕。放大、羽化、描边、再放大半小时过去头发边缘还是像狗啃的。如果你也当过手动抠图苦力你应该懂那种绝望。后来有人给我塞了一个叫MODNet的开源项目——一个只有7MB的实时人像抠图模型喂它一张普通照片它就能自动把人和背景分得干干净净。我的第一反应是这么小能行吗抠背景这件事怎么越做越崩溃先聊聊我们的日常。想给视频换个背景主流路子无非几种要么搭绿幕买灯布景把人拍得跟新闻联播似的要么打开修图剪辑软件手动画蒙版一笔一笔描要么花钱用在线工具结果导出还要排队、还要加水印。最气人的是发丝。你以为抠图最难的是身体轮廓不是那一撮在风里飘的碎发。手动工具碰到半透明、带光晕的边缘基本集体投降。于是你开始怀疑人生到底是我的技术不行还是工具不行答案其实是工具不行。因为传统抠图本质上是人教机器怎么抠而我们现在有更好的思路——让AI自己学会抠。第一次见面7MB能行吗MODNet 是发表于 AAAI 2022 的一篇论文的开源实现全称翻译过来是通过目标分解实现的实时无Trimap人像抠图。名词吓人拆开其实就一句话它不需要你手动标注前景、背景和边界区域拿一张普通RGB照片进去alpha遮罩也就是决定每个像素多透明的透明度地图直接就出来了。让我意外的是它的体积。官方在线应用用的模型只有7MB上下却能快速处理2K分辨率的画面普通PC、手机都能跑。你可能没概念同类的深度学习抠图模型动辄几百MB甚至上GB。7MB是什么概念一首高品质MP3的大小。一个模型塞进一个MP3的容量里还能实时跑这个轻量级抠图模型真的把小和快同时做到了。实时这个词也是我一开始低估它的地方。我以为这种AI工具要么吃高端显卡要么得等个几秒才出一帧。结果在普通电脑上CPU都能跑视频也是一帧接一帧地出结果。三行命令把换背景变成默认操作上手比我想象中简单太多整个流程大概三分钟核心就三步git clone https://gitcode.com/gh_mirrors/mo/MODNet cd MODNet pip install -r demo/video_matting/webcam/requirements.txt python demo/video_matting/webcam/run.py第一步克隆项目第二步装依赖第三步直接跑摄像头抠图。就这么简单——别不信我亲眼看着它在自己的电脑上弹出一个窗口左边是摄像头原画面右边是实时抠好的前景背景已经变成了纯色。你人动右边也跟着动几乎感觉不到延迟。✅想试更贴近日常的用法可以用demo/video_matting/custom/里的自定义视频处理脚本把你硬盘里躺着的素材直接丢给它。预训练模型放进pretrained/目录一条命令就能批量换背景。上面这张动图就是最直观的效果左边是原画面右边是MODNet实时抠出来的人像连墙面、灯光都留在背景里。换背景这件事传统做法到底差在哪我懒得列一堆参数表直接说人话传统做法要绿幕、要打灯、要手动画蒙版还要一遍遍处理发丝模型体积大没个像样的显卡连预览都卡。MODNet一张普通照片就能抠发丝边缘自动处理模型7MBU盘拷着走普通电脑CPU也能流畅跑。一句话总结传统做法是在伺候工具MODNet是工具伺候你。这么小的模型凭什么是实时的你可能会好奇7MB凭啥能干这活儿秘密在它的骨架和思路。骨架用的是 MobileNetV2一个为手机而生的轻量级神经网络靠深度可分离卷积这类技巧把计算量压到最低。就好比搬家别人雇了一辆大卡车它开的是小电驴——但路线规划得好送到的东西一点不少。思路上的关键是渐进式特征融合代码在src/models/modnet.py里先用一个分支把握全局——画面里哪里是人再用另一个分支抠细节——发丝、衣摆、边缘这些精细部位最后融合成一个高质量的alpha遮罩。先看全局再抠细节层次分明所以既不丢语义也不糊边缘。想深入研究的可以翻src/models/backbones/mobilenetv2.py和src/models/backbones/wrapper.py里面有骨架和注意力机制的完整实现。不止照片摄像头、批量视频、甚至打包进App这里是我第二次低估它。一开始我以为它顶多处理处理照片结果发现玩法多得很直播/视频会议虚拟背景demo/video_matting/webcam/的摄像头demo开起来就能用背景想换成公司logo、海边、二次元壁纸都行直播时脸和手都不穿帮。批量给视频换背景demo/video_matting/custom/支持处理自定义视频文件录好的素材统一过一遍透明背景的视频直接出片。打包进你自己的应用项目提供了onnx/和torchscript/两个导出目录把模型导出成ONNX或TorchScript格式后就能集成到Web前端、手机App里。onnx/inference_onnx.py里有现成的推理示例。⚡也就是说这个7MB的免费人像抠图工具不只是命令行玩具还能变成你产品里视频背景一键替换的功能模块。动手前你可能会问的三个问题我的电脑跑得动吗没独显也行CPU就能跑只是帧率会低一些有NVIDIA显卡则默认走GPU体验更顺滑。为什么我的视频效果一般项目文档写得很实在人物和背景反差越大、光线越柔和、动作别太猛效果越好。别拿人穿一身纯色衣服在同样纯色背景里动来动去这种极限场景难为它它也只是个模型。想商用或者接到自己的项目里怎么办导出ONNX/TorchScript参考onnx/和torchscript/目录的示例往自己的工程里接就行。今晚就能做的三件事别光看热闹这套工具今晚就能跑起来克隆项目、装好依赖上面的命令复制进终端三分钟搞定环境。开一次摄像头demo不花钱、不绿幕亲眼看看实时抠图四个字到底什么感觉。找一段自己的视频跑custom demo把成果导出发到朋友圈或社交平台——不出意外会有人来问你怎么做到的。那个凌晨我用MODNet五分钟处理完了原本要熬到两点的视频。如今换背景对我来说就是一条命令的事。下一个放下鼠标、告别手动抠图的希望是你。【免费下载链接】MODNetA Trimap-Free Portrait Matting Solution in Real Time [AAAI 2022]项目地址: https://gitcode.com/gh_mirrors/mo/MODNet创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考