
不用联网的AI剪辑OpenChatCut 本地语音转写与 Silero VAD 静音检测完全指南【免费下载链接】OpenChatCutOpen-source, local-first conversational AI video editor with a professional multi-track timeline, Agent Skills, MCP integration, and Remotion rendering.项目地址: https://gitcode.com/gh_mirrors/op/OpenChatCut为什么需要本地语音转写与 Silero VAD 静音检测OpenChatCut 是一款开源、本地优先local-first的对话式 AI 视频剪辑器。它的两大离线超能力正来自本地语音转写ASR与Silero VAD 静音检测️语音转写把你口播视频里的话逐字转成带词级时间戳的字幕与文稿全程不上传任何音频✂️静音检测用 Silero VAD 神经网络精准判断哪里在说话、哪里是死寂一键批量删掉废话间的空气口播视频瞬间变得紧凑。全程无需联网、无需注册任何云端 API素材与文稿都留在你自己的电脑上——这是隐私敏感内容、内网环境或断网条件下做视频的理想方案。本地语音转写Whisper 模型在本地按需运行OpenChatCut 内置了 OpenAI 开源的 Whisper 系列模型提供5 个规格档位在 shared/asr-models.ts 中统一定义模型档位体积适用场景Whisper Tiny约 176 MB最快最省适合低配置设备精度一般Whisper Base约 351 MB轻量均衡日常口播可用转写更快Whisper Small推荐约 1.2 GB多语言识别均衡词级时间戳最稳定Whisper Medium约 1.2 GB精度更高浏览器端 wasm 内存吃紧Whisper Large v3 Turbo约 1.5 GB多语言精度最强桌面端本地推理体验最佳所有档位均支持中文 / English / Italiano / Русский且转写统一走 16 kHz 采样、30 秒分片的推理契约见 shared/asr-inference-contract.ts。模型按需下载不随安装包捆绑打开设置 → 本地模型 → 本地转写即可看到各档位的下载进度模型不随应用捆绑你只下载自己需要的档位下载走应用内置的本地代理通道多源加速并做SHA-256 完整性校验文件缓存在磁盘上之后断网也能用每个档位同时提供 ONNX 与 GGMLwhisper.cpp两种格式供不同推理引擎使用。桌面端双引擎原生 whisper.cpp 与浏览器 ONNX桌面应用会自动挑选最快的引擎原生引擎独立的 Electron 推理子进程直接运行 whisper.cpp。音频先用内置 FFmpeg 解码为单声道浮点 PCM见 desktop/native-asr-pcm.ts再交给 GGML 模型速度最快长视频也从容浏览器引擎网页环境使用 ONNX 模型 WASM如果你的显卡支持还可以开启WebGPU 加速混合精度编码器 fp32 解码器 fp16实测可获得数倍提速引擎选择与开关都在 src/components/settings/LocalAsrPane.tsx 对应界面上完成普通用户只需下载模型 → 打开开关。转写完成后你会得到带词级时间戳的字幕轨道每个词都能点击定位到画面帧这也是后续字幕编辑、关键词高亮、自动剪辑的基础。Silero VAD 静音检测神经网络的语音判定什么是 VADVADVoice Activity Detection语音活动检测回答一个朴素的问题这段音频里人到底在不在说话它比音量小不大智能得多——音乐、掌声、环境底噪、低声耳语靠音量判断都会误伤。OpenChatCut 内置了Silero VAD v5MIT 协议模型文件与 WASM 运行时随应用一起打包在 public/models/silero-vad/ 中零下载、开箱即用推理全部在本地 WASM 完成实现见 src/audio/silero-vad.ts。静音检测的三道保险在 src/audio/silence.ts 与 src/audio/vad.ts 中删除逻辑被设计得相当保守RMS 只提候选不做决定先用 50ms 窗口的能量包络找出相对安静的候选段。参考基准是录音整体响度的 90 分位 相对阈值默认 −26 dB与绝对上限−35 dBFS取较严者防止把本来就安静的录音整段误判Silero VAD 是唯一判据16 kHz 采样、每 512 个样本约 32ms一个窗口逐窗口输出说话概率概率超过阈值才标记为语音间隔不足 2 个窗口约 64ms的语音片段会自动合并避免误切停顿置信门槛 呼吸保留整段证据置信度需 ≥0.65、单段语音置信度也需达标且只在候选静音段与语音段零重叠时才删除删除时两侧还各留150ms 呼吸口只删 ≥600ms的真静音。结果缓存按素材 源版本号绑定同一素材不会重复推理。一句话总结这套保守策略宁可少删绝不误删——音乐、掌声、房间底噪在 VAD 缺席或不确定时永远被保护。实战从导入到一键删除静音三步完成本地语音转写导入口播视频把素材拖入项目本地存储下载转写模型推荐 Small设置 → 本地模型 → 本地转写点击对应档位下载触发转写等待本地推理完成时间线上出现带词级时间戳的字幕轨道。断网状态下同样可用——模型已在你硬盘里。让 AI 智能体删除所有死寂启用设置 → 本地模型 → 本地转写 → 删除静音本地 VAD开关后直接在对话框里对 Agent 说帮我把这条口播视频里的所有静音片段删掉。Agent 会调用remove_silence工具实现见 src/agent/tools/silence-tools.ts对目标片段逐段做 VAD 分析批量生成剪辑并联动后续片段左移闭合空隙整个删除支持一步撤销删错了随时 CtrlZ 恢复。如果开关未启用工具会明确提示你到设置里打开而不是擅自执行——这正体现了它保守删除的设计。工具还支持微调参数thresholdDb更保守的静音阈值、minSilenceMs最短删除时长、padMs呼吸口大小适合对节奏有更高要求的创作者。常见问题 FAQ 我的音频和文稿会被上传吗不会。PCM 解码、VAD 推理、Whisper 转写全部在本地进程/本机浏览器内完成网络请求只出现在首次下载模型时。 我的电脑能跑动吗低配置选 Tiny/Base 档位即可流畅运行桌面端开启原生 whisper.cpp 引擎 Medium/Large v3 Turbo 是性能与精度的最佳组合。 背景音乐会被当成静音删掉吗不会。VAD 只保护人声音乐、掌声等非人声在证据不足时一律保守保留。 完全断网还能用吗模型下载完成后转写与静音删除全流程均可离线工作。写在最后OpenChatCut 用Whisper 本地转写 Silero VAD 静音检测把上传音频到云端这件默认的事彻底反转了数据不出本机AI 剪辑依然又快又准。配合多轨道时间线与 Agent Skills一条口播视频从删气口、加字幕到出成片都可以本地闭环完成。想深入源码可以从以下入口读起转写模型目录与下载清单shared/asr-models.tsVAD 推理与概率合并src/audio/silero-vad.ts静音分析保守策略src/audio/silence.tsAgent 删静音工具src/agent/tools/silence-tools.ts设置面板模型下载/引擎开关src/components/settings/LocalAsrPane.tsx【免费下载链接】OpenChatCutOpen-source, local-first conversational AI video editor with a professional multi-track timeline, Agent Skills, MCP integration, and Remotion rendering.项目地址: https://gitcode.com/gh_mirrors/op/OpenChatCut创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考