
video-analyzer 视频内容分析一条命令把任何视频变成一份可搜索的文字报告【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzervideo-analyzer 是一个开源的视频内容分析工具只需一条命令就能自动提取视频关键帧、转写全部语音并借助视觉大模型生成结构化的内容报告。它把看画面、听声音、组织语言三件事全部交给 AI让一段无法检索的视频变成一份随时可读、可搜、可复用的文字档案。先讲一个找东西的尴尬故事去年夏天某电商团队接到一个看似简单的任务老板想确认半年攒下的 60 多条产品演示视频里究竟哪一条展示过批量改价功能。听起来不难把视频一条条拖进播放器、拖动进度条、快进、回放、再快进。两小时后功能找到了可这位同事已经再也不想点开任何视频。更让人窝火的是——这些素材她其实全都看过画面里的每一个细节都真实存在却像一盒没有目录的老磁带内容都在就是找不着。这几乎是所有视频工作者的共同处境视频记得一切却说不出来。它没法被搜索没法被摘要没法被快速理解。时间轴是它唯一的目录而你要找的那一句话、那一帧画面可能就藏在第 47 分钟和第 12 秒之间。视频为什么总是装傻差的就是一层理解文档能检索、能划线、能摘录是因为它生来就是文字。而视频是画面与声音交织的信息流人看的时候能懂机器却默认看不懂。video-analyzer 想解决的正是这层懂。它是一个视频内容分析工具把一整段视频拆成两条线索语音交给 Whisper 转写成带时间戳的文字画面则提炼成若干关键帧随后视觉大模型逐帧解读每看一帧都带着前面所有帧的笔记保证叙事连贯最后把帧笔记和转录文本拼在一起生成一段完整的视频描述。整条流水线不需要你手动参与一条命令跑到底看不懂这张图也没关系你只需要记住结论视频进去报告出来。10分钟跑通第一次视频内容分析完整上手步骤以一个本地运行的场景为例全程三组命令。第一步拉代码、装依赖git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate pip install .别忘了先装好 FFmpegUbuntu 执行sudo apt-get install ffmpegmacOS 执行brew install ffmpeg它是音频提取的底层依赖。第二步拉起本地视觉模型ollama pull llama3.2-vision ollama serve默认方案走 Ollama 本地推理数据不出本机、无需任何 API Key。机器显存不够后面有替代方案。第三步运行分析video-analyzer demo_video.mp4喝杯咖啡的工夫output/analysis.json就会出现在你的目录下。打开 analysis.json看看 AI 替你看到了什么这份报告是标准的 JSON包含四个板块完整示例可参考项目里的 docs/sample_analysis.json技术元数据记录客户端、视觉模型、Whisper 模型、处理帧数等运行信息方便复现与审计语音转录全文文本加带时间戳的段落切分能精确定位任意一句话发生的时刻逐帧解析每一帧的场景、动作、新增信息与前后文衔接点构成完整的画面叙事视频描述综合画面与语音的最终结论直接回答这段视频到底讲了什么。这份产出既是给人读的摘要也是能被其他程序消费的数据接口。做内容检索、素材归档、自动剪辑它都能当现成的数据底座。五个高频疑问一次说清Q1没显卡、显存不够还能用吗能。切换到 OpenRouter 等 OpenAI 兼容接口即可比如用 llama 3.2 11b vision 的免费档位把看画面交给云端本地只负责跑转写。Q2语音转写不准怎么办--whisper-model large换更大模型--device cuda用 GPU 加速。它的质量自检机制会在语音模糊时主动降低转录结果权重而不是硬塞一段错误百出的文字进结论。Q3一小时的长视频处理会不会很久--max-frames可以限制分析帧数候选帧会均匀铺满整段视频--duration可以只分析前 N 秒先看效果再决定要不要跑完整片。Q4跑到一半断了要重新来吗不用。--start-stage 2可以从帧分析阶段续跑跳过已完成的部分断点续跑很省心。Q5必须联网吗二选一。Ollama 本地模式完全离线需要速度时再走 OpenAI 兼容接口。详细参数对照表在 docs/USAGES.md。进阶玩法让分析长出眼睛和耳朵默认配置适合大多数场景但工具真正的功力在于可调。想让它聚焦特定维度加一个--promptvideo-analyzer demo_video.mp4 --prompt 视频中有哪些关键决策你的问题会被注入逐帧分析与最终描述两个环节引导模型往你要的方向使劲。指定语言用--language zh跳过自动检测想要更快的云端分析加--client openai_api --api-key 你的Key --api-url 云端地址 --model 模型名。再进一步项目还附带了一个提示词自动调优模块 video-analyzer-tune你先跑几条视频、手动改一改报告里理想答案的样子它就会用 DSPy 的 MIPROv2 优化器自动找出更好的提示词指令产出的新提示词文件通过配置指向即可主包完全不受影响。相当于给分析工具请了一位教练。三个最值得动的配置旋钮需要微调时打开 video_analyzer/config/default_config.json最常动的是这三处配置项作用建议frames.per_minute每分钟候选帧数视频越长越保守控制算力开销frames.analysis_threshold关键帧识别阈值越大越挑越小越全audio.whisper_model转录模型精度追求质量调large求快用small配置遵循命令行参数 用户配置文件 默认配置的级联优先级想临时覆盖某个值直接加命令行参数即可改坏了随时回退。最后提醒三句避坑口诀内存管够本地跑视觉模型至少 16GB 内存GPU 建议 12GB 显存以上、先短后长第一次先用几分钟的短片验证效果、FFmpeg 别漏装不上会在音频阶段直接报错。视频不该是只进不出的黑盒。现在就把手边那段一直没时间看的视频拖进命令行跑出第一份属于你的视频内容分析报告——AI 当你的看片速记员随叫随到。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考