免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

多图一次看懂:North Micro Vision Instruct 多图像理解完整指南

多图一次看懂:North Micro Vision Instruct 多图像理解完整指南 多图一次看懂North Micro Vision Instruct 多图像理解完整指南【免费下载链接】North-Micro-Vision-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/CohereLabs/North-Micro-Vision-InstructNorth Micro Vision Instruct 是 CohereLabs 开源的 2.4B 参数视觉语言模型Apache 2.0 协议核心亮点是多图像理解能力可在一次对话中同时输入多张图片让模型进行对比、归纳与问答。它支持原生分辨率输入、11 种以上语言以及 OCR、图表、文档分析、视觉定位等任务是普通用户和小团队快速搭建多模态应用的高性价比选择。本文将带你从零开始用最快的方式跑通这个多图像理解模型。North Micro Vision Instruct 是什么多图像理解模型新选择简单说它是一双能看懂图片的 AI 眼睛 一个会说话的大脑。与常见的单图模型不同North Micro Vision Instruct 原生支持多图输入你可以把多张照片、多页截图或一组对比图一起丢给它再提问哪张图更清晰两张图的区别是什么这类跨图问题。关键属性数值模型总参数量2.4B语言模型 2B 视觉编码器 400M上下文窗口语言骨干 128K tokens多模态训练上下文8K tokens支持的输入交错文本与图片支持语言中、英、德、法、日、韩、阿拉伯等 11 种开源协议Apache 2.0多图像理解能力一览一次能看懂什么多图对比与跨图视觉问答同时输入多张图片模型会自动理解图与图之间的关系适合商品对比、方案比选、多图找不同等场景。这是它区别于多数单图模型的核心能力。原生分辨率输入细节不丢失传统视觉模型常把图片压缩成固定尺寸导致小字、细线丢失。North Micro Vision Instruct 采用原生分辨率处理保留原始宽高比与细节在 OCR 和文档理解上尤其占优。相关配置可查看preprocessor_config.json。OCR、图表与文档理解官方评测中它在 DocVQA 上达到 0.921、ChartQA 达到 0.808读取票据、解析报表、总结论文图表都表现稳定对新手做截图问答非常友好。视觉定位与空间理解模型可输出归一化 0–1000 的边界框坐标[x1, y1, x2, y2]乘以图片宽高即可还原像素坐标实现指哪打哪的定位能力可用于目标检测类原型开发。快速开始多图像理解模型的安装步骤第一步安装依赖首先安装 PyTorch然后安装运行时依赖与 Transformers需 5.16.0 及以上版本pip install accelerate pillow pip install transformers5.16.0如果你的显卡支持 CUDA 且想提速可额外安装 Flash Attention 2pip install flash-attn --no-build-isolation第二步加载模型并做多图推理以下是最简推理代码来自项目README.md的 Quickstart 示例支持在 messages 中交错放置多张图片from transformers import AutoModelForImageTextToText, AutoProcessor model_id CohereLabs/North-Micro-Vision-Instruct processor AutoProcessor.from_pretrained(model_id) model AutoModelForImageTextToText.from_pretrained( model_id, dtypeauto, device_mapauto ) messages [ { role: user, content: [ {type: image, url: 图片A的地址}, {type: image, url: 图片B的地址}, {type: text, text: 对比这两张图告诉我主要区别}, ], } ] inputs processor.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, return_tensorspt, return_dictTrue, ).to(model.device) outputs model.generate(**inputs, max_new_tokens128, do_sampleTrue, temperature0.7, top_p0.8, top_k20)生成参数temperature 0.7、top_p 0.8、top_k 20已内置在generation_config.json中与官方推荐一致。若想要确定性输出改为do_sampleFalse即可。多图像提示词的高效写法用好多图像理解关键是提问清晰、任务明确✅ 对比型图一和图二的构图哪个更平衡✅ 归纳型这 3 张截图分别是什么页面✅ 定位型在图中找出红车的位置输出边界框坐标❌ 模糊型看看这些图缺少指令模型难以聚焦聊天模板规则见项目中的chat_template.jinja图片会自动被替换为|IMAGE_PAD|占位符并走视觉编码流程。模型架构小科普为什么多图理解这么稳North Micro Vision Instruct 由三部分组成一个 400M 参数的原生分辨率视觉编码器基于 SigLIP 2 定制训练 一个 2B 参数的 North Micro LLM 语言模型 投影器。视觉特征通过 DeepStack 方式注入语言模型的浅层让模型同时获得像素级细节和高层语义两类信息从而在多图场景下依然能对齐图像与文本。这部分细节可在config.json的vision_config与text_config中查看。多图像理解模型的性能表现以下是官方在多个基准上的评测成绩来源README.mdVLMEvalKit 评测评测维度基准North-Micro-Vision-Instruct通用视觉问答MMBench0.687真实世界问答RealWorldQA0.622多语言MMMB0.728多图像BLINK0.527图表理解ChartQA0.808文档理解DocVQA0.921视觉定位RefCOCO 平均0.732幻觉抑制HallusionBench0.615可以看到它在文档、图表、定位等实用派任务上表现突出非常适合新手快速验证多模态想法。适用场景与注意事项推荐场景多图对比问答、票据/文档信息抽取、图表解读、目标定位原型、多语言图片理解、二次微调实验。需要留意它不是推理模型数学与代码生成能力有限不支持工具调用与 agent 流程多模态建议控制在 8K tokens 以内图片分辨率越高内存与延迟越大。总结North Micro Vision Instruct 以 2.4B 的小体积把多图像理解、原生分辨率、多语言和视觉定位打包成了开箱即用的体验。无论你是想本地部署一个多图问答助手还是基于它微调专属的多模态应用这份指南里的安装步骤与提示词写法都能帮你快速上手。动手试试吧让多图一次看懂成为你的日常生产力 【免费下载链接】North-Micro-Vision-Instruct项目地址: https://ai.gitcode.com/hf_mirrors/CohereLabs/North-Micro-Vision-Instruct创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表