一、开放程度标记标记含义典型情况A直接开放媒体文件和标注均可公开下载CLEVR、ScienceQA、部分合成数据集B申请开放免费注册、申请或签署协议后获取Ego4D、MIMIC-CXR、ScanNet相关数据C链接开放只发布URL、元数据或下载脚本LAION、CC3M、COYO、HowTo100MD派生标注只发布新标注底层图像需从COCO、Visual Genome等另行获取VQA v2、OK-VQA、A-OKVQAE评测开放验证集开放但测试答案隐藏通过评测服务器提交多数主流benchmark二、大规模图像—文本预训练数据集这类数据集主要用于CLIP式图文对齐、视觉编码器预训练、视觉语言模型中期训练以及多模态生成模型训练。数据集大致规模数据形式主要用途开放方式Conceptual Captions 3MCC3M约330万图文对网络图片经过清洗的网页替代文本图文预训练、caption、检索C主要公开URL和标注原图可能失效。(Google AI)Conceptual 12MCC12M约1200万图文对比CC3M过滤更宽松的网络图文数据大规模图文对齐、生成预训练C媒体依赖原始网页。(GitHub)WITWikipedia-based Image Text Dataset3760万样本、1150万张图像、108种语言Wikipedia图像、标题、上下文文本、页面信息多语言图文检索、多语言CLIP、知识型视觉语言学习C/A混合公开数据和处理工具但需遵守源页面许可。(GitHub)LAION-5B约58.5亿图文对其中约23.2亿为英文Common Crawl图像URL、文本、CLIP相似度及元数据CLIP、扩散模型、超大规模视觉语言预训练C主要是URL和元数据不托管全部原图。(arXiv)COYO-700M约7.47亿图文对网络图像URL、替代文本、尺寸、审美和安全相关元数据图文对比学习、生成模型预训练C提供元数据及下载工具。(GitHub)DataComp CommonPool最大候选池约128亿图文对大规模候选图文池统一训练评测协议研究数据筛选、去重、过滤和数据效率C核心价值是公开候选池和标准化实验框架。(GitHub)RedCaps约1200万图文对Reddit图片帖子标题来自约350个筛选后的社区口语化caption、网络语境视觉语言预训练C通过下载器获取仍然在线的媒体。(GitHub)Wukong约1亿中文图文对中文网页图片和文本中文CLIP、中文图文检索、中文视觉语言预训练C适合中文图文对齐研究。(NeurIPS Papers)这类数据集的主要问题URL失效几年后往往只能恢复原始数据的一部分。图文弱对应网页替代文本可能描述商品、页面或文件名而不是图像本身。重复数据严重同一图片可能以不同分辨率、裁剪或URL重复出现。成人、暴力、隐私与偏见内容必须增加安全过滤。训练—测试污染互联网数据中可能包含COCO、VQA、MMMU等测试样本或答案页面。三、图文交错与长文档预训练数据集传统CLIP数据是“一张图一句话”而多模态大模型还需要学习多张图像和长文本交错出现图像与上下文段落之间的弱对应多图推理网页、文章和教材式知识组织。数据集大致规模数据形式主要用途开放方式MMC4约1.012亿网页文档、5.71亿图像、430亿英文token网页内多图与多段文本交错排列Flamingo类模型、多图上下文、多模态in-context learningC提供网页级数据与下载工具媒体仍依赖URL。(GitHub)OBELICS约1.41亿文档、3.53亿图像、1150亿文本token过滤后的开放网页图文交错文档开放多模态大模型预训练C公开处理流程和数据索引。(GitHub)OmniCorpus约22亿文档、86亿图像、约1.696万亿文本token超大规模图文交错网页语料原生多模态模型、中期训练、长上下文图文学习C规模极大对存储和数据治理要求很高。(GitHub)这类数据更适合研究多图问答图文交错生成多模态长上下文文档级视觉语言建模多模态检索增强上下文内多模态学习。但它们通常不适合直接作为高质量指令数据因为网页中的图文位置相邻并不等于语义严格对应。四、图像描述、图文检索与细粒度视觉定位数据集4.1 图像描述和检索数据集规模与标注主要任务特点与限制开放方式MS COCO Captions超过33万张图像、约150万条人工描述图像描述、图文检索、生成评测标注质量高内容偏日常场景长期被大量模型使用污染风险较高。(arXiv)A/D/EFlickr30k约3.1万张Flickr图像每张通常有5条人工描述图文检索、caption、跨模态匹配数据规模不大但描述自然、适合快速实验A/CFlickr30k Entities31,783张图像、158,915条描述、约24.4万共指链和27.6万框短语定位、区域—词语对齐、grounding将描述中的名词短语与图像框对应是细粒度对齐的经典数据集。(GitHub)Dnocaps15,100张图像、约166,100条人工描述新类别图像描述、开放词汇caption基于Open Images重点考查训练集中少见或未见对象。(nocaps)D/ETextCaps约2.8万张图像、14.5万条描述需要读取场景文字的图像描述描述答案往往依赖招牌、包装、海报中的OCR文本。(arXiv)D/ECOCO-CN20,342张图像、27,218条中文句子、70,993个中文标签中文图像描述、中文图文检索中文视觉语言研究的经典小规模数据集。(GitHub)D4.2 区域、关系和场景图数据集规模与标注主要任务研究价值开放方式Visual Genome108,077张图像约540万区域描述、380万对象、280万属性、230万关系及170万问答场景图、关系识别、区域描述、grounding、VQA是LXMERT、UNITER、LLaVA等大量模型的数据基础但标注存在同义词、框重复和关系噪声。(华盛顿大学计算机系家庭页)A/DLocalized Narratives约84.9万张图像覆盖COCO、Flickr30k、ADE20K、Open Images等长描述、语音描述、鼠标轨迹、词语级视觉定位同时提供语音、转写和描述过程中鼠标位置适合研究语言产生过程与视觉区域对齐。(Google)DReferIt3DNr3D/Sr3D基于ScanNet三维场景Sr3D包含约8.35万条模板指代表达三维对象指代、语言定位适合研究“左边的椅子”“桌子后面的箱子”等三维空间关系。(GitHub)B/D五、视觉问答与多模态推理数据集5.1 通用视觉问答数据集规模核心能力主要问题开放方式VQA v2204,721张COCO图像、约110.6万个问题、约1105.9万个答案对象、属性、计数、常识和简单推理通过互补图像降低纯语言先验但仍存在答案分布偏差。(Visual Question Answering)D/EGQA约2200万个组合式问题场景图推理、关系、属性、组合推理提供功能程序和结构化语义但大量问题由模板生成。(Computer Science)D/EVizWiz-VQA来自视障用户拍摄的真实照片和语音问题低质量图像、模糊、遮挡、不可回答问题比COCO类数据更贴近真实辅助场景图像质量和问题分布更复杂。(VizWiz)B/ETextVQA场景文字图像及问答OCR、文字定位、视觉与文本联合推理常用于测试视觉token剪枝对细粒度文字信息的影响。(TextVQA)D/E5.2 组合与逻辑推理数据集规模核心能力特点开放方式CLEVR10万张合成图像、约100万个问题计数、属性、比较、空间关系、多步组合推理场景完全可控并提供场景图和程序视觉真实性较弱。(CVF开放获取)ANLVR2107,292个样本判断一句自然语言描述是否同时符合两张真实照片强调双图比较、量词、关系和组合推理。(LIL实验室)A/EWinoground每个样本由两张图和两条仅词序不同的描述组成组合语义、关系、词序敏感性数据量小更适合作为诊断集而非训练集。(CVF开放获取)ASugarCrepe基于图文描述构造语义扰动负样本属性替换、关系替换、对象交换和组合性用于检查CLIP类模型是否真正理解句子结构而非只匹配关键词。(arXiv)D5.3 外部知识与常识推理数据集规模核心能力特点开放方式OK-VQA14,055个开放式问题每题提供多个人工答案回答图像中无法直接观察、必须依靠外部知识的问题例如根据对象识别进一步询问历史、用途、文化或常识。(外部知识视觉问答)D/EA-OKVQA约2.5万个问题世界知识、常识推理、答案解释比OK-VQA更强调推理过程和答案依据。(GitHub)D/EScienceQA21,208道多模态选择题包含讲解和解释小学至中学科学知识、图表、示意图、文本推理既可训练回答也可训练生成推理依据。(GitHub)A5.4 视觉蕴含与解释数据集任务特点开放方式SNLI-VE判断图像与文本假设之间是蕴含、中立还是矛盾从SNLI派生适合视觉—语言逻辑关系分类。(GitHub)De-SNLI-VE在视觉蕴含基础上增加自然语言解释和标签修正超过43万个实例可用于可解释多模态推理。(GitHub)D六、OCR、文档、图表、数学和科学数据集这一类数据非常重要。很多多模态模型在普通自然图像上表现很好但面对小字号文字、表格、图表和复杂布局时会明显下降。6.1 图表问答数据集规模数据内容主要用途开放方式ChartQA约9,600个人工问题23,100个自动问题共约32,700个柱状图、折线图、饼图等及其底层数据图表读取、数值比较、算术和逻辑推理A/E。(GitHub)ChartQAPro1,341张图表、1,948个问题来自157个来源更复杂真实图表和专业问题更严格的图表推理与模型鲁棒性评测A/E。(GitHub)MapQA约6万张分区统计地图、约80万个问答地图颜色、图例、区域名称和数值地图OCR、空间定位、数值与图例推理A。(arXiv)6.2 示意图与科学图像数据集规模数据内容主要用途开放方式AI2D约4,900张科学示意图和4,500余个问题图中对象、文字、箭头、关系及分割标注图解理解、科学问答、示意图结构解析A公开版本采用较宽松的学术开放形式。(PRIOR)AI2D-RST对AI2D子集增加图形布局、语篇和修辞结构标注图像区域关系、图文组织结构适合研究示意图的层级和语篇关系D。(arXiv)ScienceQA21,208题科学插图、自然图像、问题、选项、知识和解释多模态科学推理、解释生成A。(GitHub)6.3 数学与专业学科评测数据集规模核心能力说明开放方式MathVista6,141个样本整合28个已有数据集并新增3类数据几何、图表、函数图、数学应用题、视觉算术是多模态数学推理的代表性评测集。(arXiv)A/EMMMU约11,500道题覆盖6大学科、30个专业领域大学级专业知识、图表、医学图像、设计图、乐谱等难度高但规模有限极易发生训练污染。(GitHub)A/EMMMU-Pro在MMMU基础上增加更难选项和视觉依赖设计降低通过选项模式或语言常识猜答案的可能更适合检验模型是否真正使用图像。(Hugging Face)A/E6.4 OCR综合评测数据集规模能力维度开放方式OCRBench1,000个问答样本文字识别、场景文字VQA、文档VQA、关键信息抽取和手写数学表达式A/E。(GitHub)OCRBench v2扩展到更多文档、场景、公式和多语言OCR能力更全面检查多模态大模型的文字感知与推理A/E。(Franklin)对于视觉token剪枝研究TextVQA、OCRBench、ChartQA、MathVista尤其重要因为它们能暴露模型是否错误删除了小面积但高价值的文本、刻度、图例和数学符号。七、多模态指令微调数据集这类数据集一般采用图像或视频用户指令模型回答其中不少回答由GPT-4、GPT-4V或其他教师模型自动生成。因此虽然规模较大但需要警惕幻觉、模板化语言和教师模型偏差。数据集大致规模数据组成与用途开放方式LLaVA-Instruct-150K约15万条基于COCO图像生成对话、详细描述和复杂推理指令是视觉指令微调的经典起点。(Hugging Face)DLLaVA预训练数据约55.8万图文对齐样本基于LAION、CC和SBU等数据整理用于训练视觉投影层。(GitHub)C/DM3IT40个数据集、约240万实例、400种任务指令部分任务覆盖80种语言多任务、多语言多模态指令调优D。(arXiv)MultiInstruct62项任务、10个任务类别来自21个开放数据集每项任务提供多种人工编写指令模板D。(GitHub)MIMIC-IT约280万指令—回答对、220万条独立指令图像和视频、多模态上下文、上下文内指令数据D。(arXiv)ShareGPT4V约120万条高描述性caption其中约10万由GPT-4V生成作为种子高质量详细描述、视觉指令数据扩展D。(arXiv)LVIS-Instruct4V约22万条基于LVIS图像由GPT-4V生成细粒度、长描述和对象密集指令D。(GitHub)MMInstruct约97.3万条指令覆盖24个领域和多种指令形式通用视觉指令、多领域训练D。(GitHub)Cambrian-10M / Cambrian-7M原始池接近千万条进一步整理出约700万高质量训练样本感知、知识、OCR、空间、科学、视觉推理等综合训练D由大量已有数据集重组必须检查重复和测试污染。(NeurIPS 会议论文集)ALLaVA大规模GPT-4V合成图像—文本与指令数据高质量caption及复杂视觉指令C/D。(GitHub)LAMM同时包含二维图像和三维点云指令数据2D/3D多模态对话、物体理解和场景推理D。(arXiv)使用指令数据时最容易犯的错误1. 把汇总数据集当成完全独立的数据Cambrian、M3IT、MultiInstruct、LLaVA混合数据等通常是对COCO、GQA、Visual Genome、OCR、ScienceQA等数据重新组织。因此它们之间可能高度重复。2. 把评测集混入训练集例如使用ScienceQA训练后再报告ScienceQA使用MMMU派生指令训练后再评测MMMU使用TextVQA训练集和验证集混合整理却没有重新核查划分从互联网页面抓取到包含标准题目与答案的内容。3. 完全相信教师模型生成的回答合成回答可能出现描述不存在的对象错误OCR虚构空间关系把常识猜测写成视觉事实回答过度冗长所有答案具有同一种语言风格。八、多模态综合评测与幻觉数据集这些数据一般不适合作为大规模训练语料而更适合作为独立测试集。数据集主要评测内容数据特点开放方式MMBench感知、属性、关系、推理、知识、OCR等包含中英文版本并通过CircularEval降低选项位置偏差。(arXiv)A/ESEED-Bench约1.9万道选择题、12个能力维度同时覆盖图像和视频理解。(arXiv)A/EMMMU / MMMU-Pro专业知识和复杂视觉推理更适合评价通用多模态模型的高难度能力。(GitHub)A/EMathVista视觉数学推理包含图表、几何图、函数图和自然图像数学题。(arXiv)A/EOCRBench / OCRBench v2OCR、文档、公式和场景文字对图像分辨率和视觉token保留极为敏感。(GitHub)A/EPOPE对象存在性幻觉通过正负问题检查模型是否声称图中存在实际不存在的对象。(GitHub)DHallusionBench视觉错觉、知识冲突和语言幻觉包含346张图像和1,129个问题用于区分视觉误判与语言推理错误。(arXiv)A/ERePOPE重新核查POPE标注和评测可靠性说明即使经典幻觉基准也可能存在标注错误和排名变化。(arXiv)D九、视频—语言数据集视频数据集需要进一步区分视频描述视频问答时间段定位长视频理解第一视角视频文本到视频生成音频—视觉联合理解。9.1 视频描述与检索数据集规模标注形式主要用途开放方式MSVD / YouTube2Text1,970个短视频、约8万条描述每段视频多条人工描述视频caption、视频文本检索的经典小数据集。(arXiv)C/DMSR-VTT1万段视频、约41.2小时、20万视频—句子对20类日常视频每段多条描述视频描述、检索、视频问答基础预训练A/D/E。(Microsoft)VATEX41,250段视频、82.5万条中英文描述每段视频多条英文和中文caption中英双语视频描述、检索和翻译C/D/E。(Eric Wang)ActivityNet Captions约2万条长视频时间段起止位置自然语言描述Dense video captioning、时间定位、长视频理解C/D/E。(活动网)Video Localized Narratives在多个视频数据上增加语音和鼠标轨迹描述语音、转写、时间同步视觉指向视频中的细粒度时空语言定位D。(Google)9.2 大规模视频—文本预训练数据集规模数据形式适用方向开放方式HowTo100M约122万个教学视频、1.36亿视频片段、约2.3万个任务主题YouTube视频自动语音转写视频语言预训练、步骤理解、教学视频检索C强依赖原始YouTube链接。(arXiv)HD-VILA-100M百M级高分辨率视频—文本片段高分辨率视频、字幕和自动切片大规模视频语言预训练C。(CVF开放获取)Panda-70M约7000万视频—文本样本来源于数百万高分辨率视频视频片段自动生成或整理的描述文本到视频生成、视频表征预训练C。(arXiv)OpenVid-1M超过100万视频—文本对其中包含约43.3万条1080p子集高质量视频文本描述开放文本到视频生成训练A/C。(arXiv)9.3 第一视角和长视频数据集规模与内容主要用途开放方式Ego4D约3,670小时第一视角视频来自931名拍摄者、74个地点和9个国家第一视角行为、记忆、操作、社会互动、音视频理解B需注册并遵循数据使用协议。(arXiv)视频数据的主要限制是即使标注文件仍然存在YouTube原视频也可能因删除、地区限制、版权或隐私原因无法下载因此复现实验时应记录实际成功下载的视频数量不能只报告论文标称规模。十、音频—文本与音频—视觉数据集10.1 音频描述与音频—文本对齐数据集规模数据形式主要用途开放方式AudioCaps约4.6万段音频及人工caption基于AudioSet片段训练集通常每段1条、测试部分多条描述音频描述、音频文本检索、CLAP类训练C/D。(audiocaps.github.io)Clotho4,981段音频、24,905条人工描述每段音频5条caption高质量音频caption与检索A公开于Zenodo等学术平台。(arXiv)WavCaps约40万音频—文本对来自多个音频来源经规则和语言模型清洗描述大规模音频语言预训练C/D。(arXiv)LAION-Audio-630K约63万音频—文本对网络音频、描述及嵌入元数据开放音频—语言模型训练C。(GitHub)AudioSetCaps基础版本约190万对并提供更大扩展版本为AudioSet音频片段生成高质量文本描述大规模音频caption预训练C/D部分描述为自动生成需要重新核查事实性。(Bai Jisheng / Personal Homepage)10.2 音频—视觉理解数据集规模内容与任务开放方式VGGSound超过21万段视频、310个声音类别视频画面与声音事件共同出现适合音视频分类和跨模态定位C视频依赖YouTube可用性。(arXiv)MUSIC-AVQA9,288段音乐视频、超过150小时、45,867个问答乐器识别、声音来源、计数、空间和时间音视频推理C/D。(GitHub)AVQA真实生活场景中的音频—视觉问答回答需要联合使用声音和画面而不是只依赖一种模态C/D。(清华大学计算机系mn)VoxCeleb超过7,000名说话者的大规模视听语音数据说话人识别、唇音一致性、音视频语音表征C原始视频来自公开视频平台。(牛津大学机器人研究所)音频数据常见的问题是音频描述可能只描述最显著的声音却忽略背景声自动生成caption还可能把“可能的声音来源”误写为确切视觉事实。十一、三维、多视图和具身机器人数据集11.1 三维对象与语言数据集规模数据内容主要用途开放方式Cap3D发布版本覆盖约100万三维对象每个对象提供多视图渲染、点云、深度或掩码及自动生成caption3D—语言预训练、文本检索3D对象、文本到3DA/D。(Cap3D)Objaverse超过80万个三维对象多来源3D模型及元数据3D视觉基础模型、渲染、多视图学习A/C每个对象的具体许可证可能不同。(Objaverse)Objaverse-XL超过1000万个三维对象更大规模3D资产集合大规模3D生成和3D语言模型预训练A/C。(Objaverse)ReferIt3D基于数百个ScanNet真实室内场景包含Nr3D和Sr3D语言指代表达三维对象定位、空间关系理解需要另外获取ScanNet基础数据。(GitHub)B/D11.2 机器人与视觉—语言—动作数据集规模与内容主要用途开放方式Open X-Embodiment超过100万条真实机器人轨迹、22种机器人形态并统一多机构数据格式视觉—语言—动作预训练、跨机器人泛化、通用机器人策略A/D不同子数据集可能有独立条款。(Open X-Embodiment)BridgeData V260,096条真实机器人轨迹、24种环境语言条件或目标图像条件的操作学习A。(arXiv)机器人数据不仅包含图像和语言还可能包括关节状态末端执行器位姿动作序列深度图多相机视频力觉或触觉任务自然语言成功与失败标签。这类数据的难点不只是规模而是不同机器人动作空间、相机布局、控制频率和任务定义不统一。十二、中文与多语言多模态数据集中文多模态学习不能只把英文caption机器翻译成中文。更理想的组合是同时使用原生中文数据、人工中文描述和多语言网页语料。数据集语言适用方向说明Wukong中文中文CLIP、中文图文检索、中文视觉表征约1亿中文图文对规模大但属于网络弱标注数据。(NeurIPS Papers)COCO-CN中文中文caption、图文检索、跨语言对齐人工中文描述和标签质量较高但数据规模较小。(GitHub)WIT108种语言多语言图文对齐、跨语言检索Wikipedia语境较强包含标题和上下文等多种文本。(GitHub)VATEX中文英文双语视频描述、视频检索、视频翻译同一视频具有中英文描述适合跨语言视频学习。(Eric Wang)M3IT关键任务扩展到80种语言多语言多模态指令调优许多语言版本来自翻译应区分原生语言数据和翻译数据。(arXiv)SLAKE中文英文医学问答双语医疗视觉问答包含642张医学图像和14,028个问答。(GitHub)中文方向建议至少同时包含Wukong的大规模弱标注数据COCO-CN的高质量人工数据M3IT的中文指令数据中文综合评测数据。十三、医学多模态公开数据集医学数据通常不会像普通互联网图像那样完全自由下载。即使免费也可能要求完成伦理培训、签署协议或禁止重新识别患者。数据集规模模态与任务开放方式MIMIC-CXR-JPG377,110张胸部X光图像、227,827次影像检查X光图像、放射学报告、标签胸片报告生成、医学图文对齐、医学VQA基础数据需要认证和数据使用协议。(arXiv)ROCOv279,789张放射学图像医学图像、caption和UMLS医学概念医学图文检索、医学CLIP、报告相关预训练PathVQA4,998张病理图像、32,799个问答病理图像视觉问答开放式和封闭式医学问答SLAKE642张医学图像、14,028个中英文问答X光、CT、MRI等医学视觉问答双语医学VQA和知识推理VQA-RAD放射学图像及临床问题医学视觉问答规模不大但属于经典医学VQA数据。(GitHub)PMC-VQA约22.7万问答、14.9万张图像来源于生物医学论文的图像、问题和答案大规模医学和科学视觉问答Quilt-1M约100万病理图像—文本对组织病理切片及其文本描述病理图文预训练、病理视觉语言模型医学数据适合科研验证但不能仅凭公开benchmark结果宣称可直接用于临床诊断。十四、按研究目标选择数据集1. 学习CLIP式图文对齐推荐组合阶段数据集小规模验证Flickr30k、COCO Captions中等规模预训练CC3M、CC12M、WIT大规模实验LAION-5B子集、COYO-700M子集、DataComp中文实验Wukong、COCO-CN细粒度对齐Visual Genome、Flickr30k Entities2. 学习多模态大模型和视觉指令微调推荐组合训练目标数据集视觉—语言连接器预训练LLaVA约55.8万对齐数据、CC3M、COCO Captions基础视觉指令LLaVA-Instruct-150K多任务扩展M3IT、MultiInstruct高质量长描述ShareGPT4V、LVIS-Instruct4V大规模综合训练Cambrian-7M、MMInstruct多图和视频上下文MIMIC-IT、MMC4、OBELICS3. 研究视觉Token剪枝和高效多模态推理这一方向不能只用VQA v2或MME一类综合数据。建议至少覆盖以下能力能力推荐数据集为什么重要通用视觉问答VQA v2、GQA测试整体精度保持细粒度OCRTextVQA、OCRBench检查小文本token是否被误删图表与数值ChartQA、MathVista检查刻度、图例、数字和符号保留复杂知识推理A-OKVQA、ScienceQA、MMMU检查视觉信息与语言知识联合推理图像描述COCO Captions、nocaps、TextCaps检查生成任务和开放词汇能力幻觉POPE、HallusionBench检查剪枝是否增加对象幻觉组合与关系GQA、Winoground、SugarCrepe检查关系token和对象交互是否丢失视频扩展MSR-VTT、VATEX、ActivityNet Captions检查时间冗余和帧级token预算对于动态预算方法还应在数据层面记录原图分辨率图像patch数量OCR文字密度对象数量场景复杂度问题长度问题类型剪枝前后视觉token数量每个样本实际保留比例延迟、显存、吞吐和模块自身开销。十五、建立自己的多模态数据清单时应保存哪些字段建议后续将数据集整理成一个统一表格至少包含以下字段字段说明Dataset Name数据集完整名称Year首次发布年份Modalities图像、文本、视频、音频、3D、动作等Taskcaption、VQA、检索、grounding、生成、指令调优等Sample Count样本数Unique Media Count去重后的图像、视频或音频数量Language英文、中文、多语言Annotation Source人工、模板、模型生成、网页弱标注Base Dataset是否依赖COCO、Visual Genome、YouTube等Media Availability原始媒体是否直接发布License数据和媒体的许可证Commercial Use是否允许商业使用Registration是否需要注册或申请Test Labels是否公开测试标签URL Stability是否依赖外部URLSynthetic Ratio合成标注比例Known Leakage是否可能包含主流benchmarkRecommended Use预训练、微调、评测或诊断Main Risks噪声、偏见、重复、隐私、版权等十六、最值得优先掌握的核心数据集不建议一开始就平均研究所有数据集。按照发展主线优先级可以设为第一层基础数据集COCO Captions、Flickr30k、Visual Genome、VQA v2、GQA、CLEVR、TextVQA。第二层大规模预训练CC3M、CC12M、WIT、LAION-5B、DataComp、MMC4。第三层多模态指令数据LLaVA-Instruct-150K、M3IT、MultiInstruct、ShareGPT4V、Cambrian-7M。第四层复杂推理和综合评测ScienceQA、ChartQA、MathVista、MMMU、MMBench、SEED-Bench、OCRBench。第五层可信性与细粒度诊断POPE、HallusionBench、Winoground、SugarCrepe、nocaps。第六层扩展模态MSR-VTT、VATEX、HowTo100M、Ego4D、AudioCaps、Clotho、ReferIt3D、Open X-Embodiment。