免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

疾病数据集|从医院PACS“书签“里挖出32,735个病灶标注:零人工标注成本的超大规模多类型病灶CT数据集

疾病数据集|从医院PACS“书签“里挖出32,735个病灶标注:零人工标注成本的超大规模多类型病灶CT数据集 摘要由美国国立卫生研究院NIH临床中心影像生物标志物与计算机辅助诊断实验室创建了DeepLesion数据集——通过挖掘医院 PACS影像归档和通信系统中放射科医师日常阅片时留下的书签bookmarks标注构建出包含 32,735 个病灶、32,120 张 CT 切片、覆盖 10,594 项检查和 4,427 名患者的大规模多类型病灶数据集。其意义在于开创了一种几乎零人工标注成本的数据集构建范式解决了医学影像领域长期缺乏大规模标注数据集的根本难题并支撑了首个通用病灶检测器的训练——用一套统一框架检测所有类型病灶为自动化放射诊断与推理系统奠定基础。一、研究背景1、研究背景计算机辅助检测/诊断CADe/CADx是医学影像处理领域长盛不衰的研究方向基于卷积神经网络CNN的深度学习算法性能远超传统方法但这些性能提升往往以海量标注训练数据为代价。与通用计算机视觉不同医学影像领域一直缺乏一个类似 ImageNet、MS COCO 级别的大规模标注数据集因为医学图像标注需要专业临床知识无法像普通图像那样通过谷歌搜索 众包的方式廉价获取。病灶的检测与表征是 CADe/CADx 的核心任务。但现有算法大多只针对某一种特定病灶如皮肤病变、肺结节、肝病灶、结肠息肉而放射科医师的实际阅片方式是综合性的——同一患者体内多种病灶往往互相关联例如肿瘤转移会扩散到区域淋巴结或其他部位只有掌握整体临床画面才能做出准确诊断。2、目前遇到困难和挑战1医学图像标注昂贵大规模数据集稀缺普通计算机视觉任务可以靠网络搜索加众包廉价收集标注但医学影像标注必须具备临床专业资质常规众包模式完全失效。当时公开可用的医学影像数据集大多只有几十到几百个病例超过 5000 个标注良好的病例的数据集极为罕见严重制约了深度学习模型的能力上限。2单一病灶检测与临床实际脱节现有 CADe 算法普遍一次只看一种病——研究肺结节的不管肝病灶研究肝病灶的不管淋巴结。但临床实践中放射科医师读片时会同时关注多种发现而且不同病灶之间往往存在病理关联比如转移灶。缺乏多类别病灶数据集使得通用型CADe 框架一直难以建立。3罕见病灶类型被系统性忽视研究资源高度集中在少数常见病灶肺结节、肝病灶等大量不常见的病灶类型骨病灶、软组织病灶等几乎没有对应的 CADe 研究。这些长尾病灶同样影响患者健康却因为缺少数据而被算法研究界忽略。二、介绍数据集1、数据集名称DeepLesion2、一句话介绍数据集DeepLesion 是 NIH 通过挖掘医院 PACS 中放射科医师留下的 RECIST 测量书签构建的超大规模多类型病灶 CT 数据集包含 32,735 个病灶标注、覆盖全身 8 大类病灶构建过程几乎无需人工标注。3、详细介绍数据DeepLesion 的核心思路非常巧妙放射科医师日常阅片时会在 PACS 里对重要病灶做书签标记按照 RECIST 实体瘤疗效评价标准测量病灶长短径用于后续随访对比。这些书签在医院系统里积累了二十多年本身就是现成的专业标注。研究团队把这些书签挖掘、清洗、整理出来直接变成了深度学习可用的数据集。核心数据统计参数数值病灶总数32,735 个标注切片数32,120 张CT 检查数10,594 项患者数4,427 名每张切片病灶数1~3 个病灶长径范围0.42 ~ 342.5 mm病灶短径范围0.21 ~ 212.4 mm层厚范围0.25 ~ 22.5 mm48.3% 为 1mm48.9% 为 5mm图像尺寸绝大多数 512×512数据划分训练 70% / 验证 15% / 测试 15%按患者级划分病灶类型分布人工抽检 9,816 个病灶标注为 8 类病灶类型数量说明肺部2,426肺结节、磨玻璃影等腹部2,166肝肾之外的腹部杂项病灶纵隔1,638主要为胸部淋巴结肝脏1,318肝肿瘤等盆腔869—软组织677肌肉、皮肤、脂肪内病灶肾脏490—骨骼232硬化性病变、转移等标注内容每个病灶提供 RECIST 长短径测量4 个顶点坐标、由直径外扩 5 像素生成的 2D 边界框以及像素间距、层厚、窗宽窗位、患者性别年龄等元数据。4、数据集构建1数据挖掘通过 PACS 系统Carestream Vue查询带书签的 CT 检查号用厂商提供的 Perl 脚本批量下载书签筛选出信息最完整的 RECIST 直径类书签占 CT 书签的最大比例过滤掉非轴位标注并把坐标从患者空间转换到图像像素空间。2匿名化与格式转换CT 影像从 DICOM 转为 16 位 PNG无损压缩真实患者 ID、检查号、序列号全部替换为自编号格式患者号_检查号_序列号实现匿名化。3标注转换把 RECIST 直径两条垂直测量线的 4 个顶点转换为边界框四边各外扩 5 像素以覆盖病灶完整空间范围方便直接用于目标检测任务。4噪声清洗剔除异常书签对面积、宽高比、框内像素均值/标准差异常的框过小/过大/扁平/过暗逐一人工检查合并重复标注同一病灶被不同医师重复书签的情况将重叠率超过 60% 的框坐标取平均合并5、数据集特点全类型病灶覆盖既有被大量研究的常见病灶肺结节、肝病灶也有被学界长期忽视的罕见类型骨病灶、软组织病灶是真正意义上的全科病灶数据集。一篇检查的图像里常常同时标记多个病灶天然支持病灶间关联关系研究后续工作 DeepLesion Graph 就基于此。大规模且标注成本极小超过 3.3 万个标注病灶、1 万多项检查规模远超同期医学影像数据集当时超过 5000 个良好标注病例的数据集屈指可数。最关键的是标注几乎零成本——书签是医师日常工作的副产品挖掘出来即可用。而且书签数量每年递增2015 年后爆发式增长数据集可以持续扩容。随访时序数据同一病灶肿瘤、淋巴结在多次随访检查中被重复测量天然形成时序数据可用于病灶生长分析和预测。标注贴近真实临床书签来自医师真实工作流而非专门为科研标注反映的是临床上真正值得关注的病灶而不是人工设计的标注任务。6、数据集使用方法获取方式数据集已公开释放通过 NIH 临床中心官网下载论文接受后提供链接数据内容16 位 PNG 图像 边界框坐标 RECIST 直径 元数据像素间距、层厚、窗宽窗位、性别、年龄官方划分训练 70% / 验证 15% / 测试 15%按患者级别随机划分避免同一患者数据泄漏使用注意书签不是完整标注——医师通常只标记代表性病灶图像中常有未标注的病灶假阳性里其实混着大量真病灶评估指标会偏保守7、基准测试总结在 15% 测试集上基于 Faster R-CNN 的通用病灶检测器在每图 5 个假阳性的工作点达到81.1%的敏感度每图 3 个假阳性时为 77.31%单张图像推理仅需 34 毫秒。三、数据集有哪些场景的应用1、通用病灶检测器训练——一次检测全身所有病灶这是 DeepLesion 最直接也最酷的用法。以前做病灶检测肺结节一个模型、肝病灶一个模型、淋巴结又一个模型各管各的。有了 DeepLesion你可以训练一个统一的检测器一张 CT 图丢进去肺里的结节、肝上的肿瘤、肿大的淋巴结全部一次找出来。论文用 Faster R-CNN VGG-16 做到了 81.1% 敏感度。这个检测器可以当初筛工具用先把所有可疑病灶找出来再分发给各个专科模型比如专门的肺结节良恶性分类器做精细分析就像医院里先全科医生初诊再转专科一样。2、书签缺失下的噪声标签学习研究这个数据集的标注有个天然特点医师只标记了他们关心的病灶图像里其他真实病灶并没有标注。这意味着训练数据里的负样本不纯——很多被判为假阳性的检测其实是真病灶。这反而是研究带噪标签学习learning with noisy labels的绝佳场景。你可以实验各种抗噪训练策略或者从健康人数据集里采样纯净的负样本看看哪种方式效果最好。这种不完美标注才是最真实的世界研究价值很高。3、结合放射报告做病灶分类NLP 视觉书签本身没带病灶类型标签但每项检查都配有放射诊断报告而且医师报告里常带超链接指向具体书签。你可以用自然语言处理从报告文本里自动提取病灶类型、性质描述把文本信息和图像标注对齐让数据集自动升级出细粒度标签。想研究多模态学习、视觉-语言对齐这个数据集加报告的组合是现成的材料。4、弱监督病灶分割DeepLesion 只提供边界框和长短径没有像素级分割掩码。这恰恰是弱监督分割weakly-supervised segmentation的标准设定能不能只用框级标注训练出像素级分割模型比如 BoxSup 这类方法就可以直接用。你也可以挑一部分感兴趣的病灶人工补标分割配合主动学习active learning策略让模型主动挑最值得标的样本给人标把人工标注成本压到最低。5、病灶图像检索系统3 万多个覆盖全身各部位的病灶是做医学影像检索content-based image retrieval的理想语料。比如给系统一个病灶图像或一段文字描述让它从库里找出最相似的既往病灶案例辅助医师参考历史诊断。数据集的多样性和规模足以支撑检索模型的训练和评估。6、病灶生长预测与随访分析癌症患者复查时同一病灶会被反复测量。DeepLesion 里这种时序随访数据天然存在——你可以追踪一个肿瘤几个月内的变化轨迹训练模型预测这个病灶下次复查会长大多少。这对临床价值巨大如果模型能提前预判肿瘤生长速度医师就能更精准地安排复查间隔和治疗时机。7、多病灶关联关系挖掘同一个患者身上肝里的肿瘤、旁边的肿大淋巴结、骨上的转移灶这些都不是孤立事件。DeepLesion 一次检查常标记多个病灶让研究者第一次能在大规模数据上研究病灶之间的空间关系和病理关联论文作者后续的 DeepLesion Graph 工作就是干这个的。想构建全身病灶知识图谱辅助综合诊断这个数据集是独一无二的起点。8、罕见病灶检测研究骨病灶、软组织病灶这类冷门病灶以前根本没数据做研究。DeepLesion 里虽然它们占比不高骨 232 个、软组织 677 个但总算有了起步的数据。你可以研究少样本学习、类别不平衡下的检测策略专门提升这些罕见病灶的检出率——论文也发现软组织病灶和骨病灶敏感度最低说明这里有明确的改进空间。9、小病灶与中等尺寸病灶检测难点攻关论文的尺寸分析很有意思小于 10mm 的病灶难检测正常太小了大于 50mm 的反而好找但 10~50mm 之间的敏感度并不随尺寸单调变化——15~20mm 表现最好。这说明中等尺寸病灶的检测受病灶类型、训练样本量等多因素影响。如果你想研究尺度感知检测、特征金字塔改进、小目标增强这个数据集自带丰富的尺寸梯度0.42mm 到 342.5mm想怎么切分实验都行。10、腹部盆腔复杂场景检测论文坦诚指出腹部和盆腔区域假阳性、假阴性最多因为肠道、肠系膜等正常结构和病灶外观太像了。如果你专门研究复杂背景下的目标检测——比如用 3D 上下文信息、多模型集成、注意力机制来区分肠袢和腹腔肿块DeepLesion 的腹盆腔数据就是最硬的试金石。能在这里把敏感度提上去方法肯定有两把刷子。相关资源本文是 LIDC-IDRI 数据集的详细解读。对于做医疗 AI 的朋友数据集选型往往是个痛点——不同数据集的标注标准、适用任务、获取方式分散在各处论文和存档库中查阅成本很高。我们把 LIDC-IDRI 以及全球主流医疗 AI 数据集涵盖 CT、MRI、病理、超声、多模态等整理成了 AI-Ready Dataset 条目库以统一的 Wikipedia 式结构呈现方便研究者快速比对和选型Qianfanghub AI-Ready Datasethttps://www.qianfanghub.com/ai-ready-dataset/#DeepLesion #通用病灶检测 #PACS数据挖掘 #弱监督标注 #医学影像数据集
返回列表