ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

医疗AI公开数据集全攻略:影像、信号、文本与基因组一网打尽

医疗AI公开数据集全攻略:影像、信号、文本与基因组一网打尽 做医疗AI这一年多我发现自己被问得最多的一个问题不是“模型怎么调”而是“数据从哪找”。身边不少朋友兴冲冲想复现一篇顶会论文结果卡在数据集下载上要么官网要注册审批要么链接失效要么格式吓人。这篇汇总就是想把医疗场景里那些经典、热门的公开数据集一次性捋清楚按影像、信号、文本、组学几个方向分开每个都说明白是什么、能做什么、怎么拿方便你按自己的任务对号入座。先交代一下这个清单的筛选标准。第一只要是做医疗影像、生理信号、病历文本或基因组方向这些数据集几乎绕不开属于“行业硬通货”第二优先选还在维护、申请链路相对明确的第三尽量覆盖不同模态让做算法和做临床研究的人都能找到能用的东西。你不需要全下先收藏等真需要的时候知道去哪找就值了。1. 医疗数据集的特殊之处为什么“找数据”本身就是一道坎想搞清楚这些数据集为什么这么难拿得先理解医疗数据和普通CV数据集完全不是一个物种。ImageNet你可以一键压缩包拖走但医疗数据基本都涉及患者隐私、伦理审批和使用协议所以绝大多数需要注册、填用途、过考试甚至签法律文件。1.1 医疗数据和普通公开数据集的三点本质区别第一个区别是身份门槛。很多医疗数据集的申请页面会要求你提交机构邮箱、研究背景说明甚至要求你完成一份关于人类受试者保护的在线培训拿到证书才能下载。这不是卡你而是数据共享伦理规范的一部分医院把患者数据拿出来本身就要过层层审批研究者自然也要承担对应责任。第二个区别是标注成本极其昂贵。一张胸片让放射科医生标病灶快的几分钟慢的要半小时而一个像样的数据集动辄几万张图。所以你会发现医疗数据集的标注常常是“不完美”的有的只有疾病级标签没有像素级标注有的只有部分数据被专家复核过。这不是数据集质量差而是医学专家的人力成本决定了标注精度存在天花板。第三个区别是数据分布天然不均衡。正常样本和病变样本的比例可能差几十倍不同疾病的发病率差异也极大。你拿到的数据往往只是医院历史病例的一个切片里面暗藏着设备型号、人群种族、地域疾病谱等系统性偏差。如果只闷头跑精度不去看数据本身的结构上线之后大概率会在真实场景翻车。1.2 这篇汇总的组织逻辑下面的20个数据集我按使用频率和我自己的熟悉程度分了四组医学影像类胸片、CT、超声、内镜、皮肤镜、眼底图共9个适合做分类、检测、分割任务。生理信号与重症临床类心电、脑电、重症监护记录共5个适合做时序建模、预测任务。病历文本与基因组类医疗NLP文本、肿瘤多组学数据共4个适合做文本挖掘和生信分析。我个人的“如果只能选一个”推荐给新手一个直接的入手指引。每个数据集我会说明规模、获取方式、适合什么任务以及我实际使用中踩过的坑。这样你拿到的不是一张冷冰冰的列表而是一张带“路况提示”的地图。2. 医学影像方向9个经典数据集从入门到进阶一次配齐医学影像是医疗AI里最卷也最成熟的赛道数据集数量也最多。这里选的是我反复用、周围同行也说靠谱的9个覆盖了肺、脑、皮肤、心脏、眼底、内镜等主要器官场景。2.1 胸部X光和肺结节入坑首选的两个数据集NIH ChestX-ray14是几乎每一个做过胸片识别的人都绕不开的数据集。它包含约112120张正面胸片来自3万多名患者每张图带有最多14种肺部疾病的标签。这个数字放在今天看依然非常可观而且它是很多后续胸片模型的基准。获取方式是去NIH官网填申请审核不复杂一般一周内能下来。需要注意它的标签是从影像报告中用NLP自动提取的存在一定噪声精度不如专家逐张复核这是公开数据的通病。对肺结节检测LIDC-IDRI则是更硬核的选择。它包含1018例胸部CT由四位放射科医生分别对结节进行标注标注内容包括结节位置、大小、良恶性评分等。它的价值在于每个病灶有多位专家的独立意见你可以用来做检测、分割也可以用来研究标注者间差异性。下载前需要在癌症影像档案库TCIA注册并同意数据使用协议。这两个数据集配合使用很常见先用ChestX-ray14做疾病分类预训练再用LIDC-IDRI做结节定位微调。我自己的经验是ChestX-ray14做预训练比直接用ImageNet预训练要稳因为特征分布和下游任务更接近迁移损失小很多。提示NIH ChestX-ray14申请后别急着关页面文件列表里不仅有图像还有一份包含患者性别、年龄的CSV对做公平性分析非常有用。2.2 脑肿瘤与皮肤病变病灶分割的经典难度**BraTSBrain Tumor Segmentation**是脑胶质瘤分割领域最权威的benchmark每年MICCAI都会举办配套挑战赛更新数据。它提供多模态MRIT1、T1ce、T2、FLAIR每个病例都有像素级标注区分水肿、增强肿瘤和坏死核心。做医学图像分割的人如果没跑过BraTS基本不好意思说做过分割。数据通过BraTS官网申请需要用机构邮箱注册。ISIC Archive是皮肤镜图像的数据集由国际皮肤成像协作组维护最新版本包含数万张皮肤病变图像标注覆盖良恶性、病变类型等。它每年都会推出新的挑战赛任务比如分割任务、属性分类任务数据质量整体比较高。不过由于皮肤镜图像和实际手机拍照差异较大做移动端皮肤自测工具的人需要注意域迁移问题。这两个数据集的共同特点是标注标准体系非常成熟带给了研究者一个清晰的评估框架。BraTS里把肿瘤区域拆成三个子区域分别评估DiceISIC则区分了病灶级和图像级的评估指标。做分割任务时不要只看整体Dice分结构看才有意义。2.3 肺炎检测、超声、眼底与内镜垂直场景里的高质量选择RSNA Pneumonia Detection Challenge数据集来自Kaggle是胸部X光肺炎病灶检测的经典数据集。它和NIH ChestX-ray14最大的区别是所有肺炎病灶都由放射科医生用边界框标注标注质量明显更高。虽然它名义上是Kaggle竞赛数据但赛后依然开放下载非常适合做检测任务的练手项目。CAMUS是一个超声心脏数据集包含500例患者的二维超声图像重点是左心室和左心房的分割标注。超声数据相比CT、MRI在公开数据里本身就少见CAMUS是少数能用于做超声心脏结构分割的公开资源申请手续也比较简单填表即可。它对做心功能量化分析的人非常关键。DRIVE是视网膜血管分割数据集只有40张眼底图规模不大但因为它包含金标准标注和训练测试划分是眼底血管分割领域的事实标准。很多人拿它做血管分割模型的验证集。虽然数据量小但因为它作为基准的作用大于训练集的作用因此在论文对比里到处可见。Kvasir-SEG是消化内镜息肉分割数据集包含1000张息肉图像和对应的像素级掩码另有视频版本。做内镜辅助诊断、息肉检测分割的团队几乎都会用它做初始验证。内镜图像的光反射、模糊区域都很多对模型的鲁棒性要求比较高属于“看起来很简单、实际挺难”的典型任务。个人体会做医学影像任务时数据集之间的“域差异”往往比模型结构更影响结果。同一个分割模型在BraTS上Dice刷到0.9换到Kvasir-SEG上跌到0.6并不稀奇。挑选数据集时先想清楚你的落地场景和训练集分布是否一致。3. 生理信号与重症临床从心电到MIMIC时序数据的宝藏库医学影像之外另一大类高频需求来自机器学习和时序信号结合的场景。心电图、脑电图、重症监护记录这类数据对做预测、异常检测、多模态融合的人来说是真正的金矿。3.1 MIMIC系列重症数据库里的“王者级”资源MIMIC-III和MIMIC-IV是麻省理工计算生理学实验室发布的重症监护数据库记录了Beth Israel Deaconess Medical Center重症监护室数万名患者的去标识化医疗数据包括生命体征、实验室检验、用药记录、护理记录、影像报告和自由文本等。如果你要做时序预测、患者恶化预警、药物干预效果分析这里几乎是绕不开的选择。MIMIC的申请流程是最容易卡住新手的环节。现在PhysioNet要求完成CITI Program的“Data or Specimens Only Research”课程拿到通过证书后才能申请Credentialed Access整个过程从考试到获批通常需要1到2周。建议有需求的人尽早申请不要等到论文截稿才开始走流程。MIMIC-IV是MIMIC-III的升级版表结构更清晰去标识化更彻底字段覆盖也更广。现在新项目建议直接用MIMIC-IV除非你需要复现某些基于MIMIC-III的旧方法。要注意的是MIMIC中的时间轴数据格式很复杂需要处理ICU admission、transfer event、chart time等多个表才能拼出完整的事件序列建议先看官方提供的tutorial笔记。注意下载MIMIC需要访问Google Drive或PhysioNet托管服务。国内网络环境下多人协作下载大文件经常出现中断建议使用支持断点续传的下载工具分文件逐个下载不要指望一次把几GB数据完整拉下来。3.2 心电、脑电等公开信号数据集心电图方向PTB-XL是当前最大的公开12导联心电数据集包含21837条记录每条10秒标注涵盖44种心电图诊断。它是心电自动诊断领域的标准benchmark之一数据获取很直接在PhysioNet注册后即可下载。缺点也很明显类别严重不平衡正常窦性心律占了很大比例需要自己设计采样策略。MIT-BIH心律失常数据库是心电信号处理里资历最老的数据集包含48条半小时双导联心电记录带逐拍的标注。虽然规模不大但因为它几乎被所有心电论文当作基准你没跑过它都不好意思跟人谈心电分析。它适合做心跳分类、QRS波检测等基础任务。脑电方向DEAP是一个多模态情感分析数据集包含32名被试观看音乐视频时的脑电EEG和外周生理信号并有人工标注的效价、唤醒度、支配度评分。虽然严格说属于情感计算范畴但它的EEG预处理流程、特征提取方法常被医疗健康研究借用。Sleep-EDF则是睡眠分期研究的经典数据集包含整夜多导睡眠图记录标注了睡眠阶段适合做睡眠分期模型。我建议对信号类数据集感兴趣的朋友先从PTB-XL或MIT-BIH入手因为结构简单、答案明确标注是金标准不像MIMIC需要大量表关联清洗。信号数据的坑更多在预处理不同设备采样率不同、噪声类型不同、导联顺序不同后续做跨数据集测试时都需要统一处理。4. 病历文本与基因组数据医疗NLP和多组学分析同样有好料影像和信号之外病历文本和基因组数据是另外两个大类。做医疗NLP、知识图谱、药物发现、精准医疗的人需要的资源和前两类完全不同。4.1 病历文本与临床NLP数据集**n2c2National NLP Clinical Challenges**是临床NLP领域最有影响力的数据来源之一前身是i2b2。它提供脱敏后的真实病历文本标注了时间关系、共病识别、药物信息抽取、吸烟状态等多个任务。不同年份的挑战赛对应不同任务数据需要在官网申请审核门槛不低但质量确实很好。如果你要做实体识别、关系抽取n2c2几乎是必跑的数据集。MIMIC-III其实也包含大量自由文本比如放射学报告、出院小结和护理记录很多医疗NLP工作直接在这些文本上做预训练。官方提供去标识化后的文本版本配合诊断代码可以组成不错的弱监督信号。需要注意的是MIMIC文本中包含大量缩写和记录片段没有经过NLP预处理经验的人上手会很痛苦。医疗文本NLP和通用NLP的一个显著区别是领域术语极度丰富且高度结构化。同一种疾病在不同记录里可能有多种表述这要求做实体归一化时充分结合国际疾病分类ICD和系统化临床术语SNOMED CT等标准编码体系。我在实际项目中踩过一个坑直接拿通用预训练模型做实体识别实体边界找得还行但归一化到标准编码时经常错位后来加入词典特征才逐步改善。4.2 癌症基因组与大型队列数据集**TCGAThe Cancer Genome Atlas**是癌症基因组学领域最著名的公共数据资源包含33种癌症类型的两万多个样本的基因表达、拷贝数变异、甲基化、突变和临床数据。几乎所有癌症生信论文里都能看到TCGA的身影。它通过GDC数据门户获取部分数据需要下载授权但大多数转录组和临床数据可以直接访问。UK Biobank则是另一个维度的巨型资源不是专门针对肿瘤而是包含了50万名英国志愿者的基因型数据、影像数据、生活方式问卷和纵向健康记录。数据显示量巨大对计算资源要求极高申请流程也相对严格需要通过英国伦理审查和用途审批。个人研究很难直接把全量数据搬回本地通常使用他们提供的云分析环境或提交流程获取子集。它比较适合做复杂疾病的风险预测、多基因评分等研究。如果只是入门练习也可以先用**GEOGene Expression Omnibus**上的公开芯片或测序数据集练手。GEO的优势是条目极多任何疾病方向几乎都能找到免费数据配合R语言工具包就能完成差异表达分析。不过GEO条目质量参差不齐下载前建议看下样本量和分组信息优先选择样本量大于20的数据集。5. 申请与下载中的高频问题资质审核、协议签署和本地化处理前面每个数据集都提到了获取方式但实际申请的过程中你可能会遇到各种“非技术性卡点”。把这些经验单独写一节是想让你尽量少走弯路。5.1 资质审核和数据使用协议到底是怎么一回事很多医疗数据集需要申请者完成人类研究保护培训具体由PhysioNet统一管理。流程是在CITI Program官网注册选择“Data or Specimens Only Research”课程完成在线学习和考试取得合格证书再把证书信息填到PhysioNet的申请页面。整个过程免费但需要花几个小时学习。还有一类数据集需要机构层面的《数据使用协议》DUA比如部分商业化程度较高的数据集会要求你所在机构的法务签字这通常耗时更久要提前规划。这里有个容易忽略的点申请时填写的用途要具体但不要太窄。有些机构审核人员会认真看你写的用途如果你只写“用于训练模型”可能被认为过于宽泛但如果你把具体疾病、具体方法写得太死后续调整研究方向时又可能违背最初声明。我的建议是写清楚“用于XX疾病医学影像分析的研究用途”既明确方向又有一定的弹性空间。5.2 下载之后的高频翻车点格式、标注和类不平衡数据拿到手只是开始实际使用中还有几个高频坑。第一个是格式转换。医学影像数据常用DICOM或NIfTI格式不是JPEG或PNG直接能吃。DICOM需要解析头信息和像素矩阵NIfTI需要读入三维体数据这都依赖专业库。很多新手一上来就报错其实只是格式没转对。第二个是标注的读取方式。有些数据集用XML存标注框有些用JSON有些是RLE编码的掩码还有一些需要你根据中心坐标和半径自己生成。标注格式不一致在混合多个数据集做训练时尤其痛苦建议一开始就统一转换成COCO或YOLO格式后面会省很多事。第三个是类不平衡问题。真实医疗数据里正常样本远多于病变样本直接训练会让模型全预测成正常类。正则项、损失函数加权、欠采样/过采样都有效但更重要的是先认真统计每个类别的样本量再根据任务选择合适的策略。重要无论使用哪个数据集都要做好数据使用记录。实验日志里记清数据集的版本、下载日期、预处理细节不仅是为了合规要求更是为了复现。6. 如果只能选一个不同目标下的数据集优先级建议写到这里20个数据集盘完了但我知道很多人真正的问题是“我时间有限到底先跑哪个”。根据不同目标给个直接的排序建议。目标是快速入门医疗AI从NIH ChestX-ray14开始。它是医疗影像分类任务的最佳入门数据量足够大任务定义清晰申请流程简单。配合ResNet或EfficientNet跑一个baseline再套用迁移学习技巧调参两三天就能走通医疗影像的基本pipeline。目标是发论文做分割任务把BraTS和ISIC作为两个必跑benchmark。BraTS有完整的评估协议和历年SOTA对比ISIC每年更新且覆盖面广。先分别跑通再考虑如何增强模型的结构感知能力能覆盖大多数分割类论文的实验需求。目标是做临床预测或时序建模直接从MIMIC-IV入手。虽然前期需要投入时间学习表结构和数据清洗但一旦跑通了特征提取流程你拥有的将是医疗数据中最丰富、最具临床意义的数据源之一。后续无论做死亡预测、再入院预测还是用药效果分析都能复用这套工程能力。目标是研究医疗NLP从n2c2开始。它提供的任务定义明确且官方有评测脚本适合建立基线后和后续方法做对比。跑通后可以再到MIMIC的放射学报告上做预训练实验。每个方向都是“先跑通一个完整pipeline再去积累数量”的思路。医疗数据集的申请和清洗门槛确实比普通数据集高但这也是它的门槛价值能把这些数据处理明白的人在团队里本身就是稀缺资源。我的个人建议是尽早申请MIMIC哪怕暂时用不上——审核周期摆在那里等真需要的时候再申请大概率会耽误你的研究进度。先把钥匙拿到手什么时候开门都来得及。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进