期刊:Nature Biomedical Engineering(自然生物医学工程,IF=29.7,Nature系列旗舰生物医学工程子刊,创刊于2017年,聚焦生物医学工程与转化医学交叉领域,是生物医学工程领域最具影响力的期刊之一)

发表时间:2026年7月13日(在线发表)

作者:Zelin Qiu(共同第一作者,香港科技大学计算机科学与工程系)、Xi Wang(共同第一作者,香港科技大学计算机科学与工程系)、Zhuoyao Xie(共同第一作者,南方医科大学第三附属医院放射科)、Juan Zhou(解放军总医院第五医学中心放射科)、Yu Wang、Lingjie Yang、Xinrui Jiang、Juyoung Bae、Moo Hyun Son、Qiang Ye、Dexuan Chen、Rui Zhang、Tao Li、Neeraj Ramesh Mahboobani(香港中文大学)、Varut Vardhanabhuti(香港大学)、Xiaohui Duan(通讯作者,中山大学孙逸仙纪念医院放射科)、Yinghua Zhao(通讯作者,南方医科大学第三附属医院放射科)、Hao Chen(通讯作者,香港科技大学计算机科学与工程系/化学与生物工程系/生命科学部)

研究机构:香港科技大学(第一/通讯单位)、南方医科大学第三附属医院、解放军总医院第五医学中心、中山大学孙逸仙纪念医院、香港中文大学、香港大学、香港科技大学深圳-香港协同创新研究院、神经系统疾病国家重点实验室

DOI:10.1038/s41551-026-01740-5

PMID:42443444

资金支持:香港食物及卫生局医疗卫生研究基金(20211021)、国家自然科学基金(62402458)

— — —

一、研究背景

在放射科的日常工作中,有一个几乎所有临床医生都习以为常的操作:同一个病人,往往需要做多个序列的MRI扫描。T1加权像看解剖结构,T2加权像看病变水肿,FLAIR序列看脑白质病变,DWI看急性脑梗死,增强扫描看肿瘤血供……以头颅MRI为例,一套标准的扫描方案通常包含T1WI、T2WI、T2-FLAIR、DWI、ADC和T1增强等多个序列,每个序列提供不同的组织对比度信息,放射科医师需要将这些序列综合考虑,才能做出准确的诊断判断。

问题在于,这种"多序列互补"的优势,恰恰成了AI模型落地的最大障碍。

2025年,Sun等人在Nature Biomedical Engineering上发表的MRI基础模型研究,虽然展示了通过自监督学习提升MRI图像增强和分割任务的潜力,但这类模型通常只针对单一序列或单一解剖部位进行训练。当模型从一个序列换到另一个序列、从一个医院换到另一个医院、甚至从一台扫描仪换到另一台扫描仪时,性能往往大幅下降。2020年Mårtensson等人在Medical Image Analysis上的研究也证实了这一点:深度学习模型在分布外(out-of-distribution)MRI数据上的可靠性明显下降。

为什么会这样?因为MRI序列之间存在巨大的异质性(heterogeneity):T1像和T2像的信号强度分布截然不同,不同厂家的扫描参数千差万别,甚至同一台机器在不同时间扫出来的图像都有细微差异。传统的深度学习模型在训练时学到的是"这个序列-这个解剖部位"的特定映射,而不是"无论什么序列、什么部位都能理解"的通用影像表征。

这就像训练一个只能识别北京话的语音助手,到了广州就完全听不懂了——而MRI的"方言"种类,远比人类语言要多得多。

二、研究创新点

MARS(Multi-sequence MRI Analysis with Robust representations)的核心创新在于提出了一种全新的预训练策略,其设计理念可以用一句话概括:将解剖结构不变的特征(anatomy-invariant features)与序列特异的变异(sequence-specific variations)解耦开来

具体来说,这项研究包含以下创新点:

第一,超大规模多序列预训练语料库。 研究团队收集了64个数据集,涵盖10个解剖结构(脑、心脏、肝脏、肾脏、胰腺、前列腺、膝关节、脊柱、头颈、腹部多器官)和多种MRI序列(T1、T2、FLAIR、DWI、ADC、DCE、T1增强等)。从中筛选出34个数据集(8个公开数据集和26个私有数据集),共计336,476个三维容积扫描,构建了迄今为止规模最大的多器官、多序列MRI预训练语料库。

第二,解剖-序列解耦预训练策略。 MARS的核心技术贡献是一种新颖的预训练方法,能够在学习过程中主动分离"什么解剖结构"(what)和"用什么序列拍的"(how)这两类信息。通过这种方式,模型提取出的特征既包含了对解剖结构的高层语义理解,又不受序列类型、扫描参数和成像设备的干扰。

第三,覆盖五种临床任务的统一基准。 研究团队建立了包含44个下游任务的全面基准,涵盖诊断(diagnosis)、分割(segmentation)、配准(registration)、疾病进展预测(progression prediction)和放射学报告生成(report generation)五大临床场景。这是首个在单一基础模型框架下同时评估这五类任务的综合基准。

三、技术原理

MARS的技术架构围绕"解剖-序列特征解耦"这一核心思想展开,可以分为三个关键模块:

1. 多序列数据编码与对比学习框架

MARS的预训练阶段采用了对比学习(contrastive learning)的核心范式。但与传统的对比学习方法(如2020年Chen等人提出的SimCLR)不同,MARS引入了"正样本对"和"负样本对"的多序列感知策略。对于同一个解剖区域的同一个患者,T1和T2序列被视为"同解剖-不同序列"的正样本对;对于不同解剖区域或不同患者,则构成负样本对。这种设计迫使模型学习到:同一解剖结构在不同序列下应该共享相似的表示,而不同解剖结构在任何序列下都应该保持距离。

2. 解剖不变特征提取器

MARS基于Vision Transformer(ViT)架构构建特征提取器,但不同于标准ViT在ImageNet上的预训练方式,MARS使用了医学影像专用的掩码自编码器(Masked Autoencoder, MAE)策略进行初始化。具体来说,模型在预训练时随机遮挡输入MRI容积中的部分体素,然后要求模型重建被遮挡的区域。这种"完形填空"式的训练方式迫使模型学习MRI影像的内在结构规律,而不是依赖ImageNet自然图像的外观特征。

3. 序列感知特征调制模块

这是MARS最独特的设计。在特征提取完成后,MARS引入了一个序列感知特征调制模块(Sequence-Aware Feature Modulation),该模块接收序列类型(如T1、T2、FLAIR等)作为输入,通过可学习的调制参数对特征图进行逐通道的缩放和平移。这种设计使得模型可以在推理时根据输入序列的类型动态调整特征表示,而无需为每个序列训练独立的模型。

4. 下游任务适配

在预训练完成后,MARS通过轻量化的任务头(task heads)适配到不同的下游任务。对于分割任务,使用基于U-Net的解码器;对于分类任务,使用全局平均池化加全连接层;对于报告生成任务,使用基于LLaMA 2的文本解码器。重要的是,预训练的主干网络参数在所有任务中共享,只需微调少量参数即可适配新任务。

四、实验结果

MARS在44个下游任务中取得了41项第一,以压倒性优势验证了其泛化能力。以下是关键实验结果:

诊断分类任务(Diagnosis)

在12个疾病诊断分类任务中,MARS在11项中排名第一。涵盖的疾病范围极广:从脑肿瘤分型(胶质瘤WHO分级)、阿尔茨海默病分期、帕金森病识别,到肝脏病变分类、前列腺癌检测、膝关节骨关节炎分级等。以脑肿瘤分类为例,MARS在BraTS 2021基准上的AUC达到了0.961,显著优于第二名方法(AUC=0.934,p<0.001)。在前列腺癌检测(PI-CAI挑战赛数据集)中,MARS的AUC达到0.943,与放射科医师的平均表现(AUC=0.938)相当,且显著优于之前的最佳模型(AUC=0.912)。

分割任务(Segmentation)

在18个器官/病变分割任务中,MARS在17项中排名第一。分割的解剖结构涵盖脑、心脏、肝脏、肾脏、胰腺、前列腺、膝关节、脊柱、头颈和腹部多器官,总计超过80个不同的解剖结构或病变区域。MARS的平均Dice系数达到0.867,比第二名方法高出约3.5个百分点。在最具挑战性的胰腺分割任务中,MARS的Dice系数达到0.843,而此前的最佳方法仅达到0.791。

配准任务(Registration)

在6个图像配准任务中,MARS在5项中排名第一。配准精度(Dice重叠率)平均提升2.1%,且配准速度比传统方法快了约40倍(从数分钟降至数秒)。

疾病进展预测(Progression Prediction)

在4个疾病进展预测任务中,MARS在全部4项中排名第一。包括阿尔茨海默病认知功能下降预测(ADNI数据集)、膝关节骨关节炎进展预测(OAI数据集)、帕金森病运动功能恶化预测(PPMI数据集)和肝纤维化进展预测。以阿尔茨海默病认知功能下降预测为例,MARS的C-index达到0.789,显著优于基于临床变量的模型(C-index=0.721)。

报告生成(Report Generation)

在4个报告生成任务中,MARS在全部4项中排名第一。涵盖脑MRI报告、膝关节MRI报告、腹部MRI报告和心脏MRI报告生成。以脑MRI报告生成为例,MARS生成的报告在BLEU-4、METEOR和ROUGE-L三个指标上均显著优于R2GenGPT等现有方法。

跨机构泛化验证

尤为重要的是,MARS在所有外部验证集上均保持了领先性能。例如,在肝脏分割任务中,MARS在来自3个不同医院的外部数据集上的Dice系数分别为0.932、0.919和0.908,而第二名方法在同样的外部数据集上分别降至0.876、0.843和0.811。这种跨机构、跨扫描仪的鲁棒性,正是临床落地最需要的能力。

五、技术优势

1. 一个模型覆盖所有序列和所有解剖部位。 与传统的"一个序列一个模型"或"一个部位一个模型"的碎片化方案不同,MARS用单一模型覆盖了10个解剖部位和多种MRI序列,大幅降低了临床部署和维护的复杂度。

2. 跨机构泛化能力突出。 MARS在外部数据集上的性能衰减远小于现有方法,这意味着它具备了"拿来就用"的潜力——在一个医院群体上训练好的模型,可以直接部署到其他医院,无需大量本地数据重新训练。

3. 多任务统一框架。 诊断、分割、配准、预测和报告生成五大任务共用同一套预训练权重,这种"一次预训练,到处微调"的范式,与GPT等大语言模型的发展路径高度相似。

4. 数据规模优势。 336,476个三维MRI容积扫描的预训练规模,在MRI AI领域是空前的。作为对比,2025年Sun等人在Nature Biomedical Engineering上的MRI基础模型使用了约11,000个扫描,而MARS的数据量是其30倍以上。

5. 序列异质性的系统性解决。 通过解剖-序列特征解耦,MARS从根本上解决了MRI序列异质性这一长期困扰领域的问题,而不是简单地通过数据增强或领域自适应来"打补丁"。

六、应用前景

MARS的出现,为MRI AI的临床落地打开了几扇重要的大门:

放射科工作流智能化。 一个最直观的应用场景是:放射科医师打开任何MRI序列、任何解剖部位的影像,MARS都能自动完成器官分割、病变检测、定量测量,并生成结构化报告初稿。以腹部MRI为例,传统的手动分割肝脏、脾脏、肾脏并测量体积需要15-20分钟,而MARS可以在数秒内完成,同时保持与人工相当的精度。

多中心临床试验的影像终点标准化。 在肿瘤药物临床试验中,RECIST 1.1标准要求对靶病灶进行精确测量,但不同中心、不同扫描仪之间的测量差异可能高达15%-20%。MARS的跨机构一致性可以为多中心临床试验提供标准化的影像终点评估,减少测量偏倚。

大规模人群筛查。 结合MARS的高通量处理能力,可以在大规模人群健康筛查中自动识别脑白质病变、肝脂肪变性、膝关节软骨损伤等常见影像学异常,并生成风险分层报告。尤其对于医疗资源匮乏的地区,MARS可以作为"放射科医师的倍增器"。

影像-基因组学整合研究。 MARS提取的定量影像特征可以作为影像生物标志物(imaging biomarker),与基因组学、蛋白质组学数据整合,帮助揭示疾病的内在分子机制。例如,在阿尔茨海默病研究中,MARS的脑萎缩定量特征可以与APOE基因型、tau蛋白PET成像数据联合分析,建立更精准的疾病进展模型。

医学教育。 MARS的自动化分割和标注功能可以作为放射科住院医师培训的教学工具,帮助年轻医师快速建立正常解剖结构和病理改变的影像学认知。

七、研究局限性与未来方向

第一,序列覆盖仍有缺口。 尽管MARS涵盖了T1、T2、FLAIR、DWI、ADC、DCE等多种序列,但一些高级MRI技术如弥散张量成像(DTI)、磁共振波谱(MRS)、血氧水平依赖成像(BOLD fMRI)和动脉自旋标记(ASL)尚未纳入。这些功能序列在临床神经科学中具有重要价值,未来的版本需要扩展覆盖范围。

第二,罕见疾病代表性不足。 336,476个扫描虽然规模庞大,但其中大多数来自常见疾病和正常人群。对于罕见病(如某些遗传性代谢病、罕见神经系统变性疾病),训练数据仍然稀疏,MARS在这些疾病上的性能需要进一步验证。

第三,前瞻性临床验证缺失。 目前所有评估均为回顾性研究,MARS尚未在前瞻性临床试验中验证其对临床决策和患者结局的实际影响。这是从"实验室优秀"到"临床有用"的关键一步。

第四,计算资源需求巨大。 预训练336,476个三维MRI容积扫描需要大量的GPU算力,这可能限制了MARS在其他研究团队中的复现和进一步优化。研究团队是否开源预训练权重,将直接影响MARS的学术和产业影响力。

第五,报告生成质量仍需提升。 尽管MARS在自动评估指标上领先,但生成的放射学报告在临床准确性和语言自然度方面,与资深放射科医师撰写的报告仍有差距。特别是在描述复杂病变的形态特征、鉴别诊断建议等方面,生成质量还需要进一步提升。

未来方向: 研究团队表示,下一步计划将MARS扩展到CT成像领域,构建"CT-MRI通用医学影像基础模型"。此外,整合临床文本信息(如电子病历、实验室检查结果)的多模态版本也在规划之中。

八、结论

MARS是迄今为止规模最大、覆盖范围最广的多序列MRI基础模型。通过创新的解剖-序列特征解耦预训练策略,MARS在涵盖诊断、分割、配准、疾病进展预测和报告生成五大类别的44个下游任务中,取得了41项第一的压倒性成绩。其跨机构、跨扫描仪的泛化能力尤为突出,为MRI AI从"实验室研究"走向"临床常规应用"提供了可扩展的技术路径。

如果说2025年Sun等人发表在Nature Biomedical Engineering上的MRI基础模型展示了"一个模型做多个任务"的可能性,那么MARS则进一步证明了"一个模型覆盖所有序列、所有部位、所有任务"的可行性——这或许就是MRI AI领域的"GPT时刻"。

参考文献

1. Qiu Z, Wang X, Xie Z, et al. Large-scale multi-sequence pretraining for generalizable MRI analysis in versatile clinical applications. Nature Biomedical Engineering, 2026. DOI: 10.1038/s41551-026-01740-5. PMID: 42443444.

2. Sun Y, Wang L, Li G, Lin W, Wang L. A foundation model for enhancing magnetic resonance images and downstream segmentation, registration and diagnostic tasks. Nature Biomedical Engineering, 2025; 9: 521-538. DOI: 10.1038/s41551-024-01283-7. PMID: 39638876.

3. Mårtensson G, et al. The reliability of a deep learning model in clinical out-of-distribution MRI data: a multicohort study. Medical Image Analysis, 2020; 66: 101714. DOI: 10.1016/j.media.2020.101714. PMID: 33007638.

4. Wang YR, et al. Screening and diagnosis of cardiovascular disease using artificial intelligence-enabled cardiac magnetic resonance imaging. Nature Medicine, 2024; 30: 1471-1480. DOI: 10.1038/s41591-024-02971-2. PMID: 38740996.

5. Isensee F, Jaeger PF, Kohl SAA, Petersen J, Maier-Hein KH. nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation. Nature Methods, 2021; 18: 203-211. DOI: 10.1038/s41592-020-01008-z. PMID: 33288961.

6. Chen T, Kornblith S, Norouzi M, Hinton G. A simple framework for contrastive learning of visual representations. ICML, 2020: 1597-1607.

7. He K, et al. Masked autoencoders are scalable vision learners. CVPR, 2022: 16000-16009.

8. Saha A, et al. Artificial intelligence and radiologists in prostate cancer detection on MRI (PI-CAI): an international, paired, non-inferiority, confirmatory study. Lancet Oncology, 2024; 25: 879-887. DOI: 10.1016/S1470-2045(24)00220-1. PMID: 38876123.

更多推荐