近日,上海临床研究中心特聘科学家、上海科技大学生物医学工程学院沈定刚教授团队联合上海联影智能、北京联影智能等机构,在 Nature 旗下知名期刊 npj Digital Medicine (IF=18) 上在线发表了题为 “Learning Like a Radiologist: A Medical Vision-Language Model for Radiological Image Analysis via Curriculum Learning” 的研究论文。该研究开发了一种面向放射影像分析的医学视觉语言模型 RadiSim-CL,旨在提升模型在 MR、CT、DR 等多模态影像及不同层级诊断任务中的泛化能力,为医学视觉语言模型走向复杂放射诊断推理提供了新的路径。

放射影像是疾病诊断和治疗评估的重要依据,但快速增长的影像数据给放射科医生带来了持续增加的阅片压力。现有医学视觉语言模型虽然在医学图像理解中展现出潜力,但在训练数据质量、适用范围和评价方式上仍与真实临床需求存在差距:部分模型依赖噪声较高的公开图文数据,部分模型局限于单一疾病或单一模态,现有评估也难以反映放射科医生由基础识别到复杂诊断推理的能力形成过程。该研究的创新在于从放射科医生的学习和阅片逻辑出发,将数据构建、模型训练和模型验证设计为相互衔接的整体框架。

RadiSim-CL 研究总体框架。(A) RadiSim 数据集构建与分布;(B) 三阶段课程学习训练策略;(C) 五阶段由粗到细的临床化评估体系。
在数据层面 (图2A),研究团队构建了大规模放射影像-文本数据集 RadiSim。该数据集初始汇集了约6118万组影像-文本对,经过系统清洗、筛选和语义增强后,最终形成1200万组高质量放射影像-文本对,并按照知识层级组织为基础医学图文数据、解剖结构相关数据和诊断报告相关数据。
在模型训练层面 (图2B),RadiSim-CL 采用“基础知识理解—解剖知识获取—高级诊断推理”的三阶段课程学习策略。模型首先学习医学图像与文本之间的基础对应关系,随后强化对人体解剖结构及空间关系的理解,最终进一步学习异常检测、疾病诊断、疾病分型和分级等高阶任务。
在模型验证层面 (图2C),研究团队建立了五阶段由粗到细的评估体系,依次评估影像模态识别、解剖结构识别、解剖结构定位、异常与疾病诊断、疾病分型与分级能力,覆盖 MR、CT、DR 三类影像模态和24个零样本子任务。实验结果显示,RadiSim-CL 在基础识别任务中表现稳定。例如,在影像模态识别任务中,模型总体准确率达到0.996,优于 BiomedCLIP 和 MedSigLIP;在 MRI 多器官识别任务中,Macro AUC 达到0.888,显示出较好的解剖结构理解能力。进一步的解剖定位可视化结果显示,模型能够聚焦于肝脏、肾脏等目标器官区域,并对左右肾等对称结构形成区分,提示其不仅能够识别解剖结构,也具备一定的空间定位能力。在更复杂的疾病相关任务中,RadiSim-CL 同样表现突出,例如脑肿瘤检测 AUC 达到 0.953,COVID-19 CT 诊断 AUC 达到0.947,并在脑肿瘤分型、脑膜瘤分级、肺腺癌亚型分类等细粒度任务中取得较好结果,例如脑肿瘤分型准确率达到0.835。
消融实验 (图3) 进一步表明,相比直接混合训练,按照临床认知路径组织数据并进行课程式训练,能够帮助模型逐步获得更稳定的医学影像理解能力。例如在肺炎诊断任务中,课程训练使 AUC 从0.315提升至0.852,说明训练顺序和数据组织方式对医学视觉语言模型的能力形成具有重要影响。

消融研究证明了课程学习策略的影响。拟议的基于课程的培训 (RadiSim-CL) 和统一培训基线 (RadiSim-uniform) 之间的性能比较,以及中间模型 (RadiSim-CL1 和 RadiSim-CL2)
该研究为医学视觉语言模型从通用图文对齐走向临床化诊断推理提供了新的技术路径,也为未来放射影像辅助诊断、智能筛查和临床决策支持系统的构建提供了方法基础。
上海科技大学生物医学工程学院博士研究生谭敏慧、北京联影智能吴青霞为本文共同第一作者。上海临床研究中心特聘科学家、上海科技大学沈定刚教授 (同时任联影智能联席 CEO) 和上海联影智能曹晓欢 (同时任上海科技大学生物医学工程学院特聘研究员) 为本文共同通讯作者。上海科技大学为第一完成单位,上海临床研究中心为共同完成单位。上海联影智能、北京联影智能等单位参与合作研究。
论文链接:
https://doi.org/10.1038/s41746-026-02713-3