糖尿病肾病患者精准预测模型 机器学习+SHAP!IF10.6期刊复现!
作者Toby,来源公众号:Python生物信息学,糖尿病肾病患者精准预测模型
大家好,我是Toby老师,今天看到一篇高分期刊文章,分享给大家。AI在心血管疾病(CVD)的诊断、治疗以及临床结局预测方面得到了广泛的应用。机器学习(ML)能够让计算机从大量数据中进行学习,从而识别出其中的模式并据此做出预测。本研究的主要目标是探究机器学习模型的开发及其可解释性,特别是针对来自西里西亚糖尿病心脏项目中的糖尿病(DM)和慢性肾脏病(CKD)患者,预测他们发生心血管事件(CVE)的风险。
01文献解读
- Literature interpretation -

标题title:Predicting major adverse cardiac events in diabetes and chronic kidney disease: a machine learning study from the Silesia Diabetes-Heart Project预测糖尿病和慢性肾脏病的主要不良心脏事件:西里西亚糖尿病心脏项目的一项机器学习研究
期刊:Cardiovascular Diabetology
(《Cardiovascular Diabetology》是一本专注于糖尿病与心血管疾病交叉领域的国际学术期刊。自2002年创刊以来,该期刊始终致力于探索糖尿病、心血管健康和代谢综合征之间的关系。它由Springer Nature旗下的BioMed Central出版,采用开放获取(Open Access)模式,这意味着所有文章都可以免费获取,有助于研究成果的广泛传播)
发布时间:2025年2月
影响因子:10.6/Q1
官网下载链接:
https://cardiab.biomedcentral.com/articles/10.1186/s12933-025-02615-w
1研究背景IBackground
糖尿病和慢性肾脏病患者发生心血管事件的风险有较强相关性,但医院传统科研方法有限,借助AI机器学习模型,我们可以更好为医生提供科学参考。
- 风险显著升高
:DM 与 CKD 同时存在时,患者的心血管死亡、心肌梗死、脑卒中等重大事件的发生率远高于单纯 DM 或单纯 CKD 人群。KDIGO 2024 指南明确指出,CKD 患者的心血管风险在传统人群模型中常被低估,需要使用专门针对 CKD 的预测工具。
- 关键风险因素
:eGFR 下降、尿白蛋白/肌酐比(UACR)升高、糖化血红蛋白(HbA1c)水平、年龄、血压、既往冠心病(CAD)等均与 CVE 发病密切相关。
2研究方法IResearch Methods
作者运用机器学习模型,针对西里西亚糖尿病心脏项目里的糖尿病和慢性肾脏病患者,来预测他们可能出现的心血管事件。为此,我们搭建了5种不同的机器学习模型,包括逻辑回归(Logistic Regression, LR)、随机森林(Random Forest, RF)、支持向量分类(Support Vector Classification, SVC)、Light Gradient Boosting Machine(LGBM)和eXtreme Gradient Boosting Machine(XGBM)随后,我们对这5种模型的预测能力进行了比较分析,同时借助Shapley加性解释(SHAP)这一工具,对模型的可解释性进行了评估。

图1. 研究设计流程图
Study flowchart. eGFR, estimated glomerular filtration rate; NA, not available; UAE, urine albumin excretion
02研究结果
- Findings: -
01变量对比分析研究

表1. 研究组基线特征
在两组人中,空腹血糖水平差不多,不过那些没有心血管事件(CVE)的人,糖化血红蛋白(HbA1c)水平更高。而且,两组在使用降糖药物的情况上也很相似,不管是胰岛素还是其他口服降糖药,使用情况都差不多。(表2)。
02与有心血管事件(CVEs)组和无心血管事件(CVEs)组进行比较

表2. ML模型性能对比
数据集data被随机划分成train训练集和test测试集,比例为7:3。训练集和测试集在所有比较的参数上都具有可比性。训练集和测试集的基线特征见表2。

图2. 运用Boruta 和 LASSO 回归两种算法进行变量选择
A 蓝色图表展示了最小值、平均值和最大影子分数。变量的箱线图以绿色显示为重要变量,黄色为待定变量,红色为被拒绝变量。
B LASSO回归中L1范数与不同系数之间的相关性。L1范数是LASSO的正则化项。
C λ与二项式偏差之间的相关性。图中有两条虚线。左边的虚线表示最小均方误差,右边的虚线表示从最小均方误差偏离一个标准误差。
03机器学习模型的区分能力


图中包括了五种不同的机器学习模型:
-
逻辑回归(Logistic Regression, LR):蓝色曲线,AUC(曲线下面积)为0.621,95%置信区间为[0.618, 0.623]。
-
随机森林(Random Forest, RF):橙色曲线,AUC为0.707,95%置信区间为[0.704, 0.709]。
-
支持向量分类(Support Vector Classification, SVC):绿色曲线,AUC为0.707,95%置信区间为[0.704, 0.710]。
-
轻量梯度提升机(Light Gradient Boosting Machine, LGBM):红色曲线,AUC为0.740,95%置信区间为[0.738, 0.743]。
-
极端梯度提升机(Extreme Gradient Boosting Machine, XGBM):紫色曲线,AUC为0.710,95%置信区间为[0.707, 0.713]。
AUC值越接近1,模型的判别能力越强。从图中可以看出,LGBM模型的AUC值最高,为0.740,表明其在预测CVEs方面的表现最好。其次是XGBM和SVC,它们的AUC值相同,为0.710。随机森林的AUC值为0.707,而逻辑回归的AUC值最低,为0.621。
04模型可解释性

图4. 变量的重要性排序和解释
特征的重要性及其对输出的贡献通过SHAP值评估来确定。A 图中展示了十个特征的重要性,按降序排列,并以两个矩阵的形式呈现,分别代表类别0和类别1,分别代表阴性和阳性分类;B 图是SHAP蜜蜂群图,用于解释每个特征的贡献,其中红色增加解释性,而蓝色减少解释性。CRP代表C反应蛋白;eGFR代表估算的肾小球滤过率;HbA1c代表糖化血红蛋白;HF代表心力衰竭;HTN代表高血压;TyG代表甘油三酯葡萄糖指数。中风指的是中风病史。
03文章点评
- Summary of the Paper-
文章中作者开发了一种机器学习模型,专门用来预测患有糖尿病(DM)和慢性肾脏病(CKD)的患者的心血管事件(CVE)风险,而且这个模型有很好的解释性。研究测试了多种不同的机器学习模型,发现它们在预测这类患者发生心血管事件方面都表现不错,尤其是美国微软公司算法(LGBM)模型表现最佳。研究还发现,估算的肾小球滤过率(eGFR)的降低、年龄增长以及炎症标志物水平的升高,这些因素都能显著提高模型预测的准确性。
重庆未来之智的Toby老师在论文定制有丰富经验,这里提出一些建议。整体来看文章插图做的不错,整体很好,值得大家学习参考。文章中模型区分能力最好的lightgbm只有0.7,说明变量的整体区分能力不够,作者还可以继续收集数据,特别是强变量,然后再迭代建模。变量特征工程可以做一些,可略微提升模型性能。
SHAP解释中表明eGFR代表估算的肾小球滤过率为最重要变量。但临床医生都知道肾小球滤过率为肾病的核心检测方法,这里是否涉及建模数据泄露,可以思考一下。
IF10.6期刊复现!机器学习+SHAP!糖尿病肾病患者精准预测模型就为大家介绍到这里。
版权声明:文章来自公众号(python生物信息学),未经许可,不得抄袭。遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
更多推荐
所有评论(0)