源自风暴统计网:一键统计分析与绘图的AI网站

 引言

机器学习的含金量还在上升!今天这篇文章,湘雅学者结合NHANES免费数据,探究常规临床指标+多种机器学习,最大程度减轻数据负担。这套操作实用性极强,超有看点!

文中涉及的统计学方法和公共数据库 郑老师团队都提供对应的课程 欢迎各位咨询~

哮喘是一种全球范围内高发的慢性呼吸系统疾病,伴有显著的心理共病风险,而抑郁症在哮喘患者中尤为普遍。但目前,临床上对哮喘患者抑郁的筛查缺乏基于客观指标的早期风险预测工具。

2025年10月26日,中南大学湘雅医院学者用 NHANES 数据库,在期刊《Journal of Affective Disorders(医学二区,IF=4.9)发表了一篇题为:“Screening for depression risk in asthma patients: Development and external validation of a machine learning-based predictive model”的研究论文,旨在探究哮喘患者罹患抑郁症的核心风险因素,构建并验证针对哮喘患者抑郁症的临床预测模型。

研究表明,该团队开发了一个用于预测哮喘患者抑郁症状发生风险的模型,并通过列线图进行可视化。

本公众号回复“ 原文”即可获得文献PDF等资料,想用NHANES数据库发文,欢迎联系郑老师团队,微信号:aq566665

研究团队基于美国国家健康与营养调查(NHANES)2005-2018年数据,经过纳排,最终纳入了3,517名≥18岁且符合条件的参与者。

整体队列分为训练集(2005–2012年,n=1,951)和验证集(2013–2018年,n=1,566)。

图1 参与者纳排流程

研究首先通过联合特征筛选策略(单因素logistic回归+LASSO回归+Boruta算法),确定与抑郁风险相关的核心变量。

随后,研究使用11种机器学习算法(如 CatBoost、Random Forest 和 LightGBM 等)构建预测模型,并筛选出最优模型进行可视化呈现,通过ROC曲线、校准曲线和决策曲线分析(DCA)评估模型性能。最终,进行了外部验证。

主要研究结果

结果显示,研究确定了六项与哮喘患者抑郁风险相关的核心预测变量。

具体而言,包括过去一年内哮喘急性发作、吸烟状态、贫困收入比(PIR)、总胆红素、慢性阻塞性肺疾病(COPD)和血清葡萄糖。

图2 预测变量筛选

(A)LASSO回归;(B)L1正则化;(C)Boruta算法

基于最终选定的预测变量集合,研究通过多种机器学习算法构建预测模型。其中,Logistic回归模型表现最佳。

表1 训练集基于十折交叉验证预测模型性能

同时,模型的ROC曲线下面积(AUC)在训练集和验证集中均超过 0.7,证实了模型对哮喘患者抑郁风险预测能力的稳健性。

图3 预测模型的性能评估

(A)训练集 ROC 曲线;(B)训练集校准曲线;(C)训练集 DCA

图4 预测模型的外部验证

(A)验证集 ROC 曲线;(B)验证集校准曲线;(C)验证集 DCA

此外,研究还构建了列线图以将模型可视化,从而进一步评估预测变量对哮喘患者的抑郁风险的影响。

该列线图将各预测变量的贡献转化为对应分值,累计总分越高,抑郁风险越高,便于临床进行个体化风险评估。

图5 Logistic回归模型的列线图

综上所述,研究确定了过去一年内急性哮喘发作等六项核心预测变量,并开发了一个以列线图呈现的预测模型,用于预测哮喘患者的抑郁风险。该模型可用于快速识别抑郁高风险患者,有助于早期心理干预,改善疾病管理效果。

郑老师统计服务

想用机器学习发文,却碍于基础太差?

别担心!郑老师团队统计服务,助力过数百项国家级课题,经验丰富,手把手教你从课题设计到统计分析,小白也能体验到高效科研的乐趣!

感兴趣的小伙伴,欢迎联系~

记得点个小小的关注👇

我们将为您分享更多公共数据库的高分发文思路和统计小技巧!

更多推荐