决策树(Decision Tree,DT)是一种常用的监督学习算法,适用于分类和回归任务。该方法通过对输入变量进行逐层判断,将样本划分到不同的节点,最终得到预测结果。与传统统计模型相比,决策树具有结果直观、可解释性强和操作简单等特点,能够帮助研究者识别影响分类结果的重要特征,并评估模型的区分能力、预测性能和校准效果。

本文以HiOmics“决策树算法(Decision Tree,DT)”在线工具为例,介绍从数据准备、参数设置、任务运行到结果下载和图表解读的完整操作流程。用户无需编写代码,只需准备符合要求的数据文件,即可完成决策树模型构建和性能评估。

工具地址:https://www.henbio.com/tooldetail?id=321

准备数据文件上传

决策树工具主要用于二分类任务,因此输入数据中通常需要包含一个分类变量和多个预测特征。分类变量用于表示研究对象所属类别,预测特征可以是临床指标、实验测量结果、基因表达量、代谢物水平或其他数值型变量。

数据文件建议按照“每行一个样本、每列一个变量”的格式整理。第一列通常为目标变量Y,后续列为预测特征X。例如,目标变量可以命名为class,并使用0和1表示两类结果;预测变量可以包括bare_nuclei、bl_cromatin、cell_shape、cell_size、cl_thickness和epith_c等指标。

对于二分类任务,目标变量必须仅包含0和1。其中0通常代表阴性、未患病或对照组,1通常代表阳性、患病或病例组。预测特征可以为连续变量或经过编码后的分类变量。

设置交叉验证折数

交叉验证的折数用于评估模型在不同训练集和验证集上的稳定性。平台提供三折、四折、五折、六折、七折、八折、九折和十折等选项,默认通常为十折交叉验证。

在十折交叉验证中,数据会被划分为十个子集,模型依次使用其中九个子集进行训练,并使用剩余一个子集进行验证,重复多次后汇总模型性能。折数越高,训练数据利用率通常越高,但计算时间也可能增加。对于样本量较小的数据集,可以选择五折或十折交叉验证;对于样本量较大的数据集,可根据运行时间和研究需求进行选择。

设置AUC曲线显示颜色

工具允许用户自定义AUC曲线的显示颜色,包括AUC曲线颜色、AUC曲线置信区间颜色以及AUC对角线颜色。默认情况下,AUC曲线通常使用绿色,置信区间使用青色,对角参考线使用红色。

AUC曲线颜色主要用于显示受试者工作特征曲线,即ROC曲线;置信区间颜色用于表示模型性能估计的不确定范围;对角线表示随机分类水平。颜色设置不会改变模型计算结果,主要用于提高图表的可读性和满足论文制图需求。用户可以直接输入颜色代码,也可以点击右侧颜色选择框进行调整。

设置重要特征条形图显示数量

“重要特征条形图最多显示”参数用于控制最终特征重要性图中展示的变量数量。默认值通常为10,表示最多显示模型中排名靠前的10个特征。

如果预测变量较多,建议设置为10或20,以便突出最重要的变量并保持图表清晰。如果变量数量较少,也可以将该数值设置为实际变量数。该参数只影响图表展示数量,不会改变模型训练过程,也不会删除未显示的变量。未出现在条形图中的特征,仍可能参与模型构建,只是其重要性排名相对较低。

运行时间取决于样本量、变量数量和交叉验证折数。任务提交后,用户可以在“我的项目”或“项目结果”页面查看运行状态。

查看分析结果

查看结果文件,DT_model.rds为保存决策树模型的文件,适合后续在R环境中调用;Model_performance_result.tsv用于记录模型性能指标;Model_predicted_result.tsv保存每个样本的真实类别、预测类别及预测概率;Model_ROC.PDF为ROC曲线图;Model_DCA.PDF为决策曲线分析图;Model_CalibrationCurves.PDF为校准曲线图;Model_Feature_Importance.PDF和Model_Feature_Importance.xls分别用于展示和保存特征重要性结果。

模型性能结果解读

Model_performance_result.tsv通常包含Accuracy、Sensitivity、Specificity、Precision、Recall、F1-Score、ROC和AUC等指标。Accuracy表示整体预测正确的比例,数值越高说明总体分类正确率越高。Sensitivity又称灵敏度或召回率,表示实际为阳性的样本中被正确识别的比例。Specificity表示实际为阴性的样本中被正确识别的比例。

Precision表示被模型预测为阳性的样本中,真正属于阳性的比例。Recall与Sensitivity含义基本一致,主要反映模型识别阳性样本的能力。F1-Score是Precision和Recall的调和平均值,适合用于类别不平衡情况下综合评价模型性能。AUC表示ROC曲线下面积,通常用于评价模型区分阳性和阴性样本的能力。AUC越接近1,说明模型区分能力越强;AUC接近0.5,则说明模型性能接近随机分类。

部分结果还会提供95%置信区间。置信区间越窄,通常说明模型性能估计越稳定。需要注意的是,不能仅依据Accuracy或AUC判断模型优劣,应结合Sensitivity、Specificity、Precision、F1-Score和研究目的进行综合评价。

混淆矩阵和预测结果解读

混淆矩阵通常由TN、FP、FN和TP四部分组成。TN表示实际为0且预测为0的样本数量,FP表示实际为0但预测为1的样本数量,FN表示实际为1但预测为0的样本数量,TP表示实际为1且预测为1的样本数量。

Model_predicted_result.tsv中通常会保存真实类别、预测类别、positive_probability和negative_probability等信息。positive_probability表示样本属于阳性类别的预测概率,negative_probability表示样本属于阴性类别的预测概率。平台根据设定的分类阈值将概率转换为最终预测类别。

如果研究更关注减少漏诊,应重点关注Sensitivity和FN数量;如果更关注减少误诊,则应重点关注Specificity和FP数量。对于医学研究,还应结合疾病筛查、辅助诊断或预后预测的实际应用场景选择合适的评价指标。

ROC曲线和特征重要性图解读

ROC曲线以FalsePositiveRate为横坐标,以TruePositiveRate为纵坐标,用于展示不同分类阈值下模型的分类能力。曲线越靠近左上角,说明模型在较低假阳性率下能够获得较高真阳性率。图中的对角线代表随机分类结果,ROC曲线明显位于对角线之上时,说明模型具有一定区分能力。

特征重要性图用于展示各预测变量对决策树模型的相对贡献。条形越长,通常表示该变量在模型分类过程中发挥的作用越大。需要注意,特征重要性反映的是模型预测贡献,并不等同于统计学因果关系,也不能直接说明某个变量是疾病发生的独立危险因素。若要进行病因解释,还需结合回归分析、特征筛选、外部验证和专业背景进行判断。

决策曲线和校准曲线解读

决策曲线分析(DecisionCurveAnalysis,DCA)用于评价模型在不同阈值概率下的临床净获益。图中通常会同时显示TreatAll、TreatNone和PredictionModel三条曲线。如果模型曲线在一定阈值范围内高于TreatAll和TreatNone,说明在该范围内使用模型可能具有更高的临床决策价值。

校准曲线用于比较模型预测概率与实际观察概率之间的一致性。理想情况下,预测概率应接近实际发生概率,曲线越接近理想参考线,说明模型校准能力越好。ROC曲线主要评价区分能力,校准曲线评价概率准确性,DCA评价临床应用价值,三者分别从不同角度反映模型性能,不能相互替代。

总体而言,决策树在线工具适合用于快速建立分类预测模型、筛选重要特征并生成ROC曲线、DCA曲线和校准曲线。按照规范格式准备数据、合理设置交叉验证和图表参数,并结合多种性能指标进行综合评价,可以提高分析结果的可靠性和可解释性。

更多推荐