监督学习 - 做 分类、回归

  • K 近邻算法(KNN)
  • 决策树算法
  • 支持向量机算法(SVM)
  • XGBoost
  • LightGBM

无监督学习

  • K 均值算法(K-Means)
  • PCA 算法

深度学习/网络神经类算法

  • 神经网络(全连接)
  • 卷积神经网络(CNN)
  • Temporal Fusion Transformer(TFT)

各种算法功能及适用场景

一、监督学习算法(用于有标签数据的预测任务,包括分类与回归)

1. K近邻算法 (K-Nearest Neighbors, KNN)

  • 基本功能:基于特征空间中距离度量,找到与待测样本最近的K个已知样本,通过投票(分类)或平均(回归)得到预测结果。

  • 适用场景:适用于低维空间、样本量适中的分类/回归问题,如手写数字识别、推荐系统中的用户相似度匹配。对数据分布无假设,但计算量大且对特征缩放敏感

2. 决策树算法 (Decision Tree)

  • 基本功能:通过树形结构对特征进行递归划分,每个节点对应一个特征判断,叶子节点输出类别(分类)或数值(回归)。结果可解释性强。

  • 适用场景:适用于需要解释模型逻辑的场景,如信用风险评估、医疗诊断辅助。容易过拟合,需配合剪枝或集成方法使用。

3. 支持向量机 (Support Vector Machine, SVM)

  • 基本功能:寻找一个超平面使得不同类别样本的间隔最大化;通过核技巧可处理非线性分类/回归问题。

  • 适用场景:中小型数据集、高维特征(如文本分类)效果较好,对异常值鲁棒。在图像识别、生物信息学中应用广泛。

4. XGBoost算法 (eXtreme Gradient Boosting)

  • 基本功能:基于梯度提升框架的集成学习算法,通过迭代生成弱学习器(通常是决策树),并优化损失函数。引入正则化、列采样等技术防止过拟合。

  • 适用场景:广泛应用于各类结构化数据的分类/回归任务,如金融风控、广告点击率预测、竞赛数据挖掘。训练速度快、精度高。

5. LightGBM算法 (Light Gradient Boosting Machine)

  • 基本功能:同样是梯度提升决策树(GBDT)的高效实现,采用基于直方图的决策树算法、单边梯度采样等技巧,大幅降低内存消耗并提升训练速度。

  • 适用场景:与XGBoost类似,尤其适合大规模数据和高维特征场景,如推荐系统、用户行为预测。对类别特征有原生支持。

二、无监督学习算法(用于无标签数据,发现数据内在结构)

6. K均值算法 (K-Means)

  • 基本功能:一种聚类算法,将样本划分为K个簇,使得簇内样本距离最小化、簇间距离最大化。通过迭代更新簇中心实现。

  • 适用场景:客户分群、图像分割、文档聚类等需要将数据分组但无标签的场景。需预先指定K值,对初始中心敏感。

7. PCA算法 (Principal Component Analysis)

  • 基本功能:一种线性降维技术,通过正交变换将原始特征转换为少数几个不相关的主成分,保留数据最大方差。

  • 适用场景:数据可视化、特征压缩、去噪,如高维基因表达数据的降维、图像特征提取。适用于特征间存在线性相关性的数据。

三、深度学习/神经网络类算法(基于多层神经网络,自动提取特征)

8. 神经网络算法 (Neural Network, NN)

  • 基本功能:由输入层、隐藏层、输出层组成的连接模型,通过前向传播和反向传播学习复杂非线性映射。包括多层感知机(MLP)等基础形式。

  • 适用场景:通用非线性建模,如手写识别、房价预测、简单的时序预测。适用于中等规模数据,可扩展性强。

9. 卷积神经网络 (Convolutional Neural Network, CNN)

  • 基本功能:专门处理网格结构数据(如图像、语音)的神经网络,通过卷积层、池化层自动提取局部特征,参数共享减少计算量。

  • 适用场景:图像分类、目标检测、医学影像分析、视频理解等计算机视觉任务;也可用于文本分类(将句子视为一维网格)。

10. Temporal Fusion Transformer (TFT)

  • 基本功能:一种专门用于时间序列预测的深度学习模型,结合了Transformer的自注意力机制、循环网络和多层感知机。能够处理静态特征(如用户属性)、已知未来输入(如干预计划)和多个时间步的观测值,并提供可解释性(如特征重要性)。

  • 适用场景:多变量时间序列预测,尤其需要融入外部协变量的场景,如销量预测、能源负荷预测、个性化医疗健康预测(如用户补硒后的硒含量变化)。

总结:

我的应用场景:

我们有客户之前检测的头发硒含量,会收集客户信息:身高、体重、年龄、补硒量、补硒时间等,通过我们实验室检测得到一个头发硒含量,代表身体硒元素含量,我们现在想做一个根据客户信息以及疾病情况做一个头发硒预测模型,预测客户补硒之后,未来3年内身体能达到一个什么样的硒水平。应该选择什么样的大模型

初步实现模型:选择LightGBM模型算法

        适用性:3-5万样本量,可处理混合类型特征,训练快,可解释性强。

           优点:容易实现,可快速验证。

                      可通过SHAP值解释哪些因素(累积补硒量、疾病、年龄等)对预测影响最大。

进阶模型:Temporal Fusion Transformer (TFT)

        适用性:如果大量客户有多次检测(如每个客户≥3次),且希望捕捉个体内的时间依赖。

            优点:

                      自动学习时间模式(如增长曲线、平台期、中断后的下降)。

                      提供注意力权重,可解释哪些时间点或特征更重要。

更多推荐