一、 线性回归

1.1 基本概念

线性回归用于建模连续型目标变量(因变量)与一个或多个特征(自变量)之间的线性关系。其核心思想是找到一条直线(或超平面),使得所有数据点到该直线的距离之和最小。

  • 简单线性回归:只有一个自变量。模型形式为:y = β₀ + β₁x + ε
    • y:因变量(目标值)。
    • x:自变量(特征)。
    • β₀:截距(Intercept)。
    • β₁:斜率(Coefficient),表示x每变化一个单位,y的平均变化量。
    • ε:误差项(随机噪声),通常假设服从均值为0的正态分布。
  • 多元线性回归:有多个自变量。模型形式为:y = β₀ + β₁x₁ + β₂x₂ + ... + βₚxₚ + ε

1.2 参数估计:最小二乘法(OLS)

线性回归模型的参数(β)通常通过最小二乘法(Ordinary Least Squares, OLS)进行估计。其目标是找到一组参数,使得残差平方和(RSS)最小。

目标函数min Σ(yᵢ - ŷᵢ)²,其中ŷᵢ是模型预测值。

通过求解正规方程或使用梯度下降等优化算法,可以得到参数的最优解。

1.3 模型评估指标

  • R²(决定系数):表示模型解释的方差比例,取值范围[0, 1],越接近1说明模型拟合越好。
  • 调整R²(Adjusted R²):考虑了自变量个数的影响,防止过拟合,用于比较不同特征数量的模型。
  • 均方误差(MSE)均方根误差(RMSE)平均绝对误差(MAE):衡量预测值与真实值之间的平均差异。

1.4 应用场景

  • 预测血压收缩值。
  • 预测房价、销售额等连续数值。
  • 金融领域预测股票收益率、风险评估等。

二、逻辑回归

2.1 基本概念

逻辑回归虽然名字里有“回归”,但它是一种用于解决二分类问题的线性模型。其核心是使用Sigmoid函数(Logistic函数)将线性组合的结果映射到(0, 1)区间,解释为属于某一类的概率

模型形式

  1. 线性部分:z = β₀ + β₁x₁ + ... + βₚxₚ
  2. Sigmoid变换:p = 1 / (1 + e⁻ᶻ)

其中,p表示样本属于正类(通常标记为1)的概率。最终分类决策通过设定一个阈值(通常为0.5)实现:若p ≥ 0.5,则预测为正类;否则预测为负类。

2.2 参数估计:最大似然估计(MLE)

逻辑回归的参数通过最大似然估计(Maximum Likelihood Estimation, MLE)求解。目标是找到一组参数,使得观测到的样本数据出现的似然性(Likelihood)最大。

通常转化为最小化对数损失函数(Log Loss),并使用梯度下降、牛顿法等优化算法进行求解。

2.3 模型评估指标

由于处理的是分类问题,评估指标与回归不同:

  • 准确率(Accuracy):分类正确的样本比例。
  • 精确率(Precision)召回率(Recall):用于不平衡数据集。
  • F1分数:精确率和召回率的调和平均。
  • ROC曲线与AUC值:评估模型在不同阈值下的整体分类性能。
  • 混淆矩阵(Confusion Matrix):直观展示分类结果。

2.4 应用场景

  • 银行贷款预测。
  • 疾病诊断(患病/健康)。
  • 金融风控(违约/不违约)。
  • 广告点击预测(点击/不点击)。

三、 核心区别与联系

对比维度线性回归逻辑回归
问题类型回归(预测连续值)分类(预测离散类别)
输出范围(-∞, +∞)(0, 1),表示概率
核心函数恒等函数(Identity)Sigmoid函数(Logistic)
参数估计方法最小二乘法(OLS)最大似然估计(MLE)
目标变量分布连续,假设正态分布二项分布
损失函数均方误差(MSE)对数损失(Log Loss)

联系:两者都属于广义线性模型(GLM)家族。逻辑回归可以看作是线性回归经过一个Sigmoid连接函数变换后的特例,用于处理因变量服从二项分布的情况。

更多推荐