第2章 机器学习概述

机器学习的核心是让计算机从数据中自动总结规律,再用规律预测未知数据——就像教小孩认数字,不用告诉他具体规则,看够多例子自然就能学会分辨新数字。本章先拆解机器学习的基础概念、核心要素,再通过线性回归实例帮你理解,最后讲解偏差-方差分解,帮你判断模型好坏的根源。

2.1 基本概念

要搞懂机器学习,先理清几个核心术语,用“买芒果”的例子就能轻松理解:

2.1.1 核心术语

  • 样本:每个要分析的对象(比如一个芒果),包含“特征”和“标签”。
  • 特征:描述样本的属性(比如芒果的颜色、大小、产地),通常整理成“特征向量”(比如用[黄色, 中等, 海南]这样的向量表示)。
  • 标签:样本的结果(比如芒果“甜”或“不甜”,连续值如“甜度8分”或离散值如“好/坏”)。
  • 数据集:一堆样本的集合,分两类:
    • 训练集:用来让模型“学习”规律的样本(比如先买100个芒果,记录特征和品尝后的标签);
    • 测试集:用来检验模型学得好不好的新样本(再买20个芒果,用模型预测甜度,看准不准)。
  • 模型:从特征到标签的映射函数(比如“颜色黄+产地海南→甜”的规律),用参数控制(比如参数决定“颜色”和“产地”对甜度的影响大小)。
  • 学习算法:找到最优模型参数的方法(比如通过100个训练样本,算出哪个参数组合能最准确预测甜度)。

2.1.2 基本流程

机器学习的核心逻辑很简单:

  1. 把训练集的样本(特征向量+标签)输入给学习算法;
  2. 算法从样本中找到最优参数,确定模型函数;
  3. 用这个模型,输入新样本的特征向量,直接输出预测标签(比如新芒果的甜度)。

关键要求:训练集和测试集的样本要“独立同分布”——简单说,都是从同一个市场、同一类芒果中随机选的,保证规律通用。

2.2 机器学习的三个基本要素

任何机器学习算法,本质都是“模型+学习准则+优化算法”的组合,缺一不可:

2.2.1 模型:定义“可能的规律集合”

模型是所有可能的映射函数的集合,核心是“假设空间”——我们认为数据的规律就藏在这个集合里。

  • 线性模型:最简单的模型,特征是线性组合(比如 甜度=0.3×颜色分 + 0.7×产地分 + 0.2),参数是权重(0.3、0.7)和偏置(0.2);
  • 非线性模型:特征经过非线性转换后再组合(比如 甜度=0.3×(颜色分)² + 0.7×log(产地分)),能捕捉更复杂的规律(比如“颜色特别黄的芒果甜度增长更快”)。

2.2.2 学习准则:判断“规律好不好”

学习准则是衡量模型预测结果和真实标签差距的标准,核心是“损失函数”和“风险最小化”。

  1. 损失函数:量化单个样本的预测误差
    • 0-1损失:预测对了为0,错了为1(简单直接,但不好优化);
    • 平方损失:(真实值-预测值)²(适合标签是连续值的回归问题,比如预测甜度);
    • 交叉熵损失:衡量预测概率和真实标签的差距(适合分类问题,比如判断芒果“好/坏”);
    • Hinge损失:更关注分类边界的稳定性(适合支持向量机等分类模型)。
  2. 风险最小化
    • 经验风险最小化:让训练集上的平均损失最小(比如让100个芒果的预测误差平均最小);
    • 结构风险最小化:经验风险+正则化项(避免模型“死记硬背”训练集,比如加一个惩罚项,不让参数太大,解决过拟合)。
  3. 过拟合与欠拟合
    • 过拟合:模型在训练集上预测超准,但在新样本(测试集)上误差大(比如记住了某个芒果的特殊斑点,误以为所有有斑点的都甜);
    • 欠拟合:模型太简单,连训练集的规律都没学会(比如只看颜色,忽略产地,很多黄芒果其实不甜)。

2.2.3 优化算法:找到“最优规律”

优化算法是寻找让风险最小的模型参数的方法,核心是“梯度下降”系列:

  • 参数与超参数
    • 参数:模型自己学的(比如线性模型的权重);
    • 超参数:手动设置的(比如梯度下降的步长、正则化强度),需要调优。
  • 常用优化方法
    • 批量梯度下降:每次用所有训练样本算梯度,稳定但慢;
    • 随机梯度下降:每次只用1个样本算梯度,快但波动大;
    • 小批量梯度下降:每次用一小部分样本(比如32个),兼顾速度和稳定性(最常用);
    • 提前停止:训练时用验证集监控,一旦验证集误差不下降就停止,避免过拟合。

2.3 机器学习的简单示例——线性回归

线性回归是最基础的机器学习模型,核心是“用线性函数拟合连续标签”(比如预测芒果甜度、房价、温度),我们结合前面的三要素,看它怎么落地。

2.3.1 模型定义

线性回归的模型很简单:预测值 = 特征的线性组合 + 偏置,公式简化为:
[ f(x; w) = w^{\top}x ]
其中 (w) 是权重向量(每个特征的重要程度),(x) 是特征向量。比如预测甜度:(f(x) = 0.5×颜色分 + 0.3×大小分 + 0.1×产地分)。

2.3.2 参数学习:四种常用方法

参数学习就是找最优的 (w),让预测更准,四种方法各有侧重:

  1. 经验风险最小化(最小二乘法)
    • 核心:让所有训练样本的“预测值-真实值”的平方和最小;
    • 结果:直接通过公式算出最优 (w)(只要数据满足条件),简单高效,但容易过拟合(比如特征多的时候)。
  2. 结构风险最小化(岭回归)
    • 核心:在最小二乘法基础上,加一个正则化项(惩罚权重太大的参数);
    • 解决问题:避免特征之间相关性强导致的参数不稳定(比如“产地分”和“气候分”高度相关,最小二乘法会算错权重)。
  3. 最大似然估计
    • 核心:假设标签服从正态分布,找到让“现有训练样本出现概率最高”的参数;
    • 结果:和最小二乘法的解一样,从概率角度验证了最小二乘法的合理性。
  4. 最大后验估计
    • 核心:给参数加一个先验分布(比如假设权重服从正态分布,不会太大),再找最可能的参数;
    • 结果:等价于带正则化的最小二乘法,进一步降低过拟合风险。

2.3.3 关键结论

  • 最小二乘法和最大似然估计本质一致,都是“拟合数据”;
  • 岭回归和最大后验估计是“拟合+正则化”,更适合实际场景(避免过拟合);
  • 当训练样本少、特征多的时候,优先用岭回归。

2.4 偏差-方差分解

模型预测不准,根源只有三类:偏差、方差、噪声。偏差-方差分解帮你精准定位问题。

2.4.1 核心定义

  • 偏差:模型的“拟合能力”——模型平均预测结果和真实值的差距(比如用“只看颜色”的简单模型预测甜度,平均误差大,偏差高);
  • 方差:模型的“泛化能力”——不同训练集训练出的模型,预测结果的波动(比如用“颜色+大小+斑点+纹理”的复杂模型,换一批训练样本,预测结果差很多,方差高);
  • 噪声:数据本身的误差(比如品尝甜度时的主观误差),无法通过优化模型消除。

2.4.2 期望错误的组成

模型的总体预测误差(期望错误)= 偏差² + 方差 + 噪声,三者关系如下:

  • 高偏差+低方差:模型太简单(欠拟合),比如用线性模型预测非线性数据(比如“甜度=颜色²”);
  • 低偏差+高方差:模型太复杂(过拟合),比如模型记住了训练集的噪声,新样本预测不准;
  • 理想状态:低偏差+低方差,模型既能拟合规律,又能稳定泛化。

2.4.3 实用启示

  • 当模型在训练集上误差大:大概率是高偏差(欠拟合),可以增加特征、提高模型复杂度(比如用非线性模型);
  • 当模型在训练集上误差小、测试集上误差大:大概率是高方差(过拟合),可以加正则化、减少特征、增加训练数据;
  • 正则化的本质:降低模型复杂度,减少方差,但会稍微增加偏差,核心是平衡两者。

更多推荐