📖《机器学习》第7章·通俗解读 | 贝叶斯分类器:用概率来做决策

前面几章我们学了决策树、神经网络、SVM,它们都是直接画一条线或建一棵树来分类。
这一章换一种思路:用概率
贝叶斯分类器的核心思想是:
给你一个瓜,我算出它属于每个类别的概率,然后选概率最大的那个。
就像天气预报:明天下雨的概率 80%,不下雨 20% → 预报下雨。


1. 贝叶斯决策论:概率版的“最优选择”

假设你已经知道一个瓜是好瓜的概率是 60%,坏瓜是 40%。
那你肯定会猜好瓜,对吧?

贝叶斯决策论就是这个道理:
选择风险最小(或概率最大)的那个类别

如果猜错有不同的代价(比如把好瓜当坏瓜扔掉损失 10 元,把坏瓜当好瓜卖出去损失 50 元),那就选期望损失最小的类别。

通俗理解:
如果你带伞可能淋湿(代价小),不带伞可能感冒(代价大),那即使下雨概率只有 30%,你也会带伞。


2. 贝叶斯公式:先验 + 证据 → 后验

贝叶斯公式长这样(不记也行,理解意思就好):

后验概率 = (先验概率 × 似然) / 证据

  • 先验概率:什么都没看到的时候,你觉得好瓜的比例(比如卖瓜的说他家的瓜 70% 是好瓜)

  • 似然:给定是好瓜,看到这个瓜有“青绿、蜷缩、浊响”这些特征的可能性

  • 证据:所有情况下看到这些特征的总概率

  • 后验概率:看到特征后,更新为是好瓜的概率

就像你看病:
先验:这种病在人群中发病率 1%
似然:有这个症状的病人中 90% 是这种病
看到症状后,你更新为患病的概率(后验)就大大提高了。


3. 朴素贝叶斯:“天真”但有效的假设

直接用贝叶斯公式有一个大问题:
要计算“给定类别下,所有特征同时出现的概率”,这个组合太多了(比如色泽、根蒂、敲声……),现实中几乎没法估计。

朴素贝叶斯做了一个非常“天真”的假设:
所有特征相互独立(给定类别下,色泽和根蒂没有关系)。

虽然这个假设在现实中几乎永远不成立,但神奇的是:
朴素贝叶斯在很多任务中表现很好,甚至比复杂模型还好。

为什么?
分类只需要知道哪个类别的概率最大,不需要概率绝对精确。
即使独立性假设被违反,排序往往还是对的。

拉普拉斯平滑
如果某个特征值(比如“敲声=清脆”)在训练集中没出现过,概率会算成 0,导致整个类别的概率为 0。
为了避免,我们给每个特征值加一个“小假数”(比如 1),确保概率不为零。

就像你统计民意,如果某个选项没人选,你不会说它“不可能”,只会说“样本太少”。


4. 半朴素贝叶斯:放松一点独立性

完全独立太强了,但完全不独立又算不动。
于是有人做半朴素贝叶斯:允许每个特征最多依赖一个其他特征

  • SPODE:所有特征都依赖同一个“超父”特征(比如都依赖“根蒂”)

  • TAN:用最大生成树找出特征之间的依赖关系

  • AODE:把每个特征轮流当超父,然后集成结果

就像团队合作:朴素贝叶斯是每个人都独立干活;半朴素是每人只跟一个搭档商量;完全贝叶斯网是所有人之间各种讨论(太复杂)。


5. 贝叶斯网:用图画依赖关系

贝叶斯网是一个有向无环图

  • 每个结点是一个变量

  • 箭头表示依赖(A→B 表示 A 影响 B)

  • 每个结点带一张条件概率表(在父结点取特定值下,自己取各值的概率)

贝叶斯网的结构学习(确定谁指向谁)是 NP 难问题,通常用贪心搜索。
推断(给定观测,推未知变量)可以用吉布斯采样这种近似方法。

通俗理解:贝叶斯网是一个因果图,能回答“如果下雨,地面会湿吗?”以及“如果地面湿了,可能是下雨还是洒水?”


6. EM 算法:处理“缺失”信息

有时候,样本的某些属性值缺失(比如不知道根蒂是蜷缩还是硬挺)。
或者有隐变量(比如我们想研究“甜度”,但甜度没直接测量)。

EM 算法(期望最大化)是一个迭代方法:

  1. E 步:假设当前模型参数,猜测缺失变量的值(或概率分布)

  2. M 步:用补全后的数据,重新估计模型参数

  3. 重复,直到收敛

就像猜谜:
你只看得到部分拼图,先猜缺失部分的样子(E 步),然后根据完整拼图重新调整你的猜测(M 步),越猜越准。

EM 算法广泛应用于高斯混合聚类隐马尔可夫模型等。


📌 第七章总结(背下这5句就够了)

  1. 贝叶斯决策 = 算概率,选概率最大的类别(或期望损失最小的)

  2. 朴素贝叶斯假设所有特征独立(天真但有效),用拉普拉斯平滑避免零概率

  3. 半朴素贝叶斯允许每个特征最多依赖另一个特征,折中效果好

  4. 贝叶斯网 = 有向图 + 条件概率表,能表达复杂的依赖关系

  5. EM 算法 = 先猜缺失值,再更新模型,反复迭代,处理不完整数据


👇 下章预告

第八章讲集成学习——三个臭皮匠顶个诸葛亮。
你会学到:怎么把多个弱模型组合成一个强模型(比如随机森林、AdaBoost)。
为什么“好而不同”的模型组合起来效果更好?下章告诉你。
10分钟掌握《机器学习》第八章-集成学习-CSDN博客

更多推荐