《动手学深度学习》—— 第2章 — 2.6 概率
2.6.概率
2.6.1.基本概率论
大数定律(law of large numbers):随着投掷次数的增加,这个估计值会越来越接近真实的潜在概率
把分布(distribution)看作对事件的概率分配
将概率分配给一些离散选择的分布称为多项分布(multinomial distribution)
2.6.1.1.概率论公理
我们将集合 𝑆={1,2,3,4,5,6} 称为样本空间(sample space)或结果空间(outcome space), 其中每个元素都是结果(outcome)。 事件(event)是一组给定样本空间的随机结果。

2.6.1.2.随机变量
-
我们可以将 𝑃(𝑋) 表示为随机变量 𝑋 上的分布(distribution): 分布告诉我们 𝑋 获得某一值的概率
-
我们可以简单用 𝑃(𝑎) 表示随机变量取值 𝑎 的概率
2.6.2.处理多个随机变量
估计这些概率以及概率之间的关系
元数据(Metadata)简单来说就是关于数据的数据,描述这份数据的属性和特征的信息
2.6.2.1.联合概率
联合概率 𝑃(𝐴=𝑎,𝐵=𝑏) <= 𝑃(𝐴=𝑎)
2.6.2.2.条件概率
条件概率 ![]()
![]()
2.6.2.3.贝叶斯定理
联立上式得 ![]()
2.6.2.4.边际化
边际化:通过对某些变量求和(离散情况)或积分(连续情况)来消除它们,从而得到剩余变量的边际概率分布。这个过程就叫边际化。
![]()
![]()
𝐵 的概率相当于计算 𝐴 的所有可能选择,并将所有选择的联合概率聚合在一起![]()
2.6.2.5.独立性
随机变量 𝐴 和 𝐵 是独立(事件 𝐴 的发生跟 𝐵 事件的发生无关),表述为 𝐴⊥𝐵,则 𝑃(𝐴∣𝐵)=𝑃(𝐴),在所有其他情况下,我们称 𝐴 和 𝐵 依赖。
两个随机变量是独立的,当且仅当两个随机变量的联合分布是其各自分布的乘积
随机变量𝐴和𝐵是条件独立的,当且仅当 𝑃(𝐴,𝐵∣𝐶)=𝑃(𝐴∣𝐶)𝑃(𝐵∣𝐶)。 这个情况表示为 𝐴⊥𝐵∣𝐶
2.6.3.期望和方差
随机变量 𝑋 的期望: ![]()
当函数 𝑓(𝑥) 的输入是从分布𝑃中抽取的随机变量时,𝑓(𝑥) 的期望值为:![]()
方差:衡量随机变量 𝑋 与其期望值的偏置。(平方的期望 - 期望的平方)![]()
方差的平方根被称为标准差
-
P(A∩B) 范围:max(0,P(A)+P(B)−1) ≤ P(A∩B) ≤ min(P(A),P(B))
-
P(A∪B) 范围:max(P(A),P(B)) ≤ P(A∪B) ≤ min(1,P(A)+P(B))
-
假设有随机变量 𝐴、𝐵、𝐶,其中 𝐵 只依赖于 𝐴,而 𝐶 只依赖于 𝐵,能否简化联合概率 𝑃(𝐴,𝐵,𝐶)?
-

-
第一个测试更准确。为什么不运行第一个测试两次,而是同时运行第一个和第二个测试?
更多推荐
所有评论(0)