【模式识别与机器学习】L9 概率密度函数估计
参数估计:已知概率密度函数的形式,估计未知参数【适用已知分布形式、样本量较小】
非参数估计:不假设概率密度函数形式,直接用样本估计密度【适用分布形式未知、样本量较大】
一、参数估计
1.基本概念:
统计量:指样本的函数;参数空间:指待估参数的取值范围
2.MLE最大似然估计
固定参数ɵ,最大化“样本在该参数下出现的概率”(似然函数)
似然函数:样本的联合概率密度→为简化计算,常用对数似然函数
特殊情况(如均匀分布):若似然函数无零点,可通过边界分析求解(θ1=minxiθ_1=min{x_i}θ1=minxi,θ2=maxxiθ_2=max{x_i}θ2=maxxi)
【正态分布下的MLE】
μ为无偏估计,方差分有偏估计和无偏估计
a)单变量 p(x∣θ)∼N(μ,σ2)p(x∣θ)∼N(μ,σ^2)p(x∣θ)∼N(μ,σ2),参数θ=[μ,σ2]θ=[μ,σ^2]θ=[μ,σ2]
估计结果:μ^=1N∑iNxi\hatμ=\frac{1}{N}∑_i^Nx_iμ^=N1∑iNxi(无偏估计),σ^2=1N∑iN(xi−μ^)2\hatσ^2=\frac{1}{N}∑_i^N(x_i-\hat\mu)^2σ^2=N1∑iN(xi−μ^)2(有偏估计,无偏修正需除以(N−1))。
b)多变量
3.贝叶斯估计
视ɵ为随机变量,有先验分布p(ɵ),结合样本信息得到后验分布p(ɵ|X),找到最小化风险的估计量,即找到θ^\hat θθ^使R(θ^∣X)=∫Θλ(θ^,θ)p(θ∣X)dθR(\hat θ∣X)=∫_Θλ(\hat θ,θ)p(θ∣X)dθR(θ^∣X)=∫Θλ(θ^,θ)p(θ∣X)dθ最小,θ^\hatθθ^为贝叶斯估计量
【损失函数】
1) 最常用:平方误差损失——贝叶斯估计量为后验期望:θ^=E[θ∣X]=∫Θθp(θ∣X)dθ\hatθ=E[θ∣X]=∫_Θθp(θ∣X)dθθ^=E[θ∣X]=∫Θθp(θ∣X)dθ【适用于常规参数估计如均值、方差】
2) MAP最大后验估计:0-1损失——贝叶斯估计量为概率密度最高的参数值,即:θ^MAP=argmaxθ∈Θp(θ∣X)\hat θ_{MAP}=argmax_{θ∈Θ}p(θ∣X)θ^MAP=argmaxθ∈Θp(θ∣X)【适用于分类、判定对错的任务】
3) 后验中位数估计:绝对误差损失——贝叶斯估计量为后验分布的中位数,即∫−∞θ^p(θ∣X)dθ=∫θ^+∞p(θ∣X)dθ=0.5∫_{−∞}^{\hatθ}p(θ∣X)dθ=∫_{\hat θ}^{+∞}p(θ∣X)dθ=0.5∫−∞θ^p(θ∣X)dθ=∫θ^+∞p(θ∣X)dθ=0.5【适用于存在异常值或者分布不对称的情况】
【正态分布下的贝叶斯估计】
- 场景:已知p(x∣μ)∼N(μ,σ2)p(x∣μ)∼N(μ,σ^2)p(x∣μ)∼N(μ,σ2)(σ2σ^2σ2已知),先验p(μ)∼N(μ0,σ02)p(μ)∼N(μ_0,σ_0^2)p(μ)∼N(μ0,σ02),样本均值mN=1N∑k=1Nxkm_N=\frac{1}{N}∑_{k=1}^Nx_kmN=N1∑k=1Nxk;
- 后验分布:p(μ∣X)∼N(μN,σN2)p(μ|X)∼N(μ_N,σ_N^2)p(μ∣X)∼N(μN,σN2),其中:μN=Nσ02Nσ02+σ2⋅mN+σ2Nσ02+σ2⋅μ0μ_N=\frac{Nσ_0^2}{Nσ_0^2+σ^2}⋅m_N+\frac{σ^2}{Nσ_0^2+σ^2}⋅μ_0μN=Nσ02+σ2Nσ02⋅mN+Nσ02+σ2σ2⋅μ0(样本信息与先验信息的加权平均),σN2=σ2σ02Nσ02+σ2σ_N^2=\frac{σ^2σ_0^2}{Nσ_0^2+σ^2}σN2=Nσ02+σ2σ2σ02(后验不确定性随样本量增大而减小);
- 贝叶斯估计量:μ^=μN\hatμ=μ_Nμ^=μN。
※贝叶斯学习
随样本量增加,参数后验分布逐渐尖锐,收敛于以真实参数为中心的冲激函数
后验概率分布可递推计算,p(θ∣XN)=p(xN∣θ)p(θ∣XN−1)∫Θp(xN∣θ)p(θ∣XN−1)dθp(θ∣X_N)=\frac{p(x_N|θ)p(θ|X^{N-1})}{∫_Θp(x_N|θ)p(θ∣X^{N−1})dθ}p(θ∣XN)=∫Θp(xN∣θ)p(θ∣XN−1)dθp(xN∣θ)p(θ∣XN−1),无需重新计算所有样本
二、非参数估计
通过局部样本密度估计概率密度
收敛条件:当N→∞时,需满足区域足够小即V→0,区域内样本足够多(保证可靠性)即k→∞,区域内样本占比极小即kN\frac{k}{N}Nk→0
1.直方图法:将特征空间划分为等间隔小舱
缺点:小舱体积难选(过大过小……),估计结果不连续
2.Parzen窗法:滑动窗(核函数)
公式:密度估计:p^(x)=1N∑i=1Nk(x,xi)\hat p(x)=\frac{1}{N}∑_{i=1}^Nk(x,x_i)p^(x)=N1∑i=1Nk(x,xi),其中核函数k(x,xi)=1Vφ(x−xih)k(x,x_i)=\frac{1}{V}φ(\frac{x-x_i}{h})k(x,xi)=V1φ(hx−xi)
【核函数】
1)要求:非负,积分为1,随距离衰减(保证局部性)
2) 常用核函数:
- a)方窗:对应 “矩形窗口” 贡献;
- b)高斯窗:一维形式:k(x,xi)=12πσe(x−xi)22σ2k(x,x_i)=\frac{1}{\sqrt{2π}σ}e^{\frac{(x−x_i)^2}{2σ^2}}k(x,xi)=2πσ1e2σ2(x−xi)2平滑性好,最常用);
- c)超球窗:k(x,xi)={1V∣∣x−xi∣∣≤ρ0其他 k(x,x_i)=\left\{ \begin{aligned} \frac{1}{V}& &||x-x_i||≤ρ\\0& &其他\\ \end{aligned} \right. k(x,xi)=⎩⎨⎧V10∣∣x−xi∣∣≤ρ其他其中V为超球体积,ρ为半径。
3)窗宽影响:
- 若过宽,则结果平滑但分辨率低,可能欠拟合
- 若过小,则结果波动大,可能过拟合
- 常用窗宽:h∝N−η/dh∝N^{−η/d}h∝N−η/d(η∈(0,1)η∈(0,1)η∈(0,1),如η=1/2η=1/2η=1/2,ddd为特征维度)
3.KNK_{N}KN近邻估计:固定小区域内样本数,自动调整小区域体积
密度估计公式:p^(x)=kN/NV\hat p(x)=\frac{k_N/N}{V}p^(x)=VkN/N
- 优势
1)自适应调整窗口体积:高密度区域体积小,低密度区域体积大
2)需设计核函数,只需确定参数kNk_NkN - 缺点
1)高维空间存在维度灾难:样本稀疏,为包含kNk_NkN个样本,区域体积会急剧增大
2)kNk_NkN的选择需平衡平滑性与分辨率,通常取kN∝Nk_N∝NkN∝N
三、概率神经网络
网络结构:输入层→模式层(计算核函数贡献)→类别层(累加同类样本贡献)→输出层
大家后面想看什么内容?欢迎留言~
更多推荐
所有评论(0)