参数估计:已知概率密度函数的形式,估计未知参数【适用已知分布形式、样本量较小】
非参数估计:不假设概率密度函数形式,直接用样本估计密度【适用分布形式未知、样本量较大】

一、参数估计

1.基本概念:

统计量:指样本的函数;参数空间:指待估参数的取值范围

2.MLE最大似然估计

固定参数ɵ,最大化“样本在该参数下出现的概率”(似然函数)

似然函数:样本的联合概率密度→为简化计算,常用对数似然函数

特殊情况(如均匀分布):若似然函数无零点,可通过边界分析求解(θ1​=minxi​θ_1​=min{x_i​}θ1=minxi,θ2​=maxxi​θ_2​=max{x_i​}θ2=maxxi

【正态分布下的MLE】

μ为无偏估计,方差分有偏估计和无偏估计

a)单变量 p(x∣θ)∼N(μ,σ2)p(x∣θ)∼N(μ,σ^2)p(xθ)N(μ,σ2),参数θ=[μ,σ2]θ=[μ,σ^2]θ=[μ,σ2]
估计结果:μ^=1N∑iN​xi\hatμ=\frac{1}{N}∑_i^N​x_iμ^=N1iNxi​(无偏估计),σ^2​=1N∑iN​(xi−μ^)2\hatσ^2​=\frac{1}{N}∑_i^N​(x_i-\hat\mu)^2σ^2=N1iN(xiμ^)2​(有偏估计,无偏修正需除以(N−1))。
b)多变量

3.贝叶斯估计

视ɵ为随机变量,有先验分布p(ɵ),结合样本信息得到后验分布p(ɵ|X),找到最小化风险的估计量,即找到θ^\hat θθ^使R(θ^∣X)=∫Θ​λ(θ^,θ)p(θ∣X)dθR(\hat θ∣X)=∫_Θ​λ(\hat θ,θ)p(θ∣X)dθR(θ^X)=Θλ(θ^,θ)p(θX)dθ最小,θ^\hatθθ^为贝叶斯估计量

【损失函数】
1) 最常用:平方误差损失——贝叶斯估计量为后验期望:θ^=E[θ∣X]=∫Θθp(θ∣X)dθ\hatθ=E[θ∣X]=∫_Θθp(θ∣X)dθθ^=E[θX]=Θθp(θX)dθ【适用于常规参数估计如均值、方差】

2) MAP最大后验估计:0-1损失——贝叶斯估计量为概率密度最高的参数值,即:θ^MAP​=argmaxθ∈Θ​p(θ∣X)\hat θ_{MAP}​=argmax_{θ∈Θ​}p(θ∣X)θ^MAP=argmaxθΘ​p(θX)【适用于分类、判定对错的任务】

3) 后验中位数估计:绝对误差损失——贝叶斯估计量为后验分布的中位数,即∫−∞θ^​p(θ∣X)dθ=∫θ^+∞​p(θ∣X)dθ=0.5∫_{−∞}^{\hatθ}​p(θ∣X)dθ=∫_{\hat θ}^{+∞}​p(θ∣X)dθ=0.5θ^p(θX)dθ=θ^+p(θX)dθ=0.5【适用于存在异常值或者分布不对称的情况】

【正态分布下的贝叶斯估计】

  • 场景:已知p(x∣μ)∼N(μ,σ2)p(x∣μ)∼N(μ,σ^2)p(xμ)N(μ,σ2)σ2σ^2σ2已知),先验p(μ)∼N(μ0​,σ02​)p(μ)∼N(μ_0​,σ_0^2​)p(μ)N(μ0,σ02),样本均值mN=1N∑k=1Nxkm_N=\frac{1}{N}∑_{k=1}^Nx_kmN=N1k=1Nxk
  • 后验分布:p(μ∣X)∼N(μN,σN2​)p(μ|X)∼N(μ_N,σ_N^2​)p(μX)N(μN,σN2),其中:μN​=Nσ02Nσ02​+σ2​​⋅mN​+σ2Nσ02​+σ2⋅μ0μ_N​=\frac{Nσ_0^2}{Nσ_0^2​+σ^2}​​⋅m_N​+\frac{σ^2}{Nσ_0^2​+σ^2}⋅μ_0μN=Nσ02+σ2Nσ02​​mN+Nσ02+σ2σ2μ0​(样本信息与先验信息的加权平均),σN2=σ2σ02Nσ02​+σ2​σ_N^2=\frac{σ^2σ_0^2}{Nσ_0^2​+σ^2}​σN2=Nσ02+σ2σ2σ02(后验不确定性随样本量增大而减小);
  • 贝叶斯估计量:μ^​=μN\hatμ​=μ_Nμ^=μN​。

※贝叶斯学习

随样本量增加,参数后验分布逐渐尖锐,收敛于以真实参数为中心的冲激函数

后验概率分布可递推计算,p(θ∣XN)=p(xN∣θ)p(θ∣XN−1)∫Θ​p(xN​∣θ)p(θ∣XN−1)dθp(θ∣X_N)=\frac{p(x_N|θ)p(θ|X^{N-1})}{∫_Θ​p(x_N​|θ)p(θ∣X^{N−1})dθ}p(θXN)=Θp(xN​∣θ)p(θXN1)dθp(xNθ)p(θXN1),​无需重新计算所有样本

二、非参数估计

通过局部样本密度估计概率密度

收敛条件:当N→∞时,需满足区域足够小即V→0,区域内样本足够多(保证可靠性)即k→∞,区域内样本占比极小即kN\frac{k}{N}Nk→0

1.直方图法:将特征空间划分为等间隔小舱

缺点:小舱体积难选(过大过小……),估计结果不连续

2.Parzen窗法:滑动窗(核函数)

公式:密度估计:p^​(x)=1N​∑i=1Nk(x,xi​)\hat p​(x)=\frac{1}{N}​∑_{i=1}^Nk(x,x_i​)p^(x)=N1i=1Nk(x,xi),其中核函数k(x,xi​)=1V​φ(x−xih)k(x,x_i​)=\frac{1}{V}​φ(\frac{x-x_i}{h})k(x,xi)=V1φ(hxxi)

【核函数】

1)要求:非负,积分为1,随距离衰减(保证局部性)
2) 常用核函数:

  • a)方窗:对应 “矩形窗口” 贡献;
  • b)高斯窗:一维形式:k(x,xi​)=12πσe(x−xi)22σ2k(x,x_i​)=\frac{1}{\sqrt{2π}σ}e^{\frac{(x−x_i)^2}{2σ^2}}k(x,xi)=2πσ1e2σ2(xxi)2平滑性好,最常用);
  • c)超球窗:k(x,xi​)={1V∣∣x−xi∣∣≤ρ0其他 k(x,x_i​)=\left\{ \begin{aligned} \frac{1}{V}& &||x-x_i||≤ρ\\0& &其他\\ \end{aligned} \right. k(x,xi)=V10∣∣xxi∣∣ρ其他其中V为超球体积,ρ为半径。

3)窗宽影响:

  • 若过宽,则结果平滑但分辨率低,可能欠拟合
  • 若过小,则结果波动大,可能过拟合
  • 常用窗宽:h∝N−η/dh∝N^{−η/d}hNη/dη∈(0,1)η∈(0,1)η(0,1),如η=1/2η=1/2η=1/2ddd为特征维度)

3.KNK_{N}KN近邻估计:固定小区域内样本数,自动调整小区域体积
密度估计公式:p^(x)=kN/NV\hat p(x)=\frac{k_N/N}{V}p^(x)=VkN/N

  • 优势
    1)自适应调整窗口体积:高密度区域体积小,低密度区域体积大
    2)需设计核函数,只需确定参数kNk_NkN
  • 缺点
    1)高维空间存在维度灾难:样本稀疏,为包含kNk_NkN个样本,区域体积会急剧增大
    2)kNk_NkN的选择需平衡平滑性与分辨率,通常取kN​∝N​k_N​∝N​kNN

三、概率神经网络

网络结构:输入层→模式层(计算核函数贡献)→类别层(累加同类样本贡献)→输出层

大家后面想看什么内容?欢迎留言~

更多推荐