正则化在逻辑回归中的作用,L1正则化和L2正则化的区别?

逻辑回归中,正则化用来调整模型复杂度,通过对模型的参数约束防止过拟合,正则化通过在损失函数中添加额外的正则化项来实现,正则化项对参数大小进行惩罚。

逻辑回归中的常用正则化有L1和L2,作用分别是:

L1(Lasso正则化):向损失函数中添加参数的绝对值之和来惩罚模型的大参数,从而使模型中的部分参数为0 ,这实现了特征选择,可以使模型更加稀疏,剔除不必要的参数,从而提高模型的泛化能力。

L1正则化更适合于高维数据,或者怀疑只有少数几个特征对问题有重要影响时。

L2(Ringe正则化):向损失函数中添加参数的平方和来惩罚大模型的参数,不会使参数变为0,只是会压缩参数,用于减轻多重共线性问题,稳定模型的估计。

L2正则化更适合于减轻多重共线性问题,或者认为所有特征都对问题有影响时。但不想有过大参数。

总的来说,L1和L2正则化都能够调整模型的复杂度,防止过拟合,他们的主要区别在于:
L1正则化会使模型更稀疏并且会使部分参数变为0,适用于高维数据

L2正则化不会使参数变为0,而是对参数进行缩小,有助于减轻多重共线性问题


什么是支持向量机(SVM)?主要用于解决什么类型的问题?

SVM,是一种强大的监督学习算法,主要用于分类和回归,SVM的核心思想是寻找一个最优的超平面或者决策边界,然后最大化不同数据点之间的间隔,并尽量避免误分类

1. 线性SVM(Linear SVM)

考虑一个二元分类问题,其中我们有一个训练数据集,每个数据点都包含一个X和对应的标签y,其中y可以是1或-1(或者自己任意想要的类别),我们寻找一个最优超平面,表示为:

其中,w表示法向量(权重向量),b表示截距,w代表输入向量,超平面将特征空间分为两个区域,一个表示正类,一个表示负类。

2. 支持向量

支持向量是训练数据距离超平面最近的数据点,用于定义分类间隔的关键元素。分类间隔是指超平面距离最近的支持向量的距离

3. 最大化间隔

SVM的关键就是找到一个最优超平面,使得分类的间隔最大化。分类间隔的计算如下:

4. SVM的优化问题

线性SVM的优化问题可以简化为以下的凸优化问题:

最小化目标函数:

这个优化问题的目标是最小化权重向量W的范数,从而最大化分类间隔,确保所有样本都在分类间隔以外。

5. 核函数

SVM也可以用到非线性分类问题中,通过引入核函数把数据映射到高维特征空间中,从而在高维空间中找到线性可分的超平面,常见的核函数有线性核、多项式核、径向基函数等。


SVM的基本原理是什么?他如何在分类和回归任务中工作?

支持向量机的基本原理就是在特征空间中找到一个超平面或者决策边界,该超平面或者决策边界可以最大化不同类别的数据之间的间隔,从而避免误分类。

在分类任务中:

SVM在特征空间中找到一个超平面或者决策边界,最大化不同类别之间的数据点,从而避免误分类。

Margin(最大化间隔)是指超平面距离最近的支持向量之间的距离。

SVM尝试最小化目标函数的权重向量的范数,从而最大化分类间隔,确保样本都在分类间隔之外

对于非线性分类问题,可以通过核函数将数据映射到高维特征空间中,使数据在高维空间中线性可分。

在回归任务中:

SVM的目标是使数据点尽量接近超平面,同时在一定的容忍度内。

在回归问题中,SVM最小化一个损失函数,损失函数衡量数据点离超平面的距离和容忍度的违规情况。

控制在训练期间数据点距离超平面距离的程度的参数。


软间隔(Soft Margin)与硬间隔(Hard Margin)SVM?他们有什么区别和应用场景?

软间隔和硬间隔SVM是SVM模型的两种变体,他们主要的区别是对数据的容忍度和对异常值的处理

硬间隔SVM:

1、硬间隔旨在找到一个完全将训练数据分隔开的超平面,没有任何训练数据点在分类间隔内。

2、在硬间隔SVM中,要求数据点严格遵循线性可分的条件,这要求数据点必须严格的分布在分类间隔的一侧,不允许任何分类错误。

3、硬间隔SVM对异常点非常敏感,即使一个异常点在训练数据中,都可能导致无法找到满足条件的超平面。

软间隔SVM:

1、软间隔SVM引入了容忍度的概念,允许一些数据点能够存在于分类间隔内或者错误分类,提高模型的复杂度。

2、软间隔SVM的目标是找到一个超平面,尽量最大化分类间隔,同时限制分类错误间隔内部的数据点数量

3、软间隔SVM更鲁棒,能够处理一些异常或噪点,同时可以满足非线性条件

硬间隔SVM:适用于数据集严格线性可分的情况,并且我们有信心不存在异常或者噪点。

软间隔SVM:更加鲁棒,适用于数据集中存在异常、噪点或者线性不可分的情况,允许有一定的错误分类或者数据点在分类间隔内。


密度聚类(DBSCAN)

DBSCAN(Density-Based Spatial Clustering of Applications with Noise,具有噪声的基于密度的聚类方法)是一种典型的密度聚类算法,它通过识别数据空间中的高密度区域来进行聚类。

他是一种典型的基于密度的聚类算法,既可以适用于凸样本集,也可以适用于非凸样本集。该算法将具有足够密度的区域划分为簇,并在具有噪声空间数据库中发现任意形状的簇,它将簇定义为密度相连的点的最大集合

要求聚类空间中的一定区域内的所包含的对象不小于某一个给定的阈值。

与传统的K-Means等聚类算法相比,DBSCAN具有以下特点:

1、能够发现任意形状的聚类簇

2、可以自动识别噪声点(离群点)

3、不需要预先指定聚类数量

4、对噪声数据不敏感

算法基本逻辑:

1、从数据集中任选一个未访问的点

2、检查该点周围领域内是否有足够多的点(密度是否足够高)

3、如果密度足够,则以该点为起点扩展聚类簇

4、重复上述过程,直到所有点都被访问

将簇看作是数据空间中被低密度区域(代表噪声)分割开的稠密对象区域。

将具有足够高密度的区域划分为簇,并在具有噪声空间数据库中发现任意形状的簇。

簇:密度相连的点的最大集合。

相关概念与定义:

领域:给定对象半径(epsilon)内的领域称为该对象的领域。

密度:给定距离内最小的对象点数目。

高密度:一个对象的领域至少包含最小数目的MinPts个对象

核心对象

如果对象的领域至少包含最少数目MinPts的对象,则称该对象为核心对象。

边界对象

对象的领域小于MinPts个对象,但是在某个核心对象的领域中

离群点/噪声

对象的领域小于MinPts个对象,且不是边界点

密度直达(直接密度可达):给定一个对象集合D,如果p在q的领域内,而q是一个核心对象,则我们说对象p从q出发是直接密度可达的。

密度可达:对于,若存在样本序列,其中 密度直达(出发点必须是核心对象),则称密度可达。

密度相连:对,若存在使得均由密度可达,则称密度相连。


自动驾驶和机器学习的关系?

自动驾驶是机器学习的一个重要应用领域,其核心在于机器能够根据接受到的环境数据做出决策。例如,在自动驾驶案例中,车载传感器接收到的信息就是模型的输入,而刹车、油门、方向等的控制就可以看作是模型的输出。由于自动驾驶的环境极其复杂,传统的规则变编程无法应对所有可能的情况,故机器学习很适合从数据中学习规则的任务。

自动驾驶的挑战就是环境的不确定性,通过机器学习和深度学习算法,能够让车辆从大量的训练数据中学会识别障碍物、车道线等,并根据驾驶经验优化行为。


有监督学习的理解,并举例说明有监督学习的任务?

有监督学习是机器学习中的一种重要分支, 其核心思想是从有标签的训练数据中学习模型,使模型能够预测未知数据标签或者输出。有监督学习通过学习输入与对应的输出之间的映射关系来训练,以便于在新数据上预测。

有监督学习的特点:

1、有标签的训练数据

有监督学习需要使用带有标签的或者输出的训练数据。标签通常是目标变量或者分类类别,表示我们希望模型想要预测的内容。

2、预测目标

监督学习的目标是训练模型,以使其能够根据输入的数据预测目标变量或者分类类别。这表明模型尝试捕捉输入与输出之间的关联性。

3、评估性能

在有监督学习中,常使用一些评价指标来评估模型预测的质量,常见的有准确率、MSE均方误差、对数损失。

常见的有监督学习的任务:

分类:最常见的任务之一。常见的二分类问题,模型学习将输入数据分成不同的类别。预测邮件是否是垃圾邮件或者非垃圾邮件

回归:回归任务中,模型预测的是一个连续的数值输出。例如房价预测是一个回归任务。模型通过学习房屋的各种特征(面积、地理位置、房间数量)来预测房价。

目标检测:是复杂的有监督学习,涉及在图像或者视频中识别和定位不同的对象。
自然语言处理:在NLP中,监督学习用于文本分类,情感分析等。例如通过给定文本作情感分析。


无监督学习的理解?举例说明无监督学习任务

无监督学习也是机器学习的一个重要分支,特点是训练数据中无明确的标签或者目标输出,模型需要从数据中学习隐藏的结构、模式和关系,而不需要知道模型目标变量或者标签。

常见无监督学习:

1、聚类

聚类的目的是将数据分为不同的簇,使得同一组的数据相似,而不同组的数据差别较大。

K-means

2、降维

降维的目的是减少模型的维度,降低冗余性。可以简化数据,减少噪声,同时提升计算效率。

主成分分析PCA


交叉验证及其应用?

交叉验证是一种评估机器学习模型性能的一种方法,它将数据集分成多个测试的子集,然后多次训练和测试模型,更加全面的评估模型在不同的数据子集上面的性能表现。

交叉验证是一种模型评估方法,目的是在有限的数据集上评估模型的泛化性能,具体方法包括将数据集划分为K个子集,每次选择其中的一个子集作为测试集,其余子集作为训练集。重复K次,最终以K次评估结果的平均值作为模型性能的估计。

例如,10折交叉验证是常见的选择,其中数据被分为10份,每次用1份测试其余9份训练,这种方法可以有效缓解单一划分导致的不稳定,同时避免数据浪费,是许多机器学习模型选择的标准评估方法。


什么是随机森林?

随机森林是一种基于决策树的集成学习模型,通过随机选择特征子集样本子集构建多棵树,并组合起来预测。随机森林通常能够降低过拟合的风险,提高模型的泛化能力。


什么是决策树,简述基本原理,决策树优缺点?

决策树是一种用于分类和回归的机器学习模型,他是一种树状结构,每个节点表示一个特征每一个分支代表一个特征值叶子节点代表分类类别或者回归值

决策树的基本原理是逐步分割数据集,以便最终能够根据特征的值来预测目标变量的分类或值。
决策树的优点:

1、简单易理解 决策树的树状结构直观地展示了数据特征的选择过程,易于解释。

2、高效 决策树算法的复杂度通常是O(N/logN),n是特征的数目。

3、不需要大量数据预处理 数据的缩放,缺失值的处理对决策树的影响较小。

4、特征选择 决策树自动进行特征选择并按重要性排序,例如通过信息增益或者基尼指数。

决策树的缺点:
1、过拟合风险 决策树在训练集上容易过拟合过多的特征细节,导致泛化能力下降。

2、不稳定 数据的变化可能导致树的结构大幅度变化。

4、偏向多值特征 信息增益倾向于选择多值特征,但是这并不总是合理。

5、欠拟合风险 剪枝可能会导致树过于简单,泛化性能下降。        


随机森林与决策树之间的比较?

随机森林的优势

1、降低过拟合风险:随机森林通过组合多棵决策树,每棵树的训练数据都是随机选择的,从而减少了过拟合的风险,故使得模型在训练数据上表现得更加稳定,泛化能力更强。

2、更好的泛化能力:由于随机森林综合了多个决策树的预测结果,通常具有较好的泛化能力,在不同类型的数据集和任务上更具有通用性。

3、对高维数据的适应能力:随机森林在处理高维数据时更出色,因为可以随机选择特征子集来构建决策树,降低了维度灾难的影响。
4、处理非线性关系:随机森林可以捕捉到数据的非线性问题,而单一决策树在处理复杂的问题时可能会出现欠拟合。

5、并行化处理:由于每棵树都可以独立训练,随机森林可以轻轻松松的进行并行化处理,加快模型训练。

6、自带特征重要性评估:随机森林可以估计每个特征对模型的重要性,帮助识别那些特征对问题的解决最有帮助。

随机森林的劣势
1、模型解释性较弱:与单一的决策树相比,随机森林的模型可解释性较弱,因为是多棵树的组合,其结构比较复杂,不容易直观的解释每个决策原因。

2、计算和内存的需求大:随机森林由多棵决策树组合而成,因此模型的训练与储存需要消耗较大的内容和资源。相对于单一的决策树,它需要的时间和内存可能更多。
3、不适合于小样本数据集:当数据集样本数据量较少时,随机森林的效果可能不如单一决策树的好,因为Boostrap抽样引入了更多的随机性,对于小样本数据,会导致模型的方差较大。

比较维度决策树随机森林
模型结构单一的树结构多棵决策树组成的集成模型
复杂度结构简单,计算开销小结构复杂,训练时间更长
过拟合风险高,容易记住训练集的细节低、通过集成降低过拟合风险
泛化能力,依赖剪枝等优化,利用样本和特征的随机性提升泛化能力
稳定性不稳定,数据轻微变化会显著影响树结构稳定,单棵树的波动被集成平滑
特征选择基于信息增益或者基尼系数选择最优特征每棵树随机选择特征子集,增强多样性
计算资源较少,适合简单任务较多,需要更多内存和计算能力
适用场景适合简单结构数据或对模型解释性要求高的场景    适合大规模复杂数据或者对预测性能要求高的场景

随机森林实现过程?

随机森林是通过集成学习方法构建的分类或回归模型,其实现包含以下步骤:

样本自助法:从原始训练集中有放回的抽取样本构成多个子训练集。

构建多棵决策树:对每个子训练集训练一棵决策树,在分裂每个节点时,随机选择特征子集并基于最佳分裂准则进行分裂。
集成结果:对于分类任务,通过投票决定最终类别;对于回归任务,通过取所有树预测值的平均作为结果。

特征重要性评价:通过分析每棵树的节点分裂情况,计算特征对模型性能的贡献。

随机森林在降低过拟合的同时,还能够处理高维数据,具有较好的泛化能力。


缓解BP神经网络过拟合问题?

BP神经网络过拟合的愿意通常是模型复杂度过高或者训练数据不足,常见的缓解的方式包括:
1、正则化:在损失函数中加入惩罚项(L1和L2正则化),限制权重大小,避免模型过于复杂。

2、增加训练数据:添加更多的训练样本增强模型泛化能力。

3、早停:在验证集上监控性能,当模型性能不再提升时停止训练。

4、Dropout:随机丢弃部分神经元,降低模型复杂度。

5、调整网络结构:减少隐藏层或者每层神经元的数量,简化模型结构。 


激活函数作用和选择,常见的激活函数有哪些?

激活函数的作用是引入非线性变换,对神经元的加权和作非线性映射,从而使神经网络能够逼近复杂函数并解决模型难以处理的问题。

常见的激活函数:

Sigmoid:输出范围为(0,1),适用于概率估计,但易受梯度消失影响。
ReLU:简单高效,计算开销小,广泛应用于深度网络。
Tanh:输出范围为(-1,1),适合于中心化数据。
Leaky ReLU/ELU:改善ReLU在负值区间的性能。


特征选择重要性及其例子?

特征选择通过挑选对模型最有贡献的特征,能够有效的减少维度,降低复杂度,提高模型的泛化能力,减少过拟合的风险。

在分类问题中,假设我们有个水果数据集,其中包括大量的冗余信息,而我们只需要颜色和重量的信息,我们可以通过RFE递归特征消除或者信息增益的方法,保留两个特征,去除其余噪声。


朴素贝叶斯例子?

以垃圾邮件为例

  • 假设有两个类别:垃圾邮件和正常邮件。

  • 特征为邮件里面的词(“折扣”或者“免费”)

通过计算每个关键词在两种邮件中的概率分布,朴素贝叶斯可以判断新邮件属于哪个类别。


什么是集成学习,他们的基本思想是什么?

集成学习是一种机器学习方法,它组合多个学习算法或模型的预测来提高模型性能和泛化能力。

核心思想是通过汇总多个模型的意见,以减小模型的方差和偏差,从而提高模型的准确性和鲁棒性。

集成学习通过构建并结合多个基学习器来提高模型的整体性能。其基本思想是:

利用多个学习器的“多样性”来避免单一学习器的局限。

通过加权或投票的方式进行结果融合。

作用:

提高模型的稳定性和准确性。

缓解过拟合问题,特别是在小数据集上面。

适用于分类、回归或者聚类任务。


什么是维度灾难?举例说明

维度灾难是指数据维度过高,样本之间的距离趋于相等,导致模型难以区分数据。

在高维空间中,数据变得稀疏,KNN等依赖距离的算法性能会下降, 为解决此问题,可以适用降维的技术,把数据映射到低维空间。


PCA主成分分析

主成分分析(Principal Component Analysis,简称PCA)是一种常用的降维技术,广泛应用于数据分析、模式识别等领域,PCA的核心思想是通过线性变换把原始数据集中的多个变量转换成单个变量或者少数几个不相关的成分,减少数据维度,同时尽可能多的保留原始数据集中的信息。

PCA的基本原理:

PCA的基本目的就是将原始的特征空间(高维空间)转换到一个新的特征空间(低维空间),新的特征空间由原始特征的线性组合构成,这个新的特征空间的每一个维度叫做主成分。

  • 主成分的定义:主成分是数据集中一组新的、无相关性的变量,它是由原始特征线性组合而成。每个主成分捕捉了数据中最大残差的方向。
  • 方差的解释:数据的方差反应了数据分布的广度。PCA的一组目标是找到一组主成分,来捕获最大方差,方差就是特征向量对应的最大特征值。

PCA的步骤:

1、数据中心化/数据标准化

首先将原始数据点的三列向量计算均值得到新的均值数据点

然后用原始数据点减去均值数据点得到去中心化数据点

2、计算协方差矩阵

3、求特征值

4、求解主成分方向(求特征向量)

计算出来归一化得到单位向量 

5、对中心化的数据点进行投影

6、最大方差

PCA的应用:

1、降维

PCA用于高维数据集的降维,将数据从高维空间投影到低维空间。减少数据存储需求,提高计算效率。

2、数据压缩

PCA用于图像压缩、音频压缩等领域,通过减少需要存贮的变量来实现数据压缩。

3、噪声过滤

PCA 可以去除数据中的噪声。通过选择方差最大的主成分, 忽略方差较小的成分,有效去除噪声。

4、数据可视化

当数据维度较高时,可以通过PCA将数据降维到2d或者1d空间,然后可视化,帮助识别内在结构。

5、特征选择

PCA可以作为特征选择的一种,选择其中方差较大的来进行后续的分析。

6、模式识别

在图像处理、语音识别等领域, 通过PCA来提取重要的特征,减少计算的负担。

PCA的优缺点

优点

1、减少维度:通过降维,减少特征数量,降低计算复杂度,节省存储空间

2、提高效率:在数据集非常大的情况下,PCA可以帮助提高计算速度

3、去噪:PCA可以去除不重要的成分(如噪声),保留最重要的信息

缺点

1、线性假设:PCA假设数据的主成分是线性组合的,对于非线性数据,PCA的效果可能不理想

2、可解释性差:由于主成分是原始特征的线性组合,有时候很难解释每个主成分的实际意义

3、数据标准化需求:PCA对数据的尺度敏感,因此需要先进行标准化处理,否则某些特征的影响会被放大或者忽视。


西瓜书前两章知识点


第一章

  • 机器学习是一门学科,致力于研究如何通过计算的方式,利用经验来改善系统的性能
  • “经验”以“数据”的形式存在
  • 机器学习所研究的主要内容是从数据中产生“模型”的算法,即“学习算法”
  • 记录的集合称为一个“数据集”,每条记录是关于一个事件或者对象,称为“示例”或者“样本”
  • 有时会把数据集作为一个样本,数据集可以看作是从样本空间抽样得到的
  • 反映对象或者事件在某方面的表现或者性质,“色泽”,“根蒂”等称为属性或者特征,属性上的取值称为属性值
  • 由属性张成的空间叫做属性空间、样本空间或者输入空间,“色泽”,“根蒂”,“敲声”可作为描述西瓜的三维空间,每个西瓜都可以用空间的点来表示,点对应一个坐标向量,也称为特征向量
  • 数据集中每个样本拥有的特征数目叫做维度,也称维数,维数特别大时,称为维度灾难
  • 从数据中获得模型的过程称为学习或者训练,在这过程中适用的数据集称为训练集,每一个样本称为训练样本,也称训练示例或者示例,训练样本的集合就是训练集
  • 模型有时候也称为学习器,学的模型关于数据的潜在规律称为假设,潜在规律自身称为真相或者真实
  • 标记指的是对象的类别或结果,如“好瓜”,样本和标记组合起来即是样例,所有标记的集合称为标记空间,也称输出空间
  • 学得模型后,对新样本进行模型预测称为测试
  • 测试中使用的样本为测试样本,也称为测试样例或者示例
  • 根据训练样本是否有标记信,学习任务分为有监督或无监督
  • 监督学习是指训练数据包含输入和输出,通过学习输入与输出之间的映射关系,模型可以在未知数据上预测输出,常用的有分类和回归,算法有逻辑回归、SVM、决策树
  • 无监督是指训练数据无明显的标签输出,算法通过探索数据潜在的结构、模式、关系来学习
  • 学的模型适用于新样本的能力称为泛化能力
  • 假设样本空间中的全体样本都服从于同一个未知分布D,我们获得的每一个样本都是在该分布上采样的,即独立同分布
  • 版本空间:与训练集一致的假设集合
  • 机器学习算法在学习过程中对某种类型假设的偏好
  • 奥卡姆剃刀原则:任何一个有效的机器学习算法必有其偏好
  • 学习算法的归纳偏好是否与问题本身匹配,大多数时候直接决定了算法能够取得好的性能
  • NFL:脱离具体问题,空泛的谈论“什么学习算法最好”毫无意义

第二章

  • 误差:样本真实输出与预测输出之间的差异,如分类错误率,回归误差
  • 经验误差:在训练集上的误差
  • 泛化误差:在“未来”样本上的误差,除训练集以外的所有样本
  • 由于我们事先不知道在新样本上的特征,我们只能努力使经验误差最小化,很多时候虽然能在训练集上做到错误率为零,但多数情况下这样的学习器并不好
  • 过拟合:学习器把训练样本本身特点当作所有潜在样本都会具有的一般特质
  • 欠拟合:训练样本的一般性质都尚未被学习器学习好
  • 过拟合:学习器/模型把训练样本学习的“太好”,将训练样本本身的特点当作是所有样本的一般项,导致泛化能力下降
  • 解决过拟合的方法:正则化、Early Stopping、增加训练样本
  • 欠拟合:对训练样本的一般性质都尚未学好,决策树中通常扩展分支,神经网络中通常增加训练轮数
  • 样本集的分类与作用,训练集:训练阶段用于调整参数使用的样本集;验证集:训练阶段用于评价模型的样本集;测试集:最后用于测试模型性能的数据,作为泛化误差的近似
  • 获取“测试集”的方法,原则:与训练集“互斥”;留出法、K折交叉验证、自助法

    留出法:

  • 直接将数据集划分为两个互斥集合
  • 训练或者测试的数据集要符合数据分布的一致性
  • 在分类任务中至少要保持样本的比例相似,即“分层采样”
  • 一般若干次随机划分,重复实验取平均值
  • 训练或者测试的样本比例通常为2:1-4:1

    交叉验证/K折交叉验证法:

  • 将数据集分层采样划分K个大小相似的互斥子集,每次用K-1个子集的并集作为训练集,余下的子集作为测试集,最终返回K个测试结果的平均值
  • 与留出法相似,将数据集D划分为K个互斥子集,有许多方案,为了减少因为样本划分而引入的差别,K折交叉验证通常随机使用不同的划分重复P次,最终的评估结果即P次K折交叉验证的均值
  • 假设数据集D包含m个样本,若令K=m,则得到留一法

    优点:

  1. 不受随机样本划分方式的影响
  2. 结果往往比较准确
  3. 当数据集较大时,计算开销难以忍受

    自助法/基于“自助采样”:

  • 以自助采样法为基础,对数据集有放回m次得到训练集飘作测试集
  • 实际模型与预期模型都用m个样本
  • 约有1/3的样本没在训练集中
  • 从初始数据集中产生多个训练集,对集成学习有很大的好处
  • 自助法在数据集较小,难以有效划分训练/测试时候比较有用,由于改变了数据集分布,可能会引入估计偏差,在数据量足够多的时候,留出法与交叉验证法通常更有用
  • 算法的参数:由人工设定,称“超参数”
  • 模型的参数:一般由学习决定

  • 性能度量:性能度量是衡量模型泛化能力的评价标准,反映了任务需求,使用不同的性能度量往往会导致不同的结果
  • 在预测任务中,给定样例集评估学习器的性能,也即把预测结果和真实标记比较
  • 回归任务中常用均方误差

  • 分类任务中,错误率与精度是常用的性能度量
  • 错误率

  • 精度

真实情况 \ 预测结果正例 (Positive)反例 (Negative)
正例 (Positive)TP (真正例)FN (假反例)
反例 (Negative)FP (假正例)TN (真反例)
  • 真正例率(TPR)

  • 假正例率 (FPR)

  • 敏感性 (Se)

  • 特异性 (Sp)

  • 准确率 (Accuracy)

  • 精确率 (Precision)

  • 召回率 (Recall)

  • F1 Score

  • 若一个模型的ROC曲线完全包住了另一个模型的ROC曲线,我们就认为这个模型更优
  • 若一个学习器的P-R曲线被另一个学习器的曲线完全包住,则可断言后者的性能优于前者
  • 平衡点是曲线上“查准率 = 查全率”
  • 非均等代价:犯不同的错误往往会造成不同的损失,此时需考虑“非均等代价”
  • 比较检验 性能比较:测试性能不等于泛化性能,测试性能随着测试集的变化而变化,很多机器学习算法本身具有一定的随机性
  • 假设检验 统计假设检验为学习器性能比较提供了重要依据
  • 两学习器:交叉验证t检验(基于成对t检验)、K折交叉验证、McNemar检验(基于列联表,卡方检验)
  • 多学习器:Friedman检验(基于序值 F检验,判断是否相同)Nemeny后续检验(基于序值 F检验,进一步判断两两差别)
  • 置信度:表示有多大把握认为假设正确
  • 显著性水平:表示假设出错的概览
  • 自由度:不被限制的样本数,自由取值的样本数
  • 偏差(bias),方差(variance),噪声(noise),故泛化误差 = 偏差 + 方差 + 噪声
  • 偏差 (Bias):

期望输出与真实标记的差别。

  • 方差 (Variance):

同样大小的训练集的变动所导致的性能变化。

  • 噪声 (Noise):

  • 方差 (Variance): 度量了同样大小的训练集的变动所导致的学习性能的变化,即刻画了数据扰动所造成的影响
  • 偏差 (Bias): 度量了学习算法的期望预测与真实结果的偏离程度,即刻画了学习算法本身的拟合能力
  • 噪声 (Noise): 表达了在当前任务上任何学习算法所能达到的期望泛化误差的下界,即刻画了学习问题本身的难度
  • 训练初期: 学习拟合能力不强,偏差主导
  • 随着训练加深: 学习拟合能力增强,方差上升。
  • 训练充足后: 学习拟合能力很强,方差主导

计算题

 

更多推荐