机器学习04逻辑回归分类
逻辑回归分类是利用逻辑回归实现分类

机器学习的分类过程,也就是确定某⼀事物⾪属于某⼀个类别的可能性⼤⼩的过程。

逻辑函数

Sigmoid函数的公式为:在这里插入图片描述⼴泛应⽤于逻辑回归分类和神经⽹络激活过程。抑制分类的两边,对中间区域的细微变化敏感,这对分类结果拟合效果好。
逻辑函数算出的是中间值,概率。转为最终结果还需要一个分类器在这里插入图片描述

在这里插入图片描述逻辑回归所做的事情,就是把线性回归输出的任意值,通过数学上的转换,输出为0~1的结果,以体现⼆元分类的概率

损失函数

损失函数:在逻辑回归中,不能使⽤MSE。因为经过了⼀个逻辑函数的转换之后,MSE对于w和b⽽⾔,不再是⼀个凸函数,这样的话,就⽆法通过梯度下降找到全局最低点,使用以下函数在这里插入图片描述

在这里插入图片描述
如果真值是1,但假设函数预测概率接近于0的话,得到的损失值将是巨⼤的。如果真值是0,但假设函数预测概率接近于1的话,同样将得到天价的损失值。

逻辑回归的损失函数如下在这里插入图片描述
(①取负数是在机器学习中通常希望把上升问题转化为下降问题
②loss为什么由sigmod变为了此公式,因为目的是更新参数𝑤和𝑏使得预测出的结果全部正确的概率最大,简单来讲就是所有的样本的预测正确的概率相乘得到数值是最大的,相对连乘运算,连加运算计算起来要比连乘要简单许多,因此可以利用两边同时取log的形式让连乘变成连加,e的多少次方最大等同于求次方最大)

实际运行,只需调库

from	sklearn.linear_model	import	LogisticRegression	#导⼊逻辑回归模型
lr	=	LogisticRegression()	#	lr,	就代表是逻辑回归模型
lr.fit(X_train,	y_train)	#	fit,	就相当于是梯度下降
print("SK	learn逻辑回归测试准确率{:.2f}%".format(lr.score(X_test,	y_test)*100))

哑特征

cp这个字段,它的意义是“胸痛类型”,取值为0、1、2、3。这些分类值,是⼤⼩⽆关的。但是问题在于,计算机会把它们理解为数值,认为3⽐2⼤,2⽐1⼤。
解决的⽅法,是把这种类别特征拆分成多个哑特征,⽐如cp有0、1、2、3这4类,就拆分成个4特征,cp_0为⼀个特征、cp_1为⼀个特征、cp_2为⼀个特征、cp_3为⼀个特征。每⼀个特征都还原成⼆元分类,答案是Yes或者No,也就是数值1或0。

a	=	pd.get_dummies(df_heart['cp'],	prefix	=	"cp")

多元分类

逻辑回归解决多元分类问题的思路是‘以⼀对多’
有多少类别,就要训练多少⼆元分类器。每次选择⼀个类别作为正例,标签为1,其他所有类别都视为负例,标签为0,

欠拟合和过拟合

过拟合就是机器学习的模型过于依附于训练集的特征,因⽽模型泛化能⼒降低的体现。泛化能⼒,就是模型从训练集移植到其他数据集仍然能够成功预测的能⼒。

在这里插入图片描述

降低过拟合方法 :

  1. 增加数据集的数据个数。数据量太⼩时,⾮常容易过拟合,因为⼩数据集很容易精确拟合。
  2. 找到模型优化时的平衡点,⽐如,选择迭代次数,或者选择相对简单的模型。
  3. 正则化。
    加⼊了正则化参数之后的逻辑回归均⽅误差损失函数公式被更新成下⾯这样:在这里插入图片描述
    ⼀个是损失项,⽤于衡量模型与数据的拟合度;另⼀个是正则化项,⽤于调解模型的复杂度。将正则化机制引⼊损失函数之后,当权重⼤的时候,损失被加⼤,λ值越⼤,惩罚越⼤。
    如果λ值过⼤,则模型会⾮常简单,将⾯临数据⽋拟合的⻛险。如果λ值过⼩,则模型会⽐较复杂,将⾯临数据过拟合的⻛险。

岭回归和套索回归

正则化参数通常有L1正则化和L2正则化两种选择。
L1正则化,根据权重的绝对值的总和来惩罚权重。在依赖稀疏特征(后⾯会讲什么是稀疏特
征)的模型中,L1正则化有助于使不相关或⼏乎不相关的特征的权重正好为0,从⽽将这些特征从模型中移除。
L2正则化,根据权重的平⽅和来惩罚权重。L2 正则化有助于使离群值(具有较⼤正值或较⼩负值)的权重接近于0,但⼜不会正好为0。在线性模型中,L2 正则化⽐较常⽤,⽽且在任何情况下都能够起到增强泛化能⼒的⽬的。
应⽤L1正则化的回归⼜叫Lasso Regression(套索回归),应⽤L2正则化的回归⼜叫
Ridge Regression(岭回归)。

https://scikitlearn.com.cn/0.21.3/2/#1111-logistic

回归和分类模型的评价指标:

https://blog.csdn.net/zcs2312852665/article/details/154299919

总结:
分类:①准确率:猜对的比例
②精确率:真对和假对里面真对的比例(预测准不准)
③召回率:真对和假错里面真对的比例(找得全不全)
④F1-Score:调和平均

更多推荐