零基础机器学习笔记01

机器学习笔记01

学习防止忘记的记录。

概述

在这里插入图片描述

机器学习

概念

利⽤计算机的运算能⼒从⼤量的数据中发现⼀个“函数”或“模型,把⽆序的数据转换成有⽤的信息,建模的过程就是机器的“学习”。即大量数据下的统计,找规律

特征,标签,函数,训练集,测试集
⾃变量(x, x, x, …, x),在机器学习领域叫作特征(feature),因变量y,在机器学习领域叫作标签(label),有时也叫标记。机器学习,就是在已知数据集的基础上,通过反复的计算,选择最贴切的函数(function)去描述数据集中⾃变量x, x, x, …, x和因变量y之间的关系。

特征是机器学习中的输⼊,原始的特征描述了数据的属性。它是有维度的。特征的维度指的是特征的数⽬。如果预测商品的销量,把商品的类别、价格和推荐级别这3个属性定义为商品的特征,那么这个数据集就是三维特征数据集。其中的⼀个样本的格式如下:
(x,x,x)
标签,也就是机器学习要输出的结果,是我们试图预测的⽬标。机器推断出来的,称作预测标签y’⽐较y和y’的差异,也就是在评判机器学习模型的效果。

深度学习:层数较多、结构⽐较复杂的神经⽹络的机器学习技术叫作深度学习
在这里插入图片描述

类别

监督学习:练集数据包含⼤量的图⽚,同时告诉计算机哪些是猫,哪些不是猫 。计算机判断新给出的图⽚是不是猫

⽆监督学习 :训练集数据只是包含⼤量的图⽚,没有指出哪些是猫,哪些是狗,但是计算机经过判断,它能够把像猫的图⽚归为⼀组,像狗的图⽚归为⼀组

半监督学习
在这里插入图片描述

应用

回归:预测⼀个值,其标签的值是连续的。例如,预测房价、未来的天⽓等任何连续性的⾛势、数值。

分类:将事物标记⼀个类别标签,结果为离散值,也就是类别中的⼀个选项

常用网站,库

在线网站:kaggle,colab
Pandas和NumPy提供数据结构,⽀持数学运算;Matplotlib和Seaborn⽤于数据可视化;后⾯4个库提供算法,其中的Scikit-learn是机器学习框架,TensorFlow、Keras和PyTorch则是深度学习框架

更多推荐