
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
将原图放入模型后,产生预测图,预测图宇实现已有的标签计算loss,调整参数继续循环这个过程,直至loss函数最小,即参数最优为止。最简单的语义分割,当属于二分类,即识别出图片中的两种地物,一种归为背景,另一种归为想要提取的物体。解码:图像(size)不断变大(最终恢复到原图的1/2),同时不断变薄(通道数减小)简而言之,是将一张(含有多种物体的)图片,识别出其中一种物体。编码:图像(size)不断
机器学习是从数据中自动分析获得模型,并利用模型对未知数据进行预测。1.数据集的构成:特征值+目标值每一行的数据称为样本;有些数据可以没有目标值字典特征提取(特征离散化)文本特征提取2.特征提取API特征与处理是一些转换函数将特征数据转换成更加适合算法模型的特征数据过程。数据中包含冗余或相关变量(或称特征、属性、指标等),旨在从原有特征中找出主要特征高维数据转化为低维数据的过程,在此过程中可能会舍弃
如果一个样本在特征空间中的k个最相似(即特征空间中最邻近)的样本中的大多数属于某一个类别,则该样本也属于这个类别。问题:k值取得过小,容易受到异常点的影响k值取得过大,样本不均衡的影响进行无量纲化,使不同规格的数据转换到统一规格无量钢化处理(采用标准化)归一化容易受到异常值影响案例一:鸢尾花种类预测流程:获取数据--数据集划分--特征工程(标准化)--KNN预估器流程--模型评估"""用KNN算法
优点:对缺失数据不太敏感,算法也比较简单,常用于文本分类分类准确度高,速度快缺点:由于使用了样本属性独立性的假设,所以如果特征属性有关联时其效果不好H的专业术语称之为信息熵,单位比特。优点:简单的理解和解释,树木可视化,可解释能力强缺点:决策树学习者可以创建不能很好推广数据的过于复杂的树,这被称为过拟合。改进:减枝cart算法(决策树API当中已经实现,随意森林参数调优有相关介绍)随机森林注意:企
利用回归方程(函数)对一个或者多个自变量(特征值)和因变量(目标值)之间关系进行建模的一种分析方式。
y=1 真实值属于这个类别y=0 真实值不属于这个类别。召回率:真实为正例的样本中预测结果为正例的比例查的全不全。2 精确率(Precision)与召回率(Recall)(y_predict - y_true)平方和/总数。逻辑回归的真实值/预测值 是否属于某个类别。精确率:预测结果为正例样本中真实为正例的比例。案例:癌症分类预测-良/恶性乳腺癌预测。逻辑回归的输入就是一个线性回归的结果。:其中x
计算每个人与新来的人的身高差(出现负数预测不靠谱),则将身高差先平方后开方,其中身高差最小的三个人也就是与新来的人距离最近的人,其中三个人中有两个人为女性,则预测新来的人为女性。例子:假设统计了几个人的身高数据,并且知道这几个人的性别,这时候来了一个人:知道身高但不知道性别,现在来预测一下这个人的性别。常用在汽车导航(比较两个目的地的距离哪个更长),计算机视觉领域(识别两个相似的图像或者物体)范数
比如,我们用静息心电图的结果来进行划分,分出来三种Normal,ST,LVH,其中病例数分别为552,178,188,可以计算出他们的信息熵的值都为多少。决策树的工作原理就是模拟一棵树的分叉原理,利用这些检测化验数据,把患有心脏病的病例和心脏完全健康的病例正确的分类。如果使用静息心电图的检测结果,来划分全部数据,那么全部的检测数据的不确定性(信息熵的值)能降低多少呢。这份检测结果的数据只有两个,则
比如特征值最大的3.73,如果用他对应的特征向量去降维成绩数据,那么降维后的数据能保留原始成绩数据的74.60%的信息量,由于它保留的数据量最多,我们拿它当作主成分 1;例子1:首先,在三维坐标系中寻找一条过原点的直线,空间上的所有数据点向这跟直线上投影,投影后的数据点必须方差最大(数据点在这跟直线的间隔必须最大)主成分 2:英语成绩为负,但绝对值最大,这代表主成分 2利用英语的成绩抽取了更多的成
在把数据给到算法之前,先将原始数据分成训练集(80%)和测试集(20%),我们会对训练数据集进行标准化或归一化,利用训练数据集得到的均值和标准差或者最小值、最大值来进行计算。训练结束后,我们会用测试数据集去测试模型,我们要对测试数据集进行标准化或者归一化。(Normalization):(原始数据-数据中的最小值)/(数据中的最大值-数据中的最小值)(Standardization):(原始数据-







