logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

数据认知与数据预处理--数据认知

每一条数据可以称为数据集的一个样本,而每一条数据要用不同的特征描述出来,特征也称为属性。属性通常分为两大类。一类是定性描述的属性,其可以划分为标称属性,布尔属性,序值属性,不具备数的大部分性质。一类是定量描述的属性,即数值属性,用数表示,并且具有数的大部分性质,可以是整数值和离散值。标称属性:符号或事物的名称。但是有时候,机器学习任务中,模型只能接受数值型属性,所以可以用one-hot编码将标称属

#数据挖掘
数据认知与数据预处理--数据预处理

只有当数据的质量好才能保证数据分析的结果好。然后实际系统中的原始数据会因为很多原因出现数据错误,数据缺失,不一致等情况,所以需要对原始数据进行预处理,包括数据清洗,数据集成,数据归约,数据转换。目的:填充或删除缺失值,降低噪声与识别离群点。数据清洗的第一步偏差检测(数据的不一致性,字段过载),第二步纠正偏差1.缺失值处理(1)直接删除缺失属性的记录。(2)人工填写缺失值。(3)使用全局常量填写缺失

#机器学习#数据挖掘#python
数据分类分析--决策树算法

例如:随着人工智能的不断发展,机器学习这门技术也越来越重要,很多人都开启了学习机器学习,本文就介绍了机器学习的基础内容。决策树是一种类似于流程图的树结构,其中每个内部节点表示在一个属性上的测试,每个分支代表该测试的一个输出,而每个叶子节点(终端节点)存放一个分类结果。上图是一个决策时的示例。当决策树构建好之后,对检验记录进行分类就很容易,从树的根节点开始,将测试条件用于检验记录,沿着树的分支达到叶

#决策树#算法#分类
数据挖掘概述

数据中的知识发现(KDD),也可以把数据挖掘视为知识发现过程的一个基本步骤。步骤序列:(1)数据清理(2)数据集成(3)数据选择(4)数据变换(5)数据挖掘(6)模式评估(7)知识表示数据挖掘功能分为描述性的和预测性的。描述数据:刻画目标数据中数据的一般性质。预测数据:预测其他变量。聚类,关联分析,数据总结,偏差检测是描述性任务。分类和预测是预测性任务。数据挖掘吸纳了统计学,机器学习,模式识别,数

#数据挖掘#数据分析#算法
到底了