
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
数据挖掘大部分的价值在于利用数据挖掘技术改善预测模型。知识发现KD输出的是规则数据挖掘DM输出的是模型共同点两种方法输入的都是学习集(learning sets)目的都是尽可能多的自动化数据挖掘过程只能半自动化,不能完全自动化社会信息化后,社会的运转是软件的运转,社会的历史是数据的历史技术分类预言:用历史预测未来描述:了解数据中潜在的规律数据挖掘技术关联分析序列模式分...
根据系统的内存使用量,CPU使用量,以及进程数分析问题ETL与ELTETL多数依靠工具,利用工具进行数据清洗,标准化后装载ELT是先将数据装载入数据库,再利用数据库技术清洗数据使用ETL还是ELT和你本身数据库的特性有关的,有些种类数据库(线性增长的数据库||并行处理),数据的逻辑处理在库内的速度要快,而有些库是将复杂的逻辑放在库外更合适。Teradata数据库采用的...
熵(entropy)指的是体系的混乱的程度,它在控制论、概率论、数论、天体物理、生命科学等领域都有重要应用,在不同的学科中也有引申出的更为具体的定义,是各领域十分重要的参量。数据预处理数据预处理技术包括:聚集、抽样、维规约、特征子集选择、特征创建、离散化和二元化、变量变换。属性的类型:标称(定性的)值仅仅是不同的名字,即只提供足够的信息以区分对象,如ID,性别。序数(定性的)...
数据库导入层DataStage 是由IBM公司开发的,是一套专门对多种操作数据源的数据抽取、转换和维护过程进行简化和自动化,并将其输入数据集市或数据仓库目标数据库的集成工具。DataStage 能够处理多种数据源的数据,包括主机系统的大型数据库、开放系统上的关系数据库和普通的文件系统等联机分析处理OLAP(On-Line Analytical Processing)是数据仓库系统...







