
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
机器学习-预测-线性系统的预测现在预测学的核心概念:回归。从数学的角度,为事物(系统)的预测提供现代的技术方法。回归与现代预测学统计学上最初回归的含义由高尔顿(达尔文的表弟)通过研究父母身高与孩子身高得出。矮个父母所生的儿子往往会比其父母更高,高个父母所生儿子的身高却回降到多数人的平均身高。也就是说,当父母身高走向极端时,子女的身高不会进一步极端化,他们的身高要比父母更接近平均身高,即有...
SVD(隐语义模型)协同过滤隐语义模型,数学上称为SVD,奇异值分解。该算法最早在文本挖掘领域被提出,用于找到文章的隐含主题,也被称为主题模型。隐语义模型的核心思想是通过隐含特征(Latent Factor)计算用户和物品的相似性。SVD是将矩阵A分解成以下形式A=U∑VT其中U和V均为单位正交阵,UUT=E, VVT=E,U称为左奇异矩阵,V称为右奇异矩阵,∑仅在对角线上有值,我们...
数据预处理的必要性及主要任务1、数据预处理的必要性数据库极易受噪声、缺失值和不一致数据的侵扰,因为数据库太大,并且多半来自多个异构数据源。低质量的数据导致低质量的数据挖掘。2、数据预处理技术(1)数据清理:可以用来清除数据中的噪声,纠正不一致。(2)数据集成:将数据由多个数据源合并成一个一致的数据存储,如数据仓库。(3)数据归约:可以通过如狙击、删除冗余特征或聚类来降低数据的...
机器学习-推荐系统-协同过滤协同过滤(Collaborative Filtering, CF)基于协同过滤的推荐,它的原理很简单,就是根据用户对物品或者信息的偏好,发现物品或者内容本身的相关性,或者发现用户的相关性,然后再基于这些相关性进行推荐。基于协同过滤的推荐可以分为两个简单的子类:基于用户的推荐(User-based Recommendation)和基于项目的推荐(Item-based...
数据仓库-维度模型描述Dimensional Modeling,简称DM,是一套技术和概念的集合,用于数据仓库设计核心概念事实表示对业务数据的度量通常是数字类型的,可以进行聚合和计算维度对观察数据的角度一组层次关系或描述信息,用来定义事实举例:销售金额是一个事实,而销售时间、销售的产品、购买的顾客、商店等都是销售事实的维度。维度模型按照业务流程领域即主题域简历,例如进货、销...
Task with the most failures(4):-----Task ID:task_1555476136794_8201_m_000000URL:http://hadoop1:8088/taskdetails.jsp?jobid=job_1555476136794_8201&tipid=task_1555476136794_8201_m_000000...
数据预处理的必要性及主要任务1、数据预处理的必要性数据库极易受噪声、缺失值和不一致数据的侵扰,因为数据库太大,并且多半来自多个异构数据源。低质量的数据导致低质量的数据挖掘。2、数据预处理技术(1)数据清理:可以用来清除数据中的噪声,纠正不一致。(2)数据集成:将数据由多个数据源合并成一个一致的数据存储,如数据仓库。(3)数据归约:可以通过如狙击、删除冗余特征或聚类来降低数据的...
数据预处理的必要性及主要任务1、数据预处理的必要性数据库极易受噪声、缺失值和不一致数据的侵扰,因为数据库太大,并且多半来自多个异构数据源。低质量的数据导致低质量的数据挖掘。2、数据预处理技术(1)数据清理:可以用来清除数据中的噪声,纠正不一致。(2)数据集成:将数据由多个数据源合并成一个一致的数据存储,如数据仓库。(3)数据归约:可以通过如狙击、删除冗余特征或聚类来降低数据的...
机器学习-决策树-C4.5决策树针对ID3算法存在的一些问题,1993年,Quinlan将ID3算法改进为C4.5算法。该算法成功地解决了ID3算法遇到的诸多问题,发展成为机器学习的十大算法之一。C4.5并没有改变ID3的算法逻辑,基本的程序结构仍与ID3相同,但在节点的划分标准上做了改进。C4.5使用信息增益率(GainRatio)来替代信息增益(Gain)进行特征的选择,克服了信息增益选...
概述在hudi数据湖框架中支持三种方式写入数据:UPSERT(插入更新)、INSERT(插入)和BULK INSERT(写排序)UPSERT:默认行为,数据先通过index打标(INSERT/UPDATE),有一些启发式算法决定消息的组织以优化文件的大小INSERT:跳过index,写入效率更高BULK_INSERT:写排序,对大数据量额hudi表初始化友好,对文件大小的限制best...







