2023级大数据与学习分析课堂笔记
1.数据分析的概念:用适当的数据分析方法对收集来的大量数据进行分析,提取有用信息和形成结论而对数据加以详细研究和概括总结的过程。
2.数据挖掘的概念:从大量的数据中通过算法搜索隐藏于其中信息的过程,是数据库知识发现中的一个步骤。
3.数据仓库:为企业的决策制定,提供所有类型数据支持的战略集合。他是单个数据存储,出于数据分析和决策支持目的而创建。为需要业务智能的企业,提供业务流程改进、成本质量控制等方面的指导。
4.大数据的特性4V:规模大,多样化,高速性,价值化
5.体量大,快速和多样化的信息资产,需用高效率和创新型的信息技术加以处理,以提高发现洞察,做出决策和优化流程能力。
6.数据挖掘的任务:
描述性:刻画目标数据中数据的一般性质
预测性:对当前数据进行归纳,以便预测
7.关联规则:①目的:分析变量之间的依赖关系
②应用场景:购物分析、医疗信息、气象预测、推荐系统
8.
第四次
1.缺失值清洗:...................
2.异常值的清洗

3.逻辑错误清洗


4.数据变化种类
数据变换
数据变换就是被数据转化成适当的形式,满足软件或分析理论的需要。数据变换策略包括:光滑、聚集、数据泛化、属性构造、简单函数变换、规范化和连续属性离散化等。





数据规约
数据规约是指尽可能保持原貌的前提下,最大限度地精简数据量。数据规约能够降低无效错误的数据对简模的影响,缩短处理时间,缩小存储数据的空间。
数据规约分类为:属性规约、数值规约
属性规约(减少列/特征)
定义:通过选择或组合原有属性,减少数据表中字段(列)数量,同时保留原始数据的主要信息。
1.特征选择(删除无关属性)2.特征提取(主成分分析 )
数值规约(减少行/数据量)
定义:通过选择代替的、较小的数据表示形式,减少数据记录的条数或数据的精度
1.抽样(减少行数) 2.数据离散化(降低精度分段)3.聚类块(用中心点代替整体 )
| 列名 | 含义 |
| Gender | 性别。通常为分类变量,如“男”“女”。 |
| Nationality | 国籍。学生所属的国籍类别。 |
| PlaceofBirth | 出生地。学生的出生地点(通常与国家或地区相关)。 |
| StageID | 教育阶段标识。表示学生当前所处的学段,例如小学、初中、高中等。 |
| GradeID | 年级标识。具体年级,如G1、G2..或对应某个年级的编码。 |
| SectionID | 班级/组别标识。同一学年的不同班级或教学班。 |
| Topic | 课程主题/学科。正在学习的课程名称(如数学、语文、科学等)。 |
| Semester | 学期。第一学期或第二学期 |
| Relation | 学生与监护人的关系。例如父母、祖父母、其他亲属等。 |
| RaisedHands | 举手次数。学生在课堂上的举手互动次数(数值型)。 |
| VisitedResources | 访问课程资源的次数。学生登录或浏览教学资源(如在线材料)的次数 |
| AnnouncementsView | 查看公告的次数。学生查看学校或课程通知的次数. |
| Discussion | 课觉讨论参与情况。可能是参与讨论的次数或是否参与的标识, |
| ParentAnsweringSurvey | 家长是否回应调查问卷,通常为二元变量(是/否),表示家长是否完成了学校 调查。 |
| ParentSchoolSatisfaction | 家长对学校的满意度。等级变量(如好、一般、差,或数值评分) |
| StudentAbsenceDays | 学生缺勤人数。统计该学生在统计周期内缺席的总大数(通常按"少于7天”7天1 以上等分类) |
| Class | 最终分类标签/成绩等级。表示学生的学业表现或结果类别(例如低、中、高, 或是否表现优异)。 |
1.数据维度过高会加大模型复杂度,样本不足时泛化性差
模型复杂度:指模型结构或参数数量的多少。维度越高,模型需要学习的参数往往越多
泛化性:指模型在未见过的数据上的表现能力。泛化性好的模型不仅能记住训练数据,还能对新数据做出正确预则。根据小部分数据特征来推测未见过的数据
游戏例子:假设我们只有1000个玩家的数据,但用了100个游戏指标。一个过于复杂的模型可能会学到“某次击杀数恰好与某个英雄皮肤相关”这种虚假规律,导致在匹配新玩家时完全失效。
2.数据降维可以去除数据属性之间的共线性
共线性:指两个或多个特征之间存在高度相关性。例如“击杀数”和“总伤害”往往强相关,“补刀数和“经济”也基本同步。
共线性会带来问题:
模型无法稳定区分每个特征的独立贡献,参数估计波动大。
增加计算冗余,浪费算力。
降维 (如PCA) 通过将原始特征线性组合成少数几个不相关的新特征,直接消除了共线性。这些新特征彼此正交(独立),不再互相干扰。
游戏例子:原始特征中“击杀”和“伤害”“高度相关,降维后它们被合并到“整体实力”这个新维度中,不再存在共线性问题。
3.降低模型复杂度,降低模型训练时间
模型复杂度:降维后,特征数量从几百个减少到几十个甚至几个,模型需要学习的参数数量大幅减
少。例如逻辑回归模型的系数数量等于特征数,降维后系数变少,模型结构更简单。减少数据,不再那么复杂
训练时间:模型训练的计算量通常与特征数量成正比(甚至更高)。特征减少后,每次迭代的计算量下降,训练速度自然提升。
游戏例子:匹配系统原本需要在100维空间里计算玩家相似度,降维到5维后,距离计算速度提升20倍,四配时间从十几秒缩短到3秒内。
4.提高模型的鲁棒性和泛化性
鲁棒性:指模型对噪声、异常值、数据微小变化的容忍能力。高维数据中常含有随机噪声,降维时会舍弃那些方差很小或主要代表噪声的成分,使模型不再受这些干扰影响,因此更稳健。容差变大,不会以为小意外,影响整体数据
泛化性:降维去除了冗余信息和噪声,迫使模型关注数据中最重要的模式,从而减少了过拟合的风险,使模型在新数据上的表现更好。
游戏例子:玩家单局游戏可能有偶然的“超神”或“超鬼”,这些异常值在高维原始数据中会造成剧烈波动。降维后,这些偶然噪声被过滤(因为它们不属于主要变化方向),模型评估的是玩家长期稳定的实力风格,匹配更公平,对新对局的预测也更准。
两种数据降维的方式
特征选择(Feature Selection)
特征选择是从n个特征中选择 m(m<n)个特征,将剩下的n-m个特征舍弃,选择最优特征子集,以达到特征冗余最小化,并实现模型与目标相关性的最大化。在特征选择中按照某个标准对原有特征进行简化,并去掉一些冗余特征。被选择的m个特征没有发生任何变化,只是原有特征的一个子集,因此特征选择具有更好的可读性和可解释性。选择需要的特征,去掉多余的特征,起到简化的作用
特点:
生成新特征:新特征是原始特征的数学组合(如加权和、非线性映射),没有直观的业务含义。
可能丢失可解释性:例如PCA生成的主成分是“击杀×0.3+伤害×0.5+...”,很难直接解释。
方法:PCA(主成分分析)、LDA(线性判别分析)、自编码器、1-SNE等。
游戏例子:用PCA将100个指标压缩成5个主成分,每个主成分都是所有原始指标的线性组合。虽然整体实力”这个维度可以被近似解释,但它并不等同于任何原始指标。
特征提取(Feature Extraction)
特征提取是通过函数映射从原始特征中提取新特征的过程,通过特征提取可以得到另外一组新特征。特征提取后的新特征不再是原有特征的子集,而是原有特征的线性(或者非线性)映射。特征提取的本质是从原始高维空间向低维空间投影,减少特征数量,从而达到数据降维的目的。在原有的特征里提取新特征,而新特征不属于原本的特征集合
3.3特征选择数据降维方法
选择策略-----从特征属性本身出发考虑
•采用这种选择策略时,尽量找出携带信息量较大,信息区分性较大的特征属性。
测量特征属性取值离散程度的一个重要指标是标准差或变异系数。标准差越大,说明特征属性的取值越离散。而变异系数主要用于多个特征属性离散程度的比较。
1.若某数值型特征属性的变异系数小于某个标准值,则视该特征属性为不重要。
2.若某数值型特征属性的标准差小于某个标准值,则视该特征属性为不重要。
3.对于分类型特征属性,计算该特征属性在各类中的取值比例,若比例低于某个标准值,则视
该特征属性为不重要。
4.若某个特征属性的缺失值大于某个标准值,则视该特征属性为不重要。
1.标准差(Standard Deviation)
定义:标准差是各数据点与均值之差的平方和的平均值的平方根。它反映了数据相对于均值的平均波动大小。
公式(样本标准差):
xi:第i个样本的取值
x-:样本均值
n:样本数量
理解:标准差与原始数据具有相同的单位。标准差越大,说明数据越分散,取值范围越宽;标准差越小,说明数据越集中在均傳附近。
3.为什么不能只依赖标准差?
因为标准差受是纲和均值大小影响。例如:
特征A:人均收入(单位:元),均值为 5000,标准差为 1000- CV=0.2
特征 B:击杀数 (单位:个),均值为5,标准差为2—CV=0.4
虽然特征A的绝对标准差(1000) 远大于特征B (2),但相对离散程度却更小(02<0.4),说明人均收入这个特征在所有样本中变化不大,区分度不如击杀数。如果直接用标准差阔值,可能会错误地保留收入而剔除击杀。
·选择策略一从输入特征属性与输出特征属性的相关性度考虑
如果某输入特征属性和输出特征属性之间的相关性强,则该输入特征属性需要被选入。可以比算输入特征属性与输出特征属性之间的相关系数,若相关系数比例低于某个标准值,则该输入属性应视为不重要的特征属性。特征属性间的相关性通常可以用皮尔逊相关系数计算
2.步骤
筛选:删除不重要或者有问题的数据、记录或者个案。(标准差,变异系数)
排序:对剩下数据排序并根据重要程度给他们分级。相关性(皮尔逊)
选择:确定要在后续模型中使用的功能子集
常用的特征提取数据降维方法
(1)主成分分析法
主成分分析法(PCA)是最常用的线性降维方法,它的目标是通过某种线性投影,将高维的
数据映射到低维的空间中,并期望所投影的维度上数据的方差最大,以此在使用较少的数据维
度的情况下,保留较多原有的数据特征。
主成分分析法力求在降维之后能够最大程度地保持数据的内在信息,因此,它是丢失原
始数据信息最少的一种线性降维方法。
主成分分析法根据投影方向上的数据方差大小来衡量某一维度的重要性。但是通过投影
处理后,对数据的区分作用并不大,反而可能使得数据点揉杂在一起,无法区分,这导致在很
多情况下主成分分析法的分类效果并不好。
因此,主成分分析法的优点是能够提取最主要的信息,同时保证误差最小;缺点是它将线性映射,却忽略了类别属性,而它所忽略的投影方向有可能刚好包含了重要的区分性所有的
样本(特征属性集合)作为一个整体去对待,去寻找一个均方误差最小的最优信息。
(2)因子分析法
因子分析法(FA)是研究从变量群中提取共性因子的统计方法,最早由英国心理学家斯皮尔曼提出。他发现学生的各科成绩之间存在着定的相关性,某一单科成绩好的学生,往往其他各科成绩也比较好从而推想是否存在某些潜在的共性因子或者某些一般的智力因素,影响学生的学习成绩。
因子分析法可以在许多变量中找出隐藏的具有代表性的因子将相同本质的变量归入一个因子,可减少变量的数目,还可检验变量间关系的假设。因子分析 是一种减少变量个数、降低数据维度的多元统计分析方法。有效减少参与建模的变量个数,又不造成数据特征的大量丢失,是因子分析法的核心所在。
总结
“从变量群中提取共性因子":从5 科成绩中提取"语言能力”和“数理能力”两个共性因子.。
“减少变量个数”:5 个观测变量降成2个因子。
“不造成数据特征的大量丢失”:两个因子保留了原始变量之间的相关结构,预测成绩分布时误
差较小。
“检验变量间关系的假设”:可以验证"语义和历史是否属于同一因子”"数学和物理是否属于同一
因子”等假设。
这个例子能帮你直观理解:因子分析不是直接选择或压缩观测变量,而是从观测变量的相关矩阵中
反向推断出少数潜变量(因子),用它们代替原始交量,实现有解释性的降维。
6.1
决策树的特点:
(2)决策树包括分类树和回归树
通常,决策树包括分类决策树和回归决策树两种,分别称为分类树和回归树。
分类树和回归
树分别用来对分类型输出变量进行分类和对数值型输出变量值进行预测,即分类树实现对分类型
输出变量的分类,回归树则实现对数值型输出变量取值的预测。分类或回归的结果均体现在决策
树的叶子节点上。分类树叶子节点所含样本中,输出变量的众数类别就是分类结果;回归树叶子
节点所含样本中,输出变量的平均值就是预测结果。因此,对新数据进行分类预测时,只需按照
决策树的层次,从根节点开始依次对新数据输入变量值进行判断并进入不同的决策树分枝,直至
到达叶子节点为止。
(3)决策树体现了输入变量和目标变量取值的逻辑关系
与很多同样可以实现分类预测的算法相比,决策树的最大特点是:分类预测是基于逻辑的,
即利用IF ... THEN ... 的形式。通过输入变量取值的布尔运算(逻辑比较),预测目标变量的取值。

如该图所示决策树体现的逻辑关系有:
IF消费频率=“经常”THEN打算购买;
IF(消费频率=“偶尔”)且(收入水平=“高收入”或收入水
平=“中收入”)
THEN打算购买;
IF消费频率=“从未”THEN不打算购买;
IF(消费频率=“偶尔”)且(收入水平=“低收入”)THEN不
打算购买。
决策树的生长

C5.0算法
概述:C5.0 算法用于生成多分支的决策树,决策树的核心问题之一是决策树分支准则的确定,C5.0算法以信息增益率为标准确定最佳分组变量和分割点,其核心概念是信息熵。
◆信息熵
概述:信息熵是信息论中的基本概念。该理论认为:
1信息传递(信息通信)是通过一个由信源、信道和信宿组成的传递系统实现的。其中,信源是信息的发送端,信宿是信息的接收端。
2传递系统存在于一个随机干扰环境之中,因此传递系统传递的信息存在随机误差。如果将发送的信息U1,U2, .. ,Ur记为U,接收的信息V1,V2, ... ,Vr记为V,那么信道可看做信道模型,记为P(U|V)。




信息增益





2026.6.8
C5.0算法的决策树生长算法
信息增益更大的变量在消除信宿对信源的平均不确定性能力方面表现最好。而输入
变量T1作为分组变量时信息增益更大,因此T1是最佳分组变量。

C5.0算法的推理规则集
C5.0算法不但能够构造决策树,还可以生成推理规则集(一般可以表述为IF ... THEN ... 形式)。
PRISM 算法是生成推理规则的一般算法,该算法的基本思路为:确定输出变量中的一个类别
(称为期望类别)后,完成以下步骤:
1 ,在当前样本范围(开始时为全部样本)内,寻找一条推理规则,使其能够在最大限度“覆盖”
属于该类别的样本。
2,在M个样本范围内,按照正确覆盖率最大的原则确定附加条件,得到一个再小一些的样
本范围。在此基础上不断附加“逻辑与”条件,不断缩小样本范围,直到推理规则不再“覆盖”
属于其他类别的样本时,一条推理规则就形成了。
3 ,从当前样本集合中剔除已经被正确“覆盖”的样本,并检查剩余样本中是否有属于期望类
别的样本。如果有,则重新回到第1步,否则结束(循环)。
使用IBM SPSS进行实训,首先导入演示数据集。
打开IBM SPSS,点击下方“源”,选择Excel,拉到操作台,
双击Excel,导入桌面演示数据集。
找到输出,选择表格,与源Excel产生连接,而后右键行表格;

找到输出,选择数据审核,与源Excel产生连接,而后右键运行。
后面进行数据预处理两大板块。
1.缺少值丢失处理
双击演示数据集,点类型、读取值,后发现





2.超出范围值处理




实训二:
设置筛选数据质量问题的筛选标准
数据字段重要性程度计算方法的设置

| 目标 | 输入 | 排列方法 |
| 分类 | 分类 | Pearson,似然比,克莱姆系数,Lambda |
| 分类 | 分类和数值 | Pearson,似然比 |
| 数值 | 分类 | F统计量 |
| 数值 | 数值 | T统计量 |

这个代表每个字段重要性的排名

点生成,过滤器,选择字段

会有一个“已生成”,将其和类型连接起来,点开出现过滤掉的字段(打叉的)

实训三:
#名字_文件
打开IBM,选择源里面的变量文件,拖上去,选择编辑,导入数据集,应用



而后,选择字段选项里面的导出,将文件与导出建立连接,而后编辑导出,输入列除以列,预览发现出现新的一列数据


再加入字段选项里面的过滤器,与前面的导出建立连接,编辑过滤器,删除Na与K两列


连接字段选择里面的类别,进行编辑,将drug列为输出,则将其修改为目标


连接分区,编辑分区,培训区为百分之七十,测试区为百分之三十(培训区要比测试区大,大多为七三分或者八二分)


最后,连接建模里面的c5.0,进行编辑

运行C5.0


结果1

结果2

更多推荐
所有评论(0)