logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-数据预处理

数据预处理是数据挖掘的关键环节,主要包括四大任务:数据清洗(处理缺失值和噪声)、数据集成(合并多源数据并解决实体识别问题)、数据规约(降维和压缩)以及数据变换。预处理质量直接影响后续分析效果,需从完整性、一致性等六个维度评估数据质量。常用技术包括分箱平滑、回归分析、PCA降维等,如同装修房屋需先清理毛坯、打通空间再精简装饰。良好的预处理能显著提升模型性能,避免"垃圾进垃圾出"的

文章图片
#学习
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-偏相关分析

偏相关分析(Partial Correlation Analysis)是在多变量相关分析中,研究当其他变量保持不变时,两个变量之间的相关关系。它能够排除其他变量的影响,揭示两个变量之间的真实相关性。核心思想控制其他变量的影响分析两个变量之间的净相关关系消除混淆变量的干扰揭示变量间的真实关联强度NOTE]我的理解偏相关分析就像"排除干扰项的纯净测试"——当我们想知道X和Y的真实关系时,需要先把Z的影

文章图片
#学习
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-非线性相关分析

在研一上学期学习了《大数据分析D》课程,3.3节让我彻底改变了以往对“相关性”的认知,是最让我感到“原来如此”的一章内容。之前本科学统计时,Pearson相关系数几乎成了“万能钥匙”——只要两个变量,就先算个r看看强不强。因此,以往不论是参加比赛还是写本科毕业论文时,习惯性只看Pearson相关系数,一旦接近0就认为“没关系”。经过这一节的学习才对“线性相关为0,不代表无相关”的理解更加深刻——变

文章图片
#数据挖掘#人工智能
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-Logistic回归

优势局限✅ 模型简单,可解释性强(系数即特征重要性)❌ 只能处理线性可分问题✅ 训练速度快,适合大规模数据❌ 对特征工程依赖较强✅ 输出概率值,便于阈值调整和业务决策❌ 容易欠拟合复杂非线性关系✅ 不易过拟合(尤其加正则化后)❌ 对多重共线性敏感✅ 易于扩展到多分类(Softmax)❌ 对异常值较敏感我的思考Logistic回归是理解深度学习的基石:神经网络的输出层(二分类)本质上就是一个Logi

文章图片
#学习
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-LASSO回归

维度优势局限特征选择自动进行变量选择,产生稀疏解当pnp>npn时,最多选择nnn个变量可解释性模型简单,特征重要性明确相关性强的特征中可能随机选择一个计算效率有高效算法(坐标下降、LARS)非凸推广(如SCAD)计算复杂理论性质在一定条件下具有Oracle性质需要严格的"不可表示条件"

文章图片
#数据挖掘#回归#kotlin
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-非线性回归

非线性回归是一种统计建模方法,用于描述因变量(响应变量)与一个或多个自变量(解释变量)之间的非线性关系。与线性回归不同,非线性回归模型的预测函数无法表示为自变量的线性组合。本质线性模型是指形式上呈现非线性关系,但通过适当的变量变换可以转化为线性形式的回归模型。原始模型关于参数是非线性的存在确定的数学变换可使其参数线性化变换后可使用线性回归方法进行参数估计本质非线性模型是指无法通过任何变量变换或参数

文章图片
#数据挖掘#回归#人工智能
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-集成学习与 AdaBoost

提升模型性能不一定依赖复杂结构合理组合多个简单模型同样有效Boosting 的核心在于“关注错误并修正错误”AdaBoost 作为 Boosting 家族的基础算法,为后续理解 GBDT、XGBoost 等方法提供了重要理论起点。笔记来源:冯同学均有明显提升。提升模型性能不一定依赖复杂结构合理组合多个简单模型同样有效Boosting 的核心在于“关注错误并修正错误”

文章图片
#数据挖掘#集成学习#人工智能
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-Apriori 算法

在学习 Apriori 算法的过程中,我对其自下而上的搜索和剪枝策略有了更深的理解。尽管该算法较为简单,但在实际应用中,它的性能和效率往往受到数据规模的限制。因此,在实际应用中,如何优化 Apriori 算法,使其能够更高效地处理大规模数据,是我接下来深入思考的方向。结合现有的分布式计算技术,Apriori 算法的性能有了显著提升,这也为大数据时代的关联规则挖掘提供了更多的可能性。笔记来源:董同学

文章图片
#数据挖掘#人工智能
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-非线性相关分析

在研一上学期学习了《大数据分析D》课程,3.3节让我彻底改变了以往对“相关性”的认知,是最让我感到“原来如此”的一章内容。之前本科学统计时,Pearson相关系数几乎成了“万能钥匙”——只要两个变量,就先算个r看看强不强。因此,以往不论是参加比赛还是写本科毕业论文时,习惯性只看Pearson相关系数,一旦接近0就认为“没关系”。经过这一节的学习才对“线性相关为0,不代表无相关”的理解更加深刻——变

文章图片
#数据挖掘#人工智能
大数据管理与应用系列丛书《数据挖掘》(吕欣等著)读书笔记-偏相关分析

偏相关分析(Partial Correlation Analysis)是在多变量相关分析中,研究当其他变量保持不变时,两个变量之间的相关关系。它能够排除其他变量的影响,揭示两个变量之间的真实相关性。核心思想控制其他变量的影响分析两个变量之间的净相关关系消除混淆变量的干扰揭示变量间的真实关联强度NOTE]我的理解偏相关分析就像"排除干扰项的纯净测试"——当我们想知道X和Y的真实关系时,需要先把Z的影

文章图片
#学习
    共 16 条
  • 1
  • 2
  • 请选择