
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
大数据是指数据规模和增长速度使常用软件工具无法在短时间内获取、存储、分析和管理,而需要新的处理模式(如并行化、分布式等)来实现更可靠决策支撑、更深刻洞察发现和更迅捷流转优化的数据集。│关联规则挖掘、分类、聚类、异常检测、集成学习│。│格式转换数据 → 模式:可视化、相关分析、回归分析、数据降维、│。4. **典型应用**:金融、医疗、制造业、社交媒体等领域的应用。2. **大数据的特征**:规模性
本文是《数据挖掘》教材的学习笔记第一章,主要介绍了大数据时代背景与数据挖掘基础概念。内容涵盖大数据的4V特征(规模性、多样性、高速性、价值性)、数据挖掘的基本流程和技术体系(包括分类、聚类等9大方法),以及金融、医疗等领域的典型应用场景。同时探讨了大数据挖掘面临的隐私泄露、算法偏见等伦理问题。笔记采用结构化呈现方式,包含章节目录、核心概念解释和Python代码示例,为后续数据挖掘技术学习奠定理论基
摘要 《数据挖掘》第十章系统介绍了集成学习技术。集成学习通过组合多个基学习器提升模型性能,主要方法包括:1)Bagging(如随机森林),通过自助采样并行训练多个模型并投票;2)Boosting(如AdaBoost、GBDT),序列化训练模型并调整样本权重;3)Stacking,使用次级学习器整合多个基模型的预测结果。本章通过Python代码示例展示了不同集成方法在分类和回归任务中的应用,并对比了
本文介绍了数据挖掘中的聚类方法,包括层次聚类、K-Means算法、高斯混合聚类和DBSCAN算法。层次聚类通过树状图展示聚类过程;K-Means通过肘部法则选择最佳K值;高斯混合模型基于概率分布进行软聚类;DBSCAN则基于密度识别任意形状的簇。每种方法都配有Python实现代码和可视化示例,帮助理解不同聚类技术的原理和应用场景。文章还提供了轮廓系数等评估指标的计算方法,为实际应用提供参考依据。
本文是《数据挖掘》系列笔记的第四章,重点介绍了回归分析方法。主要内容包括:一元线性回归和多元线性回归的基本原理与实现(含Python代码示例);多重共线性问题及其诊断方法(VIF);正则化方法(岭回归和LASSO回归)的应用;以及非线性回归(多项式回归)的实现。文章通过具体代码演示了数据准备、模型训练、评估指标计算(MSE、R²)等完整流程,并比较了不同回归方法的优缺点。最后还介绍了模型评估与选择







