logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

常见聚类算法及使用--Affinity Propagation(AP)

对于聚类算法,大家应该都已经略知一二,比如说它是无监督,不需要标签来监督它的学习,我们需要的是在特定场景下将这些未被标注的数据进行自然分组。聚类是在输入数据的特征空间中查找自然组的无监督问题;对于所有数据集,有许多不同的聚类算法和单一的最佳方法;在机器学习库的Python中如何实现、适配和使用顶级聚类算法。AP聚类算法与经典的K-Means聚类算法相比,具有很多独特之处:无需指定聚类“数量”参数。

#聚类#算法
大数据之SQL优化

在日常工作中,数据处理和分析在研发、产品和运营等多个领域起着重要的作用。在海量数据处理和分析中,SQL 是一项基础且重要的能力。一个优秀的 SQL Boy 和茶树姑的 SQL 代码除了保持简单、可读和易于维护的样式风格外,还需要具备良好的执行性能,准确且高效的计算出结果才能让你在工作中决胜于千里之外。计算资源量(CPU,内存,网络等);计算数据量(输入和输出的记录数);计算复杂度(业务逻辑复杂程度

#大数据#sql#数据库
机器学习之SVM(支持向量机)

前言之前一直想总结关于支持向量机的相关内容,今天终于让我找到了机会,方便自己和大家翻阅参考。SVM在之前的很长一段时间内是性能最好的分类器,它有严密而优美的数学基础作为支撑。在各种机器学习算法中,它是最不易理解的算法之一,要真正掌握它的原理有一定的难度。在本文中,将带领大家通过一张图来理清SVM的核心推导过程。正文在各种机器学习算法中,SVM是对数学要求较高的一种,一直以来不易被初学者掌握。如果能

#机器学习
特征选择与正则化

前言在机器学习中,对原始数据特征的处理和选择是一个非常重要的环节,Andrew NG 大佬曾经说过这么一句话:数据和特征决定了机器学习的上限,而机器学习算法和模型只是逼近这个上限而已。特征选择的重要性和分类首先,我们在现实任务中经常会遇到维数灾难问题,这是由于属性(特征)过多造成的,若能从中选择出重要的特征,使得后续的学习过程仅需要在一部分特征上构建模型,则维数灾难问题会大为减轻。从这个意义上说,

#机器学习
机器学习中的奇异值(SVD)分解

前言奇异值分解(Singular Value Decomposition,以下简称SVD)是在机器学习领域广泛应用的算法,它不仅可以用于降维算法中的特征分解,还可用于推荐系统,以及自然语言处理等领域。是很多机器学习算法的基石。接下来给大家介绍一下SVD的原理实现。一、特征值和特征向量首先我们来回顾一下特征值和特征向量的概念及性质:如果存在一个实对称矩阵 A∈Rn×nA \in \mathbb...

#机器学习#线性代数
机器学习概率论基础

前言一些数学理论,感觉在用到的时候才方显胸中无墨,大学时学习的知识早就已原封不动的还给老师了,况且那时候更多是用于通过期末考试。在网上看到一篇很好的文章,在这里copy一份,方便自己和广大同胞今后翻阅!首先得在此非常感谢原创博主黄海广博士整理出了如此详细的技术文章,原文出处:首发:吴恩达的 CS229的数学基础(概率论),有人把它做成了在线翻译版本!正文一、概率的基本要素为了定义集合上...

#机器学习#概率论
机器学习中数据预处理方法的一些建议

前言数据预处理的重要性?熟悉数据挖掘和机器学习的小伙伴们都知道,数据处理相关的工作时间占据了整个项目的70%以上。数据的质量,直接决定了模型的预测和泛化能力的好坏。它涉及很多因素,包括:准确性、完整性、一致性、时效性、可信性和解释性。而在真实数据中,我们拿到的数据可能包含了大量的缺失值,大量的噪声,也可能因为人工录入的错误数据导致有异常点存在,非常不利于算法模型的训练。数据清洗的结果是对各种脏..

#机器学习
机器学习概率论基础

前言一些数学理论,感觉在用到的时候才方显胸中无墨,大学时学习的知识早就已原封不动的还给老师了,况且那时候更多是用于通过期末考试。在网上看到一篇很好的文章,在这里copy一份,方便自己和广大同胞今后翻阅!首先得在此非常感谢原创博主黄海广博士整理出了如此详细的技术文章,原文出处:首发:吴恩达的 CS229的数学基础(概率论),有人把它做成了在线翻译版本!正文一、概率的基本要素为了定义集合上...

#机器学习#概率论
模型的性能评估-比较检验

前言在机器学习中,不同模型的性能度量以及比较远比大家想象的要复杂的多。这里面涉及到几个重要因素:首先,我们希望比较的是泛化性能,然后通过实验评估方法获得的是测试集上的性能,两者对比的结果未必相同。其二,测试集上的性能与测试集本身的选择有很大的关系,且不论使用不同大小的测试集会得到不同的结果,即便使用相同大小的测试集,若包含的测试样例不同,测试结果也会不同。其三,很多机器学习算法本身有一定...

#机器学习
瑞利商及其极值的计算

前言在机器学习中,特征工程应该说是流程中非常重要的一环,往往数据处理后的效果决定了你的算法模型能够达到的高度。本文中提及的 LDA 均指的是线性判别分析(Linear Discriminant Analysis),而不是 NLP 领域的隐含狄利克雷分布(Latent Dirichlet Allocation),两者是有本质的区别的。一、LDA的思想LDA 是一种监督学习的降维技术,也就是说它...

#机器学习
    共 18 条
  • 1
  • 2
  • 请选择