
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
【Python机器学习】NLP词中的数学——词袋
我们已经收集了一些词/词条,对这些词进行计数,并将它们归并成词干或者词元,接下来就可以做更多的事情。
【Python机器学习】无监督学习——K-均值聚类算法
K-均值聚类算法就是一种典型的聚类算法,之所以称之为K-均值是因为它可以发现k个不同的簇,且每个簇的中心采用簇中所含值的均值计算而成。
【Python机器学习】朴素贝叶斯——条件概率
有一种有效计算条件概率的方法被称为贝叶斯准则
【Python机器学习】Logistic回归——基于Logistic回归和Sigmoid函数的分类
训练分类器时的做法就是寻找最佳拟合参数,使用的是最优化算法。
【Python机器学习】模型评估与改进——参数过拟合的风险与验证集
有一种方法是再次划分数据集,这样我们就得到了3个数据集:用于构建模型的数据集、用于选择模型参数的验证集(开发集)、用于评估所选参数性能的测试集。
【Python机器学习】算法链与管道——通用的管道接口
Pipeline类补单可以用于预处理和分类,实际上还可以将任意数量的估计器连接在一起。
【Python机器学习】算法链与管道——在网格搜索中使用管道
我们定义一个需要搜索的参数网络,并利用管道和参数网格构建一个GridSearchCV。
【Python机器学习】交互特征与多项式特征
对于线性模型来说,想要丰富特征,还有一种方法是添加原始数据的交互特征和多项式特征。这种特征工程通常用于统计建模,但也经常用于实际的机器学习应用中。
【Python机器学习】SVM——调参
gamma参数用于控制高斯核的宽度,它决定了点与点之间“靠近”是指多大的距离,C参数是正则化参数,与线性模型类似,它限制了每个点的重要性(dual_coef_)。
【Python机器学习】决策树——树的特征重要性
利用一些有用的属性来总结树的工作原理,其中最常用的事特征重要性,它为每个特征树的决策的重要性进行排序。对于每个特征来说,它都是介于0到1之间的数字,其中0代表“根本没有用到”,1代表“完美预测目标值”。特征重要性的求和为1。







