logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

机器学习中不平衡学习方法总结一(理论)

针对不平衡学习问题,主要有以下三种常见方式处理,总结如下,其中多数类样本统一用Smax表示,少数类样本统一用Smin表示:1、欠抽样1.1 随机欠抽样随机欠采样顾名思义即从多数类Smax中随机选择少量样本E再合 并原有少数类样本作为新的训练数据集,新数据集为Smin+E,随机欠采样有两种类型分别为有放回和无放回两种,无放回欠采样在对多数类某样本被采 样后不会再被重复采样,有放回采样则有

文本主题模型之潜在语义分析(LDA:Latent Dirichlet Allocation)

1、LDA作用传统判断两个文档相似性的方法是通过查看两个文档共同出现的单词的多少,如TF-IDF等,这种方法没有考虑到文字背后的语义关联,可能在两个文档共同出现的单词很少甚至没有,但两个文档是相似的。举个例子,有两个句子分别如下:“乔布斯离我们而去了。”“苹果价格会不会降?”

LSTM之文本分类实例

待分类数据为已经分词的文本文档,其中每一行代表一篇文章,分词较为粗糙,未进行停用词过滤,使用停用词过滤后效果应该会有明显提升。1、加载数据# -*- coding: utf-8 -*-import sysreload(sys)sys.setdefaultencoding('utf-8')def loadData(fileName):#读取分词数据,存储在list列表里,每个

#keras#word2vec
RF、GBDT、XGBoost、lightGBM原理与区别

RF、GBDT和XGBoost都属于集成学习(Ensemble Learning),集成学习的目的是通过结合多个基学习器的预测结果来改善单个学习器的泛化能力和鲁棒性。  根据个体学习器的生成方式,目前的集成学习方法大致分为两大类:即个体学习器之间存在强依赖关系、必须串行生成的序列化方法,以及个体学习器间不存在强依赖关系、可同时生成的并行化方法;前者的代表就是Boosting,后者的代表是Ba

DBSCAN 密度聚类算法原理及伪代码

DBSCAN 密度聚类算法原理及伪代码

#算法
XGBoost案例代码(一)——sklearn之交叉验证

#!/usr/bin/python'''Created on 1 Apr 2015@author: Jamie Hall'''import pickleimport xgboost as xgbimport numpy as npfrom sklearn.model_selection import KFold, train_test_split, GridSearchCVf

#sklearn
到底了