logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

统计学基础——常用的概率分布(二项分布、泊松分布、指数分布、正态分布)

变量类型:连续型变量如:正态分布离散型变量如:二项分布、泊松分布三者之间的关系二项分布(Binomial distribution)二项分布(Binomial distribution)是n重伯努利试验成功次数的离散概率分布,记作。伯努利试验是只有两种可能结果的单次随机试验。伯努利试验都可以表达为“是或否”的问题。例如,抛一次硬币是正面...

机器学习——关联规则——支持度(support)、置信度(confidence)、提升度(Lift)

一般我们使用三个指标来度量一个关联规则,这三个指标分别是:支持度、置信度和提升度。Support(支持度):表示同时包含A和B的事务占所有事务的比例。如果用P(A)表示使用A事务的比例,那么Support=Confidence(可信度):表示使用包含A的事务中同时包含B事务的比例,即同时包含A和B的事务占包含A事务的比例。公式表达:Confidence=Lift(提升度):表示“包含A的...

机器学习——python解决样本类别分布不平衡(过抽样、欠抽样、集成、SVM)

一、样本不均衡所谓的不均衡指的是不同类别(标签)的样本量差异非常大。样本类别分布不均衡主要出现在分类相关的建模问题上。样本不均衡将导致样本量小的分类所包含的特征过少,并很难从中提取规律;即使得到分类模型,也容易产生过度依赖于有限的数据样本而导致过拟合的问题,当模型应用到新的数据上时,模型的准确性和健壮性将很差。样本不均衡从数据规模的角度分为:大数据分布不均衡:例如1000万条数据集...

机器学习——特征工程——交互特征(多项式特征)

两个特征的乘积可以组成一对简单的交互特征,这种相乘关系可以用逻辑操作符AND来类比,它可以表示出由一对条件形成的结果:“该购买行为来自于邮政编码为98121的地区”AND“用户年龄在18和35岁之间”。这种特征在基于决策树的模型中极其常见,在广义线性模型中也经常使用。简单线性模型使用独立输入特征, , …, 的线性组合来预测结果变量:。很容易对线性模型进行扩展,使之包含输入特征的两两组合,如下所示

机器学习——有监督——决策树(分类树)相关原理及sklearn实现(信息熵、基尼系数、信息增益、特征重要程度的量化)

一、决策树原理决策树(Decision Tree)是一种非参数的有监督学习方法,它能够从一系列有特征和标签的数据中总结出决策规则,并用树状图的结构来呈现这些规则,以解决分类和回归问题。决策树算法容易理解,适用各种数据,在解决各种问题时都有良好表现,尤其是以树模型为核心的各种集成算法,在各个行业和领域都有广泛的应用。我们来简单了解一下决策树是如何工作的。决策树算法的本质是一种图结构,我们只需...

机器学习——需求预测——准确性(误差)统计——MAE、MSE、MAPE、WMAPE

误差指标公式(为预测值,为真实值)特点缺点MAE1、易受真实值量纲上的差别带来的影响MSE1、加倍惩罚极端误差1、易受真实值量纲上的差别带来的影响2、极端值的影响MAPEWMAPE一、平均绝对误差(Mean Absolute Error,MAE)其中,为预测值,为真实值。由于...

文章图片
#数据分析
机器学习——特征工程——对数转换、Box-Cox转换

一、对数转换对数函数可以对大数值的范围进行压缩,对小数值的范围进行扩展。x越大,log(x)增长得越慢。如下图:我们以如下数据为例。biz_file = open('精通特征工程/精通特征工程/data/yelp_academic_dataset_business.json')biz_df = pd.DataFrame([json.loads(x) for x in biz_file.readli

文章图片
#机器学习#python#人工智能
统计推断——假设检验概述(节选于:数据分析的统计基础)

以下节选于:数据分析的统计基础,个人认为对理解假设检验较为深入。

python——pandas——rolling、ewm函数(移动平均VS加权移动平均)

在时间序列分析当中,我们经常会遇到时间轴上数据缺失值的补充,常用的方法使用移动平均值。Series的方法fillna()实现了该功能。常用的移动平均值方法有以下两种:滚动平均值roll_mean=reindexed['ppg'].rolling(window=30).mean()滚动平均值的理解较为简单:如现在有一个Series,包含100个数(),现在我们要以10为窗口,计算滚动...

#数据分析#python
机器学习——特征工程——对数转换、Box-Cox转换

一、对数转换对数函数可以对大数值的范围进行压缩,对小数值的范围进行扩展。x越大,log(x)增长得越慢。如下图:我们以如下数据为例。biz_file = open('精通特征工程/精通特征工程/data/yelp_academic_dataset_business.json')biz_df = pd.DataFrame([json.loads(x) for x in biz_file.readli

文章图片
#机器学习#python#人工智能
    共 45 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择