
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
天池数据竞赛“快来一起挖掘幸福感!”TOP 5%开源特征工程与模型调参代码
目前MSE在0.471左右,成绩稳定在300名以内,争取再做做特征冲进200名,把目前的代码开源出来分享给大家,若有错误或建议请直接提出,这也是对我的帮助,谢谢啦。关注公众号“数据科学与人工智能技术”并发送文字“幸福感”即可得到本代码。...
用Python遍历文件夹下的所有文件并进行数据处理(Pathlib简介)
在数据分析的日常工作中,我们可能会经常需要处理这样的问题:将一个或多个文件夹下的文件中的数据进行分析、处理、整合。这些文件通常是相似的或是同类别的,比如我们有多个月份的销售信息,每个月份的数据分别存在一个excel文档中;多个类别的销售信息,每个类的数据分别存在一个excel文档中等等。像是如图中所示:在当前文件夹中存在“files”文件夹,里面是我们将要分析的数据,在该文件夹目录下又有如下四个文
scikit-learn中一种便捷可靠的缺失值填充方法:KNNImputer
在数据挖掘工作中,处理样本中的缺失值是必不可少的一步。其中对于缺失值插补方法的选择至关重要,因为它会对最后模型拟合的效果产生重要影响。在2019年底,scikit-learn发布了0.22版本,此次版本除了修复之前的一些bug外,还更新了很多新功能,对于数据挖掘人员来说更加好用了。其中我发现了一个新增的非常好用的缺失值插补方法:KNNImputer。这个基于KNN算法的新方法使得我们现在可以更便捷
到底了







