logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

python数据分析和数据挖掘笔记

第四章1,  数据预处理的过程主要包括:数据清洗,数据集成,数据转换和数据规约。2,牛顿插值法:https://www.zhihu.com/question/22320408/answer/1419733143,数据规范化:3.1 最小最大规范化 3.2 零-均值规范化 σ为标准差3.3 小数定标规范化K为数据绝对值最

从mongodb数据库中导出数据

1,导出为json格式mongoexport -d 数据库名字 -c collection名字 -o /home/admin/test.json2,导出为csv格式mongoexport -d 数据库名字 -c collection名字 --csv -f url,name,age -o /home/admin/test.csv  导出url,name,age字段导出为csv格式的时候会出现中文乱码

从mongodb数据库中导出数据

1,导出为json格式mongoexport -d 数据库名字 -c collection名字 -o /home/admin/test.json2,导出为csv格式mongoexport -d 数据库名字 -c collection名字 --csv -f url,name,age -o /home/admin/test.csv  导出url,name,age字段导出为csv格式的时候会出现中文乱码

python数据分析和挖掘实战

第五章:1, 常用的分类和预测算法2, 回归分析3, 主要回归模型4, 决策树算法:tip:使用dot -Tpng data.txt -o data.png 可以将生成的树用Graphivz进行可视化。(目前会出现编码问题,还没解决)5 ,人工神经网络算法:6,分类与预测算法评价6.1 绝对误差和相对误差6

ubuntu chrome设置noproxy

当你的Google浏览器出现:When running Google Chrome under a supported desktop environment, the system proxy settings will be used. However, either your system is not supported or there was a prob...

#浏览器
pandas.cut函数说明

1,功能:将数据进行离散化pandas.cut(x,bins,right=True,labels=None,retbins=False,precision=3,include_lowest=False)    参数说明:x    :进行划分的一维数组     bins : 1,整数---将x划分为多少个等间距的区间         In[1]:pd.cut(np.a

关于scrapy爬取搜狐新闻网站的一点心得和体会

1,环境:本人原本使用的是win 10(CPUi5,内存8G)的环境,但自己想搭建一个分布式的爬虫,于是自己想到了虚拟机,虚拟机的环境为Ubuntu14.04,但是由于各种原因,虚拟机中的python环境(python环境要求为python3.5+)已经被我弄乱了,我在网上看到说Ubuntu16.04中有默认的python3.5+,于是果断地用了Ubuntu16.042,当环境切换为Ubuntu1

到底了