logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

数据分析入门导读

导读文章,针对刚开始的读者,讲解什么是python,python的基础介绍一些需要的包以及数据处理的流程

#python#数据分析
Python爬虫遇上动态加载

简单演示动态加载使用Javascript逆向工程和渲染动态页面获取我们需要的数据最后提了一下selenium的使用

#python#爬虫
随笔----MySQL大数据导入

随笔----MySQL大数据导入最近工作总是遇到分析一些大批量的数据,给的sql文件有1-2G,每次把数据搞进去就得花费很长时间,网上看了很多方法,说什么设置缓存大小(set global max_allowed_packet=2*1024*1024)、通信缓存区间大小(set global net_buffer_lenght=100000)等等。不知道是不是我操作问题,2G的文件导入服务器还是得

#mysql
一起来学自然语言处理----语料库和词汇资源

1、NLTK工具包2、nltk中的语料库1.古腾堡语料库2.网文语料库3.载入自己的语料库3、nltk中的词典资源4、wordnet字典

#django#数据库#python
python数据抓取

一、页面分析二、网页抓取方法1、正则表达式方法2、BeautifulSoup 模块3、lxml 模块4、各方法的对比总结三、Xpath选择器四、CSS选择器五、数据抓取总结

#python#爬虫#正则表达式
Power BI----数据处理

主讲Power BI的数据处理,而其数据处理主要是Power Query的操作,主要包括增加、修改、删除、透视、逆透视,以及一些很有用的综合处理,如:多表合并、模糊匹配

python虚拟环境配置、Python代码打包成exe可执行文件

建立虚拟环境打开anaconda(我使用的是python的发行版anaconda)打开Anaconda Navigator,选择Environments在选择Environments以后,选择createpython 代码打包成可执行文件

#python
Power BI----这几个技能让报表更具“逼格“

讲解一些报表设计中的技巧,让报表更具逼格

Python数据探索性分析和预处理

除了上面介绍的三种基于分布的方法,还有使用算法基于距离的异常值判定,比如:使用KNN算法,依次计算每个样本点与它最近的K个样本的平均距离,再利用计算的距离与阈值进行比较,如果大于阈值,则认为是异常点。在搜集数据的某些情况下,有些时候并不一定会收集到数据,因而会造成观测值或变量的数据有缺失,这些缺失的数据就称之为缺失值。总之,处理缺失值是需要研究数据规律与缺失情况来进行处理的,复杂的算法不一定有好的

#python#数据挖掘#数据分析
    共 13 条
  • 1
  • 2
  • 请选择