
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
首先说明爬虫的步骤1.请求网页,获取响应结果2.解析网页,提取数据3.数据持久化1.User-Agent:将爬虫伪装成浏览器。(haerders)2.字体反爬:将页面中重要信息使用符号进行隐藏。(例如:猫眼,瓜子二手车)3.动态页面:使用selenium模块(自动化测试的模块)。其意再模拟人的行为使用浏览器4.人机验证:九宫格选图片、选成语(词语)、图片+计算公式、字母数字验证码、滑块验证、短信验
requeests - 请求页面,得到响应结果beautifulsoup4-根据响应结果解析页面、提取数据写入文件、数据库bs4安装时 要用beautifulsoup4对网页进行解析,网页分为静态页面和动态页面静态页面:内容是写死得,除非人为得进行内容修改,否则这个页面的内容是一层不变的。动态页面:内容不是写死的,使用某种特殊的技术(JavaScript)使页面的数据通过某种方式显示在页面中其中r
得到数据(源数据)>清洗数据>模型分析>数据透视> 打标签> 建模后数据透视>可视化分析。数据透视: 将所需要的数据透视化(有时候我们要统计这个人的年龄,其他数据就没什么意义,此时只需要年龄的名字这个数据就行)先获取数据,然后再 插入页面点击数据透视表,行成所需要的数据透视图效果,在将数据效果转成图形。模型分析: 一般是将按照要求将所需要的数据,怎么分类,或者需要他的哪些部分,做什么分析结果。可视
得到数据(源数据)>清洗数据>模型分析>数据透视> 打标签> 建模后数据透视>可视化分析。数据透视: 将所需要的数据透视化(有时候我们要统计这个人的年龄,其他数据就没什么意义,此时只需要年龄的名字这个数据就行)先获取数据,然后再 插入页面点击数据透视表,行成所需要的数据透视图效果,在将数据效果转成图形。模型分析: 一般是将按照要求将所需要的数据,怎么分类,或者需要他的哪些部分,做什么分析结果。可视
selenium:需要先在浏览器对象里面登录一次,在刷新网页,然后获取cookie值(返回一个列表),result = 浏览器对象.get_cookies(). 将result写入txt文件,(一般将此数据转成json文件写入txt,下次提取就很方便了)如果有选项卡,需要切换选项卡- 浏览器对象.switch_to.window(选项卡名){选项卡名字,浏览器对象.window_handles[-
JQuery是一个JS库,它可以让DOM操作变得更简单在使用JQ时必须调用这个库1.节点的获取:$(CSS选择器)2.节点的创建、增加和删除1.创建节点: $(html代码)2添加节点:节点1.append(节点2)在节点1中后添加节点2节点1.prepend(节点2)将节点2插入到节点1中得最前面节点1.before(节点2)将节点2放到节点1得前面节点1.after (节点2)将节点2放到节点







