logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

python用selenium拖动滚动条到懒加载网页的最底部

有的网页是拖到最底部就自动加载出了,有的是还需要点击“加载更多”之类的按钮,这时再加一步点击按钮就可以了。python用selenium拖动滚动条到懒加载网页的最底部。

文章图片
#python#selenium
python用selenium网页模拟时xpath无法定位元素解决方法3

上两篇文章分别写了2种情况,1种是包含iframe的,详见https://blog.csdn.net/Sixth5/article/details/140342929。1种是有动态数字变化的,详见https://blog.csdn.net/Sixth5/article/details/140344343。针对一下特别棘手的,没法用定位的情况,我们直接放弃用selenium模块,直接使用鼠标模拟模块

文章图片
#python#selenium#开发语言
python用selenium网页模拟时xpath无法定位元素解决方法2

我们发现1721110144093这个数字在网页代码中是存在的,所以解决方法是使用正则定位抓取数字,然后拼接出xpath再用于定位元素。)精准定位数字的位置,由于网页代码中有多个重复内容,所以使用list容器,再使用data[1],即list里的第一个元素,准确把数字提取出,然后拼接,就拿到最终的动态变化的xpath啦!本篇写第2种情况,就是xpath定位的元素中有变化的数字,比如wb这个上传视频

文章图片
#python#selenium#开发语言
python判断文件夹是否存在,不存在就创建它

python判断文件夹是否存在,不存在就创建它。使用os库,file_path = 文件夹地址。

#python#开发语言
pandas读excel获取表的行数列数

读取Excel后,dataframe后直接.shape,shape输出是一个list,里面2个数字,第一个是行,第二个是列。pandas读excel获取表的行数列数,有多种方法,本人最常用的就是shape。

文章图片
#pandas
python爬虫——抓取表格pandas当爬虫用超简单

只要想提取的表格是属于<table 标签内,就可以使用pd.read_html(),它可以将网页上的表格都抓取下来,并以DataFrame的形式装在一个列表中返回。首先F12,页面元素点击表格内容,发现最上面的层级是<table,那么就可以用pandas直接抓!pandas还能当爬虫用,你敢信吗?而且超级简单,两行代码就趴下来。就看到保存的CSV文件了。

文章图片
#python#爬虫#pandas
到底了