
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
有的网页是拖到最底部就自动加载出了,有的是还需要点击“加载更多”之类的按钮,这时再加一步点击按钮就可以了。python用selenium拖动滚动条到懒加载网页的最底部。

上两篇文章分别写了2种情况,1种是包含iframe的,详见https://blog.csdn.net/Sixth5/article/details/140342929。1种是有动态数字变化的,详见https://blog.csdn.net/Sixth5/article/details/140344343。针对一下特别棘手的,没法用定位的情况,我们直接放弃用selenium模块,直接使用鼠标模拟模块

我们发现1721110144093这个数字在网页代码中是存在的,所以解决方法是使用正则定位抓取数字,然后拼接出xpath再用于定位元素。)精准定位数字的位置,由于网页代码中有多个重复内容,所以使用list容器,再使用data[1],即list里的第一个元素,准确把数字提取出,然后拼接,就拿到最终的动态变化的xpath啦!本篇写第2种情况,就是xpath定位的元素中有变化的数字,比如wb这个上传视频

python判断文件夹是否存在,不存在就创建它。使用os库,file_path = 文件夹地址。
读取Excel后,dataframe后直接.shape,shape输出是一个list,里面2个数字,第一个是行,第二个是列。pandas读excel获取表的行数列数,有多种方法,本人最常用的就是shape。

只要想提取的表格是属于<table 标签内,就可以使用pd.read_html(),它可以将网页上的表格都抓取下来,并以DataFrame的形式装在一个列表中返回。首先F12,页面元素点击表格内容,发现最上面的层级是<table,那么就可以用pandas直接抓!pandas还能当爬虫用,你敢信吗?而且超级简单,两行代码就趴下来。就看到保存的CSV文件了。








