logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Python爬虫实战】B站评论采集器开发全过程(WBI签名+游标翻页+GUI界面)

本文介绍了一个基于B站WBI签名机制的GUI评论采集工具,实现了无需编程即可获取视频评论的功能。工具主要特点包括:自动解析视频链接、生成WBI签名、支持评论翻页采集,并能导出包含用户名、内容、点赞数等结构化数据的CSV文件。文章详细解析了项目架构设计、WBI签名机制破解方法、游标翻页实现逻辑等关键技术点,并展示了采集效果和导出样例。该工具适用于舆情分析、用户行为研究等场景,作者还分享了开发过程中解

文章图片
#python#爬虫#开发语言
Python 实战:骑行数据可视化分析(Pandas+Matplotlib)

本文介绍了使用Python对骑行FIT文件数据进行解析、清洗与可视化的完整流程。通过fitparse库读取原始数据,转换为DataFrame后保存为CSV文件。利用matplotlib绘制了6个子图组成的综合可视化图表,包括海拔-距离、速度-距离、卡路里-距离等折线图以及速度-海拔散点图,全面展示骑行过程中的运动表现。文章提供了完整的代码实现,从数据读取、预处理到可视化配置,并解释了图表中反映的骑

文章图片
#python#pandas#matplotlib +1
使用Python爬取懂车帝汽车销量数据并实现pyecharts可视化

本文介绍了使用Python爬取懂车帝平台汽车销量数据并实现可视化分析的完整流程。通过requests库发送HTTP请求获取长沙市汽车销量数据,配置随机延时避免封禁,将数据保存为CSV格式。利用pandas进行数据处理后,使用pyecharts生成两种可视化图表:销量TOP15的柱状图直观展示车型销量对比,品牌销量TOP10的饼图清晰呈现市场占有率分布。项目涵盖了从数据采集、存储到分析展示的全链条技

文章图片
#python#开发语言#数据分析 +1
使用Python爬取B站弹幕并生成词云图

摘要: 本文介绍了如何使用Python爬取B站弹幕并生成词云图。通过requests获取弹幕XML文件,利用BeautifulSoup解析弹幕文本,再结合jieba分词和WordCloud库生成可视化词云。关键步骤包括获取视频cid、解析XML数据、分词处理及词云配置。代码示例完整,最终输出弹幕文本文件及词云图片,直观展示观众高频词汇。适用于B站视频评论的情感或热点分析,技术栈涵盖爬虫、文本处理及

文章图片
#python#开发语言
Python爬虫实战:雪球网沪深A股数据采集(附完整代码)

本文介绍了使用Python爬取雪球网股票数据的实现方法。项目依赖requests库,通过获取Cookie建立会话,实现分页请求股票数据。核心功能包括:1)获取带Cookie的会话;2)分页请求API数据;3)提取关键股票字段;4)CSV存储结果。代码采用随机延时(3-6秒)和重试机制(最多3次)应对反爬,支持自定义采集页数和排序参数。输出包含代码、名称、价格、市值等16个字段,数值自动转换为亿单位

文章图片
#python#爬虫#开发语言 +1
Python实战 | 使用 DrissionPage 爬取携程酒店数据并保存为 CSV

本文介绍使用Python库DrissionPage高效爬取携程酒店数据的方法。DrissionPage结合了Selenium的操作便利性和Requests的数据包捕获能力,无需下载驱动即可自动处理浏览器内核,并能直接拦截API接口返回的JSON数据。文章详细讲解了环境配置、核心思路和代码实现,包括模拟点击、监听网络请求、循环翻页等关键步骤。通过解析JSON数据而非HTML标签,大幅提升了爬取速度和

文章图片
#python#开发语言
闲鱼接口sign签名算法逆向分析与Python模拟实现

本文分析了闲鱼接口sign签名的生成算法。签名由dToken、时间戳、appKey和请求数据四部分拼接后MD5加密生成,其中dToken从cookie的_m_h5_tk字段提取。文章详细说明了签名规则、参数来源和Python实现代码,并指出需保持时间戳一致性和cookie时效性。签名验证失败时,需检查参数格式或更新cookie。该算法通过标准MD5哈希确保接口请求的安全性。

文章图片
#python#开发语言#爬虫
Python爬虫实战:爬取携程酒店评论并存入MySQL数据库

本文介绍了如何用Python爬取携程酒店评论并存入MySQL数据库的实战教程。主要内容包括:1) 环境准备(安装Python、MySQL及相关库);2) 通过开发者工具分析携程评论接口的请求方式和参数;3) 代码实现部分,详细展示了Spider类的初始化设置、请求头配置和数据库连接;4) 获取多页评论数据的方法,包括构造POST请求参数和JSON数据处理。教程强调需替换cookie等关键参数,并建

文章图片
#数据库#python#爬虫
Python爬虫实战|携程景点数据爬取附完整源码

本文介绍如何用Python爬取携程网景点数据,以武汉市为例,获取景点名称、等级、评分等关键信息。通过分析携程JSON接口,设计面向对象的爬虫类,包含请求头生成、数据提取和CSV存储功能。代码使用Requests库发送POST请求,随机UserAgent防反爬,实现自动分页抓取和结构化存储。核心方法包括构建请求参数、解析JSON响应、处理异常情况等,最终输出包含11个字段的中文CSV文件。该方案比H

文章图片
#python#爬虫#开发语言
手把手教你用Python爬取拉勾网招聘数据(附完整代码)

本文介绍了使用Python爬取拉勾网招聘信息的实用案例。通过分析目标网站结构,利用requests库发送HTTP请求,配合正则表达式提取页面JSON数据,并采用fake-useragent模拟浏览器访问。文章详细讲解了爬虫实现过程,包括类初始化、核心方法运行逻辑以及数据字段说明,最终将结果保存为CSV文件。同时提醒注意Cookie时效性、请求频率控制等反爬对策,并给出了多页爬取、异常处理等改进建议

文章图片
#python#开发语言#爬虫 +1
    共 19 条
  • 1
  • 2
  • 请选择