logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Python实现直播弹幕数据采集(WebSocket实时弹幕采集)

本文介绍了一套基于WebSocket的实时弹幕采集系统设计方案。系统通过WebSocket接收直播弹幕数据,采用asyncio异步处理机制,使用deque队列缓存弹幕消息,并同时保存为日志文件和结构化JSON文件。文章详细阐述了系统架构、关键技术实现(包括消息解析、数据存储等)以及设计考量,突出了WebSocket实时性、异步处理高效性和数据存储可扩展性等特点。该方案不仅适用于弹幕采集,还可扩展至

文章图片
#websocket#网络协议#网络 +2
Python实现数据爬取(Playwright异步版)

本文介绍如何基于search:按关键词搜索批量采集作品信息,并批量抓评论detail:给定作品链接/ID,抓作品详情与评论creator:给定创作者主页链接,抓创作者信息、其作品列表、作品评论同时,该模块内置多种“工程化能力”:反检测(stealth 脚本 + 可选 CDP 模式)代理池(自动获取/刷新代理)并发控制(Semaphore)时间范围过滤(按 create_time 过滤)自动媒体下载

#爬虫#python
Python实现微博数据爬取

本文详细介绍如何使用 Python 实现微博搜索页数据爬取,并支持:✅ 微博内容抓取✅ 博主信息抓取✅ 一级评论抓取✅ 转发数据抓取✅ 按时间分段采集(突破 50 页限制)✅ 自动生成 CSV 数据文件本程序通过模拟浏览器请求微博搜索页面,结合 AJAX 接口获取评论与转发数据,并将结果结构化保存为 CSV 文件,便于后续数据分析或文本挖掘。

文章图片
#python#开发语言
Python实现微博数据爬取

本文详细介绍如何使用 Python 实现微博搜索页数据爬取,并支持:✅ 微博内容抓取✅ 博主信息抓取✅ 一级评论抓取✅ 转发数据抓取✅ 按时间分段采集(突破 50 页限制)✅ 自动生成 CSV 数据文件本程序通过模拟浏览器请求微博搜索页面,结合 AJAX 接口获取评论与转发数据,并将结果结构化保存为 CSV 文件,便于后续数据分析或文本挖掘。

文章图片
#python#开发语言
基于 DeepSeek API 的 ASR 文本纠错脚本实战:Python 多线程批量处理 JSONL 语音转写数据

本文分享了一个基于DeepSeek大模型的ASR转写文本批量纠错Python脚本。该脚本针对直播电商场景下口播内容节奏快、语气随意的特点,通过调用DeepSeek API实现高效纠错。

文章图片
#python#开发语言#经验分享 +2
python实现LDA主题建模

本文详细介绍了如何使用Python实现LDA主题建模。LDA是一种用于主题建模的概率图模型,其基本思想是:每个文档是由一组主题混合而成的,每个主题又由一组词汇构成,而LDA试图找到最佳的主题和词汇组合,以解释给定的文本数据。

文章图片
#python#开发语言#经验分享
python绘制词云图

本文详细介绍了如何使用Python的WordCloud等库绘制词云图,包括分词、去停用词等基本数据处理以及图片保存等操作。

文章图片
#python#开发语言
python实现情感分析

本文详细介绍了如何使用Python的SnowNLP库进行情感分析,计算情感得分,绘制情感分布图。

文章图片
#python#开发语言#nlp +1
基于 DeepSeek API 的 ASR 文本纠错脚本实战:Python 多线程批量处理 JSONL 语音转写数据

本文分享了一个基于DeepSeek大模型的ASR转写文本批量纠错Python脚本。该脚本针对直播电商场景下口播内容节奏快、语气随意的特点,通过调用DeepSeek API实现高效纠错。

文章图片
#python#开发语言#经验分享 +2
Python实现数据爬取(Playwright异步版)

本文介绍如何基于search:按关键词搜索批量采集作品信息,并批量抓评论detail:给定作品链接/ID,抓作品详情与评论creator:给定创作者主页链接,抓创作者信息、其作品列表、作品评论同时,该模块内置多种“工程化能力”:反检测(stealth 脚本 + 可选 CDP 模式)代理池(自动获取/刷新代理)并发控制(Semaphore)时间范围过滤(按 create_time 过滤)自动媒体下载

#爬虫#python
    共 14 条
  • 1
  • 2
  • 请选择