logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

线上故障急救:依托 OpenClaw 日志排查 403 和 503 问题

通过正则匹配规则智能提取日志时间戳、客户端IP、请求接口路径、HTTP状态码、异常详情等核心字段,将非结构化原始日志转化为可统计、可分析的结构化数据;再次是。

#爬虫#selenium#python +1
2026 爬虫新选择:Claude Code 对比传统爬虫框架优劣分析

通过全方位对比与实操验证,2026年爬虫技术选型可遵循清晰的适配逻辑,精准匹配业务场景,兼顾效率与稳定性。优先选择Claude Code的场景:临时数据抓取、轻量化结构化采集、零基础快速开发、频繁迭代的页面采集、动态页面简易抓取。这类场景追求低成本、高效率、零维护,Claude Code的低代码智能开发模式可最大化节省时间成本,大幅降低开发门槛。优先选择传统爬虫框架的场景:工业级大规模分布式采集、

#爬虫#python#前端
Python + 大模型行业资讯自动化摘要流水线完整工程实现方案

的资讯自动化处理流水线,完整覆盖多源采集、双层去重与质量过滤、大模型结构化深度摘要、标准化报表导出四大核心模块,全程无人工介入。核心设计优势:将去重、短文本过滤、标题党拦截逻辑前置至大模型调用环节之前,仅将清洗完成、无重复、具备有效信息量的稿件送入大模型处理,从源头压缩 Token 使用量,显著降低 API 调用开销。输出字段覆盖:精炼标题、事件背景、核心事实清单、深度趋势分析、行业标签、资讯质量

#python#自动化#开发语言
无库无捷径,PyTorch 手写完整 Transformer 大语言模型 LLM

核心实现清单:Token Embedding → RoPE 位置编码 → Multi-Head Attention + Causal Mask → Feed-Forward → Pre-Norm 残差 → 自回归生成。多数开发者对 Attention 的认知停留在"Q、K、V 三个矩阵"的口号层面——面试时背得出公式,动手时写不出一个完整的 Block。工业级训练的真正瓶颈往往不在模型代码,而在数

#pytorch#transformer#语言模型 +1
Java 异步爬虫高效获取小红书短视频内容

而基于 Java 异步编程模型构建的爬虫,能充分利用网络 IO 等待时间,并发处理多个请求,大幅提升数据获取效率。而异步模式下,线程发起请求后无需等待响应,可立即处理下一个请求,响应返回时通过回调函数处理结果,线程利用率提升数倍。高并发:单线程可处理数百个并发请求,相比同步爬虫(单线程仅能处理 1 个请求),效率提升显著;异步爬虫利用网络 IO 等待时间并发处理请求,耗时仅为同步爬虫的 1/6,且

#java#爬虫#音视频 +2
Redis 在定时增量爬虫中的去重机制与过期策略

当内存达到阈值时,Redis 会按策略(如 volatile-lru:淘汰过期 Key 中最近最少使用的)淘汰 Key,需确保爬虫相关 Key 设置过期时间,避免非过期 Key 被误淘汰。Redis 凭借高性能的原子操作和灵活的数据结构,是定时增量爬虫去重的最优选择,中小规模场景优先使用 String 结构,大规模场景推荐布隆过滤器;:将爬取记录分为 “近期记录”(Redis,设过期)和 “历史记

#redis#爬虫#数据库 +1
Java 爬虫工作原理:从请求到解析小说内容

网络爬虫本质是模拟浏览器的行为,向目标网站发送请求、接收响应,并从响应数据中提取有效信息的程序。(第三方库)负责构建请求报文,包含 URL、请求方法(GET/POST)、请求头(User-Agent、Cookie 等);爬虫根据状态码判断请求结果:200 正常处理,403 需调整请求头 / 添加代理,500 需重试。服务器接收请求后,验证请求合法性(如是否为爬虫、是否登录),返回响应报文(状态码

#java#爬虫#开发语言
电商关键词挖掘:Java 爬虫抓取 1688 推荐搜索词

在电商运营、竞品分析、选品优化的工作场景中,关键词是流量获取的核心载体。1688作为国内最大的批发电商平台,其搜索框自动弹出的,是平台基于用户搜索热度、商品销量、行业趋势大数据筛选的高价值关键词,具备热度高、转化率强、贴合行业需求等特点。相比于人工整理关键词、第三方工具付费采集,通过Java爬虫自动化抓取1688推荐搜索词,能够低成本、高频次、批量获取行业精准关键词,为电商选品、标题优化、流量布局

#java#爬虫#开发语言 +1
Python+Selenium自动化爬取携程动态加载游记

摘要:本文介绍使用Python+Selenium爬取携程动态加载游记的方法。针对携程Ajax渲染的页面特性,采用Selenium模拟浏览器滚动加载,结合BeautifulSoup解析数据。技术栈包括Python 3.8+、Selenium、BeautifulSoup4和Pandas,需配置ChromeDriver驱动。实施步骤包括:分析页面结构(注意反爬机制)、Selenium模拟滚动加载、解析游

文章图片
#python#selenium#自动化
12306旅游产品数据抓取:Python+API逆向分析

本文介绍了通过API逆向分析技术高效抓取12306旅游产品数据的方法。采用Python的Requests库模拟合法请求,结合反爬策略如User-Agent轮换、IP代理池和请求频率控制。通过浏览器开发者工具分析12306旅游频道的XHR请求,定位返回JSON数据的API接口,并解析关键参数如Referer、Cookie和加密参数。文章提供了完整的Python实现方案,包括如何构造合法请求头和处理反

#旅游#python#开发语言 +1
    共 121 条
  • 1
  • 2
  • 3
  • 13
  • 请选择