logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

海量小说数据采集:Spark 爬虫系统设计

基于 Spark 的海量小说数据爬虫系统,通过分布式计算解决了传统单机爬虫的效率瓶颈,同时结合反爬突破、数据清洗、分布式存储等能力,实现了海量小说数据的高效、稳定采集。在实际应用中,需结合站点反爬策略的变化持续优化爬取逻辑,并通过监控体系保障系统的稳定性,最终为小说内容分析、版权保护等业务提供可靠的数据支撑。依赖库:Jsoup(HTML 解析)、HttpClient(请求发送)、HBase Cli

#spark#爬虫#大数据 +1
企业精准数据分析双路径对比:运营商大数据与 Python 爬虫技术选型与实践

运营商大数据可覆盖用户全场景行为轨迹,涵盖通信、网络访问、位置等多维度信息,但在应用中受严格合规约束与数据获取成本限制;Python 爬虫能够定向采集公开场景数据,包括电商交易、社交舆论、行业资讯等垂直信息,却面临目标平台反爬机制、数据更新稳定性等技术瓶颈。:采用 Python 爬虫,用于竞品动态监控、网络舆情追踪、商品价格实时采集,以高时效性数据支撑业务快速响应。:采用运营商大数据,用于用户群体

#数据分析#大数据#python +2
Python + 大模型行业资讯自动化摘要流水线完整工程实现方案

的资讯自动化处理流水线,完整覆盖多源采集、双层去重与质量过滤、大模型结构化深度摘要、标准化报表导出四大核心模块,全程无人工介入。核心设计优势:将去重、短文本过滤、标题党拦截逻辑前置至大模型调用环节之前,仅将清洗完成、无重复、具备有效信息量的稿件送入大模型处理,从源头压缩 Token 使用量,显著降低 API 调用开销。输出字段覆盖:精炼标题、事件背景、核心事实清单、深度趋势分析、行业标签、资讯质量

#python#自动化#开发语言
把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践

模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套

#tcp/ip#网络协议#网络
把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践

模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套

#tcp/ip#网络协议#网络
把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践

模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套

文章图片
#tcp/ip#网络协议#网络 +3
把 DeepSeek Harness 当全栈搭子:从代码生成到代理 IP 的数据采集工程实践

模型负责「想」和「写」,而 Harness(驾驭装置)负责把模型的能力真正接进现实世界——文件系统、终端、浏览器、外部 API、工具链。DeepSeek Harness 和 Codex / Claude Code 最大的不同,在于「一切皆插件」——模型、工具、技能、会话、沙箱、甚至 Agent 主循环本身都是插件,不爽就拔了换,不用改框架源码。当你把它从「炫技工具」切换到「生产搭子」——比如搭一套

文章图片
#tcp/ip#网络协议#网络 +3
用Python抓美团景区评论数据,长隆水上乐园那次踩了不少坑

做景区运营分析的人,手头最缺的往往是真实的游客反馈。官方介绍写得再漂亮,也抵不过一条"周末排队两小时玩五分钟"的评论。我前阵子接了个活,要整理广州长隆水上乐园的游客评价,看看大家到底在吐槽什么、又在夸什么。数据源选了美团,理由是它的评论量大、带评分、还有游玩时间和同行人数这类结构化字段,比纯文本好处理。这篇文章把整个抓取过程拆开讲,包含接口分析、代理配置、代码实现和踩过的坑,代码都能直接跑。

#python#开发语言#爬虫 +1
深入 Pillow 底层:Python 图像通道、像素运算实战开发

大多数开发者对 Pillow 的使用停留在+ 。一旦涉及水印合成、通道混合、批量处理性能优化,对通道模型和像素运算的底层理解就成了分水岭。本文从 Pillow 的内部数据结构出发,拆解通道操作、像素级运算和性能优化机制。mode 是最核心的属性,它决定了每个像素的通道数和数据类型:惰性加载: 只读文件头解析元数据,不读像素。只有在调用或任何需要像素的操作时才触发实际 I/O。批量只读尺寸时不会产生

#pillow#python#计算机视觉
企业内网场景下 Python 自定义 CA 证书信任链的正确配置方法

企业内网的自定义 CA 证书来自两类场景。内部服务 (API 网关、GitLab、Harbor、监控平台等) 使用内部域名或 IP 地址,公共 CA 无法签发此类证书,企业自建 CA 签发后要求客户端信任其根证书。网络安全设备 (防火墙、IDS、DLP) 对 HTTPS 流量做 MITM 检查,设备持有自签根证书,经其转发的连接会被重新签名。浏览器通过组策略信任该根证书,Python 不会。两类场

#python#信任链#网络 +1
    共 147 条
  • 1
  • 2
  • 3
  • 15
  • 请选择