logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Scrapy-Redis 分布式爬虫实战——从单机到集群

Scrapy-Redis 只是把请求队列从内存搬到 Redis,代码改动很小——改继承、删 start_urls、加三行配置,单机就变分布式了。单机爬虫 → 加 scrapy-redis 配置 → 多台机器启动 → push 起始 URL → 分布式跑起来建议先在一台机器上把爬虫调好,再部署到多台机器上。不要还没调通就上分布式,排查问题会多一倍的复杂度。💡 觉得有用的话,【张老师技术栈】吧!每周

#scrapy#redis#分布式 +1
Spark 大数据入门——从零搭建分布式计算环境

Spark 是大数据领域的核心技术,掌握它之后处理海量数据不再是难题。创建 SparkSession—— 入口读取数据——数据转换——filtergroupByagg等操作💡 觉得有用的话,【张老师技术栈】吧!每周更新 Java/Python/爬虫 大数据 实战干货,不让你白来。

#大数据#spark#分布式 +1
Java 8 到 17 新特性详解——Lambda、Stream、Optional、Record、密封类

Java 8 是 Java 历史上最重要的版本,引入的函数式编程彻底改变了写代码的方式。而 Java 9-17 也带来了很多实用的新特性,这些在面试和日常开发中越来越常见。

#java#开发语言
SpringBoot 项目 Docker 容器化部署——从 Dockerfile 到 Compose

Docker 是当前最主流的应用部署方式。这篇讲 SpringBoot 项目如何容器化,从编写 Dockerfile 到使用 Docker Compose 编排多容器。

#spring boot#docker#后端 +1
算法面试——双指针:移动零、盛水容器、环形链表

双指针是在有序数组或链表上常用的优化技巧,把 O(n²) 的问题优化到 O(n)。

#算法#面试#链表
Python 数据可视化之 Matplotlib——从基础到高级图表

数据可视化是数据分析中最重要的环节之一。Matplotlib 是 Python 最基础的可视化库,掌握它之后学习 Seaborn、Plotly 等会非常轻松。

#python#信息可视化#matplotlib
Python 爬取网页表格数据——pandas read_html 一行代码搞定

很多网站的数据以 HTML 表格形式展示——股票行情、天气预报、统计年鉴、学校课表。用普通爬虫写正则或 XPath 去解析 HTML 表格非常麻烦,而 pandas 的read_html一行代码就能把网页上的所有表格抓下来。

#python#pandas#html
    共 72 条
  • 1
  • 2
  • 3
  • 8
  • 请选择