
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文系统梳理 Spark 中的转换算子,涵盖惰性求值机制、常用 API 分类、宽窄依赖原理与典型使用场景。读完本篇,再看行动算子,整个 Spark 编程模型就通了。

本文系统梳理 Spark 中的行动算子,涵盖触发机制、常用 API 分类、执行原理与实际使用场景,帮助你真正理解 Action 背后发生了什么。

本文结合尚硅谷Flink1.17教程,梳理Standalone和YARN三种运行模式的原理与使用方式,帮助你真正搞清楚它们的区别。

学Flink,运行时架构是必须搞清楚的基础。只有真正理解了JobManager、TaskManager、Slot、并行度这些概念之间的关系,后面学任务提交、状态管理、Checkpoint才不会一头雾水。本文基于尚硅谷Flink1.17教程,系统梳理Flink运行时架构的核心知识点。

本文基于尚硅谷Flink1.17教程,系统梳理Flink各种Source的用法与适用场景。

ClickHouse入门

本文梳理 Flink DataStream API 的核心主线——Source(数据从哪来)、Transformation(数据怎么变)、Sink(数据到哪去),重点讲清楚聚合算子、UDF、分流合流、输出算子背后的设计逻辑,而不是罗列 API 参数。目标是建立一套"遇到需求该用哪个工具"的判断框架,而不是试图记住每一行代码怎么写。本文整理自尚硅谷《大数据技术之Flink》课程。

本文梳理 Flink 处理无界数据流的核心机制——窗口(怎么切片)、时间语义(以谁的时钟为准)、水位线(怎么判断"这批数据到齐了")、迟到数据处理、双流 Join。重点讲清楚"水位线是延迟和正确性的权衡"这条主线,而不是罗列每种窗口分配器的参数写法。本文整理自尚硅谷《大数据技术之Flink》课程。

本文梳理 Flink 处理函数(底层API,能做窗口/聚合做不到的事)、状态管理(怎么记住历史数据)、容错机制(怎么保证故障后数据不丢不重)这三章的核心概念。重点讲清楚"为什么需要这一层"“该怎么选”,具体的 API 调用方式作为示例说明,不作为记忆重点。 本文整理自尚硅谷《大数据技术之Flink》课程。

本文系统梳理 Spark 中的转换算子,涵盖惰性求值机制、常用 API 分类、宽窄依赖原理与典型使用场景。读完本篇,再看行动算子,整个 Spark 编程模型就通了。








