logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Flink 的 Exactly-Once 语义如何实现

Flink的Exactly-Once语义通过多机制组合实现数据精准处理:基于Checkpoint机制(通过Barrier标记和状态快照)确保内部状态一致性,结合两阶段提交协议(2PC)保障端到端准确性。配置需启用Checkpoint并设置EXACTLY_ONCE模式,同时要求外部系统支持事务或幂等写入。该方案整合了分布式快照算法和事务协议,配合适当的状态后端选择(如RocksDB),实现了故障情况

#flink#大数据
Flink 运行时架构 & 完整任务提交流程

本文详细解析了Apache Flink分布式流处理引擎的运行时架构和任务提交流程。Flink采用分层架构,包括客户端层(负责作业提交)、主节点JobManager(负责作业调度和管理)、资源管理器(负责资源分配)、任务执行节点TaskManager(负责实际计算)以及外部服务(提供高可用和状态存储支持)。任务提交流程包含8个关键步骤:从用户提交作业开始,经过StreamGraph生成、JobGra

#flink#大数据
Docker 基础入门指南

Docker是一个开源容器化平台,通过将应用及其依赖打包成标准化容器,解决环境不一致、依赖冲突等部署痛点。核心概念包括Dockerfile(构建镜像的脚本)、Image(只读模板)、Container(运行实例)和Registry(镜像仓库)。相比虚拟机,容器更轻量(共享宿主机内核)、启动更快(秒级)且资源占用更少。Docker采用Client-Server架构,提供丰富的命令管理镜像和容器生命周

#docker#容器
Kubernetes(K8s)系统学习指南

Kubernetes(K8s)是Google开源的容器编排平台,用于解决Docker在多机大规模场景下的管理难题。其核心架构分为控制面(API Server、etcd、Scheduler等)和工作节点(kubelet、kube-proxy等),通过声明式YAML文件管理各类资源对象。主要特性包括:Pod自动调度、Service服务发现、滚动更新、存储管理(PV/PVC)、Ingress流量入口、配

#kubernetes#容器
Kubernetes 进阶学习指南

本文介绍了 Kubernetes(K8s)的核心运维工具与最佳实践,涵盖以下关键内容: Helm:K8s包管理器,通过Chart打包应用资源,支持一键部署、升级和回滚。 RBAC:基于角色的权限控制,定义用户/服务账号对资源的操作权限。 GitOps/ArgoCD:实现持续交付,通过Git仓库管理配置变更。 可观测性:监控、日志和链路追踪确保系统透明性。 NetworkPolicy:网络隔离策略,

#kubernetes#容器#云原生
Apache Spark Real-Time Mode 深度解析:打破微批次壁垒,挑战 Flink 的实时王座

Spark RTM:流处理新突破 本文分析了Spark 4.1推出的Real-Time Mode(RTM)如何突破传统流处理困境。RTM通过三大创新实现了高吞吐与低延迟的统一:1)长周期Epoch+连续数据流,将检查点开销摊薄;2)Stage并发执行,消除上下游等待;3)非阻塞算子实现数据持续流动。相比传统微批次的秒级延迟,RTM可达毫秒级,同时保留Spark的容错优势。与Flink相比,RTM在

#apache#spark#flink
Apache Flink 算子(Operator)深度解析

Flink算子(Operator)是流处理程序的基本计算单元,负责数据转换、聚合等操作,构成有向无环图(DAG)。核心概念包括并行度(Parallelism)和算子链(Operator Chain),前者决定并发度,后者优化性能。基础转换算子包含map、flatMap、filter和keyBy等。窗口算子分为Keyed和Non-Keyed两类,支持增量/全量聚合。状态算子(Stateful Ope

#apache#flink#大数据
Apache Spark 第 3 章:核心概念 RDD / DataFrame

本文阐述了Spark核心概念RDD的血统机制与执行原理。RDD采用懒执行策略,通过血统图记录操作流程,直到Action触发才真正计算,优化了整体性能。文章对比了窄依赖和宽依赖,指出宽依赖会引发Shuffle并划分Stage边界,建议优先使用reduceByKey等优化算子。同时分析了Spark三层抽象,推荐优先使用DataFrame而非RDD以获得更好的性能优化。最后说明了Partition作为并

#apache#spark#大数据
Apache Spark 第 4 章:Spark 整体架构

本文系统解析了Spark作业执行机制,分为五个核心部分:1)作业生命周期七阶段流程,强调Driver的核心调度作用;2)Driver内部组件分工,包括DAG调度、任务执行优化等模块;3)Executor内存划分模型,详解4.6GB统一内存与3.1GB用户内存的用途;4)三种部署模式对比,指出生产环境应选用YARN/K8s的cluster模式;5)数据流与调度流协同工作的全景图。全文通过架构图与关键

#apache#spark
Apache Spark 第 5 章:Spark SQL 与 DataFrame

Spark性能优化核心在于Catalyst优化器,它通过逻辑计划转换、规则优化和物理执行计划选择实现自动性能提升。DataFrame操作分为Transformation和Action两类,其中Join策略(Broadcast/Sort-Merge/Shuffle)对性能影响最大。数据读写推荐列式存储格式,Window函数可高效处理分组计算。关键原则:优先Broadcast Join,利用AQE动态

#spark#大数据
    共 42 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择