logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【Zookeeper 】核心原理:从经典架构到现代演进

用简单的树形数据结构 + 强一致性协议 + 事件通知机制,解决分布式系统中最基础的协调问题。掌握 ZK 的核心,等于掌握了分布式共识的一半原理。但也要清醒认识到它的局限:Java 技术栈重、API 相对底层、云原生适配不如 etcd。学习 ZK 的重点应放在ZAB 协议、Znode 语义、Watcher 事件模型上,这些思想在 etcd、Consul 乃至现代分布式数据库中依然通用。最后请各位大佬

文章图片
#大数据
【Hadoop】一文吃透 Hadoop 3.x:图解 HDFS、MapReduce、YARN 核心原理与踩坑实录

海量数据存储海量数据计算资源调度由 YARN 负责,Common 提供底层工具支持。Hadoop 的设计哲学很简单:用廉价的普通机器组成集群,通过横向扩展来扛住 PB 级别的数据。当前生产环境主流是3.x系列(最新稳定版3.4.2,2025 年 8 月发布)。最低 JDK 要求:3.x 最低 JDK 8,低于这个版本的编译和运行都不支持HDFS 纠删码:默认支持 Erasure Coding,存储

文章图片
#hadoop#hdfs#mapreduce
Hive 3.x 知识手册:架构原理、查询优化与踩坑避坑

P0 - 能造成事故的那种内部表 + DROP TABLE 删了上游数据:上游系统写到 HDFS 的数据被你一个DROP TABLE全清空了,下游任务全崩。对策:外部表是默认选择,内部表只在确定数据生命周期由 Hive 管理时使用。分区条件忘写导致全表扫描:半夜 ETL 任务,结果因为变量没生效变成了,集群资源被打满,其他任务全卡死。对策:开严格模式 + 代码里做分区条件非空校验。动态分区产生几十

文章图片
#hive#hadoop
【Kafka 】从入门到生产:一篇搞懂消息队列的核心原理

每个副本最后一条消息的offset+1。Leader和各个Follower的LEO可能不一样HW(High Watermark)高水位线所有ISR副本中最小的LEO。消费者只能读到HW之前的消息这篇梳理了Kafka从架构到原理再到实战的核心知识点。KRaft替代Zookeeper是Kafka 4.0最大的变化,新集群直接上KRaft分区是并行处理的基础,分区数一开始就规划好ISR + HW机制保证

文章图片
#kafka#分布式
【Spark 】完整知识体系:从入门到生产调优

如果你的输入数据有很多小文件(比如每个几KB),Spark会为每个文件创建一个分区,导致Task数量爆炸,调度开销远大于计算开销。解决# 读取时合并小文件# 或者写入时控制文件大小df.coalesce(10).write.parquet("output/") # 合并成10个文件df.repartition(10).write.parquet("output/") # 重新分区后写coalesc

文章图片
#spark#大数据#分布式
【Flink 】从入门到生产实战:一篇文章吃透流处理核心

数据从哪来(Kafka/MySQL CDC)↓Watermark(EventTime + 延迟容忍)↓怎么算(keyBy/window/state/process/AsyncIO/CEP)↓存到哪(Kafka/Doris/Redis)↓Checkpoint 保证 exactly-once主线:数据来源 → 处理计算 → 结果输出,Checkpoint 保证不丢数据。

文章图片
#flink#大数据
【Flink Checkpoint 与状态管理】生产环境怎么配、面试怎么答,都在这了

序号知识点一句话记住1Checkpoint 是什么自动定期快照,挂了从快照恢复,数据不丢2Barrier 是什么数据流里的"分隔牌",告诉算子"到此为止,拍照存盘"3对齐 vs 非对齐反压严重时 Barrier 被堵 → 对齐超时 → 开非对齐或设 alignment timeout4状态后端选型小状态(<几百MB)用 FsStateBackend,大状态(>GB)用 RocksDB + 增量5两

文章图片
#flink
Spark 内存模型与资源调优

Spark 内存调优没有银弹,关键是理解内存模型 + 会看 Spark UI + 根据问题特征给方案。先看并行度对不对——task 太少就是浪费资源再看有没有倾斜——少数 task 拖后腿比整体慢更常见然后看内存够不够——OOM 了再谈优化都是空谈最后调参数比例——memory.fraction、storageFraction 这些是在资源有限时的精细化手段调优是一个迭代的过程,每次改一个参数,看

文章图片
#spark
【AI 一文入门】从 Prompt 到 Agent,搞懂所有核心概念 + 大数据提效实战

Prompt(提示词)就是你每次跟 AI 说的话。它是一次性的、临时的指令,用完就没了。Skill(技能)是给 AI Agent 的一套标准化"作业流程"。它包含了:Prompt 模板 + 执行步骤 + 调用的工具 + 约束规则 + 错误处理。一旦写好,AI 就"学会了"这个技能,以后一句话就能触发。Agent(智能体)是一个能够自主感知环境、做出决策、执行动作、并根据反馈调整行为的 AI 系统。

文章图片
#人工智能#大数据
【AI 一文入门】从 Prompt 到 Agent,搞懂所有核心概念 + 大数据提效实战

Prompt(提示词)就是你每次跟 AI 说的话。它是一次性的、临时的指令,用完就没了。Skill(技能)是给 AI Agent 的一套标准化"作业流程"。它包含了:Prompt 模板 + 执行步骤 + 调用的工具 + 约束规则 + 错误处理。一旦写好,AI 就"学会了"这个技能,以后一句话就能触发。Agent(智能体)是一个能够自主感知环境、做出决策、执行动作、并根据反馈调整行为的 AI 系统。

文章图片
#人工智能#大数据
    共 14 条
  • 1
  • 2
  • 请选择