logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【数据湖】一文了解啥是数据湖~

用户行为日志(JSON,量大)→ 扔数据湖实时推荐要原始数据 → 数据湖直接读固定经营报表 → 从数据湖抽数到ClickHouse出报表。

文章图片
#大数据
【sql篇】大数据SQL五层优化(万字详解)

《大数据SQL性能优化五层体系》摘要:本文系统性地提出大数据SQL优化的五层体系:1.字段级优化(选择最小化数据类型,避免隐式转换)2.算子级优化(重写SQL逻辑,减少计算量)3.表级优化(合理分区分桶,优化存储格式)4.引擎级优化(调整执行参数,处理数据倾斜)5.架构级优化(数据分层治理)。核心原则是自底向上逐层检查,通过减少数据移动和计算量提升性能。文章包含数值/时间类型选择、Join策略、分

文章图片
#sql#数据库
【Hadoop】一文吃透 Hadoop 3.x:图解 HDFS、MapReduce、YARN 核心原理与踩坑实录

海量数据存储海量数据计算资源调度由 YARN 负责,Common 提供底层工具支持。Hadoop 的设计哲学很简单:用廉价的普通机器组成集群,通过横向扩展来扛住 PB 级别的数据。当前生产环境主流是3.x系列(最新稳定版3.4.2,2025 年 8 月发布)。最低 JDK 要求:3.x 最低 JDK 8,低于这个版本的编译和运行都不支持HDFS 纠删码:默认支持 Erasure Coding,存储

文章图片
#hadoop#hdfs#mapreduce
【Spark 】完整知识体系:从入门到生产调优

如果你的输入数据有很多小文件(比如每个几KB),Spark会为每个文件创建一个分区,导致Task数量爆炸,调度开销远大于计算开销。解决# 读取时合并小文件# 或者写入时控制文件大小df.coalesce(10).write.parquet("output/") # 合并成10个文件df.repartition(10).write.parquet("output/") # 重新分区后写coalesc

文章图片
#spark#大数据#分布式
【Flink 】从入门到生产实战:一篇文章吃透流处理核心

数据从哪来(Kafka/MySQL CDC)↓Watermark(EventTime + 延迟容忍)↓怎么算(keyBy/window/state/process/AsyncIO/CEP)↓存到哪(Kafka/Doris/Redis)↓Checkpoint 保证 exactly-once主线:数据来源 → 处理计算 → 结果输出,Checkpoint 保证不丢数据。

文章图片
#flink#大数据
【数仓建模】如何从0开始搭建数据仓库?维度建模实践笔记

层级功能输入输出核心问题ODS数据接入业务系统原始数据镜像数据有没有丢?DWD清洗+建模ODS干净的事实表+维度表业务过程拆对了吗?粒度够细吗?DWS汇总指标DWD主题宽表(含指标)主题划分合理吗?指标算对了吗?ADS应用输出DWS报表/接口数据满足业务需求了吗?场景选哪个互联网公司,业务变化快,需要快速出结果Kimball大型传统企业,数据治理要求高,不差时间Inmon底层用Inmon做EDW,

文章图片
#数据仓库
【AI 一文入门】从 Prompt 到 Agent,搞懂所有核心概念 + 大数据提效实战

Prompt(提示词)就是你每次跟 AI 说的话。它是一次性的、临时的指令,用完就没了。Skill(技能)是给 AI Agent 的一套标准化"作业流程"。它包含了:Prompt 模板 + 执行步骤 + 调用的工具 + 约束规则 + 错误处理。一旦写好,AI 就"学会了"这个技能,以后一句话就能触发。Agent(智能体)是一个能够自主感知环境、做出决策、执行动作、并根据反馈调整行为的 AI 系统。

文章图片
#人工智能#大数据
【Flink反压排查】别再一上来就加机器了

以上四步全做完了还撑不住,才是真需要加资源。

文章图片
#flink#大数据
【Flink Checkpoint 与状态管理】生产环境怎么配、面试怎么答,都在这了

序号知识点一句话记住1Checkpoint 是什么自动定期快照,挂了从快照恢复,数据不丢2Barrier 是什么数据流里的"分隔牌",告诉算子"到此为止,拍照存盘"3对齐 vs 非对齐反压严重时 Barrier 被堵 → 对齐超时 → 开非对齐或设 alignment timeout4状态后端选型小状态(<几百MB)用 FsStateBackend,大状态(>GB)用 RocksDB + 增量5两

文章图片
#flink
【Spark Core 笔记】RDD 原理、调度流程和线上踩坑

Spark Core 的内容远不止这些,但上面这些覆盖了生产环境最常用的核心知识点。建议配合 Spark UI 反复观察任务执行过程,看多了自然就理解 Stage 怎么切、Task 怎么分的了。

文章图片
#spark#大数据
    共 26 条
  • 1
  • 2
  • 3
  • 请选择