logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

flink 维表关联多种方式

1.实时查询维表优点:维表数据实时更新,可以做到实时同步到。缺点:访问压力大,如果失败会造成线程阻塞。实时查询维表是指用户在Flink算子中直接访问外部数据库。这种方式可以保证数据是最新的,但是当我们流计算数据过大,会对外部系统带来巨大的访问压力,比如:连接失败,连接池满等情况,就会导致线程阻塞。task等待数据返回.核心就是通过Map算子中建立访问外部系统的连接。核心代码如下:public st

#flink
flink 1.9 自编译 适配Hadoop3.X版本

Flink 1.9本身只提供支持Hadoop2.4.1, 2.6.5, 2.7.5,2.8.3的预编译安装包。如果想要flink on yarn(HDP3.1),一定需要自己编译。编译准备gitmavenjdk8或更高编译过程在编译flink之前需要先编译安装flink-shaded.然后再编译flink.因为flink依赖flink-...

#flink
数据湖对比(hudi,iceberg,paimon,Delta)

个人更倾向于paimon的数据湖能力,可以为用户提供高吞吐、低延迟的数据摄入、流式订阅以及实时查询能力。总结一句话就是真正面向实时更新而设计的数据湖格式。在国外的应用场景主要是离线取代 Hive,虽然扩展性强,也导致计算引擎有较多优化空间,后续发展难以迅速,需要涉及众多对接引擎。面向spark,为了解决在hadoop体系内数据更新和增量查询的问题。趋势在不断的在完善面向批处理的架构细节改造,对sp

#大数据
spark Shuffle Write和Read

spark shufflesparkshuffle主要部分就是shuffleWrite 和 shuffleReader.大致流程spark通过宽依赖划分stage,如果是宽依赖就需要进行shuffle操作,上游stage的shufflemaptask进行shuffleWrite,上游的write操作做的最重要的操作其实就是分区,元数据根据MapOutputTrackerWorker汇报给drive

#spark
到底了