
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Paimon面试必备系列参考:Apache Paimon面试必备系列-基础篇本篇属于进阶篇。这是一个系列文章,包含基础篇、原理篇、进阶篇、实践篇等至少4+个系列。欢迎收藏、追更。本系列内容在知识星球持续更新,同步答疑。冲刺中大公司、高阶岗位的同学随时在知识星球提问。Paimon的时效性和一致性是如何保证的?提到Paimon的时效性与一致性,就必须要提到Paimon的快照文件,快照(snapshot
点击上方蓝色字体,选择“设为星标”回复”资源“获取更多资源大数据技术与架构点击右侧关注,大数据开发领域最强公众号!暴走大数据点击右侧关注,暴走大数据!集成kerberos后,很多使用服务...
Checkpoint 相关:numCompletedCheckpoints(成功次数)、latestCheckpointDuration(耗时)、pendingCheckpoints(排队数),优化 Checkpoint 配置。全链路延迟指数据从进入Flink任务(Source)到离开任务(Sink)的端到端耗时,Web UI 未直接提供该指标,实现端到端全链路延迟的方法有多种,我们举两个例子。事
这是一个系列文章,包含基础篇、原理篇、进阶篇、实践篇等至少4+个系列。欢迎收藏、追更。本系列的文章非常「功利」,完全着眼于面试,当然读者完全可以把它当成学习完Paimon后的自我检验也是可以的。文章较长,推荐收藏。本篇文章是基础篇。基础篇是入门Paimon必须要掌握的部分。本系列内容在知识星球同步更新,知识星球内同步答疑,冲刺中大公司、高阶岗位的同学随时在知识星球提问。本文部分参考了Paimon官
300万字!全网最全大数据学习面试社区等你来!01背景和痛点在大数据场景应用中,业务不仅要计算数据结果,而且要保障时效性。目前,我司演化出两条链路。时效性高的数据走 Kafka、Flink 实时链路;时效性要求低的数据走 Spark 离线链路。上图简单描述了 B 站数据上报、处理和使用的链路。数据采集主要通过 APP 端上报的行为事件数据。服务端上报的日志数据会通过网关以及分发层,流式分发到大数据
全网最全大数据面试提升手册!一、实时数仓场景介绍为了数据湖更好的落地,我们在落地之前与业务做了一些深入的沟通,并根据不同业务的特点主要分为了三个场景:1)场景一典型的业务主要是短视频和直播,它的数据量级一般都比较大,例如大流量的日志数据,其计算周期一般是自然的天、小时或者分钟级别的,实时性的要求一般是五分钟内,主要诉求是批流的复用,可以容忍少量数据的不一致。2)场景二一般是直播或者电商的部分场景,
点击上方蓝色字体,选择“设为星标”回复"面试"获取更多惊喜全网最全大数据面试提升手册!第一部分:Iceberg 核心功能原理剖析 :Apache Iceberg摘自官网:ApacheIcebergisanopentableformatforhugeanalyticdatasets.可以看到 Founders 对 Iceberg 的定位是面向海量数据分析...
点击上方蓝色字体,选择“设为星标”回复"面试"获取更多惊喜八股文教给我,你们专心刷题和面试Hi,我是王知无,一个大数据领域的原创作者。放心关注我,获取更多行业的一手消息。目录Flink SQL Client配置IcebergJava/Scala pom.xml配置Catalog3.1 Hive Catalog3.2 HDFS Catalog数据库和表相关DDL命令4.1 ...
这篇文章是我的一个好友彭文华彭总写的, ID Mapping是阿里巴巴数据中台的核心能力之一。欢迎大家添加彭总微信:shirenpengwh ,一起探讨大数据相关技术。网上 ID Map...
点击上方蓝色字体,选择“设为星标”回复”面试“获取更多惊喜数据湖的前世今生互联网技术发展的当下,数据是各大公司最宝贵的资源之一已经是不争的事实。收据的收集、存储和分析已经成为科技公司最重要...







