logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大数据开发常见面试问题

全量抽取一般是由于业务先开始上线进行,在我们需要采集数据进行分析的时候,业务表中已经有了许多数据,因此需要全量导入。三、假设你在数据开发过程中遇到了表关联问题,我想搞清楚是关联上了但是关联的字段值为空,还是因为根本没有关联上导致的值为空。1.根据id进行增量抽取,一般记住上次抽取的id,后根据where条件去筛选过滤数据。2.根据时间分区去进行增量抽取,一般的分区时间是一天或者一个月。增量抽取跟全

#大数据#sql#hive +2
kafka

kafka是分布式的基于订阅/发布模式的消息队列,主要用于处理大数据的实时领域优势:kafka对硬件的要求不高,即使是非常普通的硬件,也可以支持每秒百万次读写。

#kafka#分布式
kafka

kafka是分布式的基于订阅/发布模式的消息队列,主要用于处理大数据的实时领域优势:kafka对硬件的要求不高,即使是非常普通的硬件,也可以支持每秒百万次读写。

#kafka#分布式
到底了