logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

kafka:使用flume自定义拦截器,将json文件抽取到kafka的消息队列(topic)中,再从topic中将数据抽取到hdfs上

使用自定义拦截器# type指的是编写java代码所在目录的路径名(我的是在com.bigdata.zidingyi下)# 修改sink为kafka执行之前,先在kafka中创建消息队列(topic)中创建一个topic :zidingyi 数据将会导入到这个topic中创建好后执行conf文件即可可以使用把主题中所有的数据都读取出来(包括历史数据)并且还可以接收来自生产者的新数据。

文章图片
#kafka#flume#hdfs
DS:ERROR tool.ImportTool: Import failed: org.apache.hadoop.mapred.FileAlreadyExistsException错误

当我们使用dolphinscheduler(DS)调度工具,将mysql的数据增量导入至hive中的时候,可能会报出以下错误或这样的错误。

文章图片
#apache#hadoop#大数据
kafka中topic的数据抽取不到hdfs上问题解决

将json文件抽取到kafka的消息队列(topic)中,再从topic中将数据抽取到hdfs。我们在从kafka中topic的数据抽到hdfs上的时候会出现 flume不报错,但也不抽取的情况。其实这个也很简单,只需要在 /root/.flume下删除如图文件即可。就卡在页面不动,hdfs上自然也没有数据产生。再次执行flume命令就可以抽取成功了。

文章图片
#kafka#hdfs#分布式
到底了