
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
生产数据压力测试kafka-producer-perf-test.sh 脚本命令的参数为:--topic topic名称,比如test--num-records 总共需要发送的消息数,比如为1000000--record-size 每个记录的字节数,比如1000--throughput 每秒钟发送的最大记录数,比如20000--producer-props bootstrap.servers=ka
Hive支持多表插入,可以在同一个查询中使用多个insert子句,这样的好处是我们只需要扫描一遍源表就可以生成多个不相交的输出!from test1insert overwrite table test2partition (age)select name,address,school,ageinsert overwrite table test3select name,address多表插入的关
背景由于项目需求,需要跨集群向kafka发数据,发数据程序所在集群没有配置目标kafka集群的主机名,所以只能使用目标集群的ip地址。经测试两个集群网络通信是没有问题的。但是发kafka数据程序运行一直报错,显示无法解析主机名。问题详情由于跨集群发kafka数据,程序运行所在集群和目标kafka集群属于2个不同集群。为方便描述,程序运行所在集群简称为A集群,目标ka...
导语大数据有不少分布式组件,是需要各个节点保持时间同步的,比如hbase,cdh管理平台等。本文重点介绍centos7环境下,ntp服务的搭建。核心过程需要做时间同步的各个节点,选取一台作为主节点,其他从节点都向这台主节点做时间同步,而主节点向网络标准时间做同步。详细步骤各节点安装ntp,ntpdate服务执行如下两个命令[roo...
背景在构建实时数仓过程中,有时需要将两个实时数据源进行关联,生成大宽表数据,这时就不得不用到双流join。场景比如有这样的场景,订单实时数据源,和订单物品实时数据源。订单数据源有订单id,下单时间,订单金额,收货人,收货地址等信息,订单商品数据源有订。单号id,商品名称,商品品牌,商品价格,商品成交价格,商品所属商家。订单和订单商品一般是一对多的关系。生成订单大宽表数据,需要将订单的每一件商品信息
spring cloud环境问题解决
from_unixtime功能: UNIX时间戳转日期函数:语法:from_unixtime(bigintunixtime[,stringformat])返回值:string说明:转化UNIX时间戳(从1970-01-0100:00:00UTC到指定时间的秒数)到当前时区的时间格式举例:selectfrom_unixtime(1323308943,’yyyyMMdd’)fromdual; #结果

df -T 只可以查看已经挂载的分区和文件系统类型。[root@hadoop001 ~]# df -T文件系统类型1K-块已用可用 已用% 挂载点devtmpfsdevtmpfs328520120328520120% /devtmpfstmpfs3286320803286320
1 下载好spark源码,解压2 打开IDEA --> 顶部工具栏【File】 --> 【New】 --> 【Project from ExistingSources】3 为该项目配置好Maven,而不是默认的IDEA自带的Maven4 先选中这个Project,鼠标右键 ---> 【Maven】 --> 【Generate Sources and Update Fo







