logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hive2.3部署实践踩过的一些坑

1、hive.metastore.schema.verification这个参数的属性设置为false,在hive-site.xml文件中修改。否则hiveserver启动失败。2、如果报这样的错:Exception in thread "main" java.sql.SQLException: Could not open client transport with JDBC Uri:

#hive#hadoop#yarn
HDFS性能测试及优化部署

hadoop的存储系统hdfs在大数据领域有着无可比拟的地位,本篇文章对hdfs的存储性能做一个相对详细的测试,影响因素有哪些,来帮助我们优化部署应用程序和hadoop集群,最大化利用hadoop的吞吐能力。

#hadoop#hdfs
parquet研究及与spark的联合使用

    这段时间因为项目,对parquet做了一系列研究,从写入跟踪到合并及spark使用等等场景。    选择parquet来对流数据进行序列化,用于后续离线分析的理由有以下几点:    1、流数据一般格式比较杂乱,可以跳过不符合条件的数据,只读取需要的数据,降低IO数据量。    2、网络流量数据量非常的庞大,即使过滤部分,还是非常吓人,parquet压缩编码可以降低磁盘存储空间。由于同一列的

#spark#hadoop
到底了