logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hive报lzo Premature EOF from inputStream错误

今天dw组同事发邮件说有一个问题让帮解决一下,他们自己没能搞得定,以下问题解决过程:

#hive
hadoop2.0的datanode多目录数据副本存放策略

在hadoop2.0中,datanode数据副本存放磁盘选择策略有两种方式:第一种是沿用hadoop1.0的磁盘目录轮询方式,实现类:RoundRobinVolumeChoosingPolicy.java第二种是选择可用空间足够多的磁盘方式存储,实现类:AvailableSpaceVolumeChoosingPolicy.java

#hdfs
hive桶(bucket)简介

1. hive 桶相关概念    桶(bucket)是指将表或分区中指定列的值为key进行hash,hash到指定的桶中,这样可以支持高效采样工作。    抽样(sampling)可以在全体数据上进行采样,这样效率自然就低,它还是要去访问所有数据。而如果一个表已经对某一列制作了bucket,就可以采样所有桶中指定序号的某个桶,这就减少了访问量。   2. 桶作用

#hive
云计算运维与传统运维的探讨

云计算运维与传统运维的差异性51CTO:阿里巴巴云计算运维是在什么样的背景下产生的?柯旻:由于阿里巴巴业务的发展需要,数据量飞速膨胀。云计算、分布式计算等(包括我们自主开发的飞天系统),都是在这样的背景下产生的。51CTO:云计算运维与传统运维的区别在哪里?柯旻:其实最主要区别是量的膨胀。传统的运维可能只有几十,或者上百的机器,这些机器上面有十个、二十个应用

#云计算#运维#性能优化
hadoop fsck 命令详解

hadoop  fsckUsage: DFSck[-move | -delete | -openforwrite] [-files [-blocks [-locations | -racks]]]                     检查这个目录中的文件是否完整        -move               破损的文件移至/lost+found目录

#hadoop
hadoop2.0(YARN) ResourceManager failover机制

YARN RM failover机制RM(ResourceManager)每次在启动之前都会进行初始化并执行一次recovery操作,然后才启动RM,对外提供服务。RM启动流程如下图:RM启动流程图RM中的各种服务包括:(1)、ContainerAllocationExpirer:监控Containter是否到期。(2)、AmLivelinessMonitor:监控A

hadoop2.4.0的distcp引起的问题

最近在支持业务部门将数据从hadoop0.20.203迁移到hadoop2.4.0的时候,distcp报了几个错误,在这里记录一下:

hive on spark部署

本文档相关软件的版本:spark-1.0.2、hadoop2.4.0和hive-0.13.0一、编译打包1、准备       将 hadoop gateway所使用的 hadoop 相关配置文件(*-site.xml)放到 spark 的代码里的 core/src/main/resources/下进行打包,否则可能会出现找不到rm以及 nn 等情况。    参考文档:《sp

#spark#hive
hive使用python脚本导致java.io.IOException: Broken pipe异常退出

反垃圾rd那边有一个hql,在执行过程中出现错误退出,报java.io.IOException: Broken pipe异常,hql中使用到了python脚本,hql和python脚本近期没有人改过,在10.1号时还运行正常,但是在10.4号之后运行就老是出现相同的错误,而且错误出现在stage-2的reduce阶段,gateway上面的错误提示如下:

#hive#python
怎样贡献hadoop代码

转自Hadooper论坛:http://www.hadooper.cn/dct/page/65789获得源码        首先,你需要Hadoop的 源码。 你可以用SVN获得源码,大部分的开发都在”trunk”下。svn checkout http://svn.apache.org/repos/asf/hadoop/core/trunk/ hadoop-core-tru

#hadoop
    共 16 条
  • 1
  • 2
  • 请选择