
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
Hive源码系列(一)hive2.1.1+hadoop2.7.3环境搭建
这是一篇工具类的文章,要分析调试hive源码,必须搭建一套hive的运行环境。还记得第一次搭建hive源码调试环境,用了一个月的时间,才完全跑通整个调试过程。中间遇到各种各样莫名奇妙的问题,也有好多次想放弃,幸好坚持了下来。
sparksql源码系列 | 一文搞懂with one count distinct 执行原理
在面试时,或多或少会被问到有关count distinct的优化,现在离线任务用到的基本就是hivesql和sparksql,那sparksql中有关count distinct做了哪些优化呢?
关于【你们数据仓库是怎么设计的】如何回答?
你们数据仓库都是怎么设计的,数据怎么抽象?关于这个问题,我说一说我的想法,不一定是正确的,但希望能给你提供一些思路
数仓字段血缘解析实现—hive版
字段血缘关系的一种实现方式
从一个sql引发的hive谓词下推的全面复盘及源码分析(下)
网上有太多写hive谓词下推的文章,但因为版本问题,不够全面,也不够准确了。影响谓词下推的不仅仅有PPD优化器,还有CBO。该文章【上篇】主要介绍谓词下推的规则及结论,【下篇】从源码层面跟踪hive是怎么做的优化
linux工具——神奇的正则表达式
再也不是一学就会,一用就废的正则表达式了。。。

sparksql优化的奇技淫巧(一次惊掉下巴的优化)
一次惊掉下巴sparksql的优化
sparksql源码系列 | 一文搞懂Show create table 执行原理
这篇文章主要介绍了show create table命令执行的源码流程,弄清楚了sparksql是怎么和hive元数据库交互,查询对应表的metadata,然后拼接成最终的结果展示给用户的
spark sql是如何比较复杂数据类型的?该如何利用呢?
大家对简单数据类型的比较都很清楚,但是针对array、map、struct这些复杂类型,spark sql是否支持比较呢?都是怎么比较的?我们该怎么利用呢?
spark sql join情况下谓词下推优化器PushPredicateThroughJoin
为了更好理解PushPredicateThroughJoin优化器,先把EliminateOuterJoin 优化器看了~~







