
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
背景:在目前的MPPOLAP系统众多,比如Greenplum、Apache Impala、Presto、Doris、ClickHouse、Druid、TiDB等等,druid 虽然在不设置roll up 的情况下支持明细数据。但数据join 和性能都比较差。clickhouse 虽然在支持明细和汇总数据查询,但在集群扩展和数据join 的方面也比较弱。基于上面几个方面Doris 在兼容roll_u
四、状态的恢复流程todo 结合源码分析:https://blog.jrwang.me/2019/flink-source-code-checkpoint/
1、旨在对hive sql整体总结记录 todorefer https://my.oschina.net/leejun2005/blog/75722
Python脚本执行的方式python script.py# 直接执行脚本python -m script # 当做模块的方式执行,相当于 import区别1:查找文件的路径不一样第一种方法——直接运行脚本,当前脚本所在的路径会加入到 sys.path 列表中,但是 sys.modules 字典中的 main 的路径不是绝对路径,只是脚本名称。第二种方法——当做模块方式运行,当...
适用范围1、当启动某些服务出现异常时,且报错比较模糊时。问题找不到头脑调试脚本无疑是非常好的方式(cloudera 等)2、python 环境单点运行调试自己pyhon调试步骤首先你选择运行的 py 或服务程序的入口pypython -m pdb test.py(Pdb) 会自动停在第一行,等待调试,这时你可以看看 帮助(Pdb) h说明下这几个关键 命令断点设置(Pdb...
同步时间,可以使用ntpdate命令,也可以使用ntpd服务(debian中ntp服务器为ntp服务,需要安装apt-get install ntp,同时对上手动同步时间需要用到ntpdate,故还需安装apt-get installntpdate)。一、配置ntp1.在所有服务器上安装ntpyum install ntp注:这里我们选择将Inforpush1作为NTP服务器,其他服务...
在spark sql 中用户可以使用Join hint来建议Spark使用哪一种Join。从Spark 3.0开始增加了MERGE、SHUFFLE_HASH和SHUFFLE_REPLICATE_NL这三种Join Hint。优先级为BROADCAST > MERGE > SHUFFLE_HASH > SHUFFLE_REPLICATE_NL。如果Join的两侧都添加了BROADCAST或者SHUF

1、flink 、spark streaming 、storm 的异同:flink架构和容错方面 和spark Straming storm 异同。flink 和storm 、sparkstreaming在处理模型延迟和数据保证时异同:现有的开源计算方案,会把流处理和批处理作为两种不同的应用类型:流处理一般需要支持低延迟、Exactly-once保证,而批处理需要支持高吞吐、高效...
最近收到一家公司面试题感悟:要求:用户访问日志文件有两列,分别为日期和用户ID :(date,user_id) 使用spark 统计每天访问记录数和用户数。1、每天访问记录数例子完成结果(2017-01-03,4)(2017-01-02,3)(2017-01-01,3)每天访问的用户数(当时没有太理解)估计面试官想问新增用户数具体实现结果为:实现思想 是一个倒排的思想1、...
1、在我们使用spark-submit 提交spark 任务一般有以下参数/bin/spark-submit \--class <main-class> \--master <master-url> \--deploy-mode <deploy-mode> \--conf <key>=<value> \.....








