logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

hbase compaction

minor compaction会真正删除 ttl的内容major compactionttl多余version

#hbase
flink源码阅读---Flink intervalJoin 使用和原理分析

1.前言Flink中基于DataStream的join,只能实现在同一个窗口的两个数据流进行join,但是在实际中常常会存在数据乱序或者延时的情况,导致两个流的数据进度不一致,就会出现数据跨窗口的情况,那么数据就无法在同一个窗口内join。Flink基于KeyedStream提供的interval join机制,intervaljoin 连接两个keyedStream, 按照相同的key在一个相对

hive map reduce数量

一、控制hive任务中的map数:1.通常情况下,作业会通过input的目录产生一个或者多个map任务。主要的决定因素有: input的文件总个数,input的文件大小,集群设置的文件块大小(目前为128M, 可在hive中通过set dfs.block.size;命令查看到,该参数不能自定义修改);2.举例:a)假设input目录下有1个文件a,大小...

doris-查询原理

目录一.查询简介二.查询流程1.Query 接收2.Query Parse3.Query Analyze4.Query Rewrite5.Plan5.1 Query 单机Plan5.2 Query 分布式Plan6.Query Schedule7.Query ExecuteOlapScanNodeAggregationNodePartitionedAggregationNodeExchangeNo

哈希表查找——成功和不成功时的平均查找长度

哈希表查找——成功和不成功时的平均查找长度以下求解过程是按照“计算机统考的计算方法”,不同的老师、教材在“处理冲突”上可能会有不同的方法,所以最主要的是掌握原理即可,对于考研的朋友最好掌握统考真题的解题方法。题目例子:(2010年全国硕士研究生入学统一考试计算机科学与技术学科联考计算机学科专业基础综合试题第一题)将关键字序列(7、8、30、11、18、9、14)

spark启动流程1

1 standalone模式1.Driver端启动SparkSubmit进程,启动后开始向Master进行通信,此时创建了一个对象(SparkContext),接着向Master发送任务消息2.Master接收到任务信息后,开始资源调度,此时会和所有的Worker进行通信,找到空闲的Worker,并通知Worker来拿取任务和启动相应的Executor3.Executor启动后,开始与Driver

flink维表join的几种方式(1)

维表join的几种方式一 将维表预加载到内存关联实现方式:定义一个类实现RichFlatMapFunction在open()方法中读取全部数据加载到内存中。优缺点:因为存在内存中,所以仅支持小数据量维表;因为open方法中读取,所以维表变化需要重启作业。二 通过Distributed Cache分发本地维度文件到task manager后加载到内存关联实现方式:通过env.r...

flink随笔

1 map 或者source时继承对应的rich function,在其中的open方法中建立连接,对应的close方法中关闭连接。2 window必须对应keyedstream,也就是说必须在keyby之后。之后在对应相应的增量函数比如ReduceFunction, AggregateFunction, FoldFunction 或 ProcessWindowFunction。前两个函数执行..

elasticsearch查询总结

ES操作还是应该看官网api指南,这里写了几个自己用到的,作为总结记录。https://www.elastic.co/guide/en/elasticsearch/reference/5.1/search-aggregations-metrics-top-hits-aggregation.html1聚合索引中字段stu_num的数量(groupby),min_doc_count代表每一...

elasticsearch心得体会

1 聚合搜索的字段如果是求和的情况下,字段不能为string类型,那么排序时字段要求是不是也一样呢? 

    共 15 条
  • 1
  • 2
  • 请选择