logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spark六 DAG和task

task的生成:首先需要stage划分,依据划分的stage来生成tasktask的数量和分区的数量和sttage的数量是有直接关系的在发送shuffle的过程中,会产生shuffle write 和shuffle readeshuffle write : 发生在shuf/fle之前,把需要shuffle的数据写到磁盘,保证了数据的可靠性为什么在发送shuffle的时候,需要把数...

#spark
移动平均法的实现--spark

案例场景数据结构(k,t,v) k是id,t是时间,v是这个id在某个时间点对应的值股票代码,时间,收盘价AA,2017-1-7,10.8AA,2017-1-8,10.9AA,2017-1-9,11AA,2017-1-30,10.5BB,2017-1-31,10.7BB,2017-2-1,10.9BB,2017-2-2,11.1...

spark shuffle解析

依赖(血缘)的作用RDD只支持粗粒度转换,即在大量记录上执行的单个操作。将创建RDD的一系列Lineage(即血统,依赖)记录下来,以便恢复丢失的分区。RDD的Lineage会记录RDD的元数据信息和转换行为,当该RDD的部分分区数据丢失时,它可以根据这些信息来重新运算和恢复丢失的数据分区。spark的宽窄依赖RDD和依赖的父RDD关系有两种,就是宽依赖和窄依赖宽依赖: 多个子RDD的partit

文章图片
#spark
dockerfile

安装jdk

#docker
dockerfile

安装jdk

#docker
CentOS7安装和静态ip设置

目录说明背景步骤首先选择自定义直接下一步选择centos64位选择一个存放路径和虚拟机的名称,默认的也是可以的设置cpu设置内存设置网络类型,建议是桥接网络哟一路默认到创建磁盘我的是1T,比较较大,分的比较多完成添加iso启动虚拟机,一路enter选择语言是english就可以,中文也行,看个人,时区选择上海手动分区,选择I will configure partioning 选项,然后点击don

#centos#linux#网络
矩阵

flink-table-planner:planner 计划器,是 table API 最主要的部分,提供了运行时环境和生成程序执行计划的 planner;flink-table-api-scala-bridge:bridge 桥接器,主要负责 table API 和 DataStream/DataSet API的连接支持,按照语言分 java 和 scala。这里的两个依赖,是 IDE 环境下运

#线性代数#矩阵
到底了