
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
目录一、目的二、操作1、建表2、desc formatted 表名3、desc 表名4、show create table 表名一、目的主要为了阐述在现场的开发环境中怎么定位查看hive表的一些信息:是否为内部表、外部表存储位置字段分隔符分区字段建表语句二、操作1、建表--创建内部表create table inner_stu(id string,name string) row format d
一、向livy2提交spark自带例子[root@ambari1 Test]# curl -X POST --data '{"file": "/home/Test/spark-examples_2.11-2.2.0.2.6.3.0-235.jar", "className": "org.apache.spark.examples.SparkPi","args":["100"]}' -H "Cont
一、说明这里的window函数是属于functions.scala文件中的内置函数。window函数是在spark2.0.0中新增的API函数。这里选取股票数据为测试数据:测试数据下载地址。时间一定要整理成yyyy-MM-dd hh:mm:ss格式,其他格式内置函数不识别。二、数据样式--表头id,date,openPrice,highestPrice,lowestPrice,closePrice
一、说明在Spark中,自定义函数可以分为两种UDF和UDAF(这里只演示UDF)。UDF(User-Defined-Function),即最基本的自定义函数。类似 lit、sqrt之类的函数,是对每一条数据处理。输入和输出是一对一的关系。UDAF(User- Defined Aggregation Funcation),用户自定义聚合函数。类似sum、count之类的函数,是对数据按一定规则分组
说明agg函数经常与groupBy函数一起使用,起到分类聚合的作用;如果单独使用则对整体进行聚合;代码示例package com.dt.spark.Testimport org.apache.spark.sql.{DataFrame, SparkSession}object AggTest {case class Student(classId:Int,name:String,gender:Str
一、环境搭建1、windows下spark环境搭建
一、使用广播变量的好处1、Driver每次分发任务的时候会把task和计算逻辑的变量发送给Executor。不使用广播变量,在每个Executor中有多少个task就有多少个Driver端变量副本。这样会导致消耗大量的内存导致严重的后果。2、使用广播变量的好处,不需要每个task带上一份变量副本,而是变成每个节点的executor才一份副本。这样的话, 就可以让变量产生的副本大大减少;二、广播变量
一、说明1、foreachPartition属于action运算操作,而mapPartitions是转化操作;在应用场景上区别是mapPartitions可以获取返回值,继续在返回RDD上做其他的操作,而foreachPartition因为没有返回值并且是action操作,所以使用它一般都是在程序末尾比如说要落地数据到存储系统中如mysql,es,或者hbase中,可以用它。2、官方提供Trans
1、hanlp理解HanLP是一系列模型与算法组成的NLP工具包,由大快搜索主导并完全开源,目标是普及自然语言处理在生产环境中的应用。HanLP具备功能完善、性能高效、架构清晰、语料时新、可自定义的特点。2、hanlp参考gitHup地址https://github.com/hankcs/HanLP3、hanlp IDEA项目搭建(1)gitHub下载data数据包(2)下...
调优概述有的时候,我们可能会遇到大数据计算中一个最棘手的问题——数据倾斜,此时Spark作业的性能会比期望差很多。数据倾斜调优,就是使用各种技术方案解决不同类型的数据倾斜问题,以保证Spark作业的性能。数据倾斜发生时的现象绝大多数task执行得都非常快,但个别task执行极慢。比如,总共有1000个task,997个task都在1分钟之内执行完了,但是剩余两三个task却要一两个小时。这种情况很







