logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

如何解决hbase中数据热点问题

所谓数据热点, 指的是大量的数据写到hbase的某一个或者某几个region中, 导致其余的region没有数据, 其他region对应regionServer的节点承受了大量的并发请求, 此时就出现了热点问题解决方案: 通过预分区和设计良好的rowkey来解决--加盐处理(加随机数) : 可以在rowkey前面动态添加一些随机数, 从而保证数据可以均匀落在不同region中基本保证数据落在不同r

#hbase#big data#分布式
hive的安装,启动,连接操作(最详细解决方案,直接按着操作即可)

hive的安装1. 修改 hadoop的 core-site.xml中, 添加以下内容:#修改hadoop 配置文件 etc/hadoop/core-site.xml,加入如下配置项:<property><name>hadoop.proxyuser.root.hosts</name><value>*</value></propert

#hive#hadoop#big data +1
org.apache.hadoop.ipc.Remotexception(avax.security.sasl.SaslException): GSS intiate failed

原因:因hbase服务器不稳定,此段时间无法连接,导致任务失败。处理方案:重新调起任务。

文章图片
#hadoop#apache#java +1
spark 中 task 有几种类型

Spark中的Task有2种类型:1)result task类型,最后一个task;2)shuffleMapTask类型,除了最后一个task都是此类型.

#spark#scala#大数据
spark driver 的功能是什么

1)一个Spark作业运行时包括一个Driver进程,也是作业的主进程,具有main函数,并且有SparkContext的实例,是程序的人口点;2)功能:负责向集群申请资源,向master注册信息,负责了作业的调度,负责作业的解析、生成Stage并调度Task到Executor上。包括DAGScheduler,TaskScheduler。...

#spark#big data#大数据
spark 的优化

spark调优比较复杂,但是大体可以分为三个方面来进行:1)平台层面的调优:防止不必要的jar包分发,提高数据的本地性,选择高效的存储格式如parquet2)应用程序层面的调优:过滤操作符的优化降低过多小任务,降低单条记录的资源开销,处理数据倾斜,复用RDD进行缓存,作业并行化执行等等3)JVM层面的调优:设置合适的资源量,设置合理的JVM,启用高效的序列化方法如kyro,增大off head内存

#spark#大数据#big data
MySQL和oracle的常用引擎

MySQL:在MySQL数据库中,常用的引擎主要就是2个:Innodb和MyIASM。1.简单介绍这两种引擎,以及该如何去选择a.Innodb引擎,Innodb引擎提供了对数据库ACID事务的支持。并且还提供了行级锁和外键的约束。它的设计的目标就是处理大数据容量的数据库系统。它本身实际上是基于Mysql后台的完整的系统。Mysql运行的时候,Innodb会在内存中建立缓冲池,用于缓冲数据和索引。但

#big data#大数据#mapreduce
机器学习中分箱的作用及好处

分箱就是将连续变量离散化,合并成较少的状态作用:离散特征的增加和减少都很容易,易于模型的快速迭代;稀疏向量内积乘法运算速度快,计算结果方便存储,容易扩展;分箱(离散化)后的特征对异常数据有很强的鲁棒性单变量分箱(离散化)为N个后,每个变量有单独的权重,相当于为模型引入了非线性,能够提升模型表达能力分箱(离散化)后可以进行特征交叉,由M+N个变量变为M*N个变量,进一步引入非线性,提升表达能力;分箱

#机器学习#自然语言处理
JVM 内存分哪几个区,每个区的作用是什么

java虚拟机主要分为以下几个区:1) 方法区:a. 有时候也成为永久代,在该区内很少发生垃圾回收,但是并不代表不发生GC,在这里进行的GC主要是对方法区里的常量池和对类型的卸载b. 方法区主要用来存储已被虚拟机加载的类的信息、常量、静态变量和即时编译器编译后的代码等数据。c. 该区域是被线程共享的。d. 方法区里有一个运行时常量池,用于存放静态编译产生的字面量和符号引用。该常量池具有动态性,也就

#java#面试#经验分享
什么是类加载器,类加载器有哪些

实现通过类的权限定名获取该类的二进制字节流的代码块叫做类加载器。主要有一下四种类加载器:1) 启动类加载器(Bootstrap ClassLoader)用来加载java核心类库,无法被java程序直接引用。2) 扩展类加载器(extensions class loader):它用来加载 Java 的扩展库。Java 虚拟机的实现会提供一个扩展库目录。该类加载器在此目录里面查找并加载 Java 类。

#java#jar#java-ee
    共 12 条
  • 1
  • 2
  • 请选择