logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

一些sparksql的面试题

对于外部表,数据可以存在 HDFS、S3 等任何指定位置,Hive 只管理元数据。一是元数据,它存在像 MySQL 这样的独立数据库里,记录的是表结构、分区信息这些。方法,最常用,用来读文本文件,比如从 HDFS 或本地系统读,按行处理。,主要用在测试里,把程序里的一个集合(比如 List)变成 RDD 来用。所以,Hive 本身不产生数据,它主要管理和描述存储在别处的数据。,适合读取一堆小文件,

#mysql#spark
Spark Core vs Spark MLlib:从数据处理到机器学习的完整指南

分类算法:逻辑回归、决策树、随机森林聚类算法:K-means、LDA、高斯混合模型特征工程:标准化、归一化、特征提取模型评估:准确率、F1分数、AUC等指标算子类别具体算子主要作用使用场景数据准备创建特征向量所有MLlib算法的数据输入模型创建KMeans()创建算法实例定义机器学习算法和参数模型训练fit()从数据中学习规律训练阶段,构建模型预测/转换应用模型进行预测或转换推理阶段,使用模型结果

#spark-ml#机器学习#人工智能
Flink的一些面试题整理

侧输出-SideOutput:通过watermark在短时间内允许了乱序到来的数据,可以将错过水印有错过allowdelateness允许的时间的数据,单独存放在一个DataStream中,然后开发人员可以自定义逻辑对这些超级迟到的数据进行处理。滑动窗口:窗口长度!=滑动距离,其中,如果滑动距离>窗口长度,会漏掉数据,反之则会重复处理数据比如要求是每隔1分钟,统计前面5分钟的数据(滑动距离1分钟,

#flink#大数据
在flink中使用kafkasql遇到Could not find any factory for identifier ‘json‘ that implements ‘org.apache.这个问题

那么这种问题出现的原因主要是因为缺少了json的jar包,而解决的方法也很简单,和解决hive和spark中出现类似的问题一样。如果你不是使用的pom文件进行导包的话还有另一种方法,更加直接简单粗暴,那就是——去官网下载好了以后拉进来。那就是将json包给进行导入就好了,这是我的版本,具体自己适配的版本要自行查询吼。下面的是这个包所在的位置,可自行进行下载。遇到这种问题不要慌,先拍照发个朋友圈。操

#flink#json#大数据
一些sparksql的面试题

对于外部表,数据可以存在 HDFS、S3 等任何指定位置,Hive 只管理元数据。一是元数据,它存在像 MySQL 这样的独立数据库里,记录的是表结构、分区信息这些。方法,最常用,用来读文本文件,比如从 HDFS 或本地系统读,按行处理。,主要用在测试里,把程序里的一个集合(比如 List)变成 RDD 来用。所以,Hive 本身不产生数据,它主要管理和描述存储在别处的数据。,适合读取一堆小文件,

#mysql#spark
MySQL vs Hive:EXPLAIN 到底该怎么看?

维度核心目标避免全表扫描避免多余 Stage/Shuffle关键指标Stage 数、Shuffle 关键字、TableScan 行数优化手段加索引、覆盖索引、改写 SQL加分区、加盐、合并子查询、调并行度典型危险type=ALLReduce 卡住、数据倾斜MySQL 看“查”——别让 type 变成 ALLHive 看“跑”——别让 Stage 无限增加把 EXPLAIN 当成体检报告,而不是参考

#mysql#hive#数据库
到底了