logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Pyspark DataFrame中Column使用

pyspark 中dataframe column的基本使用方法,以及详细样例演示

#linux#python#spark +1
Linux下mysql安装与卸载详细教程(使用yum源安装解析,解决gpg验证问题)

使用官方源进行安装,包含linux下mysql的安装,卸载,以及解决安装过程中的问题。mysql80-community-release-el7-6.noarch.rpm的目的其实就是安装了mysql官方的yum源,这时候使用yum 进行 mysql的安装,系统会优先从mysql官方源头进行mysql安装。

文章图片
#linux#mysql#运维
Pyspark中GroupedData类型内置函数

Pyspark中GroupedData类型数据的内置函数,以及操作使用样例详细展示

文章图片
#python#开发语言#spark +1
Pyspark中catalog的作用与常用方法

Catalog是Spark中用于管理元数据信息的接口,这些元数据可能包括库、内部或外部表、函数、表列及临时视图等。总的来说,PySpark Catalogs是PySpark框架中用于管理和查询元数据的重要组件,它使得Python用户能够更有效地利用PySpark进行大数据处理和分析。

#python#hive#大数据 +1
docker-compose.yml配置

YAML 参考了其他多种语言,包括:C语言、Python、Perl,并从 XML、电子邮件的数据格式(RFC 2822)中获得灵感。命名卷可以用于持久化容器内的数据,即使容器被删除或重新创建,数据也不会丢失。1.命名卷存储在Docker管理的宿主机文件系统中,在Docker主机上创建的独立于容器生命周期的持久化存储区域。YAML 文件使用缩进和换行等符号来表示层次结构和序列关系,从而达到编写简单易

文章图片
#docker#容器
hadoop集成hive的部署方式

在已经安装完hadoop,mysql的基础上可以进行hive的安装之前部署的hadoop版本为3.2.4,mysql版本为8.0.39,详细部署流程。

文章图片
#hadoop#hive#大数据
HDFS常用操作命令(附详细演示截图)

hdfs操作,基础操作,附带配详演示截图。

文章图片
#hdfs#hadoop#大数据
scala基础学习_变量

关键字声明的变量确实是可变的,这意味着你可以在变量的生命周期内多次改变它的值。一旦一个变量被声明,就不能在同一作用域内再次声明它,无论它是。在 Scala 中声明变量和常量不一定要指明数据类型,在没有指明数据类型的情况下,其数据类型是通过变量或常量的初始值推断出来的。所以,如果在没有指明数据类型的情况下声明变量或常量必须要给出其初始值,否则将会报错。变量重新赋值为不同的值,这些值可能会存储在不同的

文章图片
#scala#学习#开发语言
到底了