logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

clickhouse集群搭建【三节点为例】

下载clickhouse的rpm包首先创建RPM包所在位置mkdir -p /opt/software/clickhouse/cd /opt/software/clickhouse/下载地址clickhouse安装包下载链接按照顺序安装rpm -ivh clickhouse-server-common-19.3.6-1.el7.x86_64.rpmrpm -ivh clickhouse-commo

#大数据#clickhouse
clickhouseMergeTree系列引擎之ReplacingMergeTree

ReplacingMergeTree的作用删除据有相同排序键值的重复项。数据去重是在合并期间进行的后台的合并操作在未知的时间出发,因此用户无法对合并进行计划。可使用OPTIMEZE语句运行计划外的合并,但OPTIMIZE是一个很重要的操作。ReplacingMergeTree适合清除后台的重复数据以节省空间。指定表引擎:ENGINE - ReplaceMergeTree[ver]参数:ver,版本

#数据库#大数据
dolphinscheduler调度hive

找到dolphinscheduler的lib目录,移除hive*.jar原因: 可能hive的jar包与你自己安装的jar包不同,这时需要将你自己的hive下相应的jar包放入进来。操作命令cd /opt/dolphinscheduler/lib/mv hive* /tmp这里最好是移动到tmp目录下,不要删除,删除也没关系将自己安装的hive下的lib目录下的jar包复制到dolphinsche

#大数据#hive#hadoop
hive【truncate table 表名 报错】【Execution Error, return code 1 from org.apache.hadoop.hive.ql.exec.DDLTa】

truncate在beline中报错0: jdbc:hive2://192.168.222.115:10000> truncate table sales_order;FAILED: Execution Error, return code 1 from org.apache.hadoop.hive.ql.exec.DDLTask. Exception while processingErr

#hive
正则表达式整理【贪婪模式、非贪婪模式、独占模式】

一、正则表达式的基本作用正则表达式可以用来做字符串的分割、匹配、替换、以及搜索截取这四部操作对与一般编程语言例如java也是可以去完成的,之所以用正则表达式,是因为它方便,如果大量的字符需要截取或者特定要求比较高的字符用java去截取将会带来很大的不便、而正则表达式只需要匹配截取就好了。二、正则表达式的基本语法\d 代表1个数字0-9\D 代表1个非数字\w 代表1个字符0-9 A-Z a-z\W

#正则表达式
hive高级查询、Map Join【配案例演示,有图有真相】

一、hive嵌套查询和CTECTE嵌套查询演示CTE跟以前的mysql中的嵌套查询是一样的效果,把查询结果作为另一个查询的表,再对这张表进行查询,这种属于嵌套查询。相比之下,hive的STE显得更有逻辑。创建两张表,插入数据,演示CTE嵌套查询#创建表abc> create table abc(> userid int,> username string,> salary

#hive#大数据#数据库 +1
Anaconda 安装教程【配有安装包】

Anaconda安装包下载链接:Anaconda windows64位安装包链接提取码:lyq6Anaconda安装步骤以管理员身份打开安装程序点击Next点击 I Agree选择用户使用权限,这里没有特殊要求,所以我选择了all Users,然后选择next选择安装目录,点击next此步骤什么都不选择,点击Install 安装成功点击next验证是否安装成功点击打开下图圈红的文件输入conda验

文章图片
#python#机器学习
数据仓库【建模】

数据仓库建模流程选择业务流程声明粒度确认维度确认事实选择业务流程确认哪些业务处理流程时数据仓库应该覆盖的例如:了解和分析一个商店的销售情况记录方式使用纯文本使用业务流程建模标注(BPMN)方法使用同一建模语言(UML)声明粒度粒度概述粒度问题时设计数据仓库的一个最重要方面。粒度时指数据仓库的数据单位中保存数据的细化或综合成都的级别。细化程度越高,粒度就越小;相反,细化程度越低,粒度级就越大。数据的

#数据仓库#大数据
spark三种模式【Standalone 模式、yarn 运行模式、local(本机)】

Standalone 模式standalone模式也叫作独立模式,自带完整的服务,可单独部署到一个集群中,无序依赖任何其他资源管理系统。 从一定程度上来说,该模式是其他两种模式的基础。借鉴Spark开发模式,我们可以得到一种开发新型计算框架的一般思路:先设计出它的standalone模式,为了快速开发,期初不需要考虑服务(比如master、slaves)的容错性,之后开发相应的wrapper,将s

#spark
sqoop导出mysql数据到hive中,因mysql中string类型字段中含有换行符导致拉取到hive,格式不正确,出现错误等现象

问题描述sqoop拉取mysql数据到hive中出现现象mysql数据到hive结构不对了,被打散了,变成一行一行中只有第一列有数据,其他均为null。或者压根就直接报错sqoop Opening field-encloser expected at position 0出现原因因为mysql某个字段中出现换行符,导致数据拉取时出现还没有拉去完直接进行了换行,算作下一行数据的开头。解决办法再sqo

    共 23 条
  • 1
  • 2
  • 3
  • 请选择