
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
@羲凡——只为了更好的活着Neo4j 完整版安装——neo4j-3.5.61.下载地址如下:https://neo4j.com/download-center/#community2.解压和配置环境变量tar -zxf neo4j-community-3.5.6-unix.tar.gz -C ../sudo vi /etc/profile#neo4jexport NEO4J_...
@羲凡——只为了更好的活着Doris hdfs数据导入doris动态分区表本文重点1.动态分区表创建2.读取路径作为分区参数3.预聚合增加count列——set (cnt = 1)4.broker load 的 hdfs HA 配置前期准备1.安装好doris——Doris 编译安装(完整版)2.doris基本知识扫盲Doris的数据模型主要分为3类:Aggregate、Duplicate、Uni
@羲凡——只为了更好的活着Sqoop 使用——将mysql数据导入到hive分区表前期准备a./etc/profile添加export HADOOP_CLASSPATH=$HADOOP_CLASSPATH:$HIVE_HOME/lib/*b.将hive-site.xml 拷贝到 $SQOOP_HOME/conf目录下(否则报错找不到hive库)0.参数说明--connect #关系型数...
@羲凡——只为了更好的活着Flink 消费kafka数据写入hbase一.前提准备1.创建Hbase表create 'test_20191122','info'2.pom.xml文件中要添加依赖<dependency><groupId>org.apache.hbase</groupId><artifactId>hbase-cli...
@羲凡——只为了更好的活着Flink 窗口函数处理数据(Watermark和SideOutput)统计过去5分钟内的一些数据是流处理中最常见的一种模式。这就涉及到经典的一个问题——数据延迟或乱序怎么办?Flink,针对数据延迟或乱序有几个重要的解决思路,1.添加水位线Watermark2.推迟关闭窗口时间3.超时数据的side输出下面的例子是,统计10s内的数据,水位线位2s,窗口再延迟4s关闭,
@羲凡——只为了更好的活着Spark 机器学习——ALS算法1.什么是ALS算法?ALS是交替最小二乘法(Alternate Least Square),其中LS是大家最熟知的最小二乘法(Least Square),所以ALS和最小二乘法脱不了干系。百度上的解释,(在矩阵分解(matrix factorization)中使用的一种算法。有一个稀疏矩阵,假设这个矩阵是低阶的,可以分解成两个小矩...
@羲凡——只为了更好的活着Spark2.3.2 HA安装(spark on yarn 模式)spark主要有四种运行模式local(本地运行)、standalone(Spark自带的资源管理框架)、yarn(将spark应用类似mr一样,提交到yarn上运行)、mesos(类似yarn的一种资源管理框架),其对应的安装方法各不相同,本文主要介绍spark on yarn的安装。前提是默认你已经..
@羲凡——只为了更好的活着DolphinScheduler docker-compose安装(配置邮件)前期准备安装 docker安装 docker-compose安装快速试用 Docker 部署 官方文档1.下载mkdir -p /opt/modules/dolphinschedulercd /opt/modules/dolphinschedulerwget https://mirrors.tu
@羲凡——只为了更好的活着踩坑——Sqoop报错ERROR tool.ExportTool: Error during export控制台打印的报错是19/04/19 20:17:09 ERROR mapreduce.ExportJobBase: Export job failed!19/04/19 20:17:09 ERROR tool.ExportTool: Error during ...
@羲凡——只为了更好的活着踩坑——Flink报错 找不到org.apache.flink.streaming.api.scala.StreamExecutionEnvironment的类文件一.问题背景新建一个项目,准备用java写flinktable,发现报错如下Error:(20, 58) java: 无法访问org.apache.flink.streaming.api.scala.S...







