
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
@羲凡——只为了更好的活着Flink 窗口函数处理数据(Watermark和SideOutput)统计过去5分钟内的一些数据是流处理中最常见的一种模式。这就涉及到经典的一个问题——数据延迟或乱序怎么办?Flink,针对数据延迟或乱序有几个重要的解决思路,1.添加水位线Watermark2.推迟关闭窗口时间3.超时数据的side输出下面的例子是,统计10s内的数据,水位线位2s,窗口再延迟4s关闭,
@羲凡——只为了更好的活着Spark 机器学习——ALS算法1.什么是ALS算法?ALS是交替最小二乘法(Alternate Least Square),其中LS是大家最熟知的最小二乘法(Least Square),所以ALS和最小二乘法脱不了干系。百度上的解释,(在矩阵分解(matrix factorization)中使用的一种算法。有一个稀疏矩阵,假设这个矩阵是低阶的,可以分解成两个小矩...
@羲凡——只为了更好的活着Spark2.3.2 HA安装(spark on yarn 模式)spark主要有四种运行模式local(本地运行)、standalone(Spark自带的资源管理框架)、yarn(将spark应用类似mr一样,提交到yarn上运行)、mesos(类似yarn的一种资源管理框架),其对应的安装方法各不相同,本文主要介绍spark on yarn的安装。前提是默认你已经..
@羲凡——只为了更好的活着DolphinScheduler docker-compose安装(配置邮件)前期准备安装 docker安装 docker-compose安装快速试用 Docker 部署 官方文档1.下载mkdir -p /opt/modules/dolphinschedulercd /opt/modules/dolphinschedulerwget https://mirrors.tu
@羲凡——只为了更好的活着踩坑——Sqoop报错ERROR tool.ExportTool: Error during export控制台打印的报错是19/04/19 20:17:09 ERROR mapreduce.ExportJobBase: Export job failed!19/04/19 20:17:09 ERROR tool.ExportTool: Error during ...
@羲凡——只为了更好的活着踩坑——Flink报错 找不到org.apache.flink.streaming.api.scala.StreamExecutionEnvironment的类文件一.问题背景新建一个项目,准备用java写flinktable,发现报错如下Error:(20, 58) java: 无法访问org.apache.flink.streaming.api.scala.S...







