logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

数据湖之Hudi(15):Apache Hudi 中表的存储类型

目录0. 相关文章链接1. 总述2. 数据计算模型2.1.批式模型(Batch)2.2. 流式模型(Stream)2.3. 增量模型(Incremental)3. 查询类型(Query Type)3.1.快照查询(Snapshot Queries)3.2.增量查询(Incremental Queries)3.3.读优化查询(Read Optimized Queries)4. Hudi中的表类型4.

#大数据
数据湖之Hudi(6):Hudi与Spark和HDFS的集成安装使用

目录0. 相关文章链接1. 编译Hudi源码1.1. Maven安装1.2. 下载并编译hudi2. 安装HDFS3. 安装Spark4. 在spark-shell中运行hudi程序主要介绍的Apache原生的Hudi、HDFS、Spark等的集成使用0. 相关文章链接大数据基础知识点 文章汇总1. 编译Hudi源码虽然对hudi的下载编译在博主的另一篇博文里有介绍,但这里是系统的介绍Hudi的体

#大数据#spark#hadoop
Hive(14):Hive调优之Explain查看执行计划

其他Hive相关系列文章链接由此进 ->添加关键词 extended。1)没有生成MR任务的。2)有生成MR任务的。

#hive#大数据
推荐系统(11):推荐系统评测之精确率和召回率

目录0. 相关文章链接1. 什么是准确率、精确率和召回率2. 准确率、精确率和召回率详解0. 相关文章链接推荐系统文章汇总1. 什么是准确率、精确率和召回率2. 准确率、精确率和召回率详解考虑一个二分问题,即将实例分成正类(positive)或负类(negative)。对一个二分问题来说,会出现四种情况。如果一个实例是正类并且也被 预测成正类,即为真正类(True positive),如果实例是负

#机器学习
推荐系统(4):推荐系统分类

目录0. 相关文章链接1. 根据实时性分类1.1. 离线推荐1.2.实时推荐2.根据推荐是否个性化分类3. 根据推荐原则分类4.根据数据源分类4.1.基于人口统计学的推荐4.2.基于内容的推荐4.3.基于协同过滤的推荐0. 相关文章链接推荐系统文章汇总1. 根据实时性分类1.1. 离线推荐离线推荐服务是综合用户所有的历史数据,利用设定的离线统计算法和离线推荐算法周期性的进行结果统计与保存,计算的结

FlinkSQL+HDFS+Hive+SparkSQL实现业务数据增量进入数据仓库

目录0. 相关文章链接1. 为什么要实现将业务数据实时写入到数据仓库中2.架构设计3.FlinkSQL将binlog写入到HDFS中4.创建增量外部表(binlog表)5.创建全量历史表6.创建Spoop任务同步商品表数据7.历史数据和增量数据合并8.Java的nanoTime()9.创建视图完成按分钟级别更新数仓中的业务表10.创建定时调度作业11.总结0. 相关文章链接开发随笔文章汇总1. 为

#数据仓库
数据湖之Hudi(4):Apache Hudi 快速发展

目录0. 相关文章链接1. Hudi 诞生2.发展历史3. 各版本新特性4.新架构:湖仓一体0. 相关文章链接大数据基础知识点 文章汇总1. Hudi 诞生Apache Hudi由Uber开发并开源,该项目在2016年开始开发,并于2017年开源,2019年1月进入 Apache 孵化器,且2020年6月称为Apache 顶级项目,目前最新版本:0.9.0版本。Hudi 一开始支持Spark进行数

#大数据
hive中多表full join主键重复问题

目录0. 其他1. 问题描述2. 问题复现2.1. 建表语句2.2. 插入数据2.3. 查询SQL以及问题3. 问题原因4. 问题解决0. 相关文章链接开发随笔文章汇总1. 问题描述在Hive中(其他类似SQL,比如PostgreSQL可能也存在此问题),当对多张表(3张及以上)进行full join时,会存在每张表的主键都是唯一,但当full join后,会发现主键可能有重复。2. 问题复现2.

#hive#大数据#sql
Hadoop(18):MapReduce框架原理之数据清洗(ETL)

目录0. 相关文章链接1. 数据清洗(ETL)概述2. 需求3. 需求分析4. 实现代码0. 相关文章链接Hadoop 文章汇总1. 数据清洗(ETL)概述“ETL,是英文Extract-Transform-Load的缩写,用来描述将数据从来源端经过抽取(Extract)、转换(Transform)、加载(Load)至目的端的过程。ETL一词较常用在数据仓库,但其对象并不限于数据仓库。在运行核心业

#mapreduce#hadoop#etl +2
机器学习:Mahout协同过滤算法

1、推荐系统1.1、什么是推荐系统为了解决信息过载和用户无明确需求的问题,找到用户感兴趣的物品,才有了个性化推荐系统。1.2、推荐系统业务流程推荐系统广泛存在于各类网站中,作为一个应用为用户提供个性化的推荐。它需要一些用户的历史数据,一般由三个部分组成:基础数据、推荐算法系统、前台展示。基础数据包括很多维度,包括用户的访问、浏览、下单、收藏,用户的历史订单信息,评...

#推荐算法
    共 52 条
  • 1
  • 2
  • 3
  • 6
  • 请选择