logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

基于阿里云linux服务器登录hadoop的网址http://localhost:9870/

在阿里云linux服务器上搭建了hadoop的Pseudo-Distributed Operation,可通过两种方式登录http://localhost:9870/,从linux云服务器登录:此处若想直观看到可视化网页,需要先配置linux的可视化图形界面https://help.aliyun.com/knowledge_detail/41227.html?spm=从windows登录...

#服务器#linux#hadoop +1
大数据面试问答-Kafka/Flink

分布式流数据平台,核心解决三大问题:高吞吐的实时数据管道:支持每秒百万级消息处理。持久化的消息队列:消息持久化到磁盘,支持多订阅者。流式数据处理:与 Flink/Spark Streaming 集成,实现实时计算。

文章图片
#大数据#面试#kafka
大数据面试问答-NoSQL与MPP

HBase是构建在Hadoop HDFS之上的分布式NoSQL数据库,采用列式存储模型,支持海量数据的实时读写和随机访问。适用于高吞吐、低延迟的场景,如实时日志处理、在线交易等。RowKey(行键)定义:表中每行数据的唯一标识,类似于关系数据库的主键。特点:数据按 RowKey 的字典序全局排序。所有查询必须基于 RowKey 或范围扫描(Scan)。(用户ID + 订单ID)。Region(区域

文章图片
#大数据#面试#hbase
用python给女朋友写了个自动提醒的程序

事件背景是经常有很多琐碎的事情需要在某个时间点去做,光靠人力去记,容易出现偏差,尤其是对容易迷糊的选手。所以动手写了一套代码,可以按需要通过微信发送消息,不论是给自己充当自动提醒的备忘录还是给其他人发送定时消息,都可以在这套代码的基础上实现。首先放上最终成果示例:图中的文字都是可以根据自身需要而进行修改的,所以文章中附上的代码也只是抛砖引玉,读者可以根据自身需要而进行调整。本篇文章会分三个部分,依

#python#爬虫#微信公众平台 +1
Spark专题-第一部分:Spark 核心概述(2)-Spark 应用核心组件剖析

理解 Spark 的执行模型是掌握其性能调优的关键。Spark 采用了三层执行模型:fill:#333;color:#333;color:#333;fill:none;Job 1Job 2Job NStage 1-1Stage 1-2Task 1-1-1Task 1-1-2Task 1-1-NTask 1-2-1Task 1-2-2Task 1-2-N定义与关系Job(作业)由 Action 操作

#spark#大数据#big data
Spark专题-第二部分:Spark SQL 入门(1)-Spark SQL 简介

Spark SQL 是 Apache Spark 中用于处理结构化数据的模块。它提供了一个名为 DataFrame 的编程抽象,并且可以与 Spark 生态系统中的其他组件无缝集成。核心价值主张Spark SQL 让你能够使用 SQL 查询或 DataFrame API 来查询 Spark 程序内的结构化数据。fill:#333;color:#333;color:#333;fill:none;Sp

#spark#sql#大数据 +1
Spark专题-第二部分:Spark SQL 入门(2)-算子介绍-Scan/Filter/Project

Scan:负责从数据源读取数据,支持分区剪枝和列裁剪Filter:负责应用WHERE条件过滤数据行,支持谓词下推Project:负责选择最终输出的字段,支持表达式计算希望这种将sql与算子对应起来的讲解方式,能更好的让读者理解,这一篇涉及的不论是sql还是算子都是基础款,后续会一点一点增加复杂程度。

#spark#sql#大数据 +2
Spark专题-第二部分:Spark SQL 入门(3)-算子介绍-Aggregate

在Spark SQL中,Aggregate算子用于处理分组和聚合操作,是数据处理中的关键步骤。它通常出现在执行计划中,当查询包含GROUP BY子句或聚合函数时。Aggregate算子负责将数据分组并计算聚合值(如总和、计数、平均值等)。根据数据特性、内存配置和Spark版本,Spark会选择不同的聚合策略,主要包括和。理解这些类型有助于优化查询性能。Aggregate算子是Spark SQL中处

#spark#sql#大数据 +2
    共 28 条
  • 1
  • 2
  • 3
  • 请选择