logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CloudMatrix384 超节点:下一代分布式计算架构解析

CloudMatrix384 超节点是一种面向大规模分布式计算场景的高性能、高可用计算单元。它通常由 384 个计算核心、高速互联网络和分布式存储模块组成,旨在为 AI 训练、科学计算、大数据分析等计算密集型任务提供强大的算力支持。CloudMatrix384 超节点代表了当前分布式计算架构的前沿方向,它通过硬件与软件的协同创新,为计算密集型应用提供了强大的基础设施。随着技术的不断成熟,这类超节点

#java
AGENTS.md - 智能体(Agents)技术指南与实现

在人工智能和软件工程领域,智能体(Agents)是指能够感知环境、自主决策并执行行动以实现特定目标的软件实体。与传统的程序不同,智能体具有自主性、反应性、主动性和社会性等特征。

#java
MateBase:新一代开源向量数据库全面介绍

MateBase 是一款面向 AI 应用的新一代开源向量数据库,专为处理大规模向量数据而设计。它提供了高性能的向量相似性搜索、实时数据更新和分布式部署能力,能够有效支撑 RAG(检索增强生成)、推荐系统、图像检索、语义搜索等 AI 场景。MateBase 作为一款新兴的开源向量数据库,在高性能、易用性和可扩展性之间取得了良好平衡。对于需要自建向量检索能力、注重数据主权和成本控制的团队来说,它是一个

#数据库
sparkSQL读取数据的方式

Spark SQL 提供了多种灵活的数据读取方式,支持多种数据源格式。以下是核心读取方法及示linux环境下,按照如下方式进行# 进入目录# 上传jar包:mysql-connector-java-5.1.32.jar。

#spark
Spark的容错机制

Spark的容错机制主要通过以下核心设计实现:各个软件为了防止数据丢失都有哪些解决方案- a. 操作日志:将内存变化操作日志追加记录在一个文件中,下一次读取文件对内存重新操作- NAMENODE:元数据的操作日志记录在edits- MySQL:日志记录binlog ()- b. 副本机制:将数据构建多份冗余副本- HDFS:构建每个数据块的3个副本- c. 依赖关系:每份数据保留与其他数据之间的一

#spark#大数据#分布式
LakeFormation:AWS 数据湖治理服务详解

AWS Lake Formation 是一项完全托管的服务,可帮助您快速、安全地构建、保护和管理数据湖。它简化了数据湖的创建过程,并提供了精细化的数据访问控制和治理能力。AWS Lake Formation 大大降低了构建和管理数据湖的复杂性,通过统一的治理框架帮助企业安全、高效地利用数据资产。无论是初创公司还是大型企业,都可以通过 Lake Formation 快速构建符合业务需求的数据湖解决方

#aws#云计算
数据仓库建模概念

如果把数据看作图书馆里的书,我们希望看到它们在书架上分门别类地放置;如果把数据看作城市的建筑,我们希望城市规划布局合理;如果把数据看作电脑文件和文件夹,我们希望按照自己的习惯有很好的文件夹组织方式,而不是糟糕混乱的桌面,经常为找一个文件而不知所措。数据仓库中就是存放了大量的规矩数据,非常清晰明了。数据模型就是数据组织和存储方法,它强调从业务、数据存取和使用角度合理存储数据。只有将数据有序的组织和存

#数据仓库#spark#大数据
Spark介绍

Spark是一个开源的大规模数据处理框架,由加州大学伯克利分校AMPLab开发,后成为Apache顶级项目。它通过内存计算和高效调度机制,显著提升了大数据处理速度,尤其适合迭代式算法和交互式分析场景。实现离线数据批处理:类似于MapReduce、Pandas,写代码做处理:代码类的离线数据处理。实现交互式即时数据查询:类似于Hive、Presto、Impala,使 用SQL做即席查询分析:SQL类

#spark#大数据#分布式
SparkSQL读取普通文件的方式

SparkSQL 读取普通文件(如 CSV、JSON、文本文件等)主要通过的readAPI 实现。

#javascript#前端#开发语言
spark读取table中的数据【hive】

Hive中的表存在哪里?元数据--MySQL , 启动metastore服务即可。本质上:SparkSQL访问了Metastore服务获取了Hive元数据,基于元数据提供的地址进行计算。

#spark#hive#大数据
    共 115 条
  • 1
  • 2
  • 3
  • 12
  • 请选择