logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

spark3 本地读hive 1.1.0版本,解决版本兼容问题

Spark3 读 hive 1.1.0 遇到的问题Exception in thread "main" org.apache.spark.sql.AnalysisException: org.apache.hadoop.hive.ql.metadata.HiveException: Unable to fetch table test1. Invalid method name: 'get_tab

文章图片
#hive#大数据#spark
数据仓库的复用性:主题域设计的详细方案

主题域设计是数据仓库建设的核心环节,其目标是提升数据复用性和共享性,降低开发和维护成本。在实施过程中,要结合具体业务场景合理划分域,并通过清晰的边界、标准化的接口和高效的数据治理机制,确保数据仓库的高质量和灵活性。与业务团队深入沟通,明确核心业务模块及关键数据需求。为每个主题域定义其管理的数据范围和边界,确保各主题域互不重叠但相互协作。将核心业务模块转换为主题域,每个主题域独立存放一个业务范围内的

文章图片
#数据仓库#大数据
Couchbase 存储引擎介绍:Couchstore和Magma

均为 Couchbase 提供持久化存储、支持基本数据库操作;在架构设计、内存需求、数据密度支持和写入性能上存在显著差异——Couchstore 更适用于内存友好型、数据量较小的场景,而 Magma 针对大规模数据和写入密集型场景进行了优化,能够在低内存占用下提供更高的磁盘 I/O 性能和更低的写放大。这种设计权衡使得 Couchbase 可以根据实际使用场景选择更合适的存储引擎,从而在性能和资源

文章图片
#数据库
实时数仓:数据湖 + Flink当前实时数仓中非常主流且高效的方案之一

是的,是当前实时数仓中非常主流且高效的方案之一,特别是在需要处理海量数据、实时分析和低延迟查询的场景下。这种方案结合了数据湖的弹性存储能力和 Flink 的强大实时计算能力,解决了传统数据仓库在实时性和灵活性方面的不足。

文章图片
#flink#大数据
Couchbase 简介

Couchbase 是一款分布式 NoSQL 数据库,主要用于现代应用程序中高性能、高可扩展性和灵活的数据存储需求。它结合了文档存储和键值存储的特性,为开发者提供了一种高效的数据库解决方案。Couchbase 是为现代应用设计的一种高性能、可扩展且灵活的数据库解决方案,如果项目需要高性能、分布式架构、灵活数据建模,它是一个值得考虑的选择。

maven命令行下载依赖

maven项目中错误,使用maven reimport 不能解决,试试maven命令行下载依赖。

#maven#java#spring
ssm框架使用druid数据库连接池(带事务配置和session监听)

ssm框架配置mybatis数据库事务,使用druid管理数据库连接池,监听session

Spark分布式计算中Shuffle Read 和 Shuffle Write的职责和区别

在 Spark 的分布式计算中,和是两个与数据重新分区和分发相关的重要阶段。通常只涉及本地磁盘写操作,不涉及网络传输。:当下游任务需要的数据分布在其他节点时,会涉及网络传输。Shuffle 主要由groupByKey。

文章图片
#spark#大数据
Dify 配置用户名和密码

要自定义和管理用户名 & 密码,可以通过以下方式进行设置。如果你需要修改用户名(邮箱)或密码,可以直接在数据库中操作。如果你正在搭建 Dify 并希望。存储的,不能直接存储明文密码。在默认情况下,Dify 的。Dify 的用户数据存储在。文件中添加默认管理员账号。,在 Web 页面访问。这样,就可以安全地管理。

文章图片
#人工智能
大数据治理领域:数据仓库建模-表名和字段名标准化的一些常见规则和建议

使用下划线(snake_case)或大写字母加下划线(UPPERCASE_SNAKE_CASE)作为分隔符,以便与其他系统兼容,并确保表名可读性。对于涉及度量单位的字段,尽量标明单位,例如 price_usd、amount_cny,避免直接使用 price 或 amount,造成单位不明确。对于涉及时间的字段,最好使用一致的命名规则,并且注明字段的类型(如创建时间、更新时间、到期时间等)。避免使用

文章图片
#大数据#数据仓库
    共 68 条
  • 1
  • 2
  • 3
  • 7
  • 请选择