
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Spark中Shuffle阶段的优化方法,包括调整参数spark.shuffle.sort.bypassMergeThreshold控制排序,spark.shuffle.file.buffer调整缓冲区大小等策略
Spark-SQL任务提交方式的介绍和提交代码举例,按不同的资源管理模式分别说明。Spark-SQL的交互式模式可以按照类似hive方式写SQL代码。Spark SQL一般依赖Hive的元数据。
大模型与人工智能的区别与联系,包括NLP、LLM、AIGC、AGI、GPT、ChatGPT等的介绍及应用范畴等。同时列举了主要AI产品,比如DeepSeek,ChatGPT、豆包、通义千问等。
数据源来自于Kafka的Json结构数据,数据结构为源头不断更新的小时报表,Flink的任务是消费Kafka主题数据,然后经过过滤、解析、去重、聚合等计算,最后将结果写入到MySQL表中。
Flink-SQL中,事实表(又称为流表)和维表连接的计算规则与两条流连接是不同的,两条流连接必须有时间属性和窗口的约束,否则状态会无限膨胀。维表一般是静态或缓慢变化的,Flink不会把维表全部加载进状态,而是连接时查询当前ID的最新值,也可设置缓存进行延迟优化等。
Clickhouse数据库的特点和优势介绍,包括Clickhouse的结构原理、查询和写入性能、分布式架构、适用场景等的介绍。
ClickHouse提供4类表引擎,分别支持不同场景。包括Log、MergeTree、Special、Integrations系列引擎。对各类引擎进行介绍和总结。最后举例说明建表的SQL脚本。
ClickHouse提供系统表查询数据库的状态,包括服务器环境、数据库信息、表信息、列信息、函数、配置等信息,系统表位于system数据库中。另外ClickHouse提供了兼容SQL标准的information_schema系统数据库,用于查看数据库对象的元数据。
ClickHouse可用参数join_use_nulls设置JOIN行为的类型。在合并表时,可能会出现空值,即左表或右表有NULL值。ClickHouse根据此设置以不同的方式填充它们。
ClickHouse可用参数prefer_column_name_to_alias启用或禁用在查询表达式和子句中使用原始列名而不是别名。尤其是在别名与列名相同的情况下。







