
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
delete操作应用虽然不多,但是有些场景使用起来还是更方便。所以对于一些大表,有时还是需要 硬删操作,也就是delete操作 。delete from table_a where id in (select id from table_b); 不需要新增索引,经过sql 优化后性能提升了100倍
最近在做数仓宽表开发时,发现某些表的在hadoop(命令:hdfs dfs -ls)上小文件特别多,整体数据量不大,每个分区却有几百个小文件。一个小文件需要在nameNode中维护一份元数据(目录、大小、权限等信息) ,占用的资源是 150字节(Byte),100个小文件则占用 14.6KB。本文介绍如何使用 COALESCE 和 REPARTITION 来解决这种问题
在编写sql代码时,需要尽量少使用 笛卡尔积,但是有些特殊场景下很难找到代替方案。这里分享了 在进行spark sql 编写任务作业时遇到笛卡尔积导致执行慢的问题,并记录了解决方案
delete操作应用虽然不多,但是有些场景使用起来还是更方便。所以对于一些大表,有时还是需要 硬删操作,也就是delete操作 。delete from table_a where id in (select id from table_b); 不需要新增索引,经过sql 优化后性能提升了100倍
最近在开发过程中,由于涉及的库太多,有时候知道关联的列名 或者表名,找不到源库了。所以整理了下面的文章,希望对你有帮助。有用的话记得点赞哟~~~**1、通过表名找到所在库**例子:有一张 STUDENT_BASE_INFO 表,但是库太多了,不知道在哪个库。执行sql:select * from all_tables where table_name = 'STUDENT_BASE_INFO';结
delete操作应用虽然不多,但是有些场景使用起来还是更方便。所以对于一些大表,有时还是需要 硬删操作,也就是delete操作 。delete from table_a where id in (select id from table_b); 不需要新增索引,经过sql 优化后性能提升了100倍
问题背景某天 跑 sparkSQL 的时候,遇到报错:org.apache.spark.SparkException: Job aborted.at org.apache.spark.sql.execution.datasources.FileFormatWriter.write(FileFormatWriter.scala:198)atorg.apache.spark.sql.hive.exec
token单点登入原理及实现过程什么是单点登入(SSO)token单点原理安全性代码演示什么是单点登入(SSO)首先举个例子:对于某个银行系统,本身有开发自己的系统,比如门户之类的。最近有新的新的需求,比如数据分析的业务需求,于是购买了一套数据分析系统、,之后又上线了一套贷款系统等等,如下图。那么用户在在登入操作的时候,就会面临一个问题,多个系统之间是不是需要登入多次呢?比如我从门户页面进入系统,
本文介绍了如何使用chatgpt进行绘画,通过输入一句话,生成一张图片。








