
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文通过一个具体案例,说明 flink sql 如何实现 connector 加载、source/sink 端操作、数据库连接等。可以帮助大家了解其原理,并在代码中找到落库执行SQL生成逻辑,得到where条件并没有下推到库执行的结论。
大数据开发过程中,难免需要上传手工数据到表中,这里介绍常见的几种上传方法。1、txt 上传hivea、首先注意解决乱码问题,需要将txt另存成 udf-8。只需要用记事本打开,然后另存即可。b、在hive上建表(txt 文件的数据是用 逗号 “,” 隔开的)c、将 txt 文件上传到服务器中,然后执行下面的sql:如果需要覆盖原来的table,执行下面的语句:2、xlsx(excel )表格类文件
maven打包时,lib文件夹下的jar无法加载(程序包不存在)程序能正常run、debug,但是使用maven进行 package打包时,却出现" java: 程序包xxxx不存在"的问题。解决办法如下:在pom.xml中加入如下代码:<plugin><groupId>org.apache.maven.plu...
最新开发的业务中,涉及到计算两个经纬度之间的距离。已知A点和B点的 经纬度,计算A点到B点之间的距离。最开始使用的是Haversine公式来进行计算,但上线后出现严重的性能问题,主要原因是业务数据量太大,每天PB级的数据量。因此,需要研究一个更高效便捷的计算方法,下面将介绍Haversine公式和实现代码,以及新的计算公式&代码,并对他们的性能及精度进行分析。

delete操作应用虽然不多,但是有些场景使用起来还是更方便。所以对于一些大表,有时还是需要 硬删操作,也就是delete操作 。delete from table_a where id in (select id from table_b); 不需要新增索引,经过sql 优化后性能提升了100倍
最近在做数仓宽表开发时,发现某些表的在hadoop(命令:hdfs dfs -ls)上小文件特别多,整体数据量不大,每个分区却有几百个小文件。一个小文件需要在nameNode中维护一份元数据(目录、大小、权限等信息) ,占用的资源是 150字节(Byte),100个小文件则占用 14.6KB。本文介绍如何使用 COALESCE 和 REPARTITION 来解决这种问题
在编写sql代码时,需要尽量少使用 笛卡尔积,但是有些特殊场景下很难找到代替方案。这里分享了 在进行spark sql 编写任务作业时遇到笛卡尔积导致执行慢的问题,并记录了解决方案
delete操作应用虽然不多,但是有些场景使用起来还是更方便。所以对于一些大表,有时还是需要 硬删操作,也就是delete操作 。delete from table_a where id in (select id from table_b); 不需要新增索引,经过sql 优化后性能提升了100倍
最近在开发过程中,由于涉及的库太多,有时候知道关联的列名 或者表名,找不到源库了。所以整理了下面的文章,希望对你有帮助。有用的话记得点赞哟~~~**1、通过表名找到所在库**例子:有一张 STUDENT_BASE_INFO 表,但是库太多了,不知道在哪个库。执行sql:select * from all_tables where table_name = 'STUDENT_BASE_INFO';结
delete操作应用虽然不多,但是有些场景使用起来还是更方便。所以对于一些大表,有时还是需要 硬删操作,也就是delete操作 。delete from table_a where id in (select id from table_b); 不需要新增索引,经过sql 优化后性能提升了100倍







