
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
背景:flink的datastream部署到线上时,发现数据只能写入到kafka的一些分区,其他分区没有数据写入。当把flink的并行度设置大于等于kafka的分区数时,kafka的分区都能写入数据。于是研究了一下源码。FlinkFixedPartitioner源码:package org.apache.flink.streaming.connectors.kafka.partitioner;im
一个任务发现延迟,并且 每个subtask的延迟程度不同 假设source(kafka/sls)有 30个subtask,最慢的延迟1小时,最快的延迟5分钟,作业消费方式是timestamp,且此时需要修改有状态的并行度(即无法通过暂停恢复),下游存储没法update(kafka/odps这类),那 这个作业要如何操作才能在调整资源停止作业重新启动的同时保证下游收到的结果准确。1、把timesta
1,负载均衡。目前我们公司后台使用clickhouse,来做数据的离线分析;配置为四台集群(shard)通过springboot+clickhouse-jdbc完成服务与clickhouse jdbc的连接;使用的是clickhouse官方,BalancedClickhouseDataSource(urls,properties),做到四台服务之间的负载均衡;网上很多资料都表示这个包虽然可以做到一
[] - Step 8: rolling back transaction after abort2021-06-04 17:18:57,132 ERROR io.debezium.connector.mysql.SnapshotReader[] - Failed due to error: Aborting snapshot due to error when last running 'SEL
1、flink线上操作redis ,跑一段时间 ,会出现错误代码如下:2021-02-03 01:24:42redis.clients.jedis.exceptions.JedisConnectionException: java.net.SocketTimeoutException: Read timed outat redis.clients.util.RedisInputStream.ens
1,执行插入order_info表调度是,查看调度任务发生的运行状态,发现order_info表运行失败,导致后续所有依赖该任务暂停。2.查看具体order_info任务的日志,发现该表被锁了,导致数据无法alter table 、rename、insert等操作3. 进行任务重跑,所有发生锁表的任务任务都处于等待状态3.1:为了不影响重要指标产出先将order_info的依赖任务取消,采用优先将
1、http请求,很容易网络抖动,所以加上超时可以解决这种问题public static String doHttpPost(String uri, JSONObject jsonObject) {CloseableHttpResponse response = null;try {HttpPost httpPost = new HttpPost(uri);RequestConfig config
1,mvn deploy:deploy-file -Dmaven.test.skip=true -Dfile=D:\flink\flink-1.9.0\lib\flink-table_2.11-1.9.0.jar -DgroupId=org.apache.flink -DartifactId=flink-table_2.11 -Dversion=1.9.0 -Dpackaging=jar -Dr.
有时生产上会按指定时间消费kafka的数据,具体日志如下:
1、线上有一个任务状态比较大,做checkpoint的时候大约有100G左右,任务在做到10G左右的时候会报错2、报错日志如下:第二个错误日志:2022-04-16 00:05:23org.apache.flink.runtime.io.network.partition.consumer.PartitionConnectionException: Connection for partition








