logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

clickhouse查询排查优化学习心得

摘要:日志分析发现ClickHouse执行包含通配符的LIKE查询(如'wget%http%'和'%base64%')时出现性能问题。查询按event_time筛选但表按receive_time分区,导致全表扫描1000万+行。执行时间从34秒增至40秒,显示系统负载累积。分析表明:1)分布式表机制导致读取行数统计失真;2)通配符LIKE效率低;3)高并发时CPU争抢严重;4)内存压力增大。优化建

#clickhouse#大数据
神经网络关于训练集数据量越大,效果越好的误解

@TOC之前一直想不通为什么训练集为什么一直需要越大越好?通常来说,训练喂的数据越多,预测应该越好吧。最好,用交叉验证确认一下也有可能训练样本量大,数据特征较多,但网络层次太少,特征训练不充分,预测结果变差,这样才对啊。随着慢慢的学习,数据量越大效果越好,这前提是网络提取特征能力不能太差,效果的好坏是有多方面因素的。多方面因素我还没理解透每一方面具体的体现。如有不正确的,还望指教。嘻嘻,学无止境啊

#cnn
到底了