logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

深度解析Claude Code 51万行源码背后的设计实现

ClaudeCode源代码意外泄露事件揭示AI产品核心竞争力:Anthropic的51万行代码暴露了其AI编程工具的系统级设计理念。核心在于构建围绕大模型的分层体系,包括查询引擎、工具抽象层和记忆系统。关键创新包括:任务驱动的长生命周期处理、统一工具接口、四层记忆架构、AI项目管理机制,以及极致的token优化策略。真正的护城河并非代码本身,而是隐藏在自然语言指令中的产品哲学,包括如何管理AI协作

#生成式AI
spark-sql 与hive 常用函数

如trunc('2019-03-06','MM')='2019-03-01',trunc('2019-03-06','YYYY')='2019-01-01'lpad():左填充。date_add(date1,int1):返回日期date1加上int1的日期,如date_add('2019-03-06',1)='2019-03-07'date_sub(date1,int1):返回日期date1减去i

文章图片
#spark#sql#hive
如何扩展Spark Catalyst,抓取spark sql 语句,通过listenerBus发送sql event以及编写自定义的Spark SQL引擎

我们可以实现特定的SQL方言,针对特殊的数据源做更深入的优化,进行SQL规范检查,针对特定执行环境制定特定的优化策略等等。Spark Catalyst的SQL处理分成parser,analyzer,optimizer以及planner等多个步骤,其中analyzer,optimizer等步骤内部也分为多个阶段,以Analyzer为例,analyse规则切分到不同的batch中,每个batch的执行

文章图片
#spark#sql#大数据
深度解析Claude Code 51万行源码背后的设计实现

ClaudeCode源代码意外泄露事件揭示AI产品核心竞争力:Anthropic的51万行代码暴露了其AI编程工具的系统级设计理念。核心在于构建围绕大模型的分层体系,包括查询引擎、工具抽象层和记忆系统。关键创新包括:任务驱动的长生命周期处理、统一工具接口、四层记忆架构、AI项目管理机制,以及极致的token优化策略。真正的护城河并非代码本身,而是隐藏在自然语言指令中的产品哲学,包括如何管理AI协作

#生成式AI
flink 流式处理中如何集成mybatis框架

flink 中自身虽然实现了大量的connectors,如下图所示,也实现了jdbc的connector,可以通过jdbc 去操作数据库,但是flink-jdbc包中对数据库的操作是以ROW来操作并且对数据库事务的控制比较死板,有时候操作关系型数据库我们会非常怀念在java web应用开发中的非常优秀的mybatis框架,那么其实flink中是可以自己集成mybatis进来的。 我们这里以flin

springcloud/springboot集成NACOS 做注册和配置中心以及nacos源码分析

Spring Cloud 是一系列框架的有序集合如服务发现注册、配置中心、消息总线、负载均衡、熔断器、数据监控等。SpringCloud 将多个服务框架组合起来,通过Spring Boot进行再封装,屏蔽掉了复杂的配置和实现原理,最终给开发者提供了一套简单易懂、易部署和易维护的分布式系统开发工具包。Spring Cloud是一个基于SpringBoot实现的微服务开发方案,Spring boot

文章图片
#spring cloud#spring boot#spring
图书出版的幕后故事-《JMeter核心技术、性能测试与性能分析》背后不为人知的事

《性能测试的实践价值与JMeter实战指南》摘要 在AI时代背景下,性能测试不仅没有过时,反而成为保障系统稳定性的关键环节。本文介绍了一本聚焦JMeter实战的原创书籍,它打破传统教程的局限,通过"理论+实战+AI"三维度构建完整知识体系: 系统讲解性能测试原理与JMeter高阶应用 提供电商秒杀等真实案例的全流程演练 创新性融入AI辅助测试的前沿实践 配备可落地的附录工具与配

文章图片
#jmeter#性能优化
每周读书与学习->JMeter主要元件详细介绍(四)再谈取样器

《JMeter核心技术、性能测试与性能分析》一书系统介绍了JMeter工具的使用,重点讲解了WebSocket和Dubbo等第三方取样器的配置方法。书中通过电商秒杀系统等实战案例,全面展示了性能测试流程,包括脚本编写、压测执行和瓶颈分析。作者强调性能测试在当今技术环境下依然重要,并分享了AI辅助测试等前沿实践。该书适合测试工程师、技术经理及高校师生阅读,是一本兼顾理论与实践的实用指南。

文章图片
#学习#jmeter#性能优化
Clickhouse 分布式表&本地表 &ClickHouse实现时序数据管理和挖掘

一、CK 分布式表和本地表(1)CK是一个纯列式存储的数据库,一个列就是硬盘上的一个或多个文件(多个分区有多个文件),关于列式存储这里就不展开了,总之列存对于分析来讲好处更大,因为每个列单独存储,所以每一列数据可以压缩,不仅节省了硬盘,还可以降低磁盘IO。(2)CK是多核并行处理的,为了充分利用CPU资源,多线程和多核必不可少,同时向量化执行也会大幅提高速度。(3)提供SQL查询接口,CK的客户端

文章图片
#分布式#数据库#java +1
图书《数据资产管理核心技术与应用》核心章节节选-3.1.2. 从Spark 执行计划中获取数据血缘

因为数据处理任务会涉及到数据的转换和处理,所以从数据任务中解析血缘也是获取数据血缘的渠道之一,Spark 是大数据中数据处理最常用的一个技术组件,既可以做实时任务的处理,也可以做离线任务的处理。如下图3-1-10所示,在Spark的官方文档链接https://spark.apache.org/docs/latest/sql-ref-syntax-qry-explain.html#content中,

文章图片
#spark#大数据#分布式
    共 14 条
  • 1
  • 2
  • 请选择