
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文探讨了RAG系统从实验室到生产环境落地的关键挑战,提出了三级降级解析方案(Docling+PyPDF2+Tesseract OCR)提升PDF解析覆盖率至95%,通过单例模式、并行检索等优化手段将延迟降至2.3s,并提供Docker部署方案解决环境依赖问题。文章重点分析了生产环境中遇到的三大典型问题:扫描件解析失败、高并发性能瓶颈和环境部署复杂性,给出了具体的技术解决方案和实施代码,帮助开发者

这是AI Insight系列的第一篇文章,但其实关于AI日报与每日论文精读我已经做了一个月,因为这个领域每日的新进展过于迅速,很多idea不及时记录或留存就会被带过去,所以特此开这个专栏记录笔记与一些个人思考,问题清单会在文末放出,若是有对这些方面感兴趣的大佬欢迎随时交流 yunzennz@gmail.com

这是AI Insight系列的第一篇文章,但其实关于AI日报与每日论文精读我已经做了一个月,因为这个领域每日的新进展过于迅速,很多idea不及时记录或留存就会被带过去,所以特此开这个专栏记录笔记与一些个人思考,问题清单会在文末放出,若是有对这些方面感兴趣的大佬欢迎随时交流 yunzennz@gmail.com

这是AI Insight系列的第一篇文章,但其实关于AI日报与每日论文精读我已经做了一个月,因为这个领域每日的新进展过于迅速,很多idea不及时记录或留存就会被带过去,所以特此开这个专栏记录笔记与一些个人思考,问题清单会在文末放出,若是有对这些方面感兴趣的大佬欢迎随时交流 yunzennz@gmail.com

本文深入解析了Transformer架构的核心组成与数据流。文章首先介绍了Encoder-Decoder的基本概念,强调Encoder的双向性和Decoder的自回归特性。随后详细拆解了Transformer的层级结构,包括Encoder的Self-Attention和Feed Forward网络,以及Decoder特有的Masked Self-Attention和Cross-Attention。

这篇文章摘要介绍了如何将零散的AI Agent组件整合成一个完整的可执行程序。文章分为三个主要部分: 整体架构:将之前开发的各个模块(LLM客户端、ReAct循环、文件操作工具、命令行工具)整合成一个统一的系统,创建命令行入口让用户可以直接运行Agent。 关键技术: 采用滑动窗口策略管理对话历史,在保留关键信息的同时控制Token消耗 设计循环终止条件(任务完成、无行动输出、达到最大轮数) 实现

摘要 本文介绍如何通过 CRAG(Corrective RAG)架构解决传统 RAG 系统"盲目自信"的问题。CRAG 在检索和生成之间插入置信度评估模块,根据相关性分数(0-10)动态选择处理路径:高置信度(≥7)直接生成,中等置信度(3-7)重写查询二次检索,低置信度(<3)触发外部搜索。实验表明,该方法使 Context Recall 提升 26%(0.62→0.7

摘要 本文介绍如何通过 CRAG(Corrective RAG)架构解决传统 RAG 系统"盲目自信"的问题。CRAG 在检索和生成之间插入置信度评估模块,根据相关性分数(0-10)动态选择处理路径:高置信度(≥7)直接生成,中等置信度(3-7)重写查询二次检索,低置信度(<3)触发外部搜索。实验表明,该方法使 Context Recall 提升 26%(0.62→0.7

本文深入解析了ReAct循环(Reasoning+Acting)的工作原理,这是构建智能Agent的核心机制。通过密室逃脱游戏的类比,作者生动展示了人类解决问题的"观察-思考-行动"循环模式。文章详细拆解了ReAct循环的数学公式和实现步骤,包括状态更新、思考决策、执行行动和反馈观察的完整闭环。对比了普通对话模型与ReAct Agent的本质区别,强调后者能通过循环执行和反馈调

Transformer架构中的残差连接与Layer Normalization 本文深入分析了Transformer架构中残差连接和Layer Normalization的作用机制。原论文采用Post-LN结构(LayerNorm(x + Sublayer(x))),而后续模型如GPT-2改用Pre-LN结构(x + Sublayer(LayerNorm(x)))。通过数学推导揭示了Pre-LN更








