logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

生产级Agent性能调优:Token消耗、延迟与吞吐量的量化分析与优化策略

Agent性能优化三要素:降本提速的关键策略 本文从性能地图、Token优化和响应加速三个维度提出Agent优化方案。核心发现: 性能瓶颈集中在LLM推理(60%)和工具执行(30%) Token成本管理策略: 系统提示瘦身可降固定成本 提示缓存技术实现90%成本折扣 动态Token预算管理上下文窗口 响应优化方案: 工具并行执行减少30%等待时间 小模型路由简单请求 流式输出提升用户体验 通过系

文章图片
#python#数据库#服务器
从 0 到 1 构建企业级 AI 桌面应用:Electron + Agent + RAG + 多模型接入与工程化交付实战

企业资料可能位于本地磁盘,或者只能通过内网访问;用户需要读取文件、整理目录、生成报告,而不是只问一个问题;密钥、模型配置和业务数据不能直接暴露在浏览器端;用户希望在办公软件、文件管理器和 AI 助手之间快速切换;弱网、离线和本地模型场景需要更强的客户端能力。Electron 适合承载这类产品,但“能打开窗口”距离“企业级可交付”还有很长一段距离。如何把 Electron 的主进程、预加载脚本和渲染

文章图片
#人工智能#electron#javascript
LangChain 与 LangGraph 生产级实践:智能体架构、状态管理、评估与安全治理

摘要 本文探讨了大模型应用中智能体系统的核心问题,指出生产级Agent需具备状态管理、流程控制、风险评估等能力,而非仅依赖模型调用工具。文章对比了LangChain(提供模型组件生态)与LangGraph(管理复杂工作流)的定位差异,并展示如何用LangGraph构建生产级问答Agent。该示例包含标准化处理、意图路由、文档检索、风险检查等模块,通过结构化状态对象实现业务流程控制。关键设计原则强调

文章图片
#架构#安全#RAG +1
别只会调用大模型:用 Dify + RAGFlow 搭建真正可用的企业知识库

摘要:本文探讨了如何构建真正可用的企业知识库系统,指出仅依赖大模型和简单文档处理会导致实际应用中的诸多问题。文章提出Dify与RAGFlow结合的解决方案:Dify负责应用层编排、工作流和模型调用,RAGFlow专注文档解析、知识管理和混合检索。关键实施步骤包括:精细化文档解析(保留结构、表格、版本等元数据)、语义化切片策略、混合检索(结合向量和关键词搜索)及权限前置过滤。通过这种架构,企业可将A

文章图片
生产级校园AI Agent架构设计:基于LangGraph的多步骤任务拆解与状态管理深度实践

本文探讨了校园场景下AI Agent的系统设计与实现,提出以LangGraph框架构建可落地的多任务处理方案。文章核心观点是将大语言模型(LLM)的语义理解能力与确定性业务逻辑分离,构建分层状态机架构: 状态设计:突破传统对话状态管理,提出包含会话、规划、执行、缓存、可靠性和产出六大域的状态模型,支持任务持久化与故障恢复。 流程拓扑:采用状态机模式组织任务流程,通过Guardrail节点处理确定性

文章图片
#人工智能#python
生产级 AI Agent 评测体系实战:从数据集构建到自动回归与质量门禁

评测体系最容易犯的错误,是先写一个评分函数,再思考业务目标。业务目标 -> 成功标准 -> 评测指标 -> 自动化实现维度成功标准任务完成正确查询订单并回答用户问题工具调用必须调用订单查询工具,不能调用退款工具事实正确订单状态、金额、时间与数据库一致证据充分答案中的关键事实能在检索内容中找到依据表达质量不暴露内部字段,不输出无关内容性能P95 延迟小于 5 秒安全不泄露手机号、地址等敏感信息这意味

文章图片
#人工智能#回归#数据挖掘
生产级 AI Agent 评测体系实战:从数据集构建到自动回归与质量门禁

评测体系最容易犯的错误,是先写一个评分函数,再思考业务目标。业务目标 -> 成功标准 -> 评测指标 -> 自动化实现维度成功标准任务完成正确查询订单并回答用户问题工具调用必须调用订单查询工具,不能调用退款工具事实正确订单状态、金额、时间与数据库一致证据充分答案中的关键事实能在检索内容中找到依据表达质量不暴露内部字段,不输出无关内容性能P95 延迟小于 5 秒安全不泄露手机号、地址等敏感信息这意味

文章图片
#人工智能#回归#数据挖掘
大模型微调与RAG落地工程师:从理论到生产的全栈实践

大模型开发不是“调参侠”的游戏,而是一套系统工程。微调考验的是对数据和任务的理解——知道什么时候该用LoRA、什么时候该用QLoRA、数据该怎么构造。RAG考验的是对检索系统的把控——文档怎么切、向量怎么存、检索怎么优化、多轮对话怎么处理。推理部署考验的是工程化能力——vLLM怎么配置、TTFT和TPOT怎么优化、量化方案怎么选。这三个环节环环相扣,任何一个环节掉链子,整个系统都无法在生产环境稳定

#人工智能#python#深度学习
多模态大模型底层能力与边界解析

多模态大模型的本质,是将不同模态的数据转换到可以交互的表示空间,再利用Transformer或扩散模型完成理解、推理和生成。高质量的视觉和语言表示;模态之间有效的语义对齐;大规模、多样化且经过清洗的数据。视觉Token会丢失细节;语言先验会引发幻觉;精确计数和空间计算不稳定;生成结果不代表事实正确;高风险场景需要外部验证。真正的工程重点不是简单地“调用一个视觉大模型”,而是围绕输入质量、视觉编码、

文章图片
#人工智能#开源#AIGC
深入浅出分布式训练框架:PyTorch、TensorFlow 与 Horovod 实战

本文探讨了深度学习中的分布式训练技术,重点分析了其基本原理、并行策略及主流框架实现。随着模型参数量和数据规模急剧增长,分布式训练已成为解决单卡显存不足和训练耗时的关键技术。文章详细介绍了数据并行、模型并行和流水线并行三种策略,并对比了PyTorch的DistributedDataParallel、TensorFlow的MultiWorkerMirroredStrategy以及Horovod三种实现

文章图片
#分布式#pytorch#tensorflow
    共 18 条
  • 1
  • 2
  • 请选择