logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型记忆系统设计方案

摘要:大模型记忆系统旨在赋予AI长期记忆、上下文关联和个性化认知能力,采用三级架构(瞬时/短时/长时记忆)实现信息分层管理。核心模块包括交互接口、记忆管理(提取/存储/检索/遗忘)和大模型交互,关键技术涵盖结构化/向量化存储、上下文感知检索和增量优化。典型应用于个性化对话、任务协作等场景,需解决记忆膨胀、隐私安全等挑战。部署建议根据规模选择轻量级或企业级方案,强调实用性、轻量化和隐私保护原则。(1

分布式架构与云原生架构的区别与关联

摘要: 分布式架构与云原生架构是现代系统设计的两种核心范式,二者并非对立,而是演进关系。云原生架构是面向云优化的分布式架构高级形态,强调容器化、微服务和DevOps。分布式架构侧重业务拆分与性能扩展,而云原生架构深度集成云能力(如弹性伸缩、服务网格),实现高效运维与自动化交付。适用场景上,传统稳定系统适合分布式架构,而高并发、快速迭代场景更适合云原生。二者呈包含关系,企业可根据实际需求选择渐进式演

#分布式#架构#云原生
推理引擎与大模型的关系(精简版)

摘要:大模型(静态权重文件)与推理引擎(动态计算框架)是AI服务的核心组件。大模型提供知识参数但无执行能力,推理引擎负责加载模型、计算调度和接口服务。二者关系如同"百科全书与朗读者"——模型决定回答质量,引擎控制响应速度与并发性能。生产环境需采用优化引擎(如vLLM)而非原生框架,业务层通过标准接口调用。完整AI服务需模型与引擎协同工作,分别解决"答得好"和

#人工智能
大模型工具调用(Function Call / Tool Call)核心原理完整讲解

大模型工具调用原理摘要(148字): 大模型工具调用实现了从文本生成到结构化决策的升级,其核心原理是模型根据用户意图和工具Schema生成JSON格式调用指令,由外部框架执行具体操作。完整流程包含工具注册、意图判断、参数生成、执行和结果回传五个环节。模型通过预训练数据、Prompt约束和解码限制确保JSON格式准确,但并不真正理解工具逻辑。工具调用与普通文本生成的关键差异在于输出严格结构化,依赖外

#人工智能
大模型响应性能全解析:影响时延、吞吐量、稳定性的核心因素与优化方向

摘要:本文系统分析了大模型响应性能的核心影响因素,涵盖六大维度:模型固有属性(参数量、架构、量化)、输入输出设计(Prompt长度、解码策略)、推理引擎优化(vLLM、TGI)、硬件基础设施(GPU算力、显存)、调度架构(请求调度、限流)及业务逻辑。关键指标包括首包时延(TTFT)、令牌生成速度(TPOT)和吞吐量。优化方向涉及模型量化、Prompt精简、引擎选型及硬件配置,强调高并发下的稳定性保

#人工智能
大模型Skill能力底层原理:从原子工具到业务技能的完整实现机制

摘要:本文系统阐述了大模型Skill能力的实现原理,指出Skill是连接用户任务与原子工具的业务抽象层。Skill与Tool存在本质差异:Tool是原子操作,而Skill是包含多Tool、子任务流程和专属Prompt的完整业务单元。Skill通过五层机制实现:描述层转化为语义声明、路由层完成意图匹配、编排层执行标准化流程、能力增强层加载专属约束、执行层实现模型与框架协同。文章还分析了Skill体系

#人工智能
Spring AI Alibaba 实现 Workflow 全指南

本文介绍了Spring AI Alibaba框架中的Workflow模块,该模块基于Java2AI Graph Core规范,实现了声明式、可视化、可复用的AI工作流编排功能。文章从核心概念、环境准备、实现步骤三个方面详细讲解了如何构建电商客服智能回复工作流。主要内容包括:1)核心概念对齐,解释Workflow与Java2AI Graph的映射关系;2)环境准备,包含Maven依赖配置和YAML核

#java#spring#人工智能
AgentScope Java 集成 Spring AI Alibaba Workflow 完整指南

本文介绍了如何将AgentScope Java与Spring AI Alibaba及Java2AI Graph Core进行深度集成,构建一个完整的智能体工作流系统。主要内容包括: 核心集成思路:通过三层适配实现能力融合,包括模型层复用、工作流层封装和执行层适配,以AgentScope为智能体核心,Spring AI Alibaba为工作流引擎。 工程配置:提供Maven依赖整合方案和YAML配置

#java#spring#人工智能
Servlet 3.1+和Reactor融合机制

摘要: Servlet 3.1+与Reactor的融合通过异步Servlet规范(AsyncContext)适配Reactive Streams模型,使Reactor能在Tomcat等Servlet容器中运行。核心原理是Servlet线程接收请求后释放,由Reactor线程处理异步流,最终通过AsyncContext回调响应。Spring WebFlux通过ServletHttpHandlerAd

#servlet#hive#hadoop
提示工程(Prompt Engineering)与上下文工程(Context Engineering)

提示工程(Prompt Engineering)与上下文工程(Context Engineering)是优化大语言模型(LLM)应用的两大核心层级。提示工程聚焦单次交互的指令优化与格式设计,而上下文工程则系统性管理多轮对话的信息供给与状态闭环。两者协同工作:提示工程作为子模块嵌入上下文框架中,上下文工程为其提供动态数据支持。实践路径建议从基础提示模板入手,逐步引入检索增强生成(RAG)、分层记忆系

    共 64 条
  • 1
  • 2
  • 3
  • 7
  • 请选择