logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Context Engineering 不是写更长 Prompt,而是管理 Agent 的注意力预算

很多 Agent 项目不是败在模型不够强,而是败在上下文太脏:历史全塞、RAG 全塞、工具结果全塞,最后模型又慢又贵还容易跑偏。本文从开发者视角讲清 Context Engineering、RAG、Memory、压缩、按需加载和最小落地方案。

文章图片
#数据库
从 LLM Wiki 到 GBrain:我对 Agent 长期记忆的一些新理解

从 LLM Wiki、Obsidian-Wiki 和 GBrain 出发,梳理 Agent Memory 的几个核心概念:短期记忆、工作记忆、事件记忆、语义记忆和程序性记忆,并分析传统 RAG 与长期记忆之间的区别。文章更偏学习笔记和知识分享,重点讨论 Agent 如何通过 Markdown Wiki、增量维护、混合检索和图谱关系沉淀长期知识。

文章图片
#人工智能#架构#后端
给 Coding Agent 装上 LSP:别再让它靠 grep 猜代码

GitHub 发布文章介绍如何让 Copilot CLI 接入 Language Server Protocol,让 Coding Agent 从粗暴 `grep`、翻依赖包、猜 API 签名,升级到使用 definition、references、types、diagnostics 等语义级代码信息。本文从 Java/Spring 项目的真实场景出发,拆解为什么 Coding Agent 靠全文

文章图片
#后端#架构
Claude Code 架构拆解:它到底是怎么把大模型变成编程 Agent 的

Claude Code 不是“终端版聊天框”,也不是一个简单的代码生成器。它的核心是一套 Agent Harness:把 Claude 模型、项目上下文、文件系统、Shell、Git、MCP、权限系统、Hooks、Skills、Subagents、Worktrees 和验证机制组织成一个可执行、可审查、可恢复的编程工作流。本文重点拆解它的运行机制、工程边界和扩展结构。

文章图片
#后端
一次讲清 Function Calling:AI Agent 怎么从会聊天变成会做事

Function Calling 不是让大模型真的去执行函数,而是让模型用结构化格式提出“我想调用哪个工具、参数是什么”。真正的工具执行、权限判断、错误处理和结果回填,都发生在你的应用侧。本文结合 OpenAI、Anthropic、MCP、Spring AI 和 LangChain4j 的官方资料,把 Function Calling 的协议骨架、工具定义、运行时架构、基础工具设计和流式 tool

文章图片
#后端
后端接入 AI Agent:Tool Calling 网关、幂等与审计日志实战

AI Agent 能发起 Tool Call,不代表它应该直接碰业务接口。真正可上线的 Java 后端,需要在模型和业务系统之间加一层 Tool Calling 网关,把工具注册、权限校验、幂等、超时、审计日志和错误回填都收住。本文结合 Spring AI、LangChain4j、OpenAI、Anthropic 的官方 Tool Calling 设计,以及 DDIA 里的可靠性、事务和分布式故障

文章图片
#java#后端#人工智能
Mem0 项目解读:AI Agent 长期记忆层到底怎么设计

Mem0 是 Agent Memory 方向里很有代表性的项目。它不只是把聊天记录存进向量库,而是把记忆写入、冲突处理、分层检索、用户隔离、MCP 接入和评测做成了一层可接入的基础设施。本文从项目定位、核心流程、检索架构、平台形态和风险边界几个角度,拆解 Mem0 为什么值得单独写一篇。

文章图片
RAG 不是向量数据库,而是在给大模型建立证据链

RAG 的关键不是“有没有向量数据库”,而是能不能建立一条从用户问题到检索证据、再到可信回答的完整证据链。本文结合 RAG 论文、OpenAI/Anthropic/Microsoft/Elastic/AWS/Google 等资料,以及 LangChain、LlamaIndex、Haystack、RAGFlow、GraphRAG 等开源实践,讲清 RAG 的工程架构、常见误区和最小落地方案。

文章图片
#人工智能#架构
大模型入门:Multi-Head Attention,从 QKV、Mask 到 KV Cache

很多人学大模型时会背 Attention 公式,却说不清 Q/K/V 到底是什么、Mask 为什么要加在 softmax 前、KV Cache 为什么只缓存 K 和 V。本文从一份最小 PyTorch 实现开始,把 Multi-Head Attention 的张量形状、因果掩码、KV Cache 推理流程和面试常见追问串起来。

#人工智能
大模型入门:手写一个 BPE 分词器,搞懂 Token 到底怎么来的

很多人学习大模型时,会直接从 Attention、Transformer、KV Cache 开始,但真正进入工程实践后,第一个绕不开的问题往往是 Token。为什么同一句话在不同模型里 token 数不一样?为什么中文、英文、代码的切分差异会影响上下文长度和费用?本文从 Byte Pair Encoding(BPE)的合并规则开始,手写一个最小 BPE 分词器,讲清 Tokenizer 的训练、编

文章图片
#人工智能
    共 55 条
  • 1
  • 2
  • 3
  • 6
  • 请选择