
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Claude Code 不是“终端版聊天框”,也不是一个简单的代码生成器。它的核心是一套 Agent Harness:把 Claude 模型、项目上下文、文件系统、Shell、Git、MCP、权限系统、Hooks、Skills、Subagents、Worktrees 和验证机制组织成一个可执行、可审查、可恢复的编程工作流。本文重点拆解它的运行机制、工程边界和扩展结构。

Function Calling 不是让大模型真的去执行函数,而是让模型用结构化格式提出“我想调用哪个工具、参数是什么”。真正的工具执行、权限判断、错误处理和结果回填,都发生在你的应用侧。本文结合 OpenAI、Anthropic、MCP、Spring AI 和 LangChain4j 的官方资料,把 Function Calling 的协议骨架、工具定义、运行时架构、基础工具设计和流式 tool

AI Agent 能发起 Tool Call,不代表它应该直接碰业务接口。真正可上线的 Java 后端,需要在模型和业务系统之间加一层 Tool Calling 网关,把工具注册、权限校验、幂等、超时、审计日志和错误回填都收住。本文结合 Spring AI、LangChain4j、OpenAI、Anthropic 的官方 Tool Calling 设计,以及 DDIA 里的可靠性、事务和分布式故障

Mem0 是 Agent Memory 方向里很有代表性的项目。它不只是把聊天记录存进向量库,而是把记忆写入、冲突处理、分层检索、用户隔离、MCP 接入和评测做成了一层可接入的基础设施。本文从项目定位、核心流程、检索架构、平台形态和风险边界几个角度,拆解 Mem0 为什么值得单独写一篇。

RAG 的关键不是“有没有向量数据库”,而是能不能建立一条从用户问题到检索证据、再到可信回答的完整证据链。本文结合 RAG 论文、OpenAI/Anthropic/Microsoft/Elastic/AWS/Google 等资料,以及 LangChain、LlamaIndex、Haystack、RAGFlow、GraphRAG 等开源实践,讲清 RAG 的工程架构、常见误区和最小落地方案。

很多人学大模型时会背 Attention 公式,却说不清 Q/K/V 到底是什么、Mask 为什么要加在 softmax 前、KV Cache 为什么只缓存 K 和 V。本文从一份最小 PyTorch 实现开始,把 Multi-Head Attention 的张量形状、因果掩码、KV Cache 推理流程和面试常见追问串起来。
很多人学习大模型时,会直接从 Attention、Transformer、KV Cache 开始,但真正进入工程实践后,第一个绕不开的问题往往是 Token。为什么同一句话在不同模型里 token 数不一样?为什么中文、英文、代码的切分差异会影响上下文长度和费用?本文从 Byte Pair Encoding(BPE)的合并规则开始,手写一个最小 BPE 分词器,讲清 Tokenizer 的训练、编

从 KV Cache 的显存公式出发,讲清 MHA、MQA、GQA 的张量形状和工程差异,并手写一个最小 GQA Attention,

Transformer 的 Attention 本身不知道 token 顺序,RoPE 通过旋转 Query 和 Key,把 position 注入到注意力分数里。本文从二维旋转直觉、相对位置公式、PyTorch 最小实现、KV Cache 下的 position_ids 和常见坑,系统讲清 RoPE 位置编码。

Claude Code 不是“终端版聊天框”,也不是一个简单的代码生成器。它的核心是一套 Agent Harness:把 Claude 模型、项目上下文、文件系统、Shell、Git、MCP、权限系统、Hooks、Skills、Subagents、Worktrees 和验证机制组织成一个可执行、可审查、可恢复的编程工作流。本文重点拆解它的运行机制、工程边界和扩展结构。








