
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
LLM应用的未来,其竞争力的核心,已不再是模型本身的参数大小或某个提示词的精巧,而是我们围绕模型所设计的那套流程的优劣。

如果你的 Agent 只靠 System Prompt 干活,有三个问题会越来越严重:**1. 规则膨胀。** 你会在 System Prompt 里不断加规则。三个月后变成 2000 字,Agent 只记住了开头和结尾。Skills 让规则分类存储——Agent 写 C 代码时加载 C 编码规范,做 Code Review 时加载 CR 规范,不需要的规则不占上下文。

我这段时间一直在琢磨自己整一个agent。这原因嘛,想必大家都懂,这天杀的anthropic不知道上辈子遭了咱们什么样的迫害,逮着咱就是一通乱封。

最近,文档平台 Mintlify 给自家 AI 助手做了一次堪称惊艳的底层重构:他们彻底抛弃了常规的 RAG(检索增强生成)管线,给大模型硬核地造了一套“假”的 POSIX 虚拟文件系统。

2025 年,一个重要的趋势正在改变 RAG 的格局:**从被动检索到主动推理**。

技术面试淘天一面最高频:多Agent怎么协作?99%的人答错了第一步面试官问你"多Agent之间怎么交互协作",你脑子里第一反应是什么?

大语言模型已经在多任务场景中展现出强大的通用能力,但一个关键问题正在成为LLM代理落地的最大瓶颈:**模型在部署后几乎无法继续学习**。预训练依赖海量数据与算力,微调成本高昂且难以频繁进行,而真实生产环境中不断积累的交互经验,却很难被模型吸收与复用。

AI Agent 是这两年最常被提到的 AI 词之一。做模型的人在讲,做产品的人在讲,做应用的人也在讲。但问题是:同样是“Agent”,很多人说的并不是同一件事。

Agent 评测不是上线前的"抽检动作",而是将不可控的智能行为收敛为可交付工程质量的持续闭环。本文从体系化视角拆解 Agent 评测的五大核心模块:体系定位、类型适配、对话特殊性、指标体系、数据集建设与评分机制,为企业提供可直接落地的评测框架。

从 LangChain、Claude Code、OpenAI、Google 到 Manus,看 agent 如何长出一套真正可运营的工作系统。








