AI Agents 的核心能力栈解析
AI Agents 的核心能力栈解析:从原理到落地的全链路拆解
作者: 极客老张(资深全栈/AI架构师,15年技术经验,前某大厂LLM应用技术负责人)
发布时间: 202X年X月X日
阅读时长: 约45分钟(建议收藏反复阅读)
标签: #AI Agents #LLM应用 #智能体 #大模型 #系统设计 #Agentic Workflow
一、 引言 (Introduction)
1.1 钩子 (The Hook)
你是否见过这样的“超级助手”?
当你输入“帮我订一张本周六从北京到上海虹桥虹桥最快的高铁二等座,顺便订虹桥机场附近离虹桥T1航站楼步行5分钟内的三星级以上、带早餐、允许带中型宠物入住的酒店,同时查一下上海周末两天(周六到周日)晴间多云的博物馆——优先推荐免费或票价低于100元、有中国古代青铜器特展的,再整理一份博物馆预约方式、交通路线和周边美食清单发我微信?”时,它不需要你一步步追问拆分问题、不需要你手动查票比价、不需要你担心时间冲突或忘记预约,甚至能主动帮你规避中型宠物入住的酒店坑——比如提前确认房间楼层、是否有额外清洁费等,短短10分钟内就能给你一份结构清晰、可直接落地的“一站式方案”,甚至已经帮你提交了高铁票候补和酒店、博物馆的预约提醒。
这不是科幻电影里的桥段——这就是今天AI Agents(智能体) 正在落地的真实场景。相比传统的、只能“一问一答、做单一步骤指令”的大模型对话助手,AI Agents 像是有了“大脑、手脚、眼睛、耳朵和记忆”的自主决策执行者:它能理解长期复杂的目标、能主动拆解任务、能调用外部工具(API、浏览器、数据库、机器人手臂等)、能感知环境状态并调整策略、能积累长期经验并优化行为。
1.2 定义问题/阐述背景 (The “Why”)
1.2.1 从“工具化大模型”到“Agentic 大模型”的必然趋势
2023年可以说是大模型工具化应用的元年:ChatGPT、Claude、文心一言、通义千问等通用大模型(LLMs)和各种行业垂直模型(如代码模型 CodeLlama、医疗模型 Med-PaLM 2、金融模型 BloombergGPT)层出不穷,催生了大量的“对话式应用”“知识库问答应用”“代码辅助工具”“内容生成工具”等。但这些应用本质上都是**“人类驱动的大模型工具”**:
- 大模型只能理解单轮或短轮次的、结构化程度较高的、目标明确的指令;
- 大模型无法自主处理非结构化的、模糊的、需要多步骤协作的长期目标;
- 大模型的知识截止时间固定,无法获取实时、动态、领域特定的外部信息;
- 大模型无法直接改变物理或数字世界的状态(比如订票、发邮件、控制机器人);
- 大模型没有长期记忆能力,无法积累之前的对话或任务执行经验,下次遇到类似问题还要重新开始。
这些局限性直接导致了大模型工具化应用的“天花板”:比如当你遇到需要协调多个外部系统、处理多个不确定因素、需要长期规划和迭代的任务时,传统的大模型对话助手就会“卡壳”——要么让你“请提供更明确的指令”,要么给出“不可执行的、逻辑混乱的方案”。
为了突破这个天花板,“Agentic 大模型”(即把大模型作为大脑核心的智能体) 应运而生。根据OpenAI CEO Sam Altman的预测,“未来5-10年,90%以上的大模型应用都将是Agentic Workflow(智能体工作流)的形式”;斯坦福大学HAI实验室、麻省理工学院CSAIL实验室、Meta AI、Google DeepMind等全球顶尖学术机构和科技公司也都在AI Agents领域投入了大量的资源,并推出了一系列具有里程碑意义的研究成果和开源框架:比如斯坦福的Generative Agents(《西部世界》式的虚拟社会智能体)、Meta的ReAct(推理+行动的智能体范式)、Google的Self-Discovery Agent(自我发现+自我优化的智能体)、OpenAI的Assistants API(官方的Agent开发框架)、LangChain的LangGraph(Agent工作流编排工具)、AutoGPT(最早火出圈的开源通用Agent)、CrewAI(多Agent协作框架)等。
1.2.2 AI Agents的核心价值与应用场景
AI Agents的核心价值在于**“将大模型的认知能力与外部世界的执行能力无缝连接,实现从‘认知’到‘决策’再到‘行动’的闭环自主执行”**。基于这个核心价值,AI Agents可以应用于几乎所有需要“多步骤协作、自主决策、环境感知、长期记忆”的领域,比如:
- 个人助手领域: 订票、订酒店、安排日程、管理财务、写代码、写论文、查资料等;
- 企业办公领域: 自动化文档处理、自动化会议纪要、自动化客户服务、自动化项目管理、自动化数据分析、自动化代码测试与部署等;
- 医疗健康领域: 自动化病历分析、自动化诊断辅助、自动化健康管理、自动化药物研发辅助等;
- 金融科技领域: 自动化风险评估、自动化投资策略制定、自动化交易执行、自动化反欺诈检测等;
- 智能制造领域: 自动化机器人控制、自动化生产流程优化、自动化设备故障检测与维修等;
- 游戏娱乐领域: 自动化NPC(非玩家角色)设计、自动化游戏关卡生成、自动化游戏直播辅助等;
- 科学研究领域: 自动化文献综述、自动化实验设计、自动化数据处理与分析、自动化论文写作等。
1.3 亮明观点/文章目标 (The “What” & “How”)
读完这篇文章,你将能够:
- 深入理解AI Agents的核心概念、发展历史、核心属性与分类体系;
- 全面掌握AI Agents的“6层核心能力栈”:感知层、记忆层、认知层、行动层、协作层、优化层;
- 掌握AI Agents的核心算法范式:如ReAct、Reflexion、Self-Discovery、Tree of Thoughts (ToT)、Reasoning Action Verification (RAV)等;
- 熟悉主流的AI Agents开源框架与开发工具:如LangChain、LangGraph、AutoGPT、CrewAI、Assistants API、LlamaIndex等;
- 通过一个完整的“多Agent协作的自动化内容生产系统”实战案例,从零开始学习如何设计、开发和部署一个AI Agents应用;
- 了解AI Agents领域的常见陷阱、最佳实践、行业发展趋势与未来挑战。
为了实现这些目标,本文将按照以下结构展开:
- 第二章:基础知识/背景铺垫:介绍AI Agents的核心概念、发展历史、核心属性、分类体系,以及相关的技术基础(如大模型、向量数据库、LangChain等);
- 第三章:核心内容/能力栈深度解析:本文的核心部分,将从感知层、记忆层、认知层、行动层、协作层、优化层6个维度,全面拆解AI Agents的核心能力,包括每个能力的定义、核心要素、实现原理、技术选型、数学模型、算法流程、代码示例等;
- 第四章:核心算法范式深度解析:介绍目前主流的AI Agents算法范式,包括ReAct、Reflexion、Self-Discovery、Tree of Thoughts (ToT)、Reasoning Action Verification (RAV)等;
- 第五章:实战演练:多Agent协作的自动化内容生产系统:通过一个完整的实战案例,从零开始设计、开发和部署一个由“选题策划Agent”“内容创作Agent”“内容审核Agent”“SEO优化Agent”“排版发布Agent”组成的多Agent协作的自动化内容生产系统;
- 第六章:进阶探讨/最佳实践:介绍AI Agents领域的常见陷阱与避坑指南、性能优化与成本考量、安全与隐私保护、最佳实践总结等;
- 第七章:行业发展与未来趋势:介绍AI Agents领域的问题演变发展历史、当前的研究热点、未来的发展趋势与挑战;
- 第八章:结论:总结本文的核心要点,展望AI Agents的未来,并给出进一步学习的资源链接。
二、 基础知识/背景铺垫 (Foundational Concepts)
2.1 AI Agents的核心概念定义
2.1.1 经典的AI Agents定义(来自计算机科学与人工智能领域)
在计算机科学与人工智能领域,智能体(Agent) 是一个非常经典且广泛使用的概念,最早可以追溯到20世纪50-60年代的人工智能早期研究(如图灵测试、感知机等)。根据斯坦福大学计算机科学系教授Russell和Norvig在他们的经典著作《人工智能:一种现代的方法》(Artificial Intelligence: A Modern Approach,第四版)中的定义:
智能体(Agent)是一个能够通过传感器(Sensors)感知环境(Environment),并通过执行器(Actuators)对环境做出反应,以实现其目标(Goals)的实体(Entity)。
这个定义非常简洁且通用,几乎涵盖了所有类型的智能体——从简单的恒温器(感知环境温度,执行器是开关空调或加热器,目标是保持室内温度恒定),到复杂的人类(感知环境的器官是眼睛、耳朵、鼻子、舌头、皮肤等,执行器是手、脚、嘴巴等,目标是生存、繁衍、实现自我价值等),再到我们今天要讨论的AI Agents(以大模型为核心的智能体)。
2.1.2 本文的AI Agents定义(针对以大模型为核心的智能体)
为了更贴合当前的技术发展现状,本文对AI Agents(以大模型为核心的智能体) 给出一个更具体、更有针对性的定义:
AI Agents是一个以通用大模型(LLMs)或垂直大模型为核心认知大脑,具备感知环境(感知层)、存储记忆(记忆层)、认知推理(认知层)、执行行动(行动层)、多Agent协作(协作层)、自我优化(优化层)6层核心能力,能够自主理解长期复杂的目标、主动拆解任务、调用外部工具、感知环境状态并调整策略、积累长期经验并优化行为,最终实现目标闭环的自主决策执行系统。
从这个定义可以看出,大模型是AI Agents的“核心大脑”,但AI Agents绝不是“大模型的简单包装”——它是一个由6层核心能力组成的完整的自主决策执行系统。
2.2 AI Agents的核心属性(根据Russell & Norvig的定义扩展)
根据Russell和Norvig的经典定义,智能体有以下几个核心属性;针对以大模型为核心的AI Agents,我们对这些属性进行了扩展和补充:
2.2.1 自主性(Autonomy)
经典定义: 智能体的行为应该主要由其自身的内部状态和目标决定,而不是完全由外部环境或人类的指令控制。
针对AI Agents的扩展:
- AI Agents应该能够自主理解长期复杂的、模糊的、非结构化的目标,而不需要人类一步步追问拆分问题;
- AI Agents应该能够主动拆解目标为多个子任务,并自主规划子任务的执行顺序和逻辑;
- AI Agents应该能够自主感知环境状态的变化,并根据环境变化自主调整子任务的执行策略;
- AI Agents应该能够自主决定是否需要调用外部工具,以及调用哪个外部工具、如何调用外部工具;
- AI Agents应该能够自主评估任务执行的结果,并自主决定是否需要重新执行某个子任务或整个任务流程。
2.2.2 感知性(Perceptiveness)
经典定义: 智能体应该能够通过传感器感知环境的当前状态和历史变化。
针对AI Agents的扩展:
- AI Agents的“传感器”不仅包括传统的数字传感器(如API接口、数据库查询接口、文件系统接口等),还包括大模型的多模态感知能力(如视觉感知(GPT-4V、Claude 3 Opus、Gemini Ultra等)、听觉感知(Whisper、Claude 3 Haiku等)、语音合成感知(ElevenLabs、Azure Speech等)等);
- AI Agents应该能够理解和处理各种类型的感知数据:如文本、图片、音频、视频、表格、JSON、XML等;
- AI Agents应该能够从感知数据中提取有用的信息,并将其转化为内部可以理解和处理的格式(如向量表示、结构化文本等)。
2.2.3 行动性(Activeness)
经典定义: 智能体应该能够通过执行器对环境做出反应,改变环境的状态。
针对AI Agents的扩展:
- AI Agents的“执行器”不仅包括传统的数字执行器(如API调用接口、数据库写入接口、文件系统写入接口、邮件发送接口、微信发送接口等),还包括物理执行器(如机器人手臂、无人机、智能家居设备等);
- AI Agents应该能够自主调用各种类型的执行器,并处理执行器返回的结果(如成功、失败、错误信息等);
- AI Agents应该能够将执行器的执行结果反馈到感知层和认知层,以便后续的决策和行动。
2.2.4 目标导向性(Goal-Orientedness)
经典定义: 智能体的所有行为都应该是为了实现其预设的目标。
针对AI Agents的扩展:
- AI Agents的目标可以是预设的、明确的、结构化的(如“订一张本周六从北京到上海虹桥的最快高铁二等座”),也可以是模糊的、非结构化的、长期的(如“帮我成为一名优秀的AI架构师”);
- AI Agents应该能够将模糊的、非结构化的、长期的目标分解为明确的、结构化的、短期的子目标;
- AI Agents应该能够自主评估每个子目标和整体目标的完成进度,并根据评估结果调整策略。
2.2.5 记忆性(Memory)
经典定义的扩展(Russell & Norvig的第四版中增加了这个属性的重要性): 智能体应该能够存储其历史的感知数据、决策过程、行动结果和目标完成进度,以便后续的决策和行动。
针对AI Agents的扩展:
- AI Agents的记忆可以分为短期记忆(Short-Term Memory)、**长期记忆(Long-Term Memory)和工作记忆(Working Memory)**三种类型(具体的定义和实现原理将在第三章的“记忆层”部分详细讲解);
- AI Agents应该能够自主管理其记忆:如记忆的存储、检索、更新、删除、压缩等;
- AI Agents应该能够从记忆中提取有用的经验和知识,并将其应用到当前的任务中。
2.2.6 学习性/自我优化性(Learning/Self-Optimization)
经典定义的扩展: 智能体应该能够从其历史的感知数据、决策过程、行动结果和目标完成进度中学习,不断优化其决策和行动策略,提高其目标完成的效率和质量。
针对AI Agents的扩展:
- AI Agents的学习可以分为监督学习(Supervised Learning)、强化学习(Reinforcement Learning, RL)、自监督学习(Self-Supervised Learning)和少样本学习(Few-Shot Learning)、**零样本学习(Zero-Shot Learning)**等多种类型;
- AI Agents应该能够自主评估其决策和行动策略的优劣,并自主决定是否需要优化策略;
- AI Agents应该能够通过微调大模型、优化提示词(Prompt Engineering)、更新记忆库、调整外部工具调用策略等方式实现自我优化。
2.2.7 协作性(Collaboration)
经典定义的扩展: 对于复杂的、需要多领域知识和多技能协作的任务,单个智能体可能无法独立完成,因此需要多个智能体之间进行协作。
针对AI Agents的扩展:
- AI Agents的协作可以分为**同步协作(Synchronous Collaboration)和异步协作(Asynchronous Collaboration)**两种类型;
- AI Agents的协作可以分为分层协作(Hierarchical Collaboration)、**平等协作(Peer-to-Peer Collaboration)和混合协作(Hybrid Collaboration)**三种模式;
- AI Agents应该能够自主与其他智能体或人类进行沟通和协作,并处理协作过程中出现的冲突和问题。
2.3 AI Agents的分类体系
根据不同的分类标准,AI Agents可以分为多种不同的类型。下面我们将介绍几种最常用的分类标准和对应的分类体系:
2.3.1 按认知能力分类(经典的AI Agents分类体系)
根据Russell和Norvig的经典著作《人工智能:一种现代的方法》中的分类标准,智能体可以分为以下5种类型,认知能力从弱到强依次递增:
| 智能体类型 | 核心定义 | 工作原理 | 典型应用场景 | 以大模型为核心的AI Agents示例 |
|---|---|---|---|---|
| 简单反射型智能体(Simple Reflex Agent) | 只根据当前的感知状态做出反应,不考虑历史的感知数据和内部状态 | 基于“条件-行动”规则(Condition-Action Rules)工作:如果感知状态满足某个条件,则执行对应的行动 | 恒温器、自动门、简单的聊天机器人(只能回答固定的问题) | 基于规则的FAQ聊天机器人(大模型只是用来理解用户的问题并匹配对应的规则,不进行任何推理) |
| 基于模型的反射型智能体(Model-Based Reflex Agent) | 不仅根据当前的感知状态,还根据历史的感知数据和内部状态(即“世界模型”,World Model)做出反应 | 基于“世界模型”和“条件-行动”规则工作:首先根据当前的感知状态和历史的感知数据更新世界模型,然后根据更新后的世界模型匹配对应的条件-行动规则,最后执行对应的行动 | 简单的自动驾驶汽车(只能根据当前的路况和之前的路况做出反应,不进行长期规划)、简单的游戏NPC | 基于记忆的短轮次对话助手(大模型可以记住之前的几轮对话,但不进行长期规划和复杂推理) |
| 基于目标的智能体(Goal-Based Agent) | 不仅根据当前的感知状态、历史的感知数据和世界模型,还根据预设的目标做出反应 | 基于“世界模型”、“目标”和“规划算法”工作:首先根据当前的感知状态和历史的感知数据更新世界模型,然后根据更新后的世界模型和预设的目标使用规划算法生成一个行动序列,最后执行这个行动序列 | 简单的路径规划机器人(如扫地机器人的路径规划)、简单的订票助手(只能按照固定的流程订票) | 基于ReAct范式的单步骤任务智能体(大模型可以理解目标、规划简单的行动序列、调用外部工具、评估结果,但不进行复杂的推理和优化) |
| 基于效用的智能体(Utility-Based Agent) | 不仅根据当前的感知状态、历史的感知数据、世界模型和预设的目标,还根据“效用函数”(Utility Function)做出反应——效用函数用来衡量每个可能的行动序列或结果的“好坏程度”,智能体会选择效用最高的行动序列或结果 | 基于“世界模型”、“目标”、“效用函数”和“决策算法”工作:首先根据当前的感知状态和历史的感知数据更新世界模型,然后根据更新后的世界模型、预设的目标和效用函数使用决策算法生成多个可能的行动序列,最后评估每个行动序列的效用并选择效用最高的执行 | 复杂的路径规划机器人(如自动驾驶汽车的路径规划,需要考虑时间、油耗、安全性等多个因素)、复杂的投资策略制定助手 | 基于Tree of Thoughts (ToT)或Self-Discovery范式的复杂任务智能体(大模型可以理解目标、生成多个可能的推理路径或行动序列、评估每个路径或序列的效用、选择最优的执行) |
| 学习型智能体(Learning Agent) | 具备自我学习和自我优化能力的智能体——可以从历史的感知数据、决策过程、行动结果和目标完成进度中学习,不断优化其世界模型、效用函数、规划算法或决策算法 | 由“学习元件”(Learning Element)、“评论元件”(Critic Element)、“性能元件”(Performance Element)和“问题生成器”(Problem Generator)四个部分组成: 1. 性能元件:负责根据当前的感知状态、世界模型、目标和效用函数做出决策和行动; 2. 评论元件:负责根据行动结果和目标完成进度评估性能元件的优劣,并生成反馈信号; 3. 学习元件:负责根据评论元件的反馈信号优化世界模型、效用函数、规划算法或决策算法; 4. 问题生成器:负责生成新的、有挑战性的问题,以便学习元件进一步优化性能 |
复杂的自动驾驶汽车(可以从历史的驾驶数据中学习,不断优化驾驶策略)、复杂的游戏AI(如AlphaGo、AlphaStar) | 基于强化学习(RL)或自监督学习(Self-Supervised Learning)的自我优化智能体(如Google的Self-Discovery Agent、Meta的Reflexion Agent) |
2.3.2 按是否具备多模态能力分类
根据AI Agents是否具备多模态感知和多模态生成能力,可以分为以下两种类型:
| 智能体类型 | 核心定义 | 感知能力 | 生成能力 | 典型应用场景 | 示例 |
|---|---|---|---|---|---|
| 单模态AI Agents | 只能感知和生成单一种类的数据(通常是文本)的AI Agents | 只能感知文本数据 | 只能生成文本数据 | 简单的FAQ聊天机器人、简单的代码辅助工具、简单的内容生成工具 | 早期的AutoGPT(只能调用文本类的外部工具,生成文本类的结果)、基于GPT-3.5-turbo的简单对话助手 |
| 多模态AI Agents | 可以感知和生成多种类型的数据(如文本、图片、音频、视频等)的AI Agents | 可以感知文本、图片、音频、视频等多种类型的数据 | 可以生成文本、图片、音频、视频等多种类型的数据 | 复杂的个人助手、复杂的客户服务机器人、复杂的内容生产系统、复杂的机器人控制 | 基于GPT-4V的多模态个人助手、基于Claude 3 Opus的多模态内容生产系统、基于Gemini Ultra的多模态机器人控制 |
2.3.3 按是否具备多Agent协作能力分类
根据AI Agents是否具备多Agent协作能力,可以分为以下两种类型:
| 智能体类型 | 核心定义 | 适用场景 | 示例 |
|---|---|---|---|
| 单AI Agents | 只有一个智能体的系统,所有的感知、记忆、认知、行动和优化都由这个智能体完成 | 简单的、单领域的、不需要多技能协作的任务 | 基于ReAct范式的单步骤订票助手、简单的代码辅助工具 |
| 多AI Agents系统(Multi-Agent System, MAS) | 有多个智能体的系统,每个智能体都有自己的感知、记忆、认知、行动和优化能力,并且可以与其他智能体或人类进行沟通和协作 | 复杂的、多领域的、需要多技能协作的任务 | 由“选题策划Agent”“内容创作Agent”“内容审核Agent”“SEO优化Agent”“排版发布Agent”组成的多Agent协作的自动化内容生产系统、由“产品经理Agent”“架构师Agent”“开发工程师Agent”“测试工程师Agent”“运维工程师Agent”组成的多Agent协作的自动化软件开发系统 |
2.3.4 按应用场景分类
根据AI Agents的应用场景,可以分为以下多种类型:
- 个人助手类AI Agents;
- 企业办公类AI Agents;
- 医疗健康类AI Agents;
- 金融科技类AI Agents;
- 智能制造类AI Agents;
- 游戏娱乐类AI Agents;
- 科学研究类AI Agents;
- 教育培训类AI Agents;
- 政务服务类AI Agents;
- ……
2.4 AI Agents的发展历史(问题演变发展历史的Markdown表格)
AI Agents的发展历史可以分为以下几个阶段,每个阶段都有其标志性的事件、研究成果和技术特点:
| 阶段名称 | 时间范围 | 标志性事件/研究成果 | 核心技术特点 | 主要问题/挑战 |
|---|---|---|---|---|
| AI Agents的萌芽期 | 20世纪50-60年代 | 1. 1950年,图灵提出“图灵测试”(Turing Test),首次探讨了“机器是否具有智能”的问题; 2. 1951年,马文·明斯基(Marvin Minsky)和迪恩·埃德蒙兹(Dean Edmonds)开发了第一个人工神经网络——感知机(Perceptron); 3. 1956年,达特茅斯会议(Dartmouth Conference)召开,正式提出了“人工智能”(Artificial Intelligence, AI)的概念; 4. 1958年,约翰·麦卡锡(John McCarthy)发明了LISP语言,这是第一个专门用于人工智能研究的编程语言; 5. 1961年,麻省理工学院开发了第一个聊天机器人——ELIZA,它可以模拟心理医生与用户进行对话; 6. 1969年,斯坦福研究所开发了第一个移动机器人——Shakey,它可以感知环境、规划路径、执行行动。 |
1. 基于规则的专家系统(Rule-Based Expert Systems); 2. 简单的感知机和神经网络; 3. 简单的路径规划算法; 4. 单模态(文本)的感知和生成能力。 |
1. 规则的数量有限,无法处理复杂的、非结构化的问题; 2. 感知机只能处理线性可分的问题,无法处理非线性问题; 3. 路径规划算法的效率很低,无法处理大规模的环境; 4. 没有长期记忆能力和自我学习能力。 |
| AI Agents的探索期 | 20世纪70-80年代 | 1. 1972年,斯坦福大学开发了第一个医疗专家系统——MYCIN,它可以帮助医生诊断血液感染疾病并推荐治疗方案; 2. 1975年,马文·明斯基提出了“框架理论”(Frame Theory),用于表示知识; 3. 1976年,爱德华·费根鲍姆(Edward Feigenbaum)提出了“知识工程”(Knowledge Engineering)的概念,强调知识在人工智能中的重要性; 4. 1980年,约翰·塞尔(John Searle)提出了“中文房间论证”(Chinese Room Argument),质疑了“强人工智能”(Strong AI)的可能性; 5. 1986年,大卫·鲁梅尔哈特(David Rumelhart)、杰弗里·辛顿(Geoffrey Hinton)和罗纳德·威廉姆斯(Ronald Williams)发表了著名的论文《通过误差反向传播学习表示》(Learning Representations by Back-Propagating Errors),解决了多层感知机的训练问题,掀起了“神经网络的第二次浪潮”; 6. 1987年,罗德尼·布鲁克斯(Rodney Brooks)提出了“包容架构”(Subsumption Architecture),用于构建不需要中央规划的、基于行为的机器人。 |
1. 基于规则的专家系统得到了广泛的应用; 2. 多层感知机和误差反向传播算法得到了发展; 3. 基于行为的机器人技术得到了发展; 4. 知识表示方法得到了发展(如框架理论、语义网络、本体论等)。 |
1. 专家系统的知识获取瓶颈(Knowledge Acquisition Bottleneck)——需要人工将专家的知识转化为规则; 2. 多层感知机的训练速度很慢,需要大量的标注数据; 3. 基于行为的机器人无法处理复杂的、需要长期规划的任务; 4. 仍然没有长期记忆能力和自我学习能力。 |
| AI Agents的发展期 | 20世纪90年代-2010年代 | 1. 1997年,IBM的深蓝(Deep Blue)战胜了国际象棋世界冠军加里·卡斯帕罗夫(Garry Kasparov); 2. 2006年,杰弗里·辛顿提出了“深度学习”(Deep Learning)的概念,掀起了“神经网络的第三次浪潮”; 3. 2011年,IBM的沃森(Watson)参加了美国著名的智力竞赛节目《危险边缘》(Jeopardy!)并获得了冠军; 4. 2012年,多伦多大学的Alex Krizhevsky、Ilya Sutskever和杰弗里·辛顿开发了AlexNet,在ImageNet图像识别竞赛中获得了冠军,准确率大幅提升; 5. 2014年,Ian Goodfellow提出了生成对抗网络(Generative Adversarial Networks, GANs); 6. 2016年,Google DeepMind的AlphaGo战胜了围棋世界冠军李世石; 7. 2017年,Google Brain的Ashish Vaswani等人发表了著名的论文《Attention Is All You Need》,提出了Transformer架构,这是大模型发展的基石; 8. 2018年,OpenAI发布了GPT-1,这是第一个基于Transformer架构的生成式预训练大模型; 9. 2019年,Google DeepMind的AlphaStar战胜了《星际争霸2》的职业选手; 10. 2020年,OpenAI发布了GPT-3,这是第一个具有“通用人工智能”(Artificial General Intelligence, AGI)雏形的大模型。 |
1. 深度学习技术得到了快速的发展; 2. Transformer架构成为了大模型的标准架构; 3. 生成式预训练大模型(Generative Pre-trained Transformers, GPTs)得到了发展; 4. 强化学习技术得到了发展(如AlphaGo、AlphaStar); 5. 多模态感知和生成技术得到了发展(如AlexNet、GANs)。 |
1. 大模型的训练成本很高,需要大量的计算资源和数据; 2. 大模型的知识截止时间固定,无法获取实时、动态、领域特定的外部信息; 3. 大模型无法直接改变物理或数字世界的状态; 4. 大模型没有长期记忆能力; 5. 大模型的“幻觉”(Hallucination)问题——会生成虚假的、不符合事实的内容。 |
| AI Agents的爆发期 | 2022年至今 | 1. 2022年11月,OpenAI发布了ChatGPT,这是第一个面向普通用户的、具有“通用人工智能”雏形的对话式大模型应用,迅速火遍全球; 2. 2023年3月,OpenAI发布了GPT-4,这是第一个具有多模态感知能力(视觉感知)的大模型; 3. 2023年3月,AutoGPT(最早火出圈的开源通用Agent)发布; 4. 2023年4月,LangChain发布了LangChain Agents和LangChain Tools; 5. 2023年5月,Meta AI发布了ReAct范式的论文《ReAct: Synergizing Reasoning and Acting in Language Models》; 6. 2023年7月,Meta AI发布了Reflexion范式的论文《Reflexion: Language Agents with Verbal Reinforcement Learning》; 7. 2023年8月,OpenAI发布了Assistants API(官方的Agent开发框架); 8. 2023年9月,Stanford HAIR实验室发布了Tree of Thoughts (ToT)范式的论文《Tree of Thoughts: Deliberate Problem Solving with Large Language Models》; 9. 2023年10月,Google DeepMind发布了Self-Discovery范式的论文《Self-Discovery: LLMs Self-Compose Reasoning Structures》; 10. 2023年11月,LangChain发布了LangGraph(Agent工作流编排工具); 11. 2023年12月,Google发布了Gemini Ultra,这是目前(202X年X月)最强的多模态大模型之一; 12. 2024年2月,Anthropic发布了Claude 3系列(Opus、Sonnet、Haiku),这是目前(202X年X月)最强的多模态大模型之一; 13. 2024年3月,OpenAI发布了GPT-4o,这是一个“全模态”(Omni-Modal)的大模型,可以同时感知和生成文本、图片、音频、视频等多种类型的数据。 |
1. 大模型技术得到了快速的发展,多模态能力越来越强; 2. 各种AI Agents算法范式层出不穷(如ReAct、Reflexion、Self-Discovery、ToT、RAV等); 3. 各种AI Agents开源框架和开发工具层出不穷(如LangChain、LangGraph、AutoGPT、CrewAI、Assistants API、LlamaIndex等); 4. 多Agent协作技术得到了快速的发展; 5. AI Agents开始从“实验室”走向“落地应用”。 |
1. AI Agents的可靠性(Reliability)问题——无法保证每次都能完成目标; 2. AI Agents的可控性(Controllability)问题——无法完全控制AI Agents的行为; 3. AI Agents的“幻觉”问题仍然存在; 4. AI Agents的成本问题——调用大模型和外部工具的成本很高; 5. AI Agents的安全与隐私保护问题——可能会泄露用户的隐私信息,或者被用来做坏事; 6. AI Agents的可解释性(Interpretability)问题——无法解释AI Agents的决策过程。 |
2.5 AI Agents的技术基础
要理解和开发AI Agents,需要掌握以下几个核心的技术基础:
2.5.1 大模型(Large Language Models, LLMs)
大模型是AI Agents的“核心大脑”,负责AI Agents的认知推理、决策制定、任务拆解、提示词生成等核心工作。目前(202X年X月)主流的大模型包括:
- 通用大模型(General-Purpose LLMs): OpenAI的GPT-4o、GPT-4、GPT-3.5-turbo,Anthropic的Claude 3 Opus、Claude 3 Sonnet、Claude 3 Haiku,Google的Gemini Ultra、Gemini Pro、Gemini Flash,Meta的Llama 3、Llama 2,百度的文心一言4.0,阿里的通义千问3.0,腾讯的混元3.0,字节跳动的豆包4.0等;
- 代码模型(Code LLMs): OpenAI的GPT-4o、GPT-4、GPT-3.5-turbo,Meta的CodeLlama,DeepSeek的DeepSeek-Coder,StarCoder等;
- 医疗模型(Medical LLMs): Google的Med-PaLM 2,Meta的Llama 3 Med,百度的文心一言医疗版,阿里的通义千问医疗版等;
- 金融模型(Financial LLMs): Bloomberg的BloombergGPT,Meta的Llama 3 Fin,百度的文心一言金融版,阿里的通义千问金融版等;
- 多模态大模型(Multimodal LLMs, MLLMs): OpenAI的GPT-4o、GPT-4V,Anthropic的Claude 3 Opus、Claude 3 Sonnet,Google的Gemini Ultra、Gemini Pro,Meta的Llama 3 Multimodal等。
2.5.2 向量数据库(Vector Databases)
向量数据库是AI Agents的“长期记忆库”的核心组件,负责存储和检索AI Agents的历史感知数据、决策过程、行动结果、目标完成进度、领域特定知识等的向量表示。目前(202X年X月)主流的向量数据库包括:
- 开源向量数据库: Chroma、Pinecone的开源替代品(如Weaviate、Qdrant、Milvus、FAISS、Pinecone的开源社区版?不,Pinecone是商业的,开源的是上面几个)、LangChain的VectorStore接口支持的其他开源向量数据库;
- 商业向量数据库: Pinecone、Weaviate Cloud、Qdrant Cloud、Milvus Cloud、AWS Kendra、Azure Cognitive Search、Google Vertex AI Vector Search等。
2.5.3 LangChain
LangChain是目前(202X年X月)最流行的AI Agents开发框架之一,它提供了一套统一的接口和工具,帮助开发者快速构建基于大模型的应用,包括:
- LLMs接口: 支持调用各种主流的大模型;
- Prompts接口: 提供了一套提示词模板(Prompt Templates)和提示词管理工具;
- Chains接口: 提供了一套将多个组件(如LLMs、Prompts、Tools、Memory等)连接起来的工具;
- Agents接口: 提供了一套构建AI Agents的工具,包括各种Agent类型(如ReAct Agent、OpenAI Functions Agent、OpenAI Assistants Agent等)和Toolkits(如Python REPL Toolkit、Google Search Toolkit、Wikipedia Toolkit等);
- Memory接口: 提供了一套存储和检索AI Agents记忆的工具,包括各种Memory类型(如ConversationBufferMemory、ConversationSummaryMemory、ConversationBufferWindowMemory、VectorStoreRetrieverMemory等);
- VectorStores接口: 支持调用各种主流的向量数据库;
- DocumentLoaders接口: 提供了一套加载各种类型文档(如PDF、Word、Excel、CSV、TXT、HTML等)的工具;
- TextSplitters接口: 提供了一套将长文本分割成小的文本块(Chunks)的工具;
- Embeddings接口: 支持调用各种主流的文本嵌入模型(如OpenAI的text-embedding-3-small、text-embedding-3-large,Cohere的Embed模型,Hugging Face的Sentence-Transformers模型等)。
2.5.4 LangGraph
LangGraph是LangChain团队在2023年11月发布的一个Agent工作流编排工具,它允许开发者使用“状态机”(State Machine)的方式构建和编排AI Agents的工作流,支持:
- 复杂的工作流编排: 支持循环、条件分支、并行执行等复杂的工作流逻辑;
- 状态管理: 提供了一套统一的状态管理机制,允许开发者在工作流的各个组件之间传递和共享状态;
- 可视化: 提供了一套工作流可视化工具,帮助开发者更好地理解和调试工作流;
- 多Agent协作: 支持构建多Agent协作的工作流。
2.5.5 其他相关技术
除了上面提到的几个核心技术基础外,要理解和开发AI Agents,还需要掌握以下几个相关的技术:
- 提示词工程(Prompt Engineering): 提示词是大模型的“输入”,提示词的质量直接影响大模型的输出质量,因此提示词工程是AI Agents开发中非常重要的一个环节;
- 函数调用(Function Calling)/工具调用(Tool Calling): 大模型无法直接改变物理或数字世界的状态,因此需要通过函数调用/工具调用的方式调用外部工具;
- 强化学习(Reinforcement Learning, RL): 强化学习可以用来训练和优化AI Agents的决策和行动策略;
- 自监督学习(Self-Supervised Learning): 自监督学习可以用来帮助AI Agents从大量的无标注数据中学习;
- 多模态感知和生成技术: 多模态感知和生成技术可以用来帮助AI Agents感知和生成多种类型的数据;
- API开发和集成技术: API开发和集成技术可以用来帮助AI Agents调用外部工具;
- 系统设计和架构设计技术: 系统设计和架构设计技术可以用来帮助开发者设计和构建高性能、高可用、可扩展的AI Agents系统;
- 安全与隐私保护技术: 安全与隐私保护技术可以用来帮助AI Agents保护用户的隐私信息,防止被用来做坏事。
三、 核心内容/能力栈深度解析 (The Core - “How-To”)
本章是本文的核心部分,将从感知层、记忆层、认知层、行动层、协作层、优化层6个维度,全面拆解AI Agents的核心能力,包括每个能力的定义、核心要素、实现原理、技术选型、数学模型、算法流程、代码示例等。
为了更好地理解AI Agents的6层核心能力栈,我们先来看一下AI Agents的核心能力栈的架构图(Mermaid架构图):
更多推荐



所有评论(0)