本文详细介绍了AI Agent的概念及核心模块,包括LLM(大脑)、感知、记忆、行动和规划。文章阐述了不同规划模式(ReAct和Plan-and-Solve)、评估方法、成本分析,对比了Agent与Workflow的区别,以及FM Agent与RL Agent的特点,为构建智能体提供了全面指导。


1 什么是Agent

智能体(Agent) 是指能够感知环境进行决策采取行动以实现某种目标的系统。

现在我们把Agent想象成一个人,这样便于我们更好的理解,比如说我们走在路上,看到对面有辆车开过来了,这个时候我们本能的会去躲避,那整个过程是怎么发生的呢?

看到对面有车开过来,这是通过眼睛看到信息,通过神经传递给大脑,大脑调动之前的记忆发现如果这个时候不躲开,就有可能会被车撞,然后驱动着脚走到旁边去。

上面的过程就是感知路面环境、大脑决策最后采取行动的过程。基于上面的过程我们可以看出,Agent会包含以下核心模块。

2 Agent核心模块

见下图,不同的机构或团队对Agent的核心模块划分不同,但都包含了感知记忆规划行动四个模块。

2.1 LLM(大语言模型)

先简单说下大语言模型,它是智能体的核心,相当于人的大脑,背后的神经网络设计也是基于人类大脑的神经系统,尤其是神经元(Neuron)之间的连接与信号传递方式。

关于大语言模型就不再详细说了,大家基本每天都在用。然后还是想着重说下深度学习,因为它与传统的软件研发流程不一样。就像AI大神卡帕西(斯坦福读书时的导师是李飞飞, OpenAI的创始成员之一,后面被马斯克亲自招募,出任特斯拉的AI总监,之后又回到OpenAI,去年,他正式宣布离开OpenAI)最近的一个演讲中,提到的一个概念,叫 “软件3.0”

  • 软件1.0,是我们最熟悉的传统软件研发流程,指的是由人类程序员一行行编写代码的方式,我们之前的研发流程都属于软件1.0。
  • 软件2.0,是随着深度学习的兴起而出现的。它的核心已经不再是人工编写的代码,而是通过训练来控制神经网络的权重。这个阶段,很多事情不再依赖程序员去手动写逻辑,而是依靠数据驱动模型进行“学习”,而且泛化能力也很好。
  • 软件3.0,就是我们现在通过cursor、trae、winself等AI 开发工具用自然语言进行编程,它大大降低了软件创造的门槛。

但仔细想想我们好像直接从1.0跳到了3.0,并没有经过2.0,但实际上软件2.0的应用其实还是蛮多的,尤其是一些垂直行业,如医疗健康,让机器学习看片子,帮助医生看病;如农业领域,能够预测作物产量和优化种植策略;还有教育行业,能够个性化学习路径和提高学习效率等等。

所以我觉得大家有兴趣可以了解了解。推荐两本书:《深度学习革命》、《深入浅出神经网络与深度学习》

2.2 Perception(感知)

即智能体对环境的感知,一个人可以通过眼睛、耳朵来感知环境,机器人可以通过雷达和摄像头感知环境,软件中主要是基于我们输入的上下文数据,可以是文本、图片、视频、语音、文件等等。

2.3 Memory(记忆)

大模型其实是没有记忆的,只能通过外部技术(如RAG、ES)模拟记忆效果,以增强任务表现和交互连贯性。

分为短期记忆(Short-term)长期记忆(Long-term)。个人认为记忆对于大模型来说非常重要,因为随着对模型的不断使用,如果模型厂商如果把这些使用的记录全部变成记忆,那模型就会越来越懂我们,使用起来也会越来越顺手,而不像现在,每次在提示词上要还很多时间,而且换个窗口后又得重来一次。

2.3.1 短期记忆依赖模型上下文的token限制

参考代码如下, 在每次调用大模型的时候,需要将工具返回的信息、人的反馈信息等都塞到messages中,然后去调用大模型接口。

ounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(line
2.3.2长期记忆依赖于外部组件(如RAG, elasticsearch)

可以通过文件或数据库来做存储介质,可以搜索、更新, 长期记忆又可以继续分,如用户画像记忆,情景记忆,事实记忆等。

  • 接下来讲下在蛋糕烘培助手案例中是如何处理记忆的,实时的对话信息作为工作记忆,存在内存中,到达一定阈值后,由大模型来提取关键信息来作为短期记忆。然后上半年商机挖掘项目能够分析出客户画像,将这部分信息作为长期记忆存储起来,后续的对话,每次调用大模型的时候会进行召回并更新短期记忆的召回次数。这些短期记忆会进行周期性的评估(包括召回次数和重要性),重要的会合并进核心记忆,不重要的进行遗忘。
  • 整体会分三层:工作记忆、短期记忆、 长期记忆
  • 每次询问通过向量检索更新短期记忆召回次数
  • 短期记忆由大模型来进行提取为边缘记忆,并设置重要性评分

2.4 Action(行动)

行动很好理解,LLM相当于我们的大脑,但是光有大脑,没有手脚也做不成事,所以Agent就需要借助外部的工具进行行动。

我们需要把我们的工具(包括名称、描述和需要的参数)告诉LLM,当LLM来决定是否用工具,以及什么时机用工具。

介绍下案例中使用的商品查询工具,即用户通过一个问题或图片就能找到商家后台商品库的商品

  • 商品的关键词查找处理:
  • 将商家后台的商品图片和标题通过多模态模型提取出关键信息;
  • 大模型会提取出关键信息,然后让工具执行,在执行过程中将关键词和商家后台商品的关键信息项进行相似度检索,从而找出匹配的;
  • 图片的查找处理:
  • 将商家后台的商品图片向量化;
  • 模型提取出用户想要的蛋糕商品图片链接,然后和商家后台商品图片进行相似度匹配;
ounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(lineounter(line

2.5 Planning(规划)

规划这部分相对会复杂点,接下来主要将常见的两种规划模式,分别是ReActPlan-and-Resolve,除了这两种模式还有多Agent模式等。

2.5.1 ReAct(Reason + Action 推理 - 行动 - 反馈)

通过不断的推理、行动和反馈来最终完成用户的目标。

蛋糕烘培助手的流程如下图:

2.5.2 Plan-and-Solve

将任务分解成子目标并分布执行,这个和ReAct的区别是:Plan-and-Solve是先通过大模型将任务拆解,然后再分布执行,和ReAct是一步一步的去执行,两种模式适用的场景不一样。

比如说旅游规划的agent,就可以用Plan-and-Solve模式,先生成计划(如要了解天气、要了解住宿等),然后再解决计划, 最终整合让大模型完成回答, 当然中间也可以加反思,对计划进行反思等。

下面是基于Plan-and-Solve的流程图:

3 Agent评估报告

评估报告是Agent开发过程中不可或缺的环节,包括响应时间、完成度、工具使用情况、后续优化等,它能够系统性地收集和分析Agent的运行数据,为后续的优化和迭代提供科学依据。

所以在agent的设计环节都需要将这些数据都记录下来。

4 Agent成本分析

在做AI应用的过程中,我们经常会被问到一个问题,做个东西的成本怎么样?

AI相关应用与传统的应用之间的计费方式完全不一样了,所以Agent中每次的模型调用,所以针对Agent需要做成本分析。

基于成本分析可以进行价值回顾和agent的优化。

5 Agent vs Workflow

用一句话来概括它们之间的区别就是:Agent是你只需要告诉我你要什么,不需要告诉我怎么做,而workflow就是你要按照我编排好的路径来执行。一个是基于大模型来规划,一个是基于人来规划。

如何选择?

  • 选Workflow
  • 数据处理管道

  • 文档审批流程

  • 任务流程相对固定,步骤可预定义

  • 需要严格的执行顺序和质量控制

  • 要求高可靠性和可重复性

  • 涉及多个系统集成,需要标准化流程

  • 合规要求严格,需要审计追踪

  • 如:数据处理管道、文档审批流程

  • 选Agent
  • 智能客服助手

  • 个人AI助理

  • 复杂问题诊断

  • 任务需要动态决策和灵活应对

  • 环境不确定性高,需要自主判断

  • 要求个性化和上下文理解

  • 需要创造性解决问题

  • 用户交互频繁,需要对话式体验

  • 如:智能客服助手、个人AI助理、复杂问题诊断

6 FM Agent 与 RL Agent

以上讲的都是FM Agent,是基于大型预训练模型(Foundation Model) 的智能体,比如基于 GPT-4、Claude、Gemini 等大模型构建的智能体。

核心能力是利用大语言模型(LLM)的理解、推理、规划和生成能力来感知世界、做决策、执行任务。

除了FM Agent,还有RL Agent,它是基于强化学习(Reinforcement Learning) 原理构建的 Agent

它与环境交互,根据奖励信号学习最优策略,以最大化长期累计奖励。如DeepMind的AlphaGo Zero,在围棋游戏中击败了世界顶级选手,就是一个RL Agent。

7 最后

今天的分享只是掀开了 Agent 世界的一角。它的深度与潜力远不止于此,新的思路、框架与落地案例正层出不穷。希望这份经验与尝试,能为大家点亮一条更高效、更有趣的道路。

回过头来看,不论是 LLM、Workflow 还是 Agent,终究只是工具。只有当它们与真实业务场景发生化学反应,切实解决痛点,创造价值时,技术的光芒才会真正被点亮。愿我们带着好奇与敬畏,把技术的锋利,打磨成改变世界的钥匙。

如何学习AI大模型 ?

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。【保证100%免费】🆓

CSDN粉丝独家福利

这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】

读者福利: 👉👉CSDN大礼包:《最新AI大模型学习资源包》免费分享 👈👈

(👆👆👆安全链接,放心点击)

对于0基础小白入门:

如果你是零基础小白,想快速入门大模型是可以考虑的。

一方面是学习时间相对较短,学习内容更全面更集中。
二方面是可以根据这些资料规划好学习计划和方向。

👉1.大模型入门学习思维导图👈

要学习一门新的技术,作为新手一定要先学习成长路线图,方向不对,努力白费。

对于从来没有接触过AI大模型的同学,我们帮你准备了详细的学习成长路线图&学习规划。可以说是最科学最系统的学习路线,大家跟着这个大的方向学习准没问题。(全套教程文末领取哈)
在这里插入图片描述

👉2.AGI大模型配套视频👈

很多朋友都不喜欢晦涩的文字,我也为大家准备了视频教程,每个章节都是当前板块的精华浓缩。
在这里插入图片描述

在这里插入图片描述

👉3.大模型实际应用报告合集👈

这套包含640份报告的合集,涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师,还是对AI大模型感兴趣的爱好者,这套报告合集都将为您提供宝贵的信息和启示。(全套教程文末领取哈)

在这里插入图片描述

👉4.大模型实战项目&项目源码👈

光学理论是没用的,要学会跟着一起做,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战项目来学习。(全套教程文末领取哈)
在这里插入图片描述

👉5.大模型经典学习电子书👈

随着人工智能技术的飞速发展,AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型,如GPT-3、BERT、XLNet等,以其强大的语言理解和生成能力,正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。(全套教程文末领取哈)
在这里插入图片描述

👉6.大模型面试题&答案👈

截至目前大模型已经超过200个,在大模型纵横的时代,不仅大模型技术越来越卷,就连大模型相关的岗位和面试也开始越来越卷了。为了让大家更容易上车大模型算法赛道,我总结了大模型常考的面试题。(全套教程文末领取哈)
在这里插入图片描述

为什么分享这些资料?

只要你是真心想学AI大模型,我这份资料就可以无偿分享给你学习,我国在这方面的相关人才比较紧缺,大模型行业确实也需要更多的有志之士加入进来,我也真心希望帮助大家学好这门技术,如果日后有什么学习上的问题,欢迎找我交流,有技术上面的问题,我是很愿意去帮助大家的!

这些资料真的有用吗?

这份资料由我和鲁为民博士共同整理,鲁为民博士先后获得了北京清华大学学士和美国加州理工学院博士学位,在包括IEEE Transactions等学术期刊和诸多国际会议上发表了超过50篇学术论文、取得了多项美国和中国发明专利,同时还斩获了吴文俊人工智能科学技术奖。目前我正在和鲁博士共同进行人工智能的研究。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

在这里插入图片描述
在这里插入图片描述

CSDN粉丝独家福利

这份完整版的 AI 大模型学习资料已经上传CSDN,朋友们如果需要可以扫描下方二维码&点击下方CSDN官方认证链接免费领取 【保证100%免费】

读者福利: 👉👉CSDN大礼包:《最新AI大模型学习资源包》免费分享 👈👈

(👆👆👆安全链接,放心点击)

更多推荐