[认知计算] 大模型与智能体

个人导航

知乎:https://www.zhihu.com/people/byzh_rc

CSDN:https://blog.csdn.net/qq_54636039

注:本文仅对所述内容做了框架性引导,具体细节可查询其余相关资料or源码

参考文章:各方资料

基本概念

人工智能技术从 “感知智能” 向 “认知智能” 跨越的过程中,大模型(LLM)智能体(Agent) 成为两大核心支柱

前者解决了 “理解与生成” 的语言能力瓶颈,后者突破了 “决策与行动” 的应用边界

  • 大模型是 “智能大脑”,专注于语言理解与知识处理
    -> 高效处理语言类任务(如文案生成、知识问答)
  • 智能体是 “行动主体”,聚焦于目标拆解与任务执行
    -> 将模糊的人类意图转化为可落地的自动化工作流

LLM + Agent -> 协同

大模型为智能体提供 “认知基础”,智能体为大模型提供 “应用载体”,二者形成 “1+1>2” 的协同效应

  • 大模型对智能体的支撑
  • 智能体对大模型的延伸
大模型:智能体的 “决策核心与交互接口”

意图解析器:将模糊需求转化为结构化指令

人类需求常存在模糊性(如 “帮我处理订单问题”),大模型可通过语境分析拆解出具体需求(是 “查询物流”“申请退款” 还是 “修改地址”),并提取关键信息(订单号、用户联系方式),转化为智能体可执行的结构化指令(如 “调用物流 API,查询订单 12345 的当前状态”)

决策辅助器:为行动提供逻辑支撑

智能体在复杂任务中需判断 “为何行动” 与 “如何行动”,大模型可基于海量知识与推理能力提供决策依据

  • 医疗 Agent 制定治疗方案时,大模型可分析患者病历、过往案例、最新医学文献,生成 “推荐采用化疗 + 免疫联合疗法” 的建议
  • 库存优化 Agent 中,大模型可基于市场趋势预测,建议 “优先促销滞销商品 A,而非商品 B”

交互接口:实现人性化反馈

智能体的行动结果(如 “API 返回库存 = 5,补货状态 = 已下单”)是技术化数据,需大模型转化为人类易懂的自然语言(如 “您关注的商品 A 目前还有 5 件库存,已为您安排补货,预计 3 天后到货”)

智能体:大模型的 “能力延伸与场景落地载体”

记忆系统:弥补大模型 “知识遗忘” 缺陷

大模型的 “上下文窗口” 有限
-> 智能体通过 “短期记忆 + 长期记忆” 系统解决这一问题:

  • 短期记忆:存储当前会话上下文(如用户 “喜欢辣口味” 的临时需求),支持多轮对话
  • 长期记忆:通过向量数据库存储用户特征(如 “对海鲜过敏”)、业务数据(如企业历史财报),可实时检索调用

工具调用:突破大模型 “无法行动” 边界

大模型无法直接与外部系统交互,智能体通过 “工具接口” 为其赋予行动能力

  • 数据类工具:API(天气查询、股票数据)、数据库(SQL 查询)、RAG(检索专业知识库)
  • 执行类工具:代码执行器(运行 Python 脚本处理数据)、IoT 接口(控制智能家居灯光)、插件(ChatPDF 解析文档、Midjourney 文生图)

规划模块:解决大模型 “任务拆解” 短板

大模型无法将复杂任务拆解为可执行的子步骤,智能体的规划模块通过 “思维链(CoT)”“ReAct” 等提示工程技术,实现任务拆解

  • 第一步:调用 RAG 工具获取客户数据(数据收集)
  • 第二步:大模型基于数据生成报告初稿(报告整理)
  • 第三步:调用企业 OA 工具确定汇报人(汇报人选定)
  • 第四步:自动提交至管理层系统(任务闭环)

Agent的设计:从单智能体到多智能体协作

目前业界主流的设计模式由吴恩达(Andrew Ng)提出,分为反思式、工具调用型、规划型、多智能体协作四类

1.反思式 Agent(Reflection)—— 自我迭代优化

模拟人类 “复盘” 行为,通过 “生成 - 评估 - 改进” 的闭环,让智能体在任务执行中自主修正错误

适用场景:对输出精度要求高的任务(如代码生成、文案优化、报告撰写)

组件:

  • Actor:生成初始解决方案
  • Evaluator:基于目标评估初始方案
  • Self-Reflection:根据评估结果生成改进建议
  1. Actor 生成初始 Python 代码(实现 “数据排序” 功能)
  2. Evaluator 运行代码,发现 “未处理空列表报错” 的问题
  3. Self-Reflection 生成改进建议:“添加空列表判断逻辑,避免 IndexError”
  4. Actor 根据建议优化代码,直至通过所有测试
2.工具调用型 Agent(Tool Use)—— 拓展能力边界

通过调用外部工具弥补智能体自身能力缺陷,将 “无法独立完成的任务” 转化为 “工具可执行的步骤”

适用场景:需外部数据 / 执行能力的任务(如天气查询、网页检索、文档解析)

  1. 任务识别:判断当前任务是否需要工具(如 “查询明天北京天气” 需调用天气 API);
  2. 工具选择:从工具库中匹配最合适的工具(如 “生成图片” 选 Midjourney);
  3. 参数生成:将任务转化为工具可识别的参数(如调用天气 API 需传入 “城市 = 北京,日期 = 明天”);
  4. 结果处理:解析工具返回结果(如 API 返回的 JSON 数据),并结合大模型生成最终答案

实践案例:智能购物助手
(用户需求 “推荐目前口碑最好的咖啡机”)

  1. 判断任务需 “实时数据”,选择 “网页检索工具”
  2. 生成检索参数 “关键词 = 2025 咖啡机 口碑排名,来源 = 知乎 / 小红书”
  3. 调用工具获取检索结果(如 “德龙 EC9665、飞利浦 EP5144 排名前二”)
  4. 大模型结合结果,生成 “推荐德龙 EC9665(奶泡细腻,适合家用)” 的自然语言回复
3.规划型 Agent(Planning)—— 拆解复杂任务

模拟人类 “任务规划” 思维,将复杂、长期目标拆解为 “小而可执行” 的子任务,避免智能体陷入 “逻辑混乱” 或 “步骤遗漏”

适用场景:需多步骤协同的任务(如生成工作报告、组织旅行、项目管理)

  • 任务拆解:通过 “思维链(CoT)” 提示大模型,将目标拆分为子步骤
  • 顺序排序:明确子任务的依赖关系
  • 动态调整:根据子任务执行结果调整后续步骤

工作报告生成 Agent:
(目标 “生成 Q3 销售部门工作报告”)

  1. 拆解子任务:“收集 Q3 销售数据→分析同比 / 环比变化→识别核心问题→提出改进建议→生成 PPT 报告”
  2. 顺序执行:先调用 “销售数据库工具” 获取数据,再由大模型分析变化,最后调用 “PPT 生成工具” 输出报告
  3. 动态调整:若数据显示 “华东区域销量下滑 30%”,则在 “核心问题” 环节增加 “华东区域渠道优化” 的分析
4.多智能体协作(Multi-agent Collaboration)—— 应对复杂系统

当任务涉及多领域、多角色时,单智能体难以覆盖所有能力,需构建 “多智能体团队”,通过角色分工与交互协作完成目标,模拟人类组织的 “部门协作” 模式

适用场景:跨领域复杂任务(如企业数字化转型、大型项目开发、医疗会诊)

  • 角色定义:为每个 Agent 分配明确职责
  • 通信机制:设计 Agent 间的信息交互接口
  • 协调机制:设定 “主导 Agent” 或 “规则引擎”,避免协作冲突

电商平台运营团队:
(目标 “提升双 11 促销转化率”)

  1. 角色分工:
    • 数据分析师 Agent:分析历史促销数据,确定 “核心客群为 25-35 岁女性”
    • 营销策划 Agent:基于客群特征,设计 “满 300 减 50 + 赠品” 的促销方案
    • 客服 Agent:提前培训促销规则,准备常见问题话术
    • 库存 Agent:根据促销方案,调整热门商品库存
  2. 协作流程:
    • 数据分析师 Agent 将客群数据传入共享记忆库
    • 营销策划 Agent 基于数据生成方案,发送至库存 Agent
    • 库存 Agent 确认库存充足后,反馈至营销策划 Agent,最终执行促销

LLM + Agent的落地挑战

  1. 幻觉问题:决策的不可靠性
    大模型的 “幻觉”(编造不存在的信息)会传递给智能体,导致错误决策
    例如:医疗 Agent 中,大模型编造 “某药物可治疗癌症” 的虚假知识,可能引发医疗事故;财报分析 Agent 中,大模型误算 “净利润增长率”,导致投资决策失误
  2. 泛化能力弱:场景的局限性
    智能体的规划能力依赖 “任务边界清晰、工具定义明确” 的场景,在动态的环境中易陷入逻辑混乱
    例如:通用助手 Agent 在处理 “帮我办一场生日会” 的任务时,可能遗漏 “预订场地→确认嘉宾→准备蛋糕” 的关键步骤,或无法应对 “场地临时取消” 的突发情况
  3. 工具调用不稳定:交互的不可控性
    智能体依赖外部工具的 API 接口,但工具的 “参数变更、服务故障、权限限制” 会导致调用失败
    例如:航班查询 API 突然调整返回格式,会导致客服 Agent 无法解析余票数据;数据库权限过期,会导致库存 Agent 无法获取实时库存

大模型智能体

大模型: LLM
智能体: AI Agent

大模型Agent是一种构建于大型语言模型(LLM)之上的智能体,它具备环境感知能力、自主理解、决策制定及执行行动的能力

Agent能够模拟独立思考过程,灵活调用各类工具,逐步达成预设目标

大模型Agent由规划、记忆、工具与行动四大关键部分组成

在这里插入图片描述

规划(Planning)

定义:规划是Agent的思维模型,负责拆解复杂任务为可执行的子任务

实现方式:通过大模型提示工程(如ReAct、CoT推理模式)实现

记忆(Memory)

定义:记忆即信息存储与回忆,包括短期记忆和长期记忆

实现方式:短期记忆用于存储会话上下文,支持多轮对话;长期记忆则存储用户特征、业务数据等,通常通过向量数据库等技术实现快速存取

工具(Tools)

定义:工具是Agent感知环境、执行决策的辅助手段

实现方式:通过接入外部工具(如API、插件)扩展Agent的能力,如ChatPDF解析文档、Midjourney文生图等

行动(Action)

定义:行动是Agent将规划与记忆转化为具体输出的过程,包括与外部环境的互动或工具调用

实现方式:Agent根据规划与记忆执行具体行动,如智能客服回复、查询天气预报、AI机器人抓起物体等

LLM Agent + RAG

RAG技术为LLM Agent提供了额外的知识来源

RAG(Retrieval Augmented Generation):检索增强生成

通过引入RAG,LLM Agent能够在需要时查询外部知识库,如专业数据库、学术论文、行业报告等,从而增强其知识广度和深度

例题

在这里插入图片描述

首先,借鉴人类 “模块化认知” 架构,优化 LLM 的网络结构分工。
现有 LLM 多采用统一的 Transformer 架构,缺乏明确的功能分化。未来可设计模块化模型,例如将负责基础语言理解的模块、逻辑推理的模块、常识存储与调用的模块分离,通过特定的交互机制实现模块间协同,避免单一架构下 “所有任务一锅煮” 导致的推理精度不足问题。

其次,模拟人类 “分层记忆” 机制,提升模型的上下文管理与知识复用能力。
现有 LLM 的上下文窗口本质是 “有限长度的短时记忆”,缺乏对长时知识的高效检索与整合。可引入记忆分层设计:将高频复用的常识、领域知识存储于 “长时记忆库”(类似人类的语义记忆),通过注意力机制或检索增强技术(RAG)实现按需提取;将当前对话、任务上下文作为 “短时记忆”,优化窗口内信息的优先级排序

再者,融合人类 “因果推理” 与 “常识认知” 模式,弥补 LLM 的逻辑缺陷。
当前 LLM 擅长捕捉文本中的统计规律,但缺乏对因果关系的深层理解。改进方向包括:在训练数据中融入因果结构信息(如因果图谱、逻辑规则),让模型学习 “因 - 果” 关联而非仅 “相关” 关联;借鉴认知科学中的 “心理理论”(Theory of Mind),让模型模拟人类对他人意图、信念的推断能力,提升社交交互中的语境适配性

最后,模仿人类 “渐进式学习” 与 “反馈调节” 机制,优化模型的学习与迭代方式。
现有 LLM 多依赖大规模静态数据的一次性预训练,缺乏动态反馈与渐进式优化。可引入增量学习与强化学习的结合:先通过基础数据让模型掌握底层语言能力(类似人类的语言习得阶段),再通过领域数据逐步提升专业能力(类似人类的专业学习);同时借鉴人类的 “纠错学习”,将人类反馈强化学习(RLHF)扩展为更精细的 “认知反馈”

更多推荐