AI Agent的商业模式创新:从SaaS到服务即软件


一、 引言 (Introduction)

1.1 钩子:你和“AI同事”离你有多远?

想象一下:你刚结束一场马拉松式的周会,脑子里塞满了待办、会议纪要要点、跨部门协作请求和KPI拆解项。换作过去,你需要花2小时整理纪要、标注优先级、生成待办清单、发邮件给协作方,甚至还要查一下上周同类任务的历史数据来预估完成时间——这一切都得靠你自己,或者最多让你的实习生/助理熬大夜。但如果有一天,你只需要对着手机上的一个按钮说一句“把刚才的腾讯会议/飞书会议(假设会议录音转文字后同步到我的AI Agent处理”,15分钟后,一份带高亮决策、标注了负责人、时间节点和截止时间差预判的结构化纪要、自动关联上周同类型KPI拆解参考、自动生成了带协同链接、权限管控的待办看板、自动帮你选好了最擅长该任务协作优先级的协作邮件草稿、甚至自动帮你预约了跨部门会议室——这一切,不是科幻电影的片段,而是2024-2025年正在发生的AI Agent商业化落地的真实场景雏形。

而这,还只是AI Agent商业模式变革的冰山一角。从企业级的自动化办公助手到个人化的“第二大脑延伸,从电商平台的“全链路导购/售后Agent集群”到金融行业的“全天候风险监控/合规Agent网络”,从医疗领域的“个性化问诊/随访Agent,AI Agent正在以一种比SaaS(Software as a Service,软件即服务)从未有过的“深度、自主、个性化姿态,重新定义企业和用户对“数字化工具”的本质——它不再是被动等待用户点击的“静态工具集”,而是能理解意图、自主规划任务、调用外部工具/API、甚至能自主学习、自主迭代的“数字员工/数字孪生/数字分身”。

1.2 定义问题/阐述背景:SaaS的“增长天花板”与Agent的“破局契机”

在正式聊AI Agent的商业模式之前,我们必须先回顾一下过去15年左右全球科技行业的“数字化基础设施”的主导者”——SaaS模式的成功与困境。

1.2.1 SaaS模式的辉煌与成功逻辑

SaaS模式起源于20世纪90年代末Salesforce的“CRM即服务(No Software!)的口号,本质是把传统的本地部署软件(On-Premise)转变为“按需订阅、云端交付”的模式,彻底改变了企业软件的购买、部署、维护和付费逻辑:

  1. **购买逻辑从“资本支出(CAPEX)”转向“运营支出(OPEX)”,降低了中小企业的数字化门槛;
  2. **部署逻辑从“企业自己买服务器、装系统、请IT运维团队”转向“云端一键部署”,大幅缩短了上线时间;
  3. **维护逻辑从“企业承担服务器运维、版本升级”转向“SaaS厂商统一维护”,降低了企业的IT运维成本;
  4. **付费逻辑从“一次性买断,后续升级另付费”转向“按月/按季度/按年订阅,按需扩容/降容”,提高了SaaS厂商的现金流稳定性和客户粘性。

在过去的20多年里,SaaS模式创造了无数市值过千亿美元的科技巨头,比如Salesforce(市值峰值曾突破3000亿美元)、Adobe Creative Cloud(将Adobe从一家卖光盘的软件公司转变为市值2800亿美元的创意云服务商)、Zoom(疫情期间市值一度突破1600亿美元)、Figma(被Adobe收购时估值200亿美元)——可以说,SaaS模式是全球科技行业过去20年最成功的商业模式之一。

1.2.2 SaaS模式的“增长天花板”已经显现

但随着全球数字化基础设施的逐渐完善,SaaS模式的增长天花板已经越来越明显,主要体现在以下几个方面:

  1. 同质化竞争严重:在几乎所有的企业服务领域,都已经出现了大量的SaaS竞品,比如CRM领域的Salesforce、HubSpot、Zoho、纷享销客、销售易;比如办公协作领域的Slack、Microsoft Teams、飞书、钉钉、企业微信;比如项目管理领域的Asana、Trello、Jira、Notion、飞书多维表格——这些产品的核心功能越来越趋同,价格战也越来越激烈,SaaS厂商的获客成本(CAC,Customer Acquisition Cost)越来越高,留存率(Retention Rate)越来越低,净收入留存率(NDR,Net Dollar Retention)的增长也越来越难;
  2. “工具化瓶颈明显:SaaS本质上是“静态的工具集,需要用户主动去“学习使用、主动去点击、去输入、去输出”——比如你需要主动去登录CRM系统,录入客户信息;你需要主动去打开飞书多维表格,录入项目进度;你需要主动去使用ChatGPT API,写好Prompt(提示词),然后才能得到输出——这就导致SaaS产品的“使用门槛”虽然比On-Premise低,但“有效使用率(Active Usage Rate)普遍不高,比如很多企业买了CRM系统,但真正用起来的员工不到30%;
  3. 个性化定制成本高企:虽然SaaS厂商都在强调“低代码/无代码(Low-Code/No-Code,LCNC)”,但真正的“深度个性化定制”(比如和企业自己的ERP、MES、OA系统的深度集成,比如针对企业特定业务流程的定制),依然需要SaaS厂商的专业技术团队来完成,定制成本很高,定制周期很长,而且很多时候还会破坏了SaaS厂商的“统一版本管理”逻辑——统一版本管理是SaaS厂商降低维护成本、提高迭代效率的核心逻辑之一,如果每个客户都有自己的定制版本,那SaaS厂商的维护成本会呈指数级增长;
  4. **无法解决“最后一公里”的问题”:很多企业的业务流程是“碎片化、非线性、多系统、多工具、跨部门、跨场景的——比如一个电商平台的“全链路用户运营”流程,涉及到了电商平台(淘宝/天猫/京东/拼多多)、私域流量平台(微信公众号/视频号/小程序/企业微信)、CRM系统、营销自动化系统(MA)、客服系统、支付系统、物流系统、ERP系统——这些系统之间的数据是割裂的,业务流程是碎片化的,SaaS厂商的“单点工具”无法把这些“碎片化的业务流程”串起来,形成一个“端到端的自动化闭环”——这就是所谓的“数字化最后一公里”的问题,也是很多企业现在最头疼的问题之一。
1.2.3 AI Agent的“破局契机”

就在SaaS模式陷入增长困境的时候,以ChatGPT(2022年11月30日发布)、GPT-4(2023年3月14日发布)、Claude(2023年3月14日发布)、Gemini(2023年12月6日发布)等大语言模型(LLM,Large Language Model)的爆发式发展,为AI Agent的商业化落地提供了“核心大脑”——LLM的“自然语言理解(NLU,Natural Language Understanding)、自然语言生成(NLG,Natural Language Generation)、推理(Reasoning)、规划(Planning)、知识图谱构建(Knowledge Graph Construction)、工具调用(Tool Calling)等能力,让AI Agent第一次具备了“理解人类意图、自主规划任务、调用外部工具/API、甚至能自主学习、自主迭代”的能力。

而OpenAI在2023年11月6日的首届DevDay开发者大会上,发布了GPT-4 Turbo、Assistants API(助手API)、GPTs Store(GPTs商店)——Assistants API让开发者可以快速构建自己的AI Agent,GPTs Store则让普通用户可以“无需代码,只需要通过自然语言就能创建自己的GPTs(本质上是一种简化版的AI Agent)——这标志着AI Agent的商业化落地进入了“平民化时代”。

同样在2023年11月,微软在Ignite 2023开发者大会上,发布了Copilot Studio——Copilot Studio让开发者可以快速构建自己的企业级Copilot(本质上是一种企业级的AI Agent集群),可以和企业自己的Microsoft 365、Azure、Dynamics 365等系统深度集成——这标志着AI Agent的商业化落地进入了“企业级深度集成时代”。

而2024年,更多的巨头和创业公司都在AI Agent领域投入了大量的资源:谷歌发布了Gemini Agent、Claude发布了Claude Projects、字节跳动发布了豆包智能体平台、阿里巴巴发布了通义千问Agent平台、腾讯发布了混元Agent平台——可以说,2024年是“AI Agent商业化元年”。

1.3 亮明观点/文章目标

本文的核心观点是:AI Agent的商业模式,不是“SaaS + 大语言模型API插件”,而是一种全新的商业模式——我们称之为“Service as Software,服务即软件”(为了避免混淆,下文统一缩写为SaS2,Service as Software 2.0?或者干脆不用缩写,直接叫“服务即软件”,或者“Agent-aaS?不过为了和传统的SaaS区分开,我们后文统一用“Agent-aaS”来指代AI Agent的核心商业模式之一,同时也会探讨其他的商业模式变种)。

Agent-aaS的核心逻辑是: 不再是“卖工具”,而是“卖服务”——卖的不是“静态的工具集”,而是“端到端的、自主的、个性化的、端到端的业务流程自动化服务”,甚至是“基于业务成果的分成”。

读完这篇文章,你将学到:

  1. **AI Agent的核心概念、核心要素组成、核心技术架构、核心交互关系;
  2. SaaS模式的本质、成功逻辑、增长天花板的数学模型;
  3. Agent-aaS模式的本质、核心价值主张、核心商业模式、核心收入模型、核心成功要素;
  4. SaaS到Agent-aaS的转型路径、转型中的关键问题与解决方案;
  5. Agent-aaS模式的实际场景应用、实际项目案例;
  6. Agent-aaS模式的最佳实践、常见陷阱与避坑指南;
  7. Agent-aaS模式的行业发展与未来趋势;
  8. AI Agent商业模式创新的数学模型、算法流程图、Python源代码示例。

二、 基础知识/背景铺垫 (Foundational Concepts)

2.1 AI Agent的核心概念与定义

2.1.1 什么是AI Agent?

在学术界,AI Agent(人工智能代理)的定义已经有几十年的历史了——1995年,斯坦福大学的人工智能专家Stuart Russell和Peter Norvig在他们的经典教材《人工智能:一种现代的方法(Artificial Intelligence: A Modern Approach)》中,首次给出了AI Agent的经典定义

**AI Agent是一个能够感知环境(Perceive Environment)、通过传感器(Sensors)获取环境信息、然后根据自己的内部状态(Internal State)和目标(Goals)、通过执行器(Actuators)作用于环境(Act on Environment)的实体。

而在工业界,随着大语言模型的爆发式发展,AI Agent的定义得到了进一步的扩展和细化——我们现在所说的“大语言模型驱动的AI Agent(LLM-Powered AI Agent)”的工业界实用定义(也是本文的核心研究对象),可以概括为:

**大语言模型驱动的AI Agent是一个以大语言模型(LLM)为核心大脑,具备自然语言理解(NLU)、推理(Reasoning)、规划(Planning)、知识检索(RAG,Retrieval-Augmented Generation)、工具调用(Tool Calling)、自主学习(Auto-Learning)、自主迭代(Auto-Iteration)等能力,能够理解人类意图、自主规划任务、调用外部工具/API、甚至能自主学习、自主迭代的数字实体,最终实现“端到端的、自主的、个性化的业务流程自动化服务”。

2.1.2 AI Agent的核心属性维度

为了更好地理解AI Agent的本质,我们可以从以下几个核心属性维度来对AI Agent进行分类和对比:

核心属性维度 描述 分类示例
自主性(Autonomy) AI Agent在没有人类干预的情况下,能够独立完成任务的程度 低自主性(需要人类全程干预,比如传统的聊天机器人)、中自主性(需要人类部分干预,比如目前的大部分GPTs)、高自主性(几乎不需要人类干预,比如AutoGPT、BabyAGI等)
智能性(Intelligence) AI Agent的自然语言理解、推理、规划、知识检索、工具调用等能力的强弱 弱智能(只能处理简单的、结构化的任务,比如传统的RPA机器人)、中智能(可以处理复杂的、非结构化的任务,比如目前的大部分企业级AI Agent)、强智能(可以处理任意的、开放的任务,比如AGI——通用人工智能,目前还不存在)
个性化程度(Personalization) AI Agent根据用户的偏好、历史数据、上下文信息等,为用户提供个性化服务的程度 低个性化(所有用户使用的都是同一个AI Agent,比如传统的SaaS客服机器人)、中个性化(可以根据用户的部分偏好、历史数据等,为用户提供部分个性化服务,比如目前的大部分电商平台的导购机器人)、高个性化(可以根据用户的所有偏好、历史数据、上下文信息等,为用户提供高度个性化的服务,比如个人化的“第二大脑Agent”)
协作性(Collaboration) AI Agent与人类、其他AI Agent之间的协作能力的强弱 低协作性(只能独立完成任务,不能与人类、其他AI Agent协作,比如传统的RPA机器人)、中协作性(可以与人类、其他AI Agent进行部分协作,比如目前的大部分企业级Copilot)、高协作性(可以与人类、其他AI Agent进行深度协作,形成一个“Agent集群”,比如金融行业的“风险监控/合规Agent网络)
可扩展性(Scalability) AI Agent能够处理的任务类型、任务数量、用户数量的扩展能力的强弱 低可扩展性(只能处理特定的、有限的任务,比如传统的客服机器人)、中可扩展性(可以处理多种任务,但需要一定的配置,比如目前的大部分AI Agent平台)、高可扩展性(可以处理任意的、无限的任务,并且可以自动扩展,比如未来的AGI驱动的Agent平台)
安全性(Security) AI Agent的安全性、隐私性、合规性的程度 低安全性(安全性、隐私性、合规性较差,比如早期的AutoGPT)、中安全性(安全性、隐私性、合规性较好,比如目前的大部分企业级AI Agent平台)、高安全性(安全性、隐私性、合规性极高,比如金融、医疗等行业的AI Agent)
2.1.3 AI Agent与其他相关概念的对比

为了避免混淆,我们需要将AI Agent与其他几个相关的概念进行对比:

2.1.3.1 AI Agent vs 传统的RPA机器人

传统的RPA(Robotic Process Automation,机器人流程自动化)机器人,本质上是“模拟人类操作计算机的鼠标点击、键盘输入等操作”的机器人,它的核心属性是:

  • 低自主性:需要人类编写“非常详细的、结构化的流程脚本”,才能完成任务;
  • 弱智能:只能处理“简单的、结构化的、重复性的任务”,比如录入数据、生成报表、发送邮件等;
  • 低个性化:所有用户使用的都是同一个RPA机器人;
  • 低协作性:只能独立完成任务,不能与人类、其他RPA机器人协作;
  • 低可扩展性:只能处理特定的、有限的任务,流程脚本的修改需要专业的技术团队来完成。

而AI Agent(尤其是大语言模型驱动的AI Agent),本质上是“理解人类意图、自主规划任务、调用外部工具/API”的机器人,它的核心属性是:

  • 高自主性:只需要人类给出“自然语言的、模糊的、非结构化的目标”,就能自主规划任务、自主调用外部工具/API、自主完成任务;
  • 中智能:可以处理“复杂的、非结构化的、非重复性的任务”,比如整理会议纪要、生成待办清单、预约会议室、分析数据、撰写报告等;
  • 高个性化:可以根据用户的偏好、历史数据、上下文信息等,为用户提供高度个性化的服务;
  • 高协作性:可以与人类、其他AI Agent进行深度协作,形成一个“Agent集群”;
  • 高可扩展性:可以处理多种任务,并且可以通过自然语言进行配置,不需要专业的技术团队来完成。

我们可以用一个**简单的例子来对比AI Agent和传统的RPA机器人:
任务: 整理2024年1月的销售数据,生成一份销售报表,然后发送给销售总监张三。
传统的RPA机器人的处理流程:

  1. 人类编写详细的流程脚本:
    a. 步骤1:登录企业微信/钉钉/飞书,找到2024年1月的销售数据Excel文件,下载到本地;
    b. 步骤2:打开本地的Excel文件,按照“销售区域、销售产品、销售金额、销售数量”等字段进行筛选、排序、求和、平均值等计算;
    c. 步骤3:根据计算结果,生成一份预设格式的销售报表PPT;
    d. 步骤4:登录企业微信/钉钉/飞书,找到销售总监张三的联系方式,将销售报表PPT作为附件发送给他,然后写一段预设格式的邮件正文;
    e. 步骤5:点击发送按钮。
  2. 人类运行流程脚本。
  3. 如果销售数据Excel文件的格式发生了变化,或者销售报表PPT的格式发生了变化,或者销售总监张三的联系方式发生了变化,人类需要重新编写流程脚本。

大语言模型驱动的AI Agent的处理流程:

  1. 人类给出自然语言的目标:“帮我整理一下2024年1月的销售数据,生成一份包含“销售区域排名、销售产品排名、销售金额同比环比分析、销售数量同比环比分析”的销售报表PPT,然后发送给销售总监张三,抄送给销售副总监李四。”
  2. AI Agent自主规划任务:
    a. 子任务1:确定需要获取的销售数据的来源——企业微信/钉钉/飞书的共享文件夹?还是企业的CRM系统?还是企业的ERP系统?
    b. 子任务2:调用相应的工具/API,获取2024年1月的销售数据;
    c. 子任务3:对获取到的销售数据进行清洗、整理、分析;
    d. 子任务4:根据分析结果,生成一份符合要求的销售报表PPT;
    e. 子任务5:调用企业微信/钉钉/飞书的工具/API,找到销售总监张三和销售副总监李四的联系方式;
    f. 子任务6:将销售报表PPT作为附件发送给张三,抄送给李四,然后写一段自然的邮件正文。
  3. AI Agent自主执行任务:
    a. 调用企业的CRM系统的API,获取2024年1月的销售数据;
    b. 对获取到的销售数据进行清洗、整理、分析;
    c. 调用Microsoft PowerPoint/Google Slides/Canva的API,生成一份符合要求的销售报表PPT;
    d. 调用企业微信的API,找到张三和李四的联系方式;
    e. 将销售报表PPT作为附件发送给张三,抄送给李四,然后写一段自然的邮件正文:“张总、李总:您好!这是2024年1月的销售报表,请查收。如有问题,请随时联系我。谢谢!”。
  4. AI Agent自主反馈任务结果:“张总、李总,我已经把2024年1月的销售报表发送给你们了,请查收。”。
  5. 如果销售数据的来源发生了变化,或者销售报表的格式发生了变化,或者发送对象发生了变化,AI Agent可以自动调整任务规划和执行流程,不需要人类重新编写任何代码或脚本。
2.1.3.2 AI Agent vs 传统的聊天机器人

传统的聊天机器人(Chatbot),本质上是“基于规则的、或者基于传统的NLP(自然语言处理)技术的”机器人,它的核心属性是:

  • 低自主性:只能回答“预设的、结构化的问题”,比如“查询订单状态”、“查询产品价格”、“查询配送时间”等;
  • 弱智能:只能处理“简单的、结构化的、封闭域任务”;
  • 低个性化:所有用户使用的都是同一个聊天机器人;
  • 低协作性:只能独立完成任务,不能与人类、其他聊天机器人协作;
  • 低可扩展性:只能处理特定的、有限的问题,问题库的扩展需要专业的技术团队来完成。

而AI Agent(尤其是大语言模型驱动的AI Agent),本质上是“理解人类意图、自主规划任务、调用外部工具/API”的机器人,它的核心属性是:

  • 高自主性:可以回答“任意的、非结构化的、开放域的问题”,并且可以自主规划任务、自主调用外部工具/API、自主完成任务;
  • 中智能:可以处理“复杂的、非结构化的、非重复性的任务”;
  • 高个性化:可以根据用户的偏好、历史数据、上下文信息等,为用户提供高度个性化的服务;
  • 高协作性:可以与人类、其他AI Agent进行深度协作,形成一个“Agent集群”;
  • 高可扩展性:可以处理多种任务,并且可以通过自然语言进行配置,不需要专业的技术团队来完成。
2.1.3.3 AI Agent vs 传统的SaaS产品

传统的SaaS产品,本质上是“静态的、被动的工具集”,它的核心属性是:

  • 低自主性:需要用户主动去“学习使用、主动去点击、去输入、去输出”;
  • 弱智能:只能处理“预设的、结构化的任务”;
  • 低个性化:虽然可以进行“部分个性化配置”,但深度个性化定制成本高企;
  • 低协作性:只能与其他SaaS产品进行“API级别的集成”,但无法形成“端到端的自动化闭环”;
  • 低可扩展性:只能处理特定的、有限的任务,功能的扩展需要SaaS厂商的专业技术团队来完成。

而AI Agent(尤其是大语言模型驱动的AI Agent),本质上是“动态的、主动的、自主的服务实体,它的核心属性是:

  • 高自主性:只需要用户给出“自然语言的、模糊的、非结构化的目标”,就能自主规划任务、自主调用外部工具/API、自主完成任务;
  • 中智能:可以处理“复杂的、非结构化的、非重复性的任务”;
  • 高个性化:可以根据用户的偏好、历史数据、上下文信息等,为用户提供高度个性化的服务;
  • 高协作性:可以与人类、其他AI Agent进行深度协作,形成一个“Agent集群”,并且可以与企业自己的On-Premise系统、SaaS系统、ERP系统、MES系统、OA系统等深度集成,形成“端到端的自动化闭环”;
  • 高可扩展性:可以处理多种任务,并且可以通过自然语言进行配置,不需要专业的技术团队来完成。
2.1.3.4 AI Agent vs 传统的大语言模型API插件

传统的大语言模型API插件(比如ChatGPT Plugins),本质上是“大语言模型的工具扩展”,它的核心属性是:

  • 低自主性:需要用户主动去“选择插件、写好Prompt、然后才能得到输出”;
  • 中智能:可以处理“复杂的、非结构化的任务”,但需要用户写好Prompt来引导;
  • 低个性化:所有用户使用的都是同一个大语言模型API插件;
  • 低协作性:只能与其他大语言模型API插件进行“有限的协作”,但无法形成“端到端的自动化闭环”;
  • 低可扩展性:只能处理特定的、有限的任务,插件的开发需要专业的技术团队来完成。

而AI Agent(尤其是大语言模型驱动的AI Agent),本质上是“以大语言模型为核心大脑,自主选择工具、自主规划任务、自主调用工具/API、自主完成任务”的实体,它的核心属性是:

  • 高自主性:只需要用户给出“自然语言的、模糊的、非结构化的目标”,就能自主选择工具、自主规划任务、自主调用工具/API、自主完成任务;
  • 中智能:可以处理“复杂的、非结构化的、非重复性的任务”,并且可以自主学习、自主迭代;
  • 高个性化:可以根据用户的偏好、历史数据、上下文信息等,为用户提供高度个性化的服务;
  • 高协作性:可以与人类、其他AI Agent进行深度协作,形成一个“Agent集群”,并且可以与企业自己的On-Premise系统、SaaS系统、ERP系统、MES系统、OA系统等深度集成,形成“端到端的自动化闭环”;
  • 高可扩展性:可以处理多种任务,并且可以通过自然语言进行配置,不需要专业的技术团队来完成。

2.2 AI Agent的核心要素组成

根据Stuart Russell和Peter Norvig的经典教材《人工智能:一种现代的方法》,以及工业界的实际应用经验,大语言模型驱动的AI Agent的核心要素组成,可以概括为以下7个部分:

2.2.1 核心大脑(Core Brain)——大语言模型(LLM)

大语言模型(LLM)是AI Agent的核心大脑,它负责AI Agent的所有“智能决策”,包括:

  1. **自然语言理解(NLU):理解人类的自然语言输入(包括文本、语音、图像、视频等多模态输入),提取其中的意图、实体、上下文信息等;
  2. **推理(Reasoning):根据理解到的意图、实体、上下文信息等,进行逻辑推理、因果推理、类比推理等,得出结论;
  3. **规划(Planning):根据推理得出的结论,以及AI Agent的目标(Goals),自主规划任务的执行流程(包括子任务的分解、子任务的优先级排序、子任务的依赖关系分析等);
  4. **自然语言生成(NLG):根据任务的执行结果,以及人类的偏好、上下文信息等,生成自然语言的输出(包括文本、语音、图像、视频等多模态输出);
  5. **知识图谱构建(Knowledge Graph Construction):根据任务的执行结果,以及AI Agent的知识库,构建和更新知识图谱,以便后续的推理、规划、知识检索等;
  6. **工具选择与调用决策(Tool Selection & Calling Decision):根据任务的执行流程,自主选择合适的工具/API,自主决定工具/API的调用参数、调用顺序等。

目前,市场上主流的大语言模型(可以作为AI Agent的核心大脑的)包括:

  • **闭源大语言模型:OpenAI的GPT-4 Turbo、GPT-4o、Claude 3 Opus/Sonnet/Haiku、谷歌的Gemini Ultra/Pro/Nano、字节跳动的豆包4.0 Ultra/Pro/Nano、阿里巴巴的通义千问4.0 Ultra/Pro/Nano、腾讯的混元4.0 Ultra/Pro/Nano等;
  • **开源大语言模型:Meta的Llama 3 70B/8B、Mistral AI的Mistral Large/Medium/Small、Anthropic的Claude 3 Haiku的开源版本(Claude Instant的开源版本(如果有的话)、国内的开源大语言模型比如智谱AI的GLM-4 9B/65B、阿里云的通义千问2.5 7B/14B/72B、百度的文心一言4.0的开源版本(如果有的话)、腾讯的混元的开源版本(如果有的话)等。
2.2.2 感知模块(Perception Module)——传感器(Sensors)

感知模块(Perception Module)是AI Agent的传感器(Sensors),它负责AI Agent的所有“环境感知”,包括:

  1. 多模态输入感知: 感知人类的自然语言输入(包括文本、语音、图像、视频等多模态输入);
  2. 外部环境感知: 感知外部环境的变化(比如天气的变化、股市的变化、用户的行为变化等);
  3. 内部状态感知: 感知AI Agent的内部状态的变化(比如任务的执行进度、工具/API的调用状态、知识库的更新状态等)。

目前,市场上主流的感知模块(可以作为AI Agent的传感器的)包括:

  • 文本输入感知模块: 各种文本输入接口(比如Web界面、移动应用界面、API接口、企业微信/钉钉/飞书的机器人接口等);
  • 语音输入感知模块: OpenAI的Whisper、谷歌的Speech-to-Text、百度的语音识别、阿里巴巴的语音识别、腾讯的语音识别等;
  • 图像输入感知模块: OpenAI的GPT-4o、Claude 3 Opus/Sonnet、谷歌的Gemini Ultra/Pro、字节跳动的豆包4.0 Ultra/Pro、阿里巴巴的通义千问4.0 Ultra/Pro、腾讯的混元4.0 Ultra/Pro等自带的图像识别能力,以及专门的图像识别API(比如阿里云的图像识别API、腾讯的图像识别API、百度的图像识别API等);
  • 视频输入感知模块: OpenAI的GPT-4o(可以处理视频帧)、Claude 3 Opus/Sonnet(可以处理视频帧)、谷歌的Gemini Ultra/Pro(可以处理视频帧)、以及专门的视频识别API(比如阿里云的视频识别API、腾讯的视频识别API、百度的视频识别API等);
  • 外部环境感知模块: 各种外部API(比如天气API、股市API、用户行为分析API等);
  • 内部状态感知模块: AI Agent自身的日志系统、监控系统等。
2.2.3 执行模块(Action Module)——执行器(Actuators)

执行模块(Action Module)是AI Agent的执行器(Actuators),它负责AI Agent的所有“环境作用”,包括:

  1. 多模态输出执行: 执行自然语言的输出(包括文本、语音、图像、视频等多模态输出);
  2. 外部工具/API调用执行: 执行外部工具/API的调用(比如企业微信/钉钉/飞书的API、Microsoft 365的API、Google Workspace的API、Salesforce的API、CRM系统的API、ERP系统的API、MES系统的API、OA系统的API、电商平台的API、支付系统的API、物流系统的API等);
  3. 内部状态更新执行: 执行AI Agent的内部状态的更新(比如任务的执行进度的更新、工具/API的调用状态的更新、知识库的更新等)。

目前,市场上主流的执行模块(可以作为AI Agent的执行器的)包括:

  • 文本输出执行模块: 各种文本输出接口(比如Web界面、移动应用界面、API接口、企业微信/钉钉/飞书的机器人接口等);
  • 语音输出执行模块: OpenAI的Text-to-Speech、谷歌的Text-to-Speech、百度的语音合成、阿里巴巴的语音合成、腾讯的语音合成等;
  • 图像输出执行模块: OpenAI的DALL-E 3、Midjourney、Stable Diffusion、以及专门的图像生成API(比如阿里云的图像生成API、腾讯的图像生成API、百度的图像生成API等);
  • 视频输出执行模块: Sora、Runway、Pika、以及专门的视频生成API(比如阿里云的视频生成API、腾讯的视频生成API、百度的视频生成API等);
  • 外部工具/API调用执行模块: LangChain、LlamaIndex、AutoGPT、BabyAGI等AI Agent框架自带的工具调用能力,以及专门的API调用工具(比如Zapier、Make等);
  • 内部状态更新执行模块: AI Agent自身的数据库系统、文件系统等。
2.2.4 知识库(Knowledge Base)

知识库(Knowledge Base)是AI Agent的记忆库(Memory),它负责存储AI Agent的所有“知识”,包括:

  1. 通用知识: 大语言模型自带的通用知识(比如历史、地理、科学、文化等);
  2. 专有知识: AI Agent专门需要的专有知识(比如企业的业务知识、行业的专业知识、用户的个人知识等);
  3. 历史数据: AI Agent的历史交互数据、历史任务执行数据、历史工具/API调用数据等;
  4. 上下文信息: AI Agent的当前上下文信息(比如用户的当前状态、任务的当前执行进度、外部环境的当前状态等)。

知识库(Knowledge Base)的存储方式,主要有以下几种:

  1. 向量数据库(Vector Database): 用于存储AI Agent的专有知识、历史数据、上下文信息等的向量表示(Embeddings),以便后续的知识检索(RAG,Retrieval-Augmented Generation);
    • 目前,市场上主流的向量数据库包括:Pinecone、Weaviate、Chroma、Milvus、Qdrant、FAISS(Meta的开源向量数据库)等;
  2. 关系型数据库(Relational Database): 用于存储AI Agent的结构化的历史数据、上下文信息等;
    • 目前,市场上主流的关系型数据库包括:PostgreSQL、MySQL、Oracle、SQL Server等;
  3. 非关系型数据库(NoSQL Database): 用于存储AI Agent的非结构化的历史数据、上下文信息等;
    • 目前,市场上主流的非关系型数据库包括:MongoDB、Redis、Cassandra等;
  4. 知识图谱(Knowledge Graph): 用于存储AI Agent的知识之间的关系;
    • 目前,市场上主流的知识图谱数据库包括:Neo4j、Amazon Neptune、JanusGraph等。
2.2.5 知识检索模块(Retrieval Module)——RAG

知识检索模块(Retrieval Module)是AI Agent的检索器(Retriever),它负责AI Agent的所有“知识检索”,也就是所谓的**RAG(Retrieval-Augmented Generation,检索增强生成)**技术——RAG技术的核心逻辑是:

  1. 知识预处理(Knowledge Preprocessing): 将AI Agent的专有知识、历史数据、上下文信息等,进行清洗、整理、分块(Chunking)、向量化(Embedding),然后存储到向量数据库中;
  2. 知识检索(Knowledge Retrieval): 根据AI Agent的当前输入(比如人类的自然语言输入、任务的执行流程等),进行向量化(Embedding),然后在向量数据库中检索出与当前输入最相关的前N个知识块;
  3. 知识增强(Knowledge Augmentation): 将检索出的前N个知识块,拼接成一个“知识增强的Prompt”,然后输入到大语言模型中,以便大语言模型生成更准确、更相关、更有时效性的输出。

RAG技术是AI Agent的核心技术之一,它可以解决大语言模型的以下几个核心问题:

  1. 幻觉问题(Hallucination Problem): 大语言模型经常会生成“看起来很真实,但实际上是错误的、不存在的内容”——RAG技术可以通过“检索出真实的、相关的知识块,然后拼接成知识增强的Prompt”,来减少大语言模型的幻觉问题;
  2. 时效性问题(Timeliness Problem): 大语言模型的知识是“截止到某个时间点的”(比如GPT-4o的知识截止到2024年5月)——RAG技术可以通过“检索出最新的、有时效性的知识块,然后拼接成知识增强的Prompt”,来解决大语言模型的时效性问题;
  3. 专有知识问题(Proprietary Knowledge Problem): 大语言模型的知识是“通用的”,不包含企业的业务知识、行业的专业知识、用户的个人知识等——RAG技术可以通过“检索出企业的业务知识、行业的专业知识、用户的个人知识等,然后拼接成知识增强的Prompt”,来解决大语言模型的专有知识问题;
  4. 可解释性问题(Explainability Problem): 大语言模型的输出是“黑盒的”,用户不知道大语言模型为什么会生成这样的输出——RAG技术可以通过“展示检索出的前N个知识块,来解释大语言模型的输出的依据”,来提高大语言模型的可解释性。
2.2.6 工具库(Tool Library)

工具库(Tool Library)是AI Agent的工具箱(Toolbox),它负责存储AI Agent可以调用的所有“外部工具/API”,包括:

  1. 系统工具: 文件操作工具、数据库操作工具、网络请求工具等;
  2. 生产力工具: Microsoft 365的工具(Word、Excel、PowerPoint、Outlook、Teams等)、Google Workspace的工具(Docs、Sheets、Slides、Gmail、Meet等)、飞书的工具(多维表格、文档、会议、邮件、日历等)、钉钉的工具、企业微信的工具等;
  3. 企业系统工具: ERP系统的工具、MES系统的工具、OA系统的工具、CRM系统的工具、营销自动化系统(MA)的工具、客服系统的工具等;
  4. 第三方服务工具: 电商平台的工具(淘宝、天猫、京东、拼多多、亚马逊等)、支付系统的工具(支付宝、微信支付、PayPal等)、物流系统的工具(顺丰、圆通、中通、申通、韵达、UPS、FedEx等)、天气API、股市API、用户行为分析API等;
  5. AI工具: 图像生成工具(DALL-E 3、Midjourney、Stable Diffusion等)、视频生成工具(Sora、Runway、Pika等)、语音识别工具(Whisper等)、语音合成工具等。

目前,市场上主流的工具库(可以作为AI Agent的工具箱的)包括:

  • AI Agent框架自带的工具库: LangChain的Tools、LlamaIndex的Tools、AutoGPT的Tools、BabyAGI的Tools等;
  • 专门的工具集成平台: Zapier、Make、IFTTT等——这些平台可以将数千种第三方服务工具集成到一起,然后提供统一的API接口,以便AI Agent调用;
  • 企业自己的API网关: 企业可以将自己的On-Premise系统、SaaS系统、ERP系统、MES系统、OA系统等的API,集成到自己的API网关中,然后提供统一的API接口,以便AI Agent调用。
2.2.7 目标管理模块(Goal Management Module)

目标管理模块(Goal Management Module)是AI Agent的指挥官(Commander),它负责AI Agent的所有“目标管理”,包括:

  1. 目标理解(Goal Understanding): 理解人类的自然语言输入中的目标(比如“帮我整理一下2024年1月的销售数据,生成一份销售报表PPT,然后发送给销售总监张三”),将其转化为“结构化的、可执行的目标”;
  2. 目标分解(Goal Decomposition): 将“结构化的、可执行的大目标”,分解为“一系列结构化的、可执行的子目标/子任务”;
  3. 目标优先级排序(Goal Priority Ranking): 根据子目标/子任务的重要性、紧急性、依赖关系等,对子目标/子任务进行优先级排序;
  4. 目标依赖关系分析(Goal Dependency Analysis): 分析子目标/子任务之间的依赖关系(比如子任务B必须在子任务A完成之后才能执行);
  5. 目标执行监控(Goal Execution Monitoring): 监控子目标/子任务的执行进度、执行状态、执行结果等;
  6. 目标调整(Goal Adjustment): 如果子目标/子任务的执行进度、执行状态、执行结果等不符合预期,或者外部环境发生了变化,对目标、子目标/子任务、任务的执行流程等进行调整;
  7. 目标反馈(Goal Feedback): 将子目标/子任务的执行进度、执行状态、执行结果等,反馈给人类。

2.3 AI Agent的核心技术架构

根据工业界的实际应用经验,大语言模型驱动的AI Agent的核心技术架构,可以概括为以下几种:

2.3.1 单Agent架构(Single Agent Architecture)

单Agent架构(Single Agent Architecture)是最简单的AI Agent架构,它的核心逻辑是:只有一个AI Agent,这个AI Agent具备所有的核心要素组成(核心大脑、感知模块、执行模块、知识库、知识检索模块、工具库、目标管理模块),可以独立完成所有的任务

单Agent架构的优点是:

  1. 架构简单: 开发成本低,维护成本低;
  2. 部署方便: 只需要部署一个AI Agent;
  3. 响应速度快: 不需要多个AI Agent之间的通信和协作。

单Agent架构的缺点是:

  1. 能力有限: 一个AI Agent的核心大脑(大语言模型)的能力是有限的,无法处理“非常复杂的、需要多种专业知识的任务”;
  2. 可扩展性有限: 只能处理特定的、有限的任务,功能的扩展需要修改这个AI Agent的核心要素组成;
  3. 可靠性有限: 如果这个AI Agent出现了故障,整个系统就会瘫痪。

单Agent架构的适用场景是:

  1. 个人化的、简单的、单场景的任务,比如个人化的“第二大脑Agent”、个人化的“日程管理Agent”、个人化的“健康管理Agent”等;
  2. 企业级的、简单的、单场景的任务,比如企业级的“客服Agent”、企业级的“会议纪要整理Agent”、企业级的“待办清单生成Agent”等。

单Agent架构的Mermaid架构图如下:

自然语言输入/反馈

结构化输入/上下文信息

知识检索请求/检索结果

知识存储/知识读取

工具选择请求/工具信息

目标管理请求/目标信息

执行命令/调用参数

外部工具/API调用

多模态输出/任务结果

任务执行进度/执行状态/执行结果

用户

感知模块

核心大脑
大语言模型 LLM

知识检索模块
RAG

知识库
向量数据库/关系型数据库/知识图谱

工具库

目标管理模块

执行模块

外部工具/API

2.3.2 多Agent协作架构(Multi-Agent Collaboration Architecture)

多Agent协作架构(Multi-Agent Collaboration Architecture)是目前工业界应用最广泛的AI Agent架构,它的核心逻辑是:有多个AI Agent,每个AI Agent都具备所有的核心要素组成,但每个AI Agent都有自己的“专业领域”(比如有的AI Agent专门负责数据分析,有的AI Agent专门负责文档撰写,有的AI Agent专门负责工具调用,有的AI Agent专门负责目标管理等),这些AI Agent之间可以通过“通信协议”进行通信和协作,形成一个“Agent集群”,共同完成“非常复杂的、需要多种专业知识的任务”

多Agent协作架构的优点是:

  1. 能力强大: 多个AI Agent的核心大脑(大语言模型)的能力可以叠加,能够处理“非常复杂的、需要多种专业知识的任务”;
  2. 可扩展性强: 可以随时添加新的AI Agent,扩展系统的功能;
  3. 可靠性强: 如果某个AI Agent出现了故障,其他AI Agent可以接替它的工作,整个系统不会瘫痪;
  4. 个性化强: 可以根据用户的需求,定制不同的AI Agent集群。

多Agent

更多推荐