AI Agent 的真相:水面之下,90% 是工程

一、一张冰山图戳破的幻觉
你有没有发现,今天聊 AI Agent 的人,开口闭口都是 Claude、GPT、DeepSeek。
仿佛只要模型够强,Agent 就能自己跑起来。
但最近一张在行业里传得很广的图,把这个幻觉戳破了:
AI Agent 不是 90% 的 AI + 10% 的工程。
而是 90% 的工程 + 10% 的 AI。
图的上方,水面之上,是我们熟悉的明星产品:Perplexity、Glean、Sierra、Lovable、Harvey、Cursor。
水面之下,是一整片你平时看不见的工程大陆:前端、记忆、认证、工具、可观测、编排、协议、路由、模型、ETL、数据库、基础设施、CPU/GPU……
每一层都不是点缀,而是决定这个 Agent 能不能从 Demo 走进生产环境的关键。
这让我想起一句话:模型是大脑,但身体在哪里?
没有身体、神经系统和生命支持系统,大脑再聪明,也只能泡在培养皿里。
二、水面之上:我们看到的,只是那 10%
先说说水面之上。
那些让你惊叹的 Agent 产品,无一不是把 10% 的 AI 能力,包裹进了 90% 的系统工程里。
Perplexity 不只是调用一个搜索 API + LLM。它的核心竞争壁垒,是索引质量、引用可信度排序、实时信息融合、答案生成后的可验证性设计。
Cursor 也不只是接了一个 GPT-4o。它的成功来自对代码上下文的精准理解、多文件编辑的工程化、Git 集成、终端交互、以及开发者工作流的深度嵌入。
再看几个企业级案例。
Sierra,由前 Salesforce 联席 CEO Bret Taylor 创立,专注企业客服 Agent。2024 年初成立,到 2025 年估值已冲到 100 亿美元,ARR 突破 1 亿美元。它的客户包括 Brex、Ramp、WeightWatchers、Sonos 这样的大型企业。
它靠什么支撑这么高的估值?
不是模型本身,而是 Agent OS——一个能把复杂客服流程、企业后端系统、品牌语气、合规约束全部编排起来的工程平台。Sierra 采用按结果付费,AI 只有真正解决问题才收钱。这意味着它对准确率、回滚机制、工具调用、状态管理的要求,远高于一个聊天机器人。
Glean,企业知识搜索和工作助手。2025 年宣布 ARR 突破 1 亿美元。它真正的护城河不是 LLM,而是 100 多个企业连接器、权限感知检索、企业知识图谱、以及跨系统的上下文理解。
没有这些工程,Glean 就只是一个接在企业数据上的聊天框。
Lovable,这款来自瑞典的 AI 编程工具,8 个月 ARR 从 0 冲到 1 亿美元,估值超过 20 亿美元。它的卖点不是模型,而是让非技术人员用自然语言生成完整应用的全栈工程闭环:前端、后端、数据库集成、部署链路。
水面上的这些公司,大家看到的是“AI 很厉害”。
水面下,它们真正的战斗力来自:把模型能力产品化、工程化、系统化的能力。
三、水面之下:14 层工程栈,一层都不能少
现在我们把冰山翻过来,看看水面之下到底有什么。
这张图把水下的部分分成了 14 层。从下往上看,你会发现:越是基础层,离用户越远,但离“能不能跑起来”越近。
第一层:CPU/GPU 提供商
包括 NVIDIA、AWS、Azure、GCP、Groq、RunPod。
这是整个 Agent 的物理底座。没有算力,模型再强也是静态文件。Agent 的运行特性决定了它对算力的需求不同于传统大模型:多轮推理、持续会话、低延迟、弹性伸缩,每一步都烧钱。
第二层:基础设施/基础层
Docker、Kubernetes、Auto Scale VMs。
Agent 一旦进入生产,就涉及部署、扩缩容、服务发现、负载均衡。没有容器化和编排能力,一个流量高峰就能让系统崩掉。
第三层:数据库
Chroma、Qdrant、Supabase、Pinecone。
Agent 需要记忆,而记忆不只是“上下文窗口”。长期记忆要存进向量数据库、关系型数据库、图数据库。知识要可检索、可更新、可权限隔离。
第四层:ETL(提取、加载、转换)
Datavolo、Needle、Verodat。
企业里的数据是脏的、分散的、格式各异的。ETL 层负责把原始数据清洗、结构化,变成 Agent 能用的信息。
第五层:基础模型
OpenAI、DeepSeek、Gemini、Grok、Claude。
这就是大家常说的 10%。它负责推理、语言理解、生成。但它只是冰山一角。
第六层:模型路由
Martian、OpenRouter、Not Diamond。
不同任务该用哪个模型?简单问候用便宜的小模型,复杂推理用 GPT-4o 或 Claude 3.5。模型路由根据成本、延迟、质量做智能选择。
第七层:Agent 协议
MCP、A2A Protocol、Cisco agntcy SLIM、IBM ACP。
这是 Agent 之间的“语言”。MCP 被称为 AI 的 USB-C,一个协议让任何模型连接任何工具。A2A 则是 Agent 与 Agent 之间的通信协议。
没有协议,多 Agent 系统就是一团意大利面。
第八层:Agent 编排
LangGraph、AutoGen、CrewAI、Haystack、LlamaIndex、ADK、AWS Agent Squad。
编排层决定 Agent 怎么思考、怎么规划、怎么调用工具、怎么在多 Agent 之间分配任务。它是把模型从“聊天机器人”变成“能干活系统”的关键。
第九层:Agent 认证
AWS AgentCore Identity、Azure Entra Agent ID。
每个 Agent 都是一个非人类身份,有凭证、有权限、有爆炸半径。企业级部署必须回答:这个 Agent 能访问什么?能被谁调用?操作如何审计?
第十层:Agent 可观测性
Arize、LangSmith、Langfuse、Helicone、Opik。
Agent 不是确定性程序,它会犯错、会循环、会幻觉。可观测性让你看到它每一步在干什么、调用了什么工具、产生了什么中间结果、哪里出了问题。
第十一层:工具层
Google Search、DuckDuckGo、Serper、Exa。
这是 Agent 的手脚。没有工具,Agent 只能说话;有了工具,它能查资料、写代码、发邮件、改数据库。
第十二层:认证层
Auth0、Okta、OpenFGA、ANON。
用户认证、权限控制、单点登录。Agent 要进入企业系统,必须先通过这扇门。
第十三层:记忆层
Zep、Mem0、Cognee、Letta。
Agent 需要记住用户偏好、对话历史、任务状态。记忆层决定它是“一个会聊天的工具”,还是“一个越来越懂你的助手”。
第十四层:前端层
Streamlit、Flask、Gradio、React。
用户最终看到的界面。再强的后端,如果没有好用的交互层,也推不到用户手里。
四、为什么 90% 的工程,才是决定生死的地方
这张图最想告诉我们的是:模型的差距正在缩小,系统的差距正在放大。
过去一年,OpenAI、Google、Anthropic、DeepSeek 的新模型此起彼伏。Benchmark 榜单上,大家的差距越来越小。
但同样是 Claude 3.5,有人拿它做出一个能处理复杂客服流程、能回滚、能审计的生产级 Agent;有人只能做出一个回答不稳定、经常跑偏的对话 Demo。
差别不在模型,而在这 14 层工程栈。
举个例子:可观测性。
传统软件出错了,日志能告诉你哪一行代码错了。Agent 出错了,可能是提示词不对、上下文不够、工具返回了脏数据、模型产生了幻觉、路由选错了模型。没有 LangSmith、Langfuse 这类工具,你连问题出在哪一层都不知道。
再比如:Agent 协议。
Anthropic 2024 年底开源了 MCP(Model Context Protocol),让模型能通过统一接口调用外部工具。短短几个月,社区已经出现上千个 MCP server。OpenAI、Google 也纷纷跟进。
为什么一个协议这么重要?
因为它解决的不是模型能力问题,而是工程集成问题。没有 MCP,每接一个新工具,你都要写一遍适配代码;有了 MCP,工具即插即用。
还有模型路由。
当 Agent 开始处理真实业务,成本就不再是“一个月几百刀 API 费用”的事。一个复杂客服会话可能消耗 3 万到 5 万 token,每次调用 GPT-4o 级别的模型,成本就是几毛钱。如果一天处理百万级会话,路由省下来的钱就是真金白银。
所以你看,水面上那 10% 决定的是“能不能听懂”;水面下那 90% 决定的是“能不能干成、能不能持续干、能不能安全地干”。
五、从“找好模型”到“建好系统”
这张图对两类人最有价值。
第一类,是 AI 创业者。
如果你还在比拼“我用的是哪个模型”,大概率已经慢了半拍。今天创业的真正机会,在于:
- 找到一两个具体场景;
- 把模型能力封装成可交付、可复用的产品;
- 在水面之下的 14 层里,至少有一两层做到比别人深。
Sierra 赢在客服场景的系统工程。Glean 赢在企业知识的连接和权限。Lovable 赢在全栈应用生成的工程闭环。
它们都没说自己“模型最先进”。它们说的是:我们在一个具体场景里,把 AI 真正落地了。
第二类,是企业技术决策者。
当你评估一个 Agent 方案时,不要只问:
“接的是哪个大模型?”
更要问:
- 数据怎么接入?权限怎么管?
- 出错时能不能回滚?能不能审计?
- 工具调用失败怎么办?
- 多轮任务状态怎么保持?
- 成本怎么控制?延迟能不能接受?
这些才是决定一个 Agent 能不能上生产环境的问题。
结语:冰山之下,藏着真正的护城河
AI Agent 的发展,正在经历一个从“模型崇拜”到“系统工程觉醒”的转折。
两年前,谁拿到 GPT-4 的 API,谁就能做出惊艳 Demo。
今天,模型能力已经泛化。真正稀缺的是:把模型能力变成可靠、可扩展、可信任产品的工程能力。
那张冰山图最刻薄、也最诚实的地方在于:
它把 AI 放得很小,却把工程放得很大。
不是贬低 AI 的重要性,而是提醒我们:
模型是大脑。
但大脑不能自己走路、自己吃饭、自己对抗风险。
一个真正有用的 Agent,需要一整个身体。
而这个身体,90% 都是工程。
参考资料与数据来源:
- AI Agent 冰山图原始来源:行业公开分享资料,图中列示产品/技术栈据此整理
- Sierra:公开融资信息及客户案例,sierra.ai;2025 年估值约 100 亿美元,ARR 突破 1 亿美元
- Glean:Glean 官方新闻稿,2025 年宣布 ARR 突破 1 亿美元
- Lovable:公开融资及媒体报道,2025 年估值超 20 亿美元,8 个月 ARR 破 1 亿美元
- MCP / A2A Protocol:Anthropic 2024 年底开源 MCP,Google 2025 年发布 A2A Protocol
免责声明:文中涉及的市场数据、融资信息及产品动态均来自公开资料,仅供分析参考,不构成任何投资建议。
更多推荐



所有评论(0)