收藏!小白程序员快速入门大模型:Agent与LLM调用的区别与实战解析
本文深入浅出地解析了LLM调用与Agent的区别,阐述了Agent作为具备规划、记忆、工具使用能力的自主系统,如何进化AI从“能说会道”到“能动手解决实际问题”。文章详细拆解了Agent的核心组件:大语言模型(LLM)、记忆模块(短期与长期)、规划模块以及工具使用模块,并通过实例展示了各模块如何协同工作,实现复杂任务的分解、执行与优化。对于想要学习大模型、提升AI实践能力的小白和程序员来说,本文提供了宝贵的入门指南和实战参考。
1、Agent与LLM调用的区别
LLM调用是单纯的输入-输出,而Agent是具备规划、记忆、工具使用能力的自主系统。
一般,我们打开一个对话窗口,输入一个问题,模型立刻给出回答——这就是一次典型的LLM调用
| 一般 LLM 调用 | Agent(智能体) | |
|---|---|---|
| 核心定义 | 一个语言模型,根据输入生成文本输出 | 一个以LLM为“大脑”的系统,能自主规划、调用工具、管理记忆 |
| 交互方式 | 一次性问答:用户输入 → 模型输出 | 多轮循环:任务 → 思考 → 行动 → 观察 → 再思考 → 输出 |
| 是否具备自主性 | 被动响应,完全依赖用户指令 | 主动分解任务、制定步骤,过程中可自行决策 |
| 工具使用能力 | 无,仅靠内部知识 | 可调用外部API、数据库、计算器、搜索引擎等 |
| 记忆管理 | 通常只有单次对话的短期记忆 | 可维护长期记忆(向量数据库)和短期记忆(上下文) |
| 输出方式 | 一次生成最终答案 | 可能经过多步推理,最终给出结果,过程中可能有中间动作 |
| 典型例子 | 你用ChatGPT问“今天天气怎么样”,它说“我无法获取实时信息” | Agent收到同样问题,会主动调用天气API,获取数据后告诉你结果 |
LLM像是大脑(一个拥有短期记忆的大脑),但Agent不仅拥有大脑,并且拥有记忆和手脚(工具)。Agent不是另一个模型,而是以LLM为控制中枢,融合规划、记忆、工具执行能力的完整系统。它让AI从“能说会道”进化到“能动手解决实际问题”。接下来,我们就来拆解这个系统到底由哪些核心组件构成,它们又是如何协作的。
2、Agent的组成
Agent由以下部分组成:
- 大语言模型(LLM):LLM是Agent的大脑,它不仅是语言理解与生成的基础,更是整个系统的决策中枢。负责思考“用户想要什么?”、“现在该做什么?”以及“怎么做更好?”。往往LLM决定了一个Agent的上限。
- 记忆模块(Memory):记忆让Agent不再是“一次性对话”的工具,而是能持续学习和积累经验的个体。记忆通常分为两类:
- 短期记忆:类似于人类的“工作记忆”,指在单次任务或会话中临时存储的信息。有多种实现方式,上下文窗口和摘要等。例如把对话历史、刚刚观察到的环境反馈直接拼接到提示词中。但短期记忆有容量限制(如上下文长度),当信息太多时会被遗忘或压缩。
- 长期记忆:相当于人类的“长时记忆”,用于跨会话持久化存储重要信息。通常借助外部数据库(向量数据库+关系数据库)实现。Agent可以将关键知识(如用户偏好、任务经验、领域知识)向量化后存入数据库,后续需要时通过相似性检索召回,再放入短期记忆中供LLM使用。长期记忆让Agent在多次交互中保持一致性,并不断成长。
- 规划模块(Planning):规划能力是Agent从“被动响应”走向“主动行动”的关键;规划模块负责任务的分解,并决定执行顺序和策略;执行结果的反馈调整甚至是反思。
- 行动,工具的使用(Tool Use):工具是Agent连接外部世界、打破LLM自身能力限制的桥梁。通过调用各种工具,Agent能获取实时信息、执行具体操作、进行计算等。工具的使用抽象来讲就是Function Calling,具体一点可以是:浏览器搜索、调用api接口(查天气、查地图等)、发邮件等。将工具调用的方式标准化的实现就是MCP协议。

一个典型的Agent工作流程如下:
-
用户输入任务 → 进入短期记忆。
-
LLM结合短期记忆和从长期记忆中检索到的相关知识,理解任务。
-
规划模块将任务拆解为步骤,决定下一步行动(可能是一个子任务,或直接调用工具)。
-
如果需要外部信息或操作,LLM生成工具调用指令,工具模块执行并返回结果。
-
结果被放回短期记忆,LLM继续分析,可能修正计划或进行下一步。
-
重复3-5步,直到任务完成,LLM生成最终答案返回给用户。
3、 大语言模型(LLM)
由大语言模型(LLM)来负责感知,如果把Agent比作一个能独立完成任务的数字员工,那么大语言模型(LLM)就是他的大脑。它不仅负责理解你说的话,更重要的是——它决定了整个Agent的思考深度和行动能力。在Agent架构中,LLM不再只是一个“文本生成器”,而是一个通用的推理引擎和决策中心。
在传统用法中,我们给LLM一个 prompt,它直接返回答案。但在Agent系统中,LLM被赋予了更多的“职责”:
- 意图理解与任务分解:将用户模糊的指令(如“帮我研究一下RAG的最新进展”)转化为清晰、可执行的子任务清单。
- 推理与规划:基于当前状态(包括对话历史、环境反馈)思考下一步该做什么。它可能采用 思维链(Chain-of-Thought) 的方式,一步步推理出解决方案。
- 工具调用决策:判断何时需要借助外部工具(如搜索引擎、计算器),并生成符合格式的调用指令(如JSON格式的function calling参数)。
- 自我反思与修正:当某一步执行失败或结果不符合预期时,LLM能分析原因,调整计划,甚至尝试新的路径。
- 生成最终响应:综合所有信息,以自然语言的形式返回给用户。
简单来说,LLM让Agent具备了“思考”的能力,而其他模块(记忆、规划、工具)则是它的“感知”和“行动”的延伸。
让我们来举个🌰来进一步理解:
在下面这个例子中,LLM不仅理解了多步任务,还自主规划了调用工具的时机、解析了API返回结果,并最终生成了人性化的回答。整个过程完全由LLM的推理能力驱动。
用户输入:帮我查一下这周末杭州的天气,并推荐两个适合带小孩去的室内景点。
LLM 第一轮思考(Thought):
用户需要两个信息:1. 杭州周末天气;2. 室内儿童景点推荐。
我目前没有实时天气数据,需要调用天气API;景点推荐可以结合天气情况和我的知识库给出,但最好也获取最新评价。
计划:先调用天气API获取天气,然后根据天气情况推荐景点。
LLM 行动(Action):
调用天气API,参数:城市=杭州,日期=本周六、日。
(系统返回天气数据:周六小雨,13-18℃;周日阴,15-20℃)
LLM 观察(Observation):
天气:周末有小雨,气温适宜。适合推荐室内景点。
思考(Thought):现在需要推荐两个室内儿童景点。我可以从我的训练知识中回忆一些热门选项,但为了确保准确性,最好再调用一个景点评价API或搜索最新信息。
计划:先调用景点查询API,如果没有再使用搜索引擎。
LLM 行动(Action):
调用景点推荐API,参数:城市=杭州,类型=室内儿童,返回数量=2。
(系统返回:杭州Do都城少儿社会体验馆、杭州烂苹果乐园)
LLM 最终思考(Final Thought):
已获取景点信息,结合天气,可以给出完整回答。需要提醒用户带雨具。
LLM 响应(Response):
本周末杭州有小雨,气温13-20℃,建议带上雨具。推荐两个室内儿童景点:
1. 杭州Do都城少儿社会体验馆(适合儿童职业体验)
2. 杭州烂苹果乐园(大型室内儿童乐园)
祝您周末愉快!
4、记忆模块(Memory)
如果说LLM是Agent的大脑,那么记忆模块就是它的海马体——负责存储、检索和更新信息。没有记忆的Agent就像一位患有严重失忆症的助手:每次对话都从零开始,无法记住用户的偏好,也无法从过去的经验中学习。而有了记忆,Agent才能真正实现持续进化和个性化交互。
在Agent架构中,记忆被划分为两个层次:短期记忆和长期记忆,它们各司其职,共同构建起智能体的“经验库”。

4 .1 短期记忆
短期记忆是指在当前任务或会话过程中临时存储的信息。它相当于人类在工作时脑海中暂时记住的几个数字或一句话,用完即忘。
特点:
- • 容量有限:受限于LLM的上下文窗口(如cursor中的gpt-5.3-codex 272k tokens context window),超出部分会被截断或遗忘。
- • 会话级持久性:仅在单次对话或任务执行期间有效,任务结束后通常不会保留。
- • 实现方式:最直接的方式就是将对话历史、中间推理步骤、工具返回结果等直接拼接到LLM的提示词中(即In-Context Learning)。一些框架还会对记忆进行压缩或摘要,以节省上下文空间。
例如:
- • 用户连续提问:“南京天气怎么样?”→“那明天呢?” Agent需要记住刚刚提到的“南京”,才能理解第二次询问的是同一城市的天气。
- • Agent在执行多步任务时(如先查天气、再定酒店),需要将第一步的结果暂存,供后续步骤使用。
4.2 长期记忆
长期记忆用于跨会话持久化存储重要信息,使Agent能够在多次交互中记住用户、积累知识、学习新技能。
特点:
- • 容量近乎无限:借助外部存储系统(如数据库),可以存储海量信息。
- • 跨会话持久性:信息被保存下来,下次对话时可以重新调用。
- • 实现方式:通常采用向量数据库(如Pinecone、Chroma、Weaviate)+RAG(检索增强生成Retrieval Augment Generation)、关系型数据库、知识图谱(一种用图结构来组织和表示知识的数据模型)、模型微调(Fine-tuning,让LLM形成“肌肉记忆”)等。具体流程是:将文本(如用户偏好、领域知识)转化为特定的数据结构(如:向量),存入数据库;当需要回忆时,将当前问题也转为向量,在数据库中做相似性检索,召回最相关的内容,再放入短期记忆中供LLM使用。
例如:
- • 用户第一次使用时告诉Agent:“我喜欢读科幻小说。” 下次用户说“推荐一本书”,Agent会优先推荐科幻类书籍。
- • Agent在工作中学习了一套代码库的结构,下次处理类似项目时能直接调出相关模块的说明。
4.3 短期记忆和长期记忆的配合
短期和长期记忆不是孤立的,而是紧密配合:
- 用户输入进入短期记忆(当前对话上下文)。
- Agent根据用户问题和当前短期记忆,从长期记忆中检索相关信息(如用户偏好、历史对话摘要)。
- 检索到的信息被加入到短期记忆中,供LLM参考。
- LLM结合短期记忆(包括当前输入+检索到的长期记忆)进行推理和决策。
- 在对话过程中,Agent可能将重要的新信息写入长期记忆(如用户新透露的偏好、任务执行经验)。
记忆模块的核心作用
- 个性化体验:让Agent记住每个用户的偏好,提供定制化服务。
- 持续学习:Agent可以从每次交互中学习,不断丰富自己的知识库,避免重复犯错。
- 上下文连贯:即使对话中断很久,也能无缝衔接,因为长期记忆保存了之前的要点。
- 复杂任务支撑:对于需要多步推理的任务,短期记忆保证了中间结果的可用性。
5、规划模块(Planning)
规划模块负责将模糊的目标转化为清晰的行动步骤,决定先做什么、后做什么,并在执行过程中根据新情况动态调整。正是规划能力,让Agent从“被动响应”进化到“主动解决问题”。
规划的第一步是任务分解,将大目标变成小任务。分解后,还需要决定这些任务的先后顺序(排序)、处理依赖关系(调度)。以及在执行过程中根据反馈调整计划(动态调整),甚至是从失败中学习(反思)。
Agent的规划模块并非一成不变,而是经历了一条从静态推理到动态交互,再到分层解耦和自我进化的演进路径。
| 阶段 | 核心范式 | 代表技术 | 核心思想 | 提出时间 |
|---|---|---|---|---|
| 阶段1 | 静态推理范式 | CoT(思维链) | 让模型在回答前生成中间推理步骤,但不与环境交互 | 2022 |
| 阶段2 | 动态交互范式 | ReAct | 推理与行动交替进行,边想边做 | 2022 |
| 阶段3 | 分层解耦范式 | Plan-and-Execute | 规划与执行分离,先想后做+动态调整 | 2023 |
| 阶段4 | 高级扩展范式 | ToT、Reflexion、MCTS | 多路径探索、自我反思、搜索式规划 | 2023-2024 |
注:范式是一个领域内被公认的、用于思考和解决问题的框架——它不是具体的代码或工具,而是指导我们如何设计、如何思考的一套方法论。
ReAct(Reasoning and Acting,thought->action->observation循环)与Plan-and-Execute的关系:
- 设计哲学:ReAct是“边想边做”,计划隐含在思考-行动循环中;Plan-and-Execute是“先想后做”,计划显式生成再执行。
- 灵活性 vs 稳定性:ReAct更灵活,能实时适应环境变化,但可能效率低或陷入循环;Plan-and-Execute更稳定,可解释性强,但可能无法应对计划外的变化。
- 是否互斥:不一定。有些系统结合两者,比如先用Plan-and-Execute生成高级计划,然后在执行每个步骤时用ReAct处理细节。
在实际项目中,不必拘泥于单一范式。可以构建混合架构——用Plan-and-Execute生成粗粒度计划,对计划中不确定性高的步骤(如“查资料”),内部用ReAct精细化执行。这样既保证了整体方向的可控性,又保留了局部执行的灵活性。
举个🌰假设Agent的任务是“组织一场公司团建活动”:
- 纯Plan-and-Execute:先规划出完整方案(场地选择、餐饮预订、活动安排),然后逐一执行。如果预定场地时发现满员,计划可能卡住,需要人工介入。
- 纯ReAct:每一步都思考:“现在该干什么?哦,先找场地……找到了,下一步订餐……” 虽然灵活,但可能绕弯路,且用户无法提前知晓整体方案。
- 结合方案:先用Plan-and-Execute生成一个初步计划:“确定日期 → 预订场地 → 安排餐饮 → 设计活动”。执行“预订场地”这一步时,如果遇到满员,Agent立即启动ReAct模式,动态搜索替代场地、调整日期,甚至修改后续餐饮和活动安排。整个过程既保持了计划的框架,又具备了应变能力。
6、工具使用(Tool Use)
在前几节中,我们介绍了Agent的大脑(LLM)、记忆(Memory)和规划(Planning)模块。但一个只会思考、不会行动的智能体,终究只是“纸上谈兵”。工具使用模块,正是Agent连接外部世界的桥梁,让它能够真正“动手”解决问题。
工具使用模块的核心作用是:赋予Agent调用外部工具的能力,以突破LLM自身的局限性。

LLM虽然强大,但存在三个天然短板:
- 知识截止日期:无法获取训练数据之后的新信息
- 无法访问私有数据:无法查询企业内部数据库、用户个人数据
- 缺乏执行能力:只能生成文本,无法操作外部系统
工具使用模块解决了这些问题。通过调用各种工具,Agent可以:
- 获取实时信息:查询天气、股票价格、最新新闻
- 操作外部系统:发送邮件、创建日历事件、操作数据库
- 执行精确计算:调用计算器、代码解释器
- 访问知识库:检索企业文档、专业数据库
通俗理解:如果把LLM比作一个博学的顾问,那么工具就是他的“手脚”和“感官”——让他不仅能说,还能查、能算、能做。
目前,工具使用主要有通过Function Calling(与外界交互的基本能力) + MCP协议(标准化外界交互)实现。
| 维度 | Function Calling | MCP协议 |
|---|---|---|
| 本质 | LLM的原生能力,一种调用机制 | 工具接入的标准化协议 |
| 定位 | 解决“如何调用”的问题 | 解决“如何接入”的问题 |
| 实现方 | LLM厂商提供支持 | 社区推动的开放标准 |
| 适用范围 | 单个函数的调用 | 整个工具生态的互联 |
| 与LLM关系 | LLM直接输出函数调用 | Agent作为客户端连接MCP服务器 |
在MCP出现之前,每个工具都需要单独适配:
- 天气API有一套调用方式
- 数据库查询有另一套方式
- 企业内部系统又有自己的接口
开发者需要为每个工具编写适配代码,重复劳动且难以维护。MCP的出现,就是为了解决这个问题——标准化工具接入,让工具接入像插拔U盘一样简单。

MCP官方文档:https://modelcontextprotocol.io/docs/getting-started/intro
7、 Agent各模块的协同工作
在前面的章节中,我们逐一拆解了Agent的四大核心模块:大语言模型(LLM)、记忆模块(Memory)、规划模块(Planning) 和 工具使用(Tool Use)。它们各自承担着独特的职责——LLM负责理解与决策,记忆模块存储与检索信息,规划模块分解任务与动态调整,工具模块连接外部世界。
但一个真正的智能体,绝不是这四个模块的简单堆砌。真正的魔力,来自它们之间的无缝协同。就像一支交响乐团,每个乐手都有自己的乐谱,但只有当他们按照指挥的节奏默契配合时,才能奏出恢弘的乐章。
在宏观层面,Agent处理一个任务通常会经历以下五个阶段:
- 感知与理解:接收用户输入,LLM结合短期记忆(当前对话上下文)理解用户意图。
- 记忆检索:从长期记忆中召回与当前任务相关的历史信息或知识。
- 规划与决策:LLM作为“大脑”,基于当前状态(用户输入 + 短期记忆 + 检索到的长期记忆)进行推理,生成行动计划(可能涉及任务分解、步骤排序)。
- 执行与交互:按照计划调用外部工具(如搜索、API),获取实时信息或执行操作。
- 学习与更新:将本次交互中的重要信息(如用户偏好、新知识)存入长期记忆,供未来参考。
这个流程不是单向的直线,而是一个循环迭代的过程——Agent可能在执行某一步后,根据观察到的结果重新回到规划阶段,调整后续计划。
让我们用一个贯穿全篇的例子来展示这些模块如何协同工作。假设用户向Agent提出这样一个请求:“我下周末想去南京放松两天,喜欢安静的自然风光,预算2000元左右,帮我规划一下行程。”
第1步:感知与理解(LLM + 短期记忆)
- • 短期记忆:当前对话刚刚开始,短期记忆中只有用户这一条输入。
- • LLM:解析用户输入,提取关键要素:时间(下周末)、地点(南京)、偏好(安静、自然风光)、预算(2000元)、任务类型(行程规划)。LLM意识到这是一个需要多步操作的复杂任务,必须调用其他模块。
第2步:记忆检索(长期记忆)
- • 长期记忆:Agent查询向量数据库,看是否有与该用户或类似任务相关的历史记录。
- • 检索结果:发现该用户三个月前曾询问过“南京有什么小众景点”,当时用户提到“不喜欢人多的地方”。这个信息被召回,放入短期记忆,供后续参考。
第3步:规划与决策(规划模块 + LLM)
- • LLM(作为规划器):结合用户当前请求和历史偏好,LLM开始规划。它采用 Plan-and-Execute 的思路,先生成一个粗粒度的计划:
- 查询下周末南京的天气(影响户外活动安排)。
- 根据天气和“安静自然风光”的偏好,推荐合适的景点。
- 规划两天的行程顺序,估算交通和门票费用。
- 搜索预算内的住宿(人均2000元,住宿预算约1000元)。
- 整合所有信息,生成最终行程建议。
- • 规划模块:将这个计划记录在短期记忆中,作为后续执行的蓝图。同时,规划模块会监控每一步的执行状态。
第4步:执行与交互(工具使用 + 观察)
现在Agent开始按计划执行,但每一步都不是机械的——它会在每个行动后观察结果,动态调整。
子任务1:查询天气
- • 思考(LLM):第一步需要天气信息。我可以调用天气API。
- • 行动(工具模块):调用天气API,参数:南京,下周末。
- • 观察:API返回——周六多云,14-21℃;周日晴,15-22℃。非常适合户外活动。
- • 更新短期记忆:天气信息被暂存。
子任务2:推荐景点
- • 思考(LLM):天气很好,可以推荐自然风光类景点。需要从长期记忆中检索南京适合安静自然风光的景点,同时参考用户历史偏好(喜欢人少的地方)。
- • 行动(工具模块):查询内部知识库(或调用景点API),条件:南京,自然风光,评价“安静”“人少”。
- • 观察:返回候选列表——紫金山探险公园周边步道、中山植物园(南园)、明孝陵石象路、灵谷寺、清凉山公园、燕子矶公园。
- • 思考(LLM):需要筛选出真正安静且自然风光好的地方。紫金山区域有很多徒步路线,中山植物园植物丰富,明孝陵石象路秋季很美但可能人多,清凉山公园位于市区相对小巧,燕子矶有江景但稍远。结合用户“安静”偏好,优先选择紫金山深处的步道和植物园。
- • 更新短期记忆:候选景点列表(初步筛选:紫金山徒步道、中山植物园、灵谷寺)被暂存。
子任务3:规划行程与预算
- • 思考(LLM):需要安排两天的行程,避免奔波。紫金山区域景点集中,可以全部安排在钟山风景区内。第一天上午徒步紫金山(如从蒋王庙上山,经天文台到头陀岭),下午逛中山植物园;第二天游览灵谷寺和明孝陵石象路(尽量早去避开人流)。同时要考虑交通和餐饮预算。
- • 行动(工具模块):调用地图API,计算景点间的交通时间和费用;调用餐饮API,估算当地简餐人均价格。
- • 观察:紫金山各景点之间公交车或共享单车方便,单次票价2-3元;餐饮人均40-70元(鸭血粉丝汤、小笼包等)。
- • 思考(LLM):交通和餐饮预算可控。接下来需要找住宿,预算剩余约1500元(总预算2000 - 交通50 - 餐饮400 = 1550元),可住两晚品质不错的民宿。
- • 行动(工具模块):调用住宿API,搜索南京钟山风景区附近民宿,价格<700元/晚,评价“安静”“环境好”。
- • 观察:返回两家候选——A民宿(650元/晚,近下马坊,有庭院),B民宿(620元/晚,近孝陵卫,背靠紫金山)。
- • 思考(LLM):两家都符合预算和安静要求。可以给用户两个选择,并生成详细行程。
- • 更新短期记忆:所有收集到的信息(天气、景点、交通、住宿)都已齐备。
第5步:生成最终回答(LLM + 短期记忆)
- • LLM:整合短期记忆中所有中间结果,生成一份结构清晰、考虑周全的行程建议。
- • 最终回答(Agent输出):
根据你的需求(安静自然风光、预算2000元),我为你规划了以下南京周末行程:
Day1(周六)
上午抵达南京,建议入住A民宿(650元/晚,近下马坊)。下午从蒋王庙步道上紫金山,沿途森林茂密,游客较少,到达头陀岭可俯瞰南京城(全程约2-3小时)。下山后前往中山植物园南园,欣赏热带植物和宁静的湖景,傍晚在植物园附近品尝地道鸭血粉丝汤(人均40元)。
Day2(周日)
早餐后前往灵谷寺(公交202路直达),寺内古树参天,环境清幽,可登灵谷塔远眺。中午在灵谷寺素斋馆用简餐(人均50元)。下午游览明孝陵石象路(从灵谷寺步行或乘景区接驳车),这段路在清晨或傍晚人少时格外宁静,神道两侧的石兽和秋色(或四季常青)非常治愈。傍晚返程。
预算预估:住宿650 + 餐饮240 + 交通30 = 920元,远低于2000元预算。如果你更喜欢B民宿(620元/晚,近孝陵卫,背靠山林),也可以调整行程。
需要我帮你查询具体民宿的空房情况或预订吗?
第6步:学习与更新(长期记忆)
- • 本次交互的重要信息:用户对“安静”“人少”“自然风光”的偏好再次被强化;用户本次最终选择了A民宿(假设用户后续反馈)。
- • 写入长期记忆:Agent将“用户→偏好南京紫金山区域的安静徒步路线”“用户→倾向于选择有庭院的民宿”等信息存入向量数据库。下次该用户再提问时,Agent能提供更个性化的服务。
最后
对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?
答案只有一个:人工智能(尤其是大模型方向)
当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右。
再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。

对于想入局大模型、抢占未来10年行业红利的程序员和小白来说,现在正是最好的学习时机:行业缺口大、大厂需求旺、薪资天花板高,只要找准学习方向,稳步提升技能,就能轻松摆脱“低薪困境”,抓住AI时代的职业机遇。
如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!
下面是我整理的大模型学习资源,希望能帮到你。

👇👇扫码免费领取全部内容👇👇

最后
1、大模型学习路线

2、从0到进阶大模型学习视频教程
从入门到进阶这里都有,跟着老师学习事半功倍。

3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)

4、 AI大模型最新行业报告
2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

5、面试试题/经验

【大厂 AI 岗位面经分享(107 道)】

【AI 大模型面试真题(102 道)】

【LLMs 面试真题(97 道)】

6、大模型项目实战&配套源码

适用人群

四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
-
硬件选型
-
带你了解全球大模型
-
使用国产大模型服务
-
搭建 OpenAI 代理
-
热身:基于阿里云 PAI 部署 Stable Diffusion
-
在本地计算机运行大模型
-
大模型的私有化部署
-
基于 vLLM 部署大模型
-
案例:如何优雅地在阿里云私有部署开源大模型
-
部署一套开源 LLM 项目
-
内容安全
-
互联网信息服务算法备案
-
…
👇👇扫码免费领取全部内容👇👇

3、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐


所有评论(0)