大模型全景图-GPT到多模态演进路线
大模型全景图:从 GPT 到多模态,我是怎么被一路"卷"过来的
一张图理清大模型演进路线,不再被各种名词绕晕
从一个场景说起
前段时间有个朋友问我:“现在大模型这么多,GPT、Claude、Gemini、文心、通义,还有多模态、Agent、RAG 这些概念,我都懵了,到底该学哪个?”
说实话,我一开始也是懵的。
假设你也面临这样的情况:老板让你调研大模型,准备接入项目。你打开网页一搜,好家伙:
- GPT-3、GPT-4、GPT-4o、o1、o3… OpenAI 你家命名能不能有点规律?
- 文心一言、通义千问、讯飞星火、智谱清言… 国产模型也一大堆
- 还有什么多模态、Agent、RAG、Function Calling,名词多得记不住
你心想:“这不就是调个 API 嘛,简单!”
结果一调研才发现:每个模型特点不一样,有的擅长聊天,有的擅长代码,有的能看图,有的能画图,价格还千差万别…
好吧,事情没那么简单。
问题分析
为啥大模型这么"卷"?我梳理了一下,发现不是大家故意搞复杂,而是技术真的在快速迭代:
三个核心问题:
-
能力边界不清楚
- GPT-3 和 GPT-4 到底差在哪?
- 什么时候该用多模态模型?
- 自研模型还是调 API?
-
技术路线太多
- 预训练、微调、Prompt Engineering、RAG,怎么组合?
- 开源 vs 闭源,怎么选?
-
演进速度太快
- 上半年学的方案,下半年可能就被新技术颠覆了
- 今天的热门概念,明天可能就被整合进基础模型
看来得理一理大模型的演进脉络…
方案设计
说白了,我们要解决的核心问题是:建立对大模型技术演进的认知框架
我把自己这两年"被卷"的经历捋了捋,发现大模型的发展大概分了四个阶段:
四个时代:
- GPT 时代(2020-2022):预训练 + 提示工程,“大力出奇迹”
- 指令时代(2022-2023):InstructGPT、ChatGPT,模型学会听人话
- 多模态时代(2023-2024):GPT-4V、Gemini,能看图、能听声音
- Agent 时代(2024-至今):工具调用、深度推理,模型开始"动手"了
每个时代的核心变化和选型逻辑都不一样,咱们一个个看。
实现过程
Step 1: GPT 时代 —— “预训练 + Prompt”
那是 2020 年,GPT-3 横空出世。
当时的核心思路特别简单:堆数据、堆参数、堆算力。
# 伪代码:GPT-3 时代的用法(2020-2022)
def gpt3_era():
# 核心:预训练好的模型 + 精心设计的 Prompt
model = load_pretrained_gpt3() # 加载预训练模型
# 关键:Prompt Engineering
prompt = """
你是一个专业的文案写手。
任务:给一款运动耳机写广告文案。
要求:
- 突出降噪功能
- 语气年轻化
- 100字以内
文案:
"""
# 模型只负责"续写"
result = model.complete(prompt)
return result
这个时代的关键认知:
- 模型是"续写机",你要通过 Prompt 告诉它"你是谁、要做什么"
- Few-shot(给几个例子)能显著提升效果
- 不用微调,调 Prompt 就行(Prompt Engineering)
局限性也很明显:
- 模型经常答非所问(因为只是在续写)
- 对复杂指令理解能力差
- 容易生成有害内容(没有对齐人类价值观)
Step 2: 指令时代 —— “对齐人类意图”
2022 年底,ChatGPT 爆了。
它不是简单的 GPT-3.5,而是经过了指令微调(Instruction Tuning)和RLHF(人类反馈强化学习)。
说白了,就是教会模型"听人话、说人话"。
# 伪代码:ChatGPT 时代的用法(2022-2023)
def chatgpt_era():
# 核心:对话式交互,模型理解"指令"
model = load_instruct_model() # 指令微调后的模型
# 关键:不用写复杂 Prompt,直接说人话
messages = [
{"role": "system", "content": "你是 helpful assistant"},
{"role": "user", "content": "写个运动耳机的广告文案,突出降噪,年轻化语气"}
]
# 模型理解"指令",而不是简单续写
result = model.chat(messages)
return result
这个时代的变化:
- 从"续写"变成"对话",交互方式更自然
- 引入了 System Prompt,可以设定角色和规则
- 指令遵循能力大幅提升
关键技术点:
- SFT(监督微调):用高质量对话数据教模型怎么聊天
- RLHF:让人类给回答打分,模型学会"什么回答是人类喜欢的"
选型建议:
- 如果你今天还在用基座模型(Raw Model),别折腾 Prompt 了,直接用 Chat 版本
- 国内模型(文心、通义、Kimi)都是这个时代的产物,选谁主要看价格和效果
Step 3: 多模态时代 —— “不止能看字”
2023 年,GPT-4V 发布,模型开始能"看图"了。
然后是 Gemini、Claude 3、Qwen-VL… 大模型进入"眼睛+耳朵"时代。
# 伪代码:多模态时代的用法(2023-2024)
def multimodal_era():
# 核心:支持图文混合输入
model = load_multimodal_model() # GPT-4V / Gemini / Qwen-VL
# 关键:可以传图片了!
messages = [
{
"role": "user",
"content": [
{"type": "text", "text": "这张图里的代码有什么 bug 吗?"},
{"type": "image", "image": "screenshot.png"} # 传图片!
]
}
]
result = model.chat(messages)
return result
多模态解决了什么问题:
- OCR + 理解:截图里的文字能识别,还能理解含义
- 视觉问答:“这张图里的图表说明什么趋势?”
- 跨模态生成:看图写文案、根据描述画图(DALL-E、Midjourney)
技术实现思路:
文本 Token + 图像 Token -> 统一编码 -> 解码生成
图像被编码成类似文本的 Token,和文本一起喂给 Transformer。
什么时候必须用多模态?
- 处理截图、PDF、扫描件(OCR+理解一步到位)
- 需要理解 UI 界面(比如自动化测试、RPA)
- 内容审核(图文结合判断)
选型建议:
- GPT-4V:效果最好,但贵
- Gemini Pro Vision:性价比高,Google 生态
- Qwen-VL / InternVL:国产开源,可私有化部署
Step 4: Agent 时代 —— “模型开始动手了”
2024 年,大模型开始"长手"了。
Function Calling、工具调用、AutoGPT、Devin… 模型不再只是"说话",而是能"做事"。
# 伪代码:Agent 时代的用法(2024-至今)
def agent_era():
# 核心:模型可以调用工具了
model = load_agent_model() # 支持 Function Calling 的模型
# 定义工具(让模型知道它能干什么)
tools = [
{
"name": "search",
"description": "搜索互联网信息",
"parameters": {"query": "string"}
},
{
"name": "calculator",
"description": "数学计算",
"parameters": {"expression": "string"}
}
]
# 用户提问
user_input = "今年 GDP 增长 5%,去年是 100 万亿,那今年是多少?"
# 关键:模型自己决定要不要用工具
response = model.chat_with_tools(user_input, tools)
if response.tool_call: # 模型决定调用计算器
result = calculator(response.tool_call.parameters)
# 把结果给模型,让它继续回答
final = model.chat(f"计算结果是 {result},请回答用户")
return final
return response.content
Agent 时代的核心能力:
- 工具调用(Function Calling):模型知道什么时候该查数据库、调 API、算数学
- 规划能力(Planning):把复杂任务拆成步骤,一步步执行
- 记忆(Memory):记住之前的对话和上下文
典型应用:
- AI 编程助手:Cursor、GitHub Copilot、Devin,不只是补代码,还能改 Bug、跑测试
- 智能客服:能查订单、改地址、发起退款
- 数据分析:自动查数据、画图、写报告
技术演进:
1.0: 单轮调用 -> 模型决定用什么工具
2.0: 多轮 ReAct -> 思考-行动-观察循环
3.0: 多 Agent 协作 -> 多个模型分工合作
选型建议:
- 如果你只是做聊天机器人,没必要上 Agent,反而复杂
- 如果需要和现有系统对接(查数据、调接口),Function Calling 是刚需
- OpenAI、Claude 的工具调用能力最强,国产模型(通义、文心)也在快速追赶
踩坑记录
梳理演进路线的过程中,有几个常见误区,记录一下:
坑 1: 盲目追新,忽视场景
现象:听说 o1 推理能力强,所有场景都换 o1
问题:o1 贵且慢,简单场景用 GPT-4o mini 就够了
解决方案:
- 简单任务 -> 快模型(GPT-4o mini、Claude Haiku)
- 复杂推理 -> 慢模型(o1、Claude Opus)
- 视觉任务 -> 多模态模型
- 系统对接 -> 支持 Function Calling 的模型
坑 2: 忽视上下文长度
现象:模型选对了,但扔进去一篇长文档,中间内容被"遗忘"
问题:不同模型上下文长度差异巨大(4k -> 128k -> 2000k)
解决方案:
- 长文档处理 -> 选长上下文模型(Claude 200k、Gemini 1M、Kimi 200k)
- 超长文本 -> 考虑 RAG(检索增强生成),别硬塞
坑 3: 混淆基础模型和对话模型
现象:用了 Llama-3-70B,发现效果还不如 GPT-3.5
问题:基础模型(Base)没经过指令微调,不会对话
解决方案:
- 用 Instruct/Chat 版本(Llama-3-70B-Instruct)
- 或者自己微调(成本高,除非有特定需求)
坑 4: 私有化部署的幻觉
现象:“我们要私有化部署 GPT-4 级别的模型”
问题:70B 参数的模型需要 140G+ 显存,成本吓死人
解决方案:
- 小参数模型(7B、13B)+ 微调,适合特定任务
- 大参数模型(70B+),除非真有数据安全要求,否则调 API 更划算
一张图看懂全景
说了这么多,画张图总结一下:
大模型演进路线(2020-2024)
GPT 时代 指令时代 多模态时代 Agent 时代
(2020-2022) (2022-2023) (2023-2024) (2024-至今)
| | | |
v v v v
预训练模型 指令微调模型 多模态模型 Agent 模型
+ + + +
Prompt Engineering 对话交互 图文理解 工具调用
+ + +
RLHF 对齐 跨模态生成 规划执行
代表模型: 代表模型: 代表模型: 代表模型:
- GPT-3 - ChatGPT - GPT-4V - GPT-4o
- BERT - Claude - Gemini Pro Vision - Claude 3.5
- T5 - 文心一言 - Qwen-VL - Devin
- LLaMA - 通义千问 - InternVL - AutoGPT
选型决策树:
你的场景是什么?
|
├─-> 简单文本任务(问答、摘要)
| └─-> GPT-4o mini / Claude Haiku(便宜够用)
|
├─-> 复杂推理(代码、数学)
| └─-> o1 / Claude Opus / DeepSeek-R1
|
├─-> 需要看图/看文档
| └─-> GPT-4V / Gemini / Qwen-VL
|
├─-> 需要调工具/查数据库
| └─-> 支持 Function Calling 的模型(GPT-4o、Claude)
|
└─-> 数据敏感,必须私有化
└─-> Llama-3 / Qwen / ChatGLM(开源模型 + 微调)
小结
今天我们梳理了大模型从 GPT 到多模态再到 Agent 的演进路线:
四个时代:
- GPT 时代:预训练 + Prompt,学会"续写"
- 指令时代:SFT + RLHF,学会"听话"
- 多模态时代:视觉编码,学会"看图"
- Agent 时代:工具调用,学会"动手"
选型逻辑:
- 不是越新越好,是越适合越好
- 简单任务别用重炮,复杂任务别省成本
- 多模态和 Agent 是刚需再上,不是刚需别折腾
当然,这个路线还在快速演进中:
- o1/o3 代表的"深度推理"可能是下一个方向
- 端侧小模型(手机本地跑)也在快速发展
- 多模态还在往"视频理解"进化
写在最后
大模型技术发展太快,今天的"新"可能明天就"旧"了。
我的建议是:别追新,追理解。理解了演进的逻辑,就能快速适应变化。
你在大模型选型中踩过哪些坑?对哪个方向最感兴趣?欢迎在评论区交流!
如果觉得有用,给个👍吧,咱们下篇见!
更多推荐
所有评论(0)