大模型全景图:从 GPT 到多模态,我是怎么被一路"卷"过来的

一张图理清大模型演进路线,不再被各种名词绕晕


从一个场景说起

前段时间有个朋友问我:“现在大模型这么多,GPT、Claude、Gemini、文心、通义,还有多模态、Agent、RAG 这些概念,我都懵了,到底该学哪个?”

说实话,我一开始也是懵的。

假设你也面临这样的情况:老板让你调研大模型,准备接入项目。你打开网页一搜,好家伙:

  • GPT-3、GPT-4、GPT-4o、o1、o3… OpenAI 你家命名能不能有点规律?
  • 文心一言、通义千问、讯飞星火、智谱清言… 国产模型也一大堆
  • 还有什么多模态、Agent、RAG、Function Calling,名词多得记不住

你心想:“这不就是调个 API 嘛,简单!”

结果一调研才发现:每个模型特点不一样,有的擅长聊天,有的擅长代码,有的能看图,有的能画图,价格还千差万别…

好吧,事情没那么简单。


问题分析

为啥大模型这么"卷"?我梳理了一下,发现不是大家故意搞复杂,而是技术真的在快速迭代:

三个核心问题:

  1. 能力边界不清楚

    • GPT-3 和 GPT-4 到底差在哪?
    • 什么时候该用多模态模型?
    • 自研模型还是调 API?
  2. 技术路线太多

    • 预训练、微调、Prompt Engineering、RAG,怎么组合?
    • 开源 vs 闭源,怎么选?
  3. 演进速度太快

    • 上半年学的方案,下半年可能就被新技术颠覆了
    • 今天的热门概念,明天可能就被整合进基础模型

看来得理一理大模型的演进脉络…


方案设计

说白了,我们要解决的核心问题是:建立对大模型技术演进的认知框架

我把自己这两年"被卷"的经历捋了捋,发现大模型的发展大概分了四个阶段:

四个时代:

  • GPT 时代(2020-2022):预训练 + 提示工程,“大力出奇迹”
  • 指令时代(2022-2023):InstructGPT、ChatGPT,模型学会听人话
  • 多模态时代(2023-2024):GPT-4V、Gemini,能看图、能听声音
  • Agent 时代(2024-至今):工具调用、深度推理,模型开始"动手"了

每个时代的核心变化和选型逻辑都不一样,咱们一个个看。


实现过程

Step 1: GPT 时代 —— “预训练 + Prompt”

那是 2020 年,GPT-3 横空出世。

当时的核心思路特别简单:堆数据、堆参数、堆算力。

# 伪代码:GPT-3 时代的用法(2020-2022)
def gpt3_era():
    # 核心:预训练好的模型 + 精心设计的 Prompt
    model = load_pretrained_gpt3()  # 加载预训练模型
    
    # 关键:Prompt Engineering
    prompt = """
    你是一个专业的文案写手。
    
    任务:给一款运动耳机写广告文案。
    要求:
    - 突出降噪功能
    - 语气年轻化
    - 100字以内
    
    文案:
    """
    
    # 模型只负责"续写"
    result = model.complete(prompt)
    return result

这个时代的关键认知:

  • 模型是"续写机",你要通过 Prompt 告诉它"你是谁、要做什么"
  • Few-shot(给几个例子)能显著提升效果
  • 不用微调,调 Prompt 就行(Prompt Engineering)

局限性也很明显:

  • 模型经常答非所问(因为只是在续写)
  • 对复杂指令理解能力差
  • 容易生成有害内容(没有对齐人类价值观)

Step 2: 指令时代 —— “对齐人类意图”

2022 年底,ChatGPT 爆了。

它不是简单的 GPT-3.5,而是经过了指令微调(Instruction Tuning)RLHF(人类反馈强化学习)

说白了,就是教会模型"听人话、说人话"。

# 伪代码:ChatGPT 时代的用法(2022-2023)
def chatgpt_era():
    # 核心:对话式交互,模型理解"指令"
    model = load_instruct_model()  # 指令微调后的模型
    
    # 关键:不用写复杂 Prompt,直接说人话
    messages = [
        {"role": "system", "content": "你是 helpful assistant"},
        {"role": "user", "content": "写个运动耳机的广告文案,突出降噪,年轻化语气"}
    ]
    
    # 模型理解"指令",而不是简单续写
    result = model.chat(messages)
    return result

这个时代的变化:

  • 从"续写"变成"对话",交互方式更自然
  • 引入了 System Prompt,可以设定角色和规则
  • 指令遵循能力大幅提升

关键技术点:

  • SFT(监督微调):用高质量对话数据教模型怎么聊天
  • RLHF:让人类给回答打分,模型学会"什么回答是人类喜欢的"

选型建议:

  • 如果你今天还在用基座模型(Raw Model),别折腾 Prompt 了,直接用 Chat 版本
  • 国内模型(文心、通义、Kimi)都是这个时代的产物,选谁主要看价格和效果

Step 3: 多模态时代 —— “不止能看字”

2023 年,GPT-4V 发布,模型开始能"看图"了。

然后是 Gemini、Claude 3、Qwen-VL… 大模型进入"眼睛+耳朵"时代。

# 伪代码:多模态时代的用法(2023-2024)
def multimodal_era():
    # 核心:支持图文混合输入
    model = load_multimodal_model()  # GPT-4V / Gemini / Qwen-VL
    
    # 关键:可以传图片了!
    messages = [
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "这张图里的代码有什么 bug 吗?"},
                {"type": "image", "image": "screenshot.png"}  # 传图片!
            ]
        }
    ]
    
    result = model.chat(messages)
    return result

多模态解决了什么问题:

  • OCR + 理解:截图里的文字能识别,还能理解含义
  • 视觉问答:“这张图里的图表说明什么趋势?”
  • 跨模态生成:看图写文案、根据描述画图(DALL-E、Midjourney)

技术实现思路:

文本 Token + 图像 Token -> 统一编码 -> 解码生成

图像被编码成类似文本的 Token,和文本一起喂给 Transformer。

什么时候必须用多模态?

  • 处理截图、PDF、扫描件(OCR+理解一步到位)
  • 需要理解 UI 界面(比如自动化测试、RPA)
  • 内容审核(图文结合判断)

选型建议:

  • GPT-4V:效果最好,但贵
  • Gemini Pro Vision:性价比高,Google 生态
  • Qwen-VL / InternVL:国产开源,可私有化部署

Step 4: Agent 时代 —— “模型开始动手了”

2024 年,大模型开始"长手"了。

Function Calling、工具调用、AutoGPT、Devin… 模型不再只是"说话",而是能"做事"。

# 伪代码:Agent 时代的用法(2024-至今)
def agent_era():
    # 核心:模型可以调用工具了
    model = load_agent_model()  # 支持 Function Calling 的模型
    
    # 定义工具(让模型知道它能干什么)
    tools = [
        {
            "name": "search",
            "description": "搜索互联网信息",
            "parameters": {"query": "string"}
        },
        {
            "name": "calculator",
            "description": "数学计算",
            "parameters": {"expression": "string"}
        }
    ]
    
    # 用户提问
    user_input = "今年 GDP 增长 5%,去年是 100 万亿,那今年是多少?"
    
    # 关键:模型自己决定要不要用工具
    response = model.chat_with_tools(user_input, tools)
    
    if response.tool_call:  # 模型决定调用计算器
        result = calculator(response.tool_call.parameters)
        # 把结果给模型,让它继续回答
        final = model.chat(f"计算结果是 {result},请回答用户")
        return final
    
    return response.content

Agent 时代的核心能力:

  • 工具调用(Function Calling):模型知道什么时候该查数据库、调 API、算数学
  • 规划能力(Planning):把复杂任务拆成步骤,一步步执行
  • 记忆(Memory):记住之前的对话和上下文

典型应用:

  • AI 编程助手:Cursor、GitHub Copilot、Devin,不只是补代码,还能改 Bug、跑测试
  • 智能客服:能查订单、改地址、发起退款
  • 数据分析:自动查数据、画图、写报告

技术演进:

1.0: 单轮调用 -> 模型决定用什么工具
2.0: 多轮 ReAct -> 思考-行动-观察循环
3.0: 多 Agent 协作 -> 多个模型分工合作

选型建议:

  • 如果你只是做聊天机器人,没必要上 Agent,反而复杂
  • 如果需要和现有系统对接(查数据、调接口),Function Calling 是刚需
  • OpenAI、Claude 的工具调用能力最强,国产模型(通义、文心)也在快速追赶

踩坑记录

梳理演进路线的过程中,有几个常见误区,记录一下:

坑 1: 盲目追新,忽视场景

现象:听说 o1 推理能力强,所有场景都换 o1

问题:o1 贵且慢,简单场景用 GPT-4o mini 就够了

解决方案

  • 简单任务 -> 快模型(GPT-4o mini、Claude Haiku)
  • 复杂推理 -> 慢模型(o1、Claude Opus)
  • 视觉任务 -> 多模态模型
  • 系统对接 -> 支持 Function Calling 的模型

坑 2: 忽视上下文长度

现象:模型选对了,但扔进去一篇长文档,中间内容被"遗忘"

问题:不同模型上下文长度差异巨大(4k -> 128k -> 2000k)

解决方案

  • 长文档处理 -> 选长上下文模型(Claude 200k、Gemini 1M、Kimi 200k)
  • 超长文本 -> 考虑 RAG(检索增强生成),别硬塞

坑 3: 混淆基础模型和对话模型

现象:用了 Llama-3-70B,发现效果还不如 GPT-3.5

问题:基础模型(Base)没经过指令微调,不会对话

解决方案

  • 用 Instruct/Chat 版本(Llama-3-70B-Instruct)
  • 或者自己微调(成本高,除非有特定需求)

坑 4: 私有化部署的幻觉

现象:“我们要私有化部署 GPT-4 级别的模型”

问题:70B 参数的模型需要 140G+ 显存,成本吓死人

解决方案

  • 小参数模型(7B、13B)+ 微调,适合特定任务
  • 大参数模型(70B+),除非真有数据安全要求,否则调 API 更划算

一张图看懂全景

说了这么多,画张图总结一下:

大模型演进路线(2020-2024)

GPT 时代              指令时代              多模态时代              Agent 时代
(2020-2022)          (2022-2023)          (2023-2024)             (2024-至今)
    |                      |                      |                       |
    v                      v                      v                       v
预训练模型            指令微调模型            多模态模型              Agent 模型
+                     +                     +                       +
Prompt Engineering    对话交互              图文理解                 工具调用
                      +                     +                       +
                      RLHF 对齐             跨模态生成               规划执行

代表模型:              代表模型:              代表模型:               代表模型:
- GPT-3               - ChatGPT            - GPT-4V               - GPT-4o
- BERT                - Claude             - Gemini Pro Vision    - Claude 3.5
- T5                  - 文心一言            - Qwen-VL              - Devin
- LLaMA               - 通义千问            - InternVL             - AutoGPT

选型决策树:

你的场景是什么?
    |
    ├─-> 简单文本任务(问答、摘要)
    |       └─-> GPT-4o mini / Claude Haiku(便宜够用)
    |
    ├─-> 复杂推理(代码、数学)
    |       └─-> o1 / Claude Opus / DeepSeek-R1
    |
    ├─-> 需要看图/看文档
    |       └─-> GPT-4V / Gemini / Qwen-VL
    |
    ├─-> 需要调工具/查数据库
    |       └─-> 支持 Function Calling 的模型(GPT-4o、Claude)
    |
    └─-> 数据敏感,必须私有化
            └─-> Llama-3 / Qwen / ChatGLM(开源模型 + 微调)

小结

今天我们梳理了大模型从 GPT 到多模态再到 Agent 的演进路线:

四个时代:

  1. GPT 时代:预训练 + Prompt,学会"续写"
  2. 指令时代:SFT + RLHF,学会"听话"
  3. 多模态时代:视觉编码,学会"看图"
  4. Agent 时代:工具调用,学会"动手"

选型逻辑:

  • 不是越新越好,是越适合越好
  • 简单任务别用重炮,复杂任务别省成本
  • 多模态和 Agent 是刚需再上,不是刚需别折腾

当然,这个路线还在快速演进中:

  • o1/o3 代表的"深度推理"可能是下一个方向
  • 端侧小模型(手机本地跑)也在快速发展
  • 多模态还在往"视频理解"进化

写在最后

大模型技术发展太快,今天的"新"可能明天就"旧"了。

我的建议是:别追新,追理解。理解了演进的逻辑,就能快速适应变化。

你在大模型选型中踩过哪些坑?对哪个方向最感兴趣?欢迎在评论区交流!

如果觉得有用,给个👍吧,咱们下篇见!

更多推荐