一.大模型LLM是干什么的

        大模型就是一个通过海量数据学习,能理解、生成人类语言,并完成各种智能任务的通用人工智能。

  • 理解人类语言能读懂文字、理解意图、提取信息、做总结、做翻译。

  • 生成人类语言写文案、写代码、写邮件、写报告、对话聊天、创作内容。

  • 执行复杂任务逻辑推理、数学计算、代码编写、规划步骤、决策建议。

  • 作为通用基座可以通过微调、外挂工具,适配各行各业:客服、教育、医疗、法律、办公自动化、智能助手等。

二.为什么会出现大模型

        大模型的出现,是数据、算力、模型架构三者共同推动的必然结果:

  1. 数据层面:互联网积累了海量多样化文本,为模型提供了充足学习素材;
  2. 算力层面:GPU 与分布式训练技术成熟,使大规模模型训练成为可能;
  3. 模型架构层面:Transformer 提出与 Scaling Law 发现,证明 “越大越强”,推动了参数规模爆炸式增长。

三.大模型计量单位?

训练数据:Ttoken,10^12
    算力:FlOPS:单位时间浮点数运算次数
    参数:B:10亿

四.大模型分类:

    生成式:文本模型(LLM),多模态模型
    嵌入模型:embeding
    重排序:reranker
    分类器/判别器模型


五.AIGC和AGI

AIGC:用AI生成内容(工具)
    AGI:通用人工智能

六.大语言模型演进路线

RNN->LSTM->GRU->seq2seq->seq2seq+attention->transformer

transformer:编码器+解码器,


为什么现在大模型用的都是decoder-only?

因为decoder-only是自回归生成,更符合人类语言规范
    效率更好

七.什么是预训练:

在一个巨大的通用语料库(互联网文本、书籍、代码、论文等)上,让模型进行无监督学习,学习语言规律、世界知识、逻辑推理。
对应大模型:
预训练后的模型 = 懂数学、懂物理、懂代码、懂人类语言
但它还不会按照你的指令做事

八.什么是监督微调(SFT):

先用大量高质量的「问题 + 标准答案」数据,去训练一个已经预训练好的大模型,让模型学会按照人类期望的方式回答,而不是随便瞎编。
然后让模型照着学、照着说。学完之后,它就变成听话、好用、能落地的对话模型。
输入:指令 / 问题(prompt)
输出:标准答案(response)

九.什么是人类反馈强化学习(RLHF):

RLHF = 让 AI 不仅会做题,还要学会 “人话”、讲礼貌、不胡说、更安全。(让模型学会人类喜欢什么样的回答 → 更有用、更安全、更自然、不乱编、不骂人)
RLHF 三步流程(必考)    
    ① 收集人类反馈
            给模型同一个问题,生成多个回答,让人来:
            打分(1~5 分)
            排序(哪个好、哪个差)
            标注是否安全、合规
    ② 训练奖励模型(Reward Model, RM)
            让 AI 学人类的口味:“人类觉得哪种回答更好。”
    ③ 用强化学习(PPO)微调大模型
            让模型朝着 “得分更高” 的方向进化:
            说得更清楚
            更有用
            更安全
            不乱编
            不冒犯

十.什么是强化学习:

强化学习 = 让 AI 在不断试错中学习,靠 “奖励” 和 “惩罚” 变得越来越聪明。
    强化学习三大特点
        1.没有标准答案不像监督学习有 “正确答案”,只有奖励信号。
        2.试错学习错多了就知道什么不能做,对多了就知道最优路线。
        3.长期收益优先不只看眼前一步,还要看未来能不能拿更高分。


十一.大语言模型训练范式?

    预训练+后训练
        后训练:监督微调(SFT)+人类反馈强化学习(RLHF)
    预训练目标:让模型学习语义知识
    后训练目标:做指令微调,限制输出内容

十二.大模型的算力基础设施?

    显卡:A100,H100,B100,V100
    显存:GPU的内存

    训练阶段硬件瓶颈?
    显存,多卡通信,单卡算力
    推理阶段硬件瓶颈?
    显存,显存带宽,多卡通信,单卡算力

更多推荐