文章详细介绍了大语言模型(LLM)从零开始训练的五个关键阶段:随机初始化、预训练、指令微调、偏好微调和推理微调。通过这些阶段,模型从初始的随机状态逐步获得语言理解、对话能力、符合人类偏好的回答以及推理能力,最终能够执行问答、代码编写等复杂任务。

前排提示,文末有大模型AGI-CSDN独家资料包哦!

随机初始化

在模型训练前,该模型一无所知。

你问它“What is an LLM?”,它却回答“try peter hand and hello 448Sn”之类的胡言乱语。它还没有看到任何数据,只有随机权重。

预训练(Pretraining)

这个阶段通过训练语言学习模型(LLM)使用海量语料库来预测下一个词元,从而教会它语言的基础知识。这样,它就能吸收语法、世界知识等等。但它不擅长对话,因为当被问及时,它只会继续发送文本。

指令微调(Instruction Fine-Tuning)

为了使其更像对话,我们通过训练指令-反应对(Instruction-Response Pair)来进行指令微调。这有助于它学习如何遵循提示并正确回复。

现在大模型具备了一下几个能力: 回答问题、内容总结、编写代码等等。

至此,我们可能已经充分利用了互联网上的所有原始资料和知识,以及人工标注的Instruction-Response Pair数据。那么我们还能做些什么来进一步改进这个模型呢?

偏好微调(Preference fine-tuning,PFT)

你一定在 ChatGPT 上看到过这个屏幕,它会问:你更喜欢哪种回复?

这不仅可以用于收集反馈,而且是宝贵的人类偏好数据。OpenAI 利用这种特性,通过偏好微调来微调其模型。在 PFT 中:用户在两种答案中做出选择,以生成人类偏好数据。然后训练奖励模型来预测人类偏好,并使用强化学习更新 LLM。

上述过程称为 RLHF(带人类反馈的强化学习),用于更新模型权重的算法称为 PPO。它教导LLM即使没有“正确”答案的场景也要与人类保持一致。但是我们还可以进一步改进LLM。

推理微调(Reasoning fine-tuning)

在推理任务(数学、逻辑等)中,通常只有一个正确答案,并且有一系列明确的步骤来获得答案。因此我们不需要人类的偏好,我们可以用正确性作为信号,这被称为推理微调。

步骤:

  • 该模型能够对提示信息做出回答。
  • 将答案与已知的正确答案进行比较。
  • 根据答案的正确性,给予奖励。

这被称为基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards)。DeepSeek 的 GRPO 是实现这一目标的一种常用技术。

读者福利:倘若大家对大模型感兴趣,那么这套大模型学习资料一定对你有用。

针对0基础小白:

如果你是零基础小白,快速入门大模型是可行的。
大模型学习流程较短,学习内容全面,需要理论与实践结合
学习计划和方向能根据资料进行归纳总结

包括:大模型学习线路汇总、学习阶段,大模型实战案例,大模型学习视频,人工智能、机器学习、大模型书籍PDF。带你从零基础系统性的学好大模型!

😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

请添加图片描述

👉AI大模型学习路线汇总👈

大模型学习路线图,整体分为7个大的阶段:(全套教程文末领取哈)

第一阶段: 从大模型系统设计入手,讲解大模型的主要方法;

第二阶段: 在通过大模型提示词工程从Prompts角度入手更好发挥模型的作用;

第三阶段: 大模型平台应用开发借助阿里云PAI平台构建电商领域虚拟试衣系统;

第四阶段: 大模型知识库应用开发以LangChain框架为例,构建物流行业咨询智能问答系统;

第五阶段: 大模型微调开发借助以大健康、新零售、新媒体领域构建适合当前领域大模型;

第六阶段: 以SD多模态大模型为主,搭建了文生图小程序案例;

第七阶段: 以大模型平台应用与开发为主,通过星火大模型,文心大模型等成熟大模型构建大模型行业应用。

👉大模型实战案例👈

光学理论是没用的,要学会跟着一起做,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。

在这里插入图片描述

👉大模型视频和PDF合集👈

这里我们能提供零基础学习书籍和视频。作为最快捷也是最有效的方式之一,跟着老师的思路,由浅入深,从理论到实操,其实大模型并不难

在这里插入图片描述

👉学会后的收获:👈

• 基于大模型全栈工程实现(前端、后端、产品经理、设计、数据分析等),通过这门课可获得不同能力;

• 能够利用大模型解决相关实际项目需求: 大数据时代,越来越多的企业和机构需要处理海量数据,利用大模型技术可以更好地处理这些数据,提高数据分析和决策的准确性。因此,掌握大模型应用开发技能,可以让程序员更好地应对实际项目需求;

• 基于大模型和企业数据AI应用开发,实现大模型理论、掌握GPU算力、硬件、LangChain开发框架和项目实战技能, 学会Fine-tuning垂直训练大模型(数据准备、数据蒸馏、大模型部署)一站式掌握;

• 能够完成时下热门大模型垂直领域模型训练能力,提高程序员的编码能力: 大模型应用开发需要掌握机器学习算法、深度学习框架等技术,这些技术的掌握可以提高程序员的编码能力和分析能力,让程序员更加熟练地编写高质量的代码。

👉获取方式:

😝有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

更多推荐