
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
大模型训练分为三个阶段:预训练通过海量数据学习语言规律和世界知识,形成基础智能;中训练使用高质量专业数据强化特定领域能力,如多模态支持或长文本处理;后训练通过监督微调和强化学习优化模型交互能力,使其更符合人类偏好。三个阶段分别解决"有知识"、"更专业"和"更会交流"的问题,共同塑造出实用的AI助手。预训练成本最高但通用性强,后训练对最终用
大模型后训练阶段的核心方法包括微调(Fine-tuning)和强化学习(RL)。微调通过让模型模仿人类提供的标准答案来优化行为,强调过程的正确性和稳定性,适合指令性任务,但依赖高质量数据且创造力有限。强化学习则通过奖励机制让模型自主探索最优策略,关注结果而非固定流程,能激发更强推理能力和创新性,但训练难度高且稳定性较差。两者在数据需求上也有差异:微调需要标准答案数据,而RL依赖有效的评分机制。简言
大模型训练分为预训练和后训练两个阶段:预训练让模型通过海量文本数据学习语言规律和基础知识;后训练则通过微调、强化学习等技术优化模型行为,使其更符合人类需求,具备推理、工具使用、思维链等能力。后训练不增加知识量,而是提升模型的交互性、安全性和实用性,将其从"文本生成器"转变为"智能助手"。整个过程实现了从知识获取到知识应用的进化。
Question↓Answer一次输入。一次输出。Question↓Planning↓Tool Use↓↓Reasoning↓AnswerAgent 不只是回答问题,而是主动完成任务。查询天气规划旅行分析财务数据自动生成报告调用外部系统问题优先方案新知识RAG过时知识RAG输出风格SFT用户偏好RL工具调用SFT + RL小 BugPrompt新技能SFT推理能力RL数据↓训练↓评测↓部署↓用户反
作为系列教程的第一部分,将首先对 Web3.py 库进行整体概述,随后演示如何查看以太坊账户的余额。开发智能合约:运用 Solidity 编程语言编写可在区块链上运行的程序。开发与区块链交互的客户端:编写用于从区块链读取和写入数据的代码(涵盖与智能合约的交互)。Web3.py 能够助力你完成第二项任务,即开发与以太坊区块链交互的客户端。
DeepSeek-R1最大的经验不是“用RL学会推理”,而是先用少量高质量CoT数据教会模型输出<think>格式,再通过RL激发推理能力,最后利用拒绝采样生成大规模推理数据完成能力扩展。这也是目前训练 Reasoning Model 最主流的路线。
大模型通过Tokenizer将文本转换为数字TokenID进行处理。Tokenizer将文本切分为单词、子词或字符,映射为唯一ID,形成词表。模型通过Embedding层将TokenID转为向量输入Transformer,预测下一个Token的概率分布。不同分词器规则各异,影响模型理解。温度参数控制输出随机性,BeamSearch优化解码。训练时使用Padding统一批次长度。Tokenizer决
文章摘要:推理能力是大模型的核心功能,表现为逐步分析问题并得出正确结果。传统监督学习可能仅记忆答案而缺乏真正理解。思维链(CoT)方法通过训练模型输出推理过程(如<think>标签内容)显著提升推理能力。监督微调(SFT)让模型模仿人类思考,而强化学习(RL)则通过奖励机制让模型自主探索推理路径,可能突破能力上限但训练成本较高。DeepSeek等研究发现,RL可使模型自发形成推理能力。
例如:会数学会代码会写作会翻译代码能力 ↑翻译能力 ↓数学能力 ↓模型忘记了原来的知识。这就是:灾难性遗忘。fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;Evaluate训练决定模型参数,评估决定模型方向,而误差分析决定下一步应该修复什么。
获得能力提升需要多少次训练回合。例如:1000次回合提升10%100次回合提升10%B更高效强化学习最大的挑战不是训练模型,而是设计正确的奖励和评估系统。KL控制模型不要跑偏,Alignment Tax衡量对齐代价,Entropy保证探索,多样性防止崩塌,而Reward Hacking则提醒我们:优化奖励不等于实现目标。







