
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
采集而来的数据,如同刚从河中舀起的水,泥沙俱下,杂质众多。若不清洗,模型将学习到错误知识,产生有害输出。本章将揭示数据清洗的核心技术。

本章深入探讨了文本预处理中的关键环节——Tokenization技术。文章首先阐述了Token作为模型处理文本最小单元的核心概念,分析了统一表示、高效编码和灵活切分三大需求。随后系统梳理了分词方法的演进历程:从早期的词级分词、字符级分词,到当前主流的子词分词技术。重点讲解了BPE算法的原理与实现步骤,包括初始化、频率统计、合并操作等核心流程,并对比了WordPiece、Unigram等不同算法的特

2017年,谷歌门派发表论文《Attention Is All You Need》,Transformer架构横空出世,如九阳神功现世,彻底改变了AI武学格局。本章将深入剖析这一革命性架构。

本章系统介绍了大模型预训练的核心技术与实战方法。主要内容包括:1)预训练流程与目标;2)分布式训练策略(数据/张量/流水线并行);3)混合精度训练技术;4)梯度累积优化;5)学习率调度策略;6)损失函数与评估指标;7)检查点与容错机制;8)训练监控体系。通过"3D并行"、"ZeRO优化"等关键技术,结合BF16混合精度和梯度累积,实现高效的大规模模型训练。本

语言模型的核心能力,在于预测未来。给定前面的文字,预测下一个字。这看似简单的任务,却蕴含着语言理解、知识推理的深刻能力。

预训练后的模型,内功深厚,但不懂如何与人交流。监督微调(Supervised Fine-Tuning, SFT)便是名师指点,教模型如何与人对话、如何遵循指令。

真正的对话不是一问一答,而是多轮交互。模型需要记住上下文,理解对话历史,才能接招拆招,应对自如。

真正的大模型应该文能提笔安天下,武能上马定乾坤。多任务微调让模型学会多种技能,成为全能选手。

经过预训练和SFT,模型已具备强大的能力。但能力越强,潜在危害越大。对齐训练确保模型输出符合人类价值观,是决定模型是侠是魔的关键一步。

摘要: DPO(直接偏好优化)是一种革新性的大模型对齐方法,相比传统RLHF具有显著优势。它通过数学推导直接优化策略,跳过了奖励模型训练和PPO强化学习阶段,实现了更简单高效的偏好学习。核心原理是将奖励函数表示为策略与参考模型的比值,并构建基于Bradley-Terry模型的损失函数。实验表明,DPO在效果相当甚至更好的情况下,训练更稳定、计算成本更低、调参更简单。文章详细解析了DPO的数学原理、








