logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

斯坦福 CS336 从零构建大模型 (2025春) - 第一讲:(超详细且易懂的笔记,且最后有核心问答部分解决你的所有困惑)

斯坦福CS336课程"从零构建大模型"第一讲深入探讨了大模型构建的核心技术与理论。课程强调从底层理解大模型的必要性,拆解了五大核心模块:基础架构改进、系统优化、缩放定律、数据处理和对齐技术。重点讲解了分词技术,比较了字符、字节和词分词的优劣,详细介绍了目前主流的字节对编码(BPE)算法,其通过统计语料库中的高频字节对合并为新token,在词表大小和序列长度间取得平衡。课程还揭示

文章图片
#计算机视觉#机器学习#自然语言处理 +2
斯坦福 CS336 从零构建大模型 (2025春) - 第二讲:PyTorch 与资源核算

本文摘要: 斯坦福CS336课程第二讲聚焦PyTorch底层机制与资源核算技术。主要内容包括:1) 混合精度训练中BF16的优势及其与FP32/FP16的对比;2) PyTorch张量的内存布局与视图操作原理;3) 大模型训练的算力(FLOPs)估算方法,包括前向/反向传播的计算量分析;4) 显存占用的四大部分(参数、梯度、优化器状态、激活值)核算方法;5) 初始化策略与优化器选择建议。课程强调通

文章图片
#pytorch#人工智能#python +3
斯坦福大学 CS336 第三讲:大语言模型的架构演进与超参数选择

斯坦福大学CS336课程第三讲系统梳理了大语言模型的架构演进与超参数选择。课程从数据驱动视角,总结了2017年Transformer诞生至今的现代共识:1)架构方面,采用Pre-norm、RMSNorm和RoPE位置编码,移除偏置项,使用GLU变体激活函数;2)超参数遵循经验法则,如前馈网络扩增比例8/3倍、注意力头维度1:1比例、增大词表至10-25万;3)训练稳定性通过Z-loss、QK-no

文章图片
#语言模型#架构#人工智能 +4
斯坦福 CS336 从零构建大模型 (2025 春) - 第四讲:专家混合模型(Mixture of Experts, MoE)

斯坦福CS336课程第四讲深入解析了专家混合模型(MoE)的核心原理与技术实现。课程系统性地介绍了MoE的架构优势——通过稀疏激活专家网络实现参数量与计算量的解耦,在保持计算成本不变的同时大幅提升模型容量。重点剖析了路由机制设计、训练稳定性解决方案(如辅助损失、Z-Loss)、系统并行优化策略等关键技术挑战。特别以DeepSeek V3为例,详细拆解了其细粒度专家划分、共享专家设计、无损均衡创新等

文章图片
#语言模型#架构#人工智能 +4
斯坦福 CS336 从零构建大模型 (2025 春) - 第六讲:GPU 高性能编程与 Kernel 融合

斯坦福CS336课程第六讲聚焦GPU高性能编程,重点讲解了算子融合技术。课程从GPU硬件架构与执行模型入手,强调算术强度优化的重要性。在基准测试方面,提出了预热迭代和强制同步两个关键实践。通过性能分析工具揭示了CPU/GPU异步执行中的陷阱,特别是print语句导致的性能瓶颈。课程以GLU激活函数为例,对比了原生PyTorch实现(8.1ms)、官方融合版本(1.1ms)、手写CUDA Kerne

文章图片
#自然语言处理#python#人工智能 +1
斯坦福 CS336 从零构建大模型 (2025 春) - 第五讲:GPU 与系统优化(Flash Attention)

斯坦福CS336课程第五讲深入解析GPU架构与系统优化技术,重点讲解如何克服"内存墙"瓶颈。课程比较了CPU与GPU的设计差异,指出GPU通过海量ALU单元优化吞吐量而非延迟。详细剖析了GPU的SM多处理器架构和SIMT执行模型,揭示现代大模型主要受限于内存带宽而非计算能力。课程总结了六大核心优化技术:消除条件分支、降低数值精度、算子融合、激活值重计算、内存合并访问和分块矩阵乘

文章图片
#transformer#深度学习#人工智能 +3
斯坦福 CS336 从零构建大模型 (2025 春) - 第十四讲:数据处理 2(质量过滤与去重)

斯坦福CS336课程第十四讲聚焦大模型预训练数据的底层处理算法,重点解决两大核心问题:质量过滤与去重。质量过滤提出三大算法流派:N-gram统计语言模型用于粗略筛选语法合规文本;FastText线性分类器通过哈希映射实现高效二分类;重要性重采样通过N-gram频率比估计文档权重。工业应用包括语言识别、质量过滤(如Phi-1采用大小模型协同策略)和毒性过滤。去重方面,Bloom Filter实现精确

文章图片
#pytorch#人工智能#python +2
斯坦福 CS336 从零构建大模型 (2025 春) - 第十三讲:数据(Data 1)

本讲强调数据是大语言模型质量与差异化的核心护城河。训练数据大致分为预训练、中期训练与后训练:先用海量网络语料获得基础能力,再用高质量小规模数据强化数学、代码与长上下文,最后用指令微调与对齐数据产出可用的聊天模型。课程梳理了从 BERT 的书籍/维基、GPT‑2 的 WebText 到 Common Crawl 的主流过滤路线(规则过滤与模型分类过滤),以及 The Pile、书籍、代码等垂直数据的

文章图片
#pytorch#人工智能#python +3
斯坦福 CS336 从零构建大模型 (2025 春) - 第十五讲:对齐(SFT、RLHF 与 DPO)

斯坦福CS336课程第十五讲探讨了大模型对齐的关键技术(SFT、RLHF、DPO)及其挑战。SFT通过模仿专家演示让模型学会响应指令,但存在幻觉陷阱、格式偏见等问题。RLHF通过偏好数据解决SFT的质量判断缺陷,但面临人类标注的局限性。DPO创新性地将强化学习问题转化为监督学习,大幅简化了训练流程。课程揭示了当前对齐技术的核心矛盾:既要提升模型表现力,又要避免引入偏见和幻觉。完整流程包括预训练、S

文章图片
#语言模型#架构#人工智能 +1
斯坦福 CS336 从零构建大模型 (2025 春) - 第七讲:并行计算基础(Parallelism 1)

斯坦福CS336第七讲深入讲解了大模型训练的并行计算基础。课程从硬件通信原理解析入手,系统拆解了数据并行(DP)、模型并行(MP)和激活值并行三大核心策略。重点剖析了ZeRO优化的显存节省机制,包括参数切分、梯度切分和动态拉取等关键技术,以及流水线并行与张量并行的优劣对比。最后提出了3D并行黄金法则:优先使用张量并行(TP)填满单机8卡,再结合流水线并行(PP)或ZeRO-3切分模型,最后用数据并

文章图片
#transformer#深度学习#人工智能 +2
    共 48 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择