
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在前面几章中,我们已经介绍了 Transformer、Self-Attention、Decoder-only 架构和 Tokenizer。到这里,我们终于可以正式进入 GPT 路线。。这篇论文由 OpenAI 在 2018 年提出。现在回头看,GPT-1 的规模并不算大,也没有今天 ChatGPT、GPT-4、LLaMA、Qwen、DeepSeek 这些模型那么强大的对话和推理能力。但是它的意义非
SparseGPT 不是全模型一起优化所有权重,而是逐层处理。第一,收集校准数据在当前层的输入激活。第二,对当前线性层计算近似 Hessian。第三,对该层权重做稀疏剪枝和误差补偿。第四,把剪枝后的输出继续传给下一层。第五,处理下一层。第一,内存可控。如果对整个 175B 模型同时构造二阶信息,完全不可行。逐层处理只需要当前层的激活统计和权重。第二,误差逐层传播更现实。剪完前一层后,后一层看到的是
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning》提出 LLM-Shearing:先用 targeted structured pruning 将 LLaMA2-7B 剪成预先指定的 1.3B / 2.7B 目标结构,剪枝对象包括 layers、hidden dimensions、atten
图补充中..............................................
但是,到这里为止,我们讨论的核心任务仍然主要是:图像分类。也就是输入一张图像,输出一个类别标签。ViT 证明了:图像可以被切成 patch token,然后输入 Transformer Encoder 进行图像分类。DeiT 进一步说明:通过更好的训练策略和蒸馏机制,ViT 可以在不依赖超大规模外部数据的情况下更高效地训练。这就引出一个非常重要的问题:原始 ViT 能不能直接作为目标检测和语义分割
计算最优所谓 compute-optimal training,就是在固定计算预算 (C) 下,选择最合适的参数量 (N) 和训练 token 数 (D),让模型最终 loss 最低、效果最好。如果无限增加计算量,模型能做到多强?如果计算预算固定,应该怎么分配给模型参数和训练数据?这个问题非常重要。因为现实中没有无限计算资源。多少张 GPU训练多久总 FLOPs 预算是多少数据规模有多少推理成本能
《Multimodal Deep Learning》是2011年ICML会议发表的早期多模态学习代表作。论文以视听语音识别为研究对象,系统探讨了三种多模态学习范式:多模态融合、跨模态学习和共享表示学习。研究证明,简单拼接不同模态特征效果有限,而通过深度自编码器学习跨模态关联能显著提升性能。论文创新性地提出利用音频作为辅助监督改善纯视觉唇读,并探索了模态缺失下的鲁棒表示学习。实验表明,多模态优势在噪
不一定。Token 可能是字、词、子词、标点、空格片段。可能被切成多个 token。
在上一篇文章中,我们从整体上介绍了大语言模型的发展路线。大语言模型并不是突然出现的,它背后经历了一个长期演进过程:统计语言模型↓神经网络语言模型↓↓Seq2Seq↓Attention↓↓↓大语言模型如果想真正理解大语言模型,不能一上来就只看 GPT、LLaMA、Qwen 或 DeepSeek。我们需要先理解一个更基础的问题:为什么早期的 RNN、LSTM、Seq2Seq 结构不够用了?
Causal Language Modeling 可以翻译为因果语言建模。这里的“因果”不是因果推理中的因果,而是指:当前 token 的预测只能依赖它之前的 token,不能依赖它之后的 token。假设一个文本序列为:语言模型要建模整个序列的概率:请总结下面这段文字:[长文本]模型输出摘要。







