logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

12 GPT-1 论文精读:生成式预训练如何用于 NLP 任务?

在前面几章中,我们已经介绍了 Transformer、Self-Attention、Decoder-only 架构和 Tokenizer。到这里,我们终于可以正式进入 GPT 路线。。这篇论文由 OpenAI 在 2018 年提出。现在回头看,GPT-1 的规模并不算大,也没有今天 ChatGPT、GPT-4、LLaMA、Qwen、DeepSeek 这些模型那么强大的对话和推理能力。但是它的意义非

#自然语言处理#人工智能
SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot 解读

SparseGPT 不是全模型一起优化所有权重,而是逐层处理。第一,收集校准数据在当前层的输入激活。第二,对当前线性层计算近似 Hessian。第三,对该层权重做稀疏剪枝和误差补偿。第四,把剪枝后的输出继续传给下一层。第五,处理下一层。第一,内存可控。如果对整个 175B 模型同时构造二阶信息,完全不可行。逐层处理只需要当前层的激活统计和权重。第二,误差逐层传播更现实。剪完前一层后,后一层看到的是

#人工智能#语言模型#剪枝
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning 解读

Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning》提出 LLM-Shearing:先用 targeted structured pruning 将 LLaMA2-7B 剪成预先指定的 1.3B / 2.7B 目标结构,剪枝对象包括 layers、hidden dimensions、atten

#机器学习#深度学习#人工智能
05 Pytorch之 ViT-B/16 源码逐行解析

图补充中..............................................

#pytorch#人工智能#python
08 ViT 的局限:为什么不适合直接做检测和分割?

但是,到这里为止,我们讨论的核心任务仍然主要是:图像分类。也就是输入一张图像,输出一个类别标签。ViT 证明了:图像可以被切成 patch token,然后输入 Transformer Encoder 进行图像分类。DeiT 进一步说明:通过更好的训练策略和蒸馏机制,ViT 可以在不依赖超大规模外部数据的情况下更高效地训练。这就引出一个非常重要的问题:原始 ViT 能不能直接作为目标检测和语义分割

#transformer#人工智能#深度学习 +1
14 Chinchilla 论文精读:为什么大模型不能只堆参数?

计算最优所谓 compute-optimal training,就是在固定计算预算 (C) 下,选择最合适的参数量 (N) 和训练 token 数 (D),让模型最终 loss 最低、效果最好。如果无限增加计算量,模型能做到多强?如果计算预算固定,应该怎么分配给模型参数和训练数据?这个问题非常重要。因为现实中没有无限计算资源。多少张 GPU训练多久总 FLOPs 预算是多少数据规模有多少推理成本能

#语言模型#人工智能#gpt-3
2 Multimodal Deep Learning论文精读:深度多模态表示学习的早期奠基工作

《Multimodal Deep Learning》是2011年ICML会议发表的早期多模态学习代表作。论文以视听语音识别为研究对象,系统探讨了三种多模态学习范式:多模态融合、跨模态学习和共享表示学习。研究证明,简单拼接不同模态特征效果有限,而通过深度自编码器学习跨模态关联能显著提升性能。论文创新性地提出利用音频作为辅助监督改善纯视觉唇读,并探索了模态缺失下的鲁棒表示学习。实验表明,多模态优势在噪

#深度学习#学习#人工智能
10 大语言模型基本术语总结:参数、Token、Context、Logits、Temperature

不一定。Token 可能是字、词、子词、标点、空格片段。可能被切成多个 token。

#语言模型#人工智能#自然语言处理
02 从 RNN 到 Transformer:为什么语言建模需要新结构?

在上一篇文章中,我们从整体上介绍了大语言模型的发展路线。大语言模型并不是突然出现的,它背后经历了一个长期演进过程:统计语言模型↓神经网络语言模型↓↓Seq2Seq↓Attention↓↓↓大语言模型如果想真正理解大语言模型,不能一上来就只看 GPT、LLaMA、Qwen 或 DeepSeek。我们需要先理解一个更基础的问题:为什么早期的 RNN、LSTM、Seq2Seq 结构不够用了?

#rnn#transformer#人工智能
06 Transformer Decoder 详解:GPT 为什么使用 Decoder?

Causal Language Modeling 可以翻译为因果语言建模。这里的“因果”不是因果推理中的因果,而是指:当前 token 的预测只能依赖它之前的 token,不能依赖它之后的 token。假设一个文本序列为:语言模型要建模整个序列的概率:请总结下面这段文字:[长文本]模型输出摘要。

#transformer#深度学习
    共 44 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择