logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

模型剪枝经典论文精读:Channel Pruning for Accelerating Very Deep Neural Networks

Channel Pruning for Accelerating Very Deep Neural Networks》将 CNN 通道剪枝建模为 LASSO 稀疏通道选择与最小二乘特征重建问题,是结构化剪枝中“优化驱动通道选择”路线的经典代表工作。

#剪枝#算法#机器学习
09 PVT 论文:Pyramid Vision Transformer: A Versatile Backbone for Dense Prediction without Convolution

它通常把图像切成固定大小的 patch,然后在一个固定长度的 token 序列上堆叠 Transformer Encoder,最后使用 class token 完成分类。论文明确指出,PVT 希望克服 ViT 迁移到检测和分割任务时的困难,并通过金字塔结构和 Spatial-Reduction Attention 生成高分辨率、多尺度特征。原始 ViT 的问题在于:输出通常是单尺度、低分辨率 to

#transformer#深度学习#人工智能
04 ViT 原论文精读:An Image is Worth 16x16 Words

01 为什么 Vision Transformer 会出现?02 Transformer 基础:Self-Attention 原理详解03 图像如何变成 Token:Patch Embedding 详解现在,我们终于可以正式进入 ViT 的原始论文:这篇论文提出了后来非常经典的Vision Transformer,简称 ViT。ViT 的核心思想非常直接:把图像切成固定大小的 patch,把每个

#transformer
14 Chinchilla 论文精读:为什么大模型不能只堆参数?

计算最优所谓 compute-optimal training,就是在固定计算预算 (C) 下,选择最合适的参数量 (N) 和训练 token 数 (D),让模型最终 loss 最低、效果最好。如果无限增加计算量,模型能做到多强?如果计算预算固定,应该怎么分配给模型参数和训练数据?这个问题非常重要。因为现实中没有无限计算资源。多少张 GPU训练多久总 FLOPs 预算是多少数据规模有多少推理成本能

#语言模型#人工智能#gpt-3
模型剪枝经典论文精读:Towards Optimal Structured CNN Pruning via Generative Adversarial Learning

Towards Optimal Structured CNN Pruning via Generative Adversarial Learning》提出用带 soft mask 的剪枝网络作为生成器,通过对抗学习和 MSE 输出对齐来模仿原始网络,并用 L1 稀疏正则与 FISTA 将冗余结构的 mask 推到 0,从而实现 channels、branches、blocks 等异构结构的端到端联

#剪枝#cnn#算法
模型剪枝经典论文精读:Towards Efficient Model Compression via Learned Global Ranking

Towards Efficient Model Compression via Learned Global Ranking》提出 LeGR,通过学习每层 filter norm 的仿射变换,把同层内可比较的 L2 norm 转换成跨层可比较的全局重要性排序;随后只需剪掉排名靠后的 filters,就能一次生成多个不同 FLOPs / accuracy trade-off 的剪枝模型,从而显著降低

#剪枝#算法#机器学习
模型剪枝经典论文精读:DepGraph: Towards Any Structural Pruning

DepGraph: Towards Any Structural Pruning》提出用 Dependency Graph 自动建模神经网络中的结构依赖关系,将必须同步裁剪的输入维度、输出维度和参数维度归为同一个 pruning group,从而支持 CNN、Transformer、RNN、GNN 等多种网络的通用结构化剪枝;它的核心贡献不是新的重要性指标,而是把结构化剪枝中最复杂的依赖分析和同步

#剪枝#算法#机器学习
12 GPT-1 论文精读:生成式预训练如何用于 NLP 任务?

在前面几章中,我们已经介绍了 Transformer、Self-Attention、Decoder-only 架构和 Tokenizer。到这里,我们终于可以正式进入 GPT 路线。。这篇论文由 OpenAI 在 2018 年提出。现在回头看,GPT-1 的规模并不算大,也没有今天 ChatGPT、GPT-4、LLaMA、Qwen、DeepSeek 这些模型那么强大的对话和推理能力。但是它的意义非

#自然语言处理#人工智能
SparseGPT: Massive Language Models Can Be Accurately Pruned in One-Shot 解读

SparseGPT 不是全模型一起优化所有权重,而是逐层处理。第一,收集校准数据在当前层的输入激活。第二,对当前线性层计算近似 Hessian。第三,对该层权重做稀疏剪枝和误差补偿。第四,把剪枝后的输出继续传给下一层。第五,处理下一层。第一,内存可控。如果对整个 175B 模型同时构造二阶信息,完全不可行。逐层处理只需要当前层的激活统计和权重。第二,误差逐层传播更现实。剪完前一层后,后一层看到的是

#人工智能#语言模型#剪枝
Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning 解读

Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning》提出 LLM-Shearing:先用 targeted structured pruning 将 LLaMA2-7B 剪成预先指定的 1.3B / 2.7B 目标结构,剪枝对象包括 layers、hidden dimensions、atten

#机器学习#深度学习#人工智能
    共 51 条
  • 1
  • 2
  • 3
  • 6
  • 请选择