logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

高效部署MoE大语言模型:专家剪枝与动态跳跃的突破

《Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models》提出了一种创新的专家级稀疏化方法,通过后训练专家剪枝(Expert Pruning)和动态专家跳跃(Dynamic Expert Skipping),显著降低了 MoE 模型的内

文章图片
#语言模型#剪枝#人工智能 +3
什么是Boltzmann分布(玻尔兹曼分布)?

Boltzmann分布的核心思想是将概率与能量联系起来:能量越低的状态,出现的概率越高。

#深度学习
美国俚语“POV”全解析:从观点到网络梗

“POV”是“Point of View”(观点)的缩写,字面意思是“视角”或“看法”。

SiLU与GeLU激活函数:现代大模型的选择

为什么这些激活函数会成为新宠?它们又有哪些优越的性质呢?本文将为你详细解析。

文章图片
#深度学习#transformer#人工智能
深入解析 Latent Diffusion Model(潜在扩散模型,LDMs)(代码实现)

传统扩散模型在像素空间直接操作的特性导致其训练和推理过程计算成本极高,限制了其在高分辨率图像生成中的广泛应用。为了解决这一问题,Latent Diffusion Model(潜在扩散模型,LDMs)应运而生,它通过在潜在空间中运行扩散过程,显著降低了计算复杂度,同时保留甚至提升了生成质量。

文章图片
#人工智能#pytorch#深度学习 +1
深入解析 FID:深度学习生成模型评价指标

FID 作为生成模型评价的核心指标,通过比较特征分布的 Fréchet 距离,提供了一种高效且语义敏感的评估方法。

#深度学习#人工智能
什么是Cross Attention(交叉注意力)?详细解析与应用

Cross Attention 的核心在于:它允许一个序列(称为 Query,查询)去关注另一个序列(称为 Key 和 Value,键和值),从而实现信息的融合。

文章图片
#人工智能#机器学习#深度学习
微分方程家族:常微分方程(ODE)、偏微分方程(PDE)和随机微分方程(SDE)

本篇博客将以直观的语言,面向具有一定数学基础的读者,介绍常微分方程(ODE)、偏微分方程(PDE)和随机微分方程(SDE)的基本概念,并简述数学系研究微分方程的主要方向。

#机器学习#人工智能
    共 697 条
  • 1
  • 2
  • 3
  • 70
  • 请选择