logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

【论文笔记】大型语言模型的知识蒸馏与数据集蒸馏

我们来看一篇关于大型语言模型的知识蒸馏与数据集蒸馏的综述

文章图片
#人工智能#深度学习#论文阅读
【论文笔记】知识蒸馏的全面综述

今天看一篇关于知识蒸馏(Knowledge Distillation, KD)的全面综述

文章图片
#人工智能#算法#机器学习
手把手教你在Windows上的安装openclaw!全面测评大龙虾!

手把手教你在Windows上的安装openclaw!全面测评大龙虾!

文章图片
#人工智能#深度学习
为什么可灵、即梦只能生成10秒视频?

玩过视频生成模型的朋友可能有过这样的疑问:“为什么可灵、即梦等视频生成模型只能生成大约10秒的视频?”要回答这个问题,我们首先需要了解当前主流的视频生成模型的结构。简而言之:无论多长的视频,都是“嗷”一下直接生成的;而不是一帧一帧逐步生成的。这样做的好处是可以保证内容的一致性,但也受到计算能力的限制,生成视频的长度也将受到限制。

文章图片
#人工智能#算法#深度学习 +2
如何训练一个大模型:LoRA篇

现在有很多开源的大模型,他们一般都是通用的,这就意味着这些开源大模型在特定任务上可能力不从心。为了适应我们的下游任务,就需要对预训练模型进行微调。全参数微调有两个问题:在新的数据集上训练,会破坏大模型原来的能力,使其泛化能力急剧下降;而且现在的模型参数动辄几十亿上百亿,要执行全参数微调的话,他贵啊!!于是LoRA出现了,LoRA(Low-Rank Adaptation)是微软提出的一种参数有效的微

文章图片
#自然语言处理#人工智能#pytorch +1
深度学习调参tricks总结

寻找合适的学习率(learning rate)学习率是一个非常非常重要的超参数,这个参数呢,面对不同规模、不同batch-size、不同优化方式、不同数据集,其最合适的值都是不确定的,我们无法光凭经验来准确地确定lr的值,我们唯一可以做的,就是在训练中不断寻找最合适当前状态的学习率。比如下图利用fastai中的lr_find()函数寻找合适的学习率,根据下方的学习率-损失曲线得到此时合适的学习率为

文章图片
#算法#机器学习#神经网络
【论文笔记】独属于CV的注意力机制CBAM-Convolutional Block Attention Module

CBAM(Convolutional Block Attention Module)是2018年被提出的,不同于ViT的Attention,CBAM是为CNN量身定做的Attention模块,实现简单、效果好,你值得拥有。

文章图片
#人工智能#深度学习#计算机视觉 +1
大模型的FP32、FP16、INT8等格式都是干什么用的?

小伙伴们在开源大模型社区浏览下载页面时,常能看到模型文件名后跟着"FP16""INT8"或"INT4"的后缀——比如"Llama3-8B-FP16",或是标注为"INT4量化版"。这些看似神秘的字母组合,其实是模型参数的存储格式,直接影响着模型的内存占用、计算效率与性能表现。

文章图片
#人工智能#算法#深度学习
大模型中的KVCache是什么

小伙伴们肯定发现了,现在的大模型推理速度越来越快,甚至有的文本大模型已经可以实现“腹泻式”输出。其实优化速度的手段有很多,其中一个就是KVCache 。

文章图片
#人工智能#深度学习#语言模型 +1
微博开源VibeThinker-1.5B大模型:15亿参数,挑战万亿参数AI巨头

当整个AI行业都在追逐"更大即更强"的 scaling law 时,微博AI团队带来的VibeThinker-1.5B却用实实在在的数据告诉我们:小模型,同样可以拥有大智慧。这个仅有15亿参数的"小个子",在AIME2025数学竞赛中斩获74.4分,超越了参数量400倍于它的DeepSeek R1;在代码生成任务上,它以51.1分的成绩小幅领先Magistral Medium。更令人惊叹的是,这一

文章图片
#人工智能
    共 65 条
  • 1
  • 2
  • 3
  • 7
  • 请选择