logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

MOELoRA:结合MoE与LoRA的Qwen3-VL高效微调(代码开源)

本文介绍了一种融合MoE多专家扩展能力和LoRA轻量化优势的MOELoRA方法,用于在消费级显卡上高效微调视觉语言模型(如Qwen3-VL)。该方法借鉴DeepSeekV3的无损耗负载均衡策略,仅通过可学习路由偏置实现专家均衡调用,无需额外损失项。文章详细阐述了MOELoRA的核心实现,包括配置类扩展、MOELoraLayer设计以及与Peft库的集成,并以Qwen3-VL-4B为例展示了在8G显

文章图片
#语言模型#人工智能#自然语言处理 +1
FSFP——专为蛋白质工程设计的少样本学习策略

FSFP(Few-Shot Learning for Protein Fitness Prediction)是一种专为蛋白质工程设计的少样本学习策略。它通过结合元迁移学习(MTL)、排序学习(LTR)和低秩适应(LoRA)技术,有效提升了蛋白质语言模型在极少量标记数据下的性能。FSFP通过在相关蛋白质的辅助任务上进行元训练,获取能够快速适应新任务的初始模型参数,然后在目标蛋白质的少量数据上进行微调

文章图片
#人工智能#神经网络#深度学习
交叉熵损失深度解析--大模型基础

本文系统介绍了交叉熵损失在深度学习中的应用,重点分析了其在LLM预训练中的核心作用。文章从数学原理出发,详细推导了交叉熵与熵、KL散度的关系,阐述了其作为分布差异度量的本质。

文章图片
#语言模型#算法
优化器(Optimizer)——大模型基础

梳理深度学习优化器的演进历程及其在LLM训练中的应用

文章图片
#机器学习#人工智能#算法
C++中双引号和单引号的区别(全面分析)

摘要:C++中单引号('')和双引号("")有本质区别:单引号表示字符常量(char类型),存储单个字符的ASCII码(1字节);双引号表示字符串常量(const char[]类型),存储字符序列并以'\0'结尾。关键区别包括:字符常量只能包含1个字符,而字符串常量可为空或多字符;存储上字符常量固定1字节,字符串常量占用字符数+1字节。使用时应根据变量类型匹配,字符变量用单引号

文章图片
#c++#开发语言#算法
C++算法题—图的邻接矩阵输入形式(I\O)

本文介绍了图论中邻接矩阵的存储方式和常见应用。

文章图片
#算法#c++#深度优先 +1
C++算法题中的输入输出形式(I/O)

本文总结了C++刷题中常见的输入输出处理方式,帮助Leetcode选手快速适应

文章图片
#算法#c++#数据结构
    共 17 条
  • 1
  • 2
  • 请选择