
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
相比传统稠密模型,MoE 能以更低成本实现万亿参数级模型,是当前大模型轻量化、高性能扩展的主流技术,典型代表有 Mixtral-8x7B、Switch Transformer 等。“MoE(混合专家模型)是一种稀疏激活的大模型架构,核心是将传统单一生成的稠密网络,拆分为多个独立的‘专家子网络’和一个‘门控调度网络’。大模型是一个更广泛的概念,GPT 只是其中最具代表性的一类。的大模型架构,核心是把
我做的是一个基于 ResNet18 迁移学习的食物图像分类任务,因为数据集中有标签样本少、无标签样本多,所以我采用了伪标签半监督学习来提升模型效果。整体流程是:先用有标签数据训练模型,再用训练好的模型给无标签数据打高置信度伪标签,最后把伪标签数据加入训练,进一步提升分类准确率。优化器就是根据损失函数算出的梯度,去自动更新模型的权重,让模型越来越准、损失越来越小的工具。模型一开始是瞎猜的,预测不准。
BART 以 Encoder-Decoder 架构融合双向编码与自回归生成,通过去噪预训练实现理解与生成的统一,是 NLP 领域的 “多面手”,尤其在文本生成类任务中优势显著,其变体与微调策略持续推动下游应用落地。BART 预训练 =文本损坏 + 文本复原,核心是「降噪自编码」任务;输入是「随机破坏的文本」,输出要求是「原始干净文本」,模型用 Encoder-Decoder 完成这个任务;BART
反向传播是深度学习 / 机器学习中用于计算模型参数梯度的核心算法先通过「前向传播」计算模型预测值和损失值(损失值反映模型预测结果与真实标签的差距);再沿着「损失值 → 模型预测值 → 模型参数」的反向路径,根据链式求导法则(复合函数求导法则),从后往前逐层计算每个模型参数对损失值的梯度(偏导数);最终得到的梯度,会用于后续的参数更新(比如你代码中的 SGD 梯度下降),让模型逐渐逼近最优解。
涵盖从数据预处理到模型部署的全流程。本文基于 PyTorch 框架实现了一套完整的。
BERT 是由 Google 于 2018 年提出的,基于 Transformer 的部分构建,核心创新是采用,彻底改变了自然语言处理(NLP)的范式,成为后续众多大模型的基础框架。简单来说:BERT 像一个 “语言学霸”,先通过海量文本数据进行(学习通用的语言知识,如语义、语法、上下文关联),再通过(在具体任务上适配少量标注数据),就能在各类 NLP 任务(如文本分类、问答、命名实体识别)上达到
相比传统稠密模型,MoE 能以更低成本实现万亿参数级模型,是当前大模型轻量化、高性能扩展的主流技术,典型代表有 Mixtral-8x7B、Switch Transformer 等。“MoE(混合专家模型)是一种稀疏激活的大模型架构,核心是将传统单一生成的稠密网络,拆分为多个独立的‘专家子网络’和一个‘门控调度网络’。大模型是一个更广泛的概念,GPT 只是其中最具代表性的一类。的大模型架构,核心是把
BERT 是由 Google 于 2018 年提出的,基于 Transformer 的部分构建,核心创新是采用,彻底改变了自然语言处理(NLP)的范式,成为后续众多大模型的基础框架。简单来说:BERT 像一个 “语言学霸”,先通过海量文本数据进行(学习通用的语言知识,如语义、语法、上下文关联),再通过(在具体任务上适配少量标注数据),就能在各类 NLP 任务(如文本分类、问答、命名实体识别)上达到
BERT 是由 Google 于 2018 年提出的,基于 Transformer 的部分构建,核心创新是采用,彻底改变了自然语言处理(NLP)的范式,成为后续众多大模型的基础框架。简单来说:BERT 像一个 “语言学霸”,先通过海量文本数据进行(学习通用的语言知识,如语义、语法、上下文关联),再通过(在具体任务上适配少量标注数据),就能在各类 NLP 任务(如文本分类、问答、命名实体识别)上达到







