logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

微调【动手学深度学习v2】

微调通过使用在大数据上得到的预训练好的模型来初始化模型权重来完成提升精度预训练模型质量很重要,微调通常速度更快、精度更高。

#深度学习#人工智能
如何用少量标签训练强大模型?一文读懂半监督学习

简单来说,半监督学习介于“监督学习”和“无监督学习”之间。全部数据都有标签(土豪模式,效果好但太贵)。数据完全没标签(两眼一抹黑,通常用于聚类)。少量有标签数据 + 大量无标签数据。它的核心思想是:利用少量“有老师教”的样本(有标签)建立基础认知,再去探索大量“没老师教”的习题(无标签),以此自我提升。显著降低了对人工标注的依赖。在标签数据极少的情况下,通常能比纯监督学习获得更好的准确率。半监督学

#人工智能#机器学习#深度学习
【考研复试】深度学习核心:特征提取与名词全解析

复试中,老师非常看重你对底层逻辑的理解。深度学习的本质就是“玩特征”,即如何将原始数据编码为高质量的特征向量。

#人工智能#深度学习#考研
深度学习生成任务 (Seq2seq & Transformer) 核心考点全解析

本文系统讲解了Transformer架构在生成任务中的核心原理与应用。重点解析了Encoder-Decoder结构、MaskedAttention机制和位置编码等关键技术,并深入对比了训练时的TeacherForcing与推理时的Autoregressive模式差异。文章还介绍了KVCache优化和BeamSearch等实用技巧,为理解现代大模型工作原理提供了清晰框架,特别适合考研复试准备。

#深度学习#transformer#nlp
【硬核万字长文】从 BERT 到 DeepSeek:大模型架构演进、预训练全流程与 RLHF 深度解析(附 PPT 原理图解与面经)

本文深入解析大语言模型的技术演进与核心原理。从Transformer架构的分野出发,详细对比了Encoder和Decoder-Only结构的特性差异。重点剖析了DeepSeek架构的创新之处:包括RMSNorm归一化、SwiGLU激活函数、RoPE旋转位置编码、MLA多头潜在注意力以及MoE混合专家模型等关键技术。文章还系统讲解了预训练阶段的ScalingLaw、数据预处理和NextTokenPr

#bert#架构#语言模型 +2
【2025考研复试】深度学习扩展知识:从ViT到多模态,以及简历项目挖掘策略(第11章复盘)

考研复试深度学习前沿技术解析:从ViT到多模态学习 本文聚焦考研复试中导师关注的前沿技术点,重点剖析了Vision Transformer(ViT)的核心原理与多模态学习的演进历程。ViT通过将图像分割为Patch并引入位置编码,实现了基于全局注意力的图像处理;多模态领域则从VisualBERT发展到ALBEF,展示了"先对齐再融合"的先进思路。文章还探讨了分布式训练、联邦学习

#考研#深度学习#人工智能 +3
【2025考研复试】深度学习扩展知识:从ViT到多模态,以及简历项目挖掘策略(第11章复盘)

考研复试深度学习前沿技术解析:从ViT到多模态学习 本文聚焦考研复试中导师关注的前沿技术点,重点剖析了Vision Transformer(ViT)的核心原理与多模态学习的演进历程。ViT通过将图像分割为Patch并引入位置编码,实现了基于全局注意力的图像处理;多模态领域则从VisualBERT发展到ALBEF,展示了"先对齐再融合"的先进思路。文章还探讨了分布式训练、联邦学习

#考研#深度学习#人工智能 +3
【2025考研复试】深度学习扩展知识:从ViT到多模态,以及简历项目挖掘策略(第11章复盘)

考研复试深度学习前沿技术解析:从ViT到多模态学习 本文聚焦考研复试中导师关注的前沿技术点,重点剖析了Vision Transformer(ViT)的核心原理与多模态学习的演进历程。ViT通过将图像分割为Patch并引入位置编码,实现了基于全局注意力的图像处理;多模态领域则从VisualBERT发展到ALBEF,展示了"先对齐再融合"的先进思路。文章还探讨了分布式训练、联邦学习

#考研#深度学习#人工智能 +3
【硬核万字长文】从 BERT 到 DeepSeek:大模型架构演进、预训练全流程与 RLHF 深度解析(附 PPT 原理图解与面经)

本文深入解析大语言模型的技术演进与核心原理。从Transformer架构的分野出发,详细对比了Encoder和Decoder-Only结构的特性差异。重点剖析了DeepSeek架构的创新之处:包括RMSNorm归一化、SwiGLU激活函数、RoPE旋转位置编码、MLA多头潜在注意力以及MoE混合专家模型等关键技术。文章还系统讲解了预训练阶段的ScalingLaw、数据预处理和NextTokenPr

#bert#架构#语言模型 +2
深度学习生成任务 (Seq2seq & Transformer) 核心考点全解析

本文系统讲解了Transformer架构在生成任务中的核心原理与应用。重点解析了Encoder-Decoder结构、MaskedAttention机制和位置编码等关键技术,并深入对比了训练时的TeacherForcing与推理时的Autoregressive模式差异。文章还介绍了KVCache优化和BeamSearch等实用技巧,为理解现代大模型工作原理提供了清晰框架,特别适合考研复试准备。

#深度学习#transformer#nlp
    共 13 条
  • 1
  • 2
  • 请选择