
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
LLL(输入层为第0层,输出层为第LLL层)alσzlalσzlσ\sigmaσσx11e−xσx1e−x1zlWlal−1zlWlal−1WWW为权值矩阵)J12y−y2J21y−y2yyy为真实值,y\hat{y}y为预测值)多层感知机解决单层网络线性不可分问题,BP算法通过梯度下降训练多层网络。CNN用卷积+池化。
本文系统梳理了深度学习在计算机视觉领域的核心知识体系。首先介绍了7个经典视觉数据集,从入门级MNIST到工业级MS COCO;然后详细解析了视觉任务评价指标,包括精确率、召回率、P-R曲线、AP和mAP;接着深入讲解了目标检测任务及YOLO算法的核心思想;最后介绍了语义分割任务及FCN、DeepLab v3等核心算法。文章构建了从数据基础到性能评估再到核心算法的完整视觉应用框架。
2017年,Google团队发表《Attention Is All You Need》一文,彻底抛弃RNN/LSTM/CNN结构,仅基于注意力机制提出Transformer模型,成为NLP领域里程碑式成果。如今Transformer不仅主导翻译、文本生成等NLP任务,更延伸至CV、语音、多模态大模型等领域,是深度学习的核心模型。
本周学习了《神经网络与深度学习》课程中视觉Transformer(ViT)与视觉大模型基础两大模块内容,系统讲解了ViT的架构原理、训练流程、实验效果,同时延伸介绍了大语言模型、多模态大模型、知识蒸馏与DINO等当下主流视觉大模型技术。
LLL(输入层为第0层,输出层为第LLL层)alσzlalσzlσ\sigmaσσx11e−xσx1e−x1zlWlal−1zlWlal−1WWW为权值矩阵)J12y−y2J21y−y2yyy为真实值,y\hat{y}y为预测值)多层感知机解决单层网络线性不可分问题,BP算法通过梯度下降训练多层网络。CNN用卷积+池化。
2017年,Google团队发表《Attention Is All You Need》一文,彻底抛弃RNN/LSTM/CNN结构,仅基于注意力机制提出Transformer模型,成为NLP领域里程碑式成果。如今Transformer不仅主导翻译、文本生成等NLP任务,更延伸至CV、语音、多模态大模型等领域,是深度学习的核心模型。
本周学习了《神经网络与深度学习》课程中视觉Transformer(ViT)与视觉大模型基础两大模块内容,系统讲解了ViT的架构原理、训练流程、实验效果,同时延伸介绍了大语言模型、多模态大模型、知识蒸馏与DINO等当下主流视觉大模型技术。







