
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文介绍了自然语言处理中的自注意力机制及其相关技术。首先阐述了文字向量化的必要性,指出RNN和LSTM在处理序列数据时的局限性,特别是LSTM通过遗忘门、输入门和输出门来优化长序列记忆。重点讲解了自注意力机制的优势,它能并行处理全局信息,通过query-key-value结构和位置编码解决语义歧义问题。最后介绍了Transformer架构,其编码器(如BERT)擅长特征提取,解码器(如GPT)擅长

仅仅记录自己准备复试的一些项目情况和重要知识点。刷到的朋友不要喷我写的不好。
本文介绍了深度学习中几种重要的学习范式。重点讲解了无监督学习的应用场景和典型方法,包括PCA降维、生成对抗网络(GAN)和自监督学习。GAN通过生成器与判别器的对抗训练生成逼真数据;自监督学习通过数据重构任务学习特征表示,如MAE模型。对比学习则通过拉近相似样本、推远不相似样本学习数据表征。这些无监督方法能有效利用大量无标签数据,结合少量监督数据进行微调,可显著提升模型性能。文章还回顾了有监督、无
本文介绍了生成任务的基本概念和实现方法。生成任务指输入序列后输出长度不定的序列,如问答系统。文章重点讲解了基于自学习的生成模型,分析了其串行错误问题,并提出用Masked Self-attention解决。通过上三角矩阵实现仅能看到前面输入的效果,避免"面向结果编程"。训练时使用标签并行计算,测试时则需串行输出。最后介绍了BeamSearch算法,并总结了需要掌握的5个关键点:
本文介绍了大模型的关键技术与训练方法。在模型架构方面,重点分析了专家混合模型(MoE)的两种路由机制、旋转位置编码(RoPE)的优势、多头潜在注意力(MLA)的低秩压缩特性,以及Swiglu激活函数和RMSNorm归一化的创新点。在训练方法上,阐述了强化学习的基本原理及其与PPO算法的关系,PPO通过限制策略更新幅度实现稳定优化,已成为大模型RLHF微调的主流方法。这些技术创新共同推动了大模型在参
本文介绍了神经网络项目的实战流程,以一个新冠病毒感染人数预测项目为例。主要内容包括:1. 数据准备部分:划分训练集、验证集和测试集,进行数据标准化处理,并使用SelectKBest方法筛选关键特征;2. 模型构建部分:实现包含两个全连接层的简单神经网络,使用ReLU激活函数;3. 训练优化部分:采用SGD优化器,引入L2正则化防止过拟合,并实现训练验证流程;4. 特征工程:演示了特征选择和主成分分







