logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

15天学习大模型打卡(2):从 RNN 到 Transformer 的跨越

摘要:本文对比了RNN、LSTM、GRU和Transformer的关键特性。RNN通过隐藏状态传递信息,但存在梯度消失问题;LSTM引入门控机制和细胞状态,有效缓解长程依赖问题;GRU作为轻量版LSTM,合并状态减少参数。Transformer则突破性地采用Self-Attention机制,实现全并行计算,通过多头注意力和位置编码捕捉全局依赖,配合残差连接和层归一化提升训练稳定性。相比循环架构,T

#学习#rnn#transformer +1
到底了