
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
15天学习大模型打卡(2):从 RNN 到 Transformer 的跨越
摘要:本文对比了RNN、LSTM、GRU和Transformer的关键特性。RNN通过隐藏状态传递信息,但存在梯度消失问题;LSTM引入门控机制和细胞状态,有效缓解长程依赖问题;GRU作为轻量版LSTM,合并状态减少参数。Transformer则突破性地采用Self-Attention机制,实现全并行计算,通过多头注意力和位置编码捕捉全局依赖,配合残差连接和层归一化提升训练稳定性。相比循环架构,T
到底了







