
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
从零开始讲LLM(大语言模型)原理-2.2Encoder-Decoder
在《Attention is All You Need》中,作者摒弃传统的 RNN、CNN 架构,仅依靠注意力机制构建出 Transformer 模型,引发了 NLP 领域的重大变革。Transformer 的核心组件为编码器(Encoder)和解码器(Decoder),二者均运用了注意力机制。后续基于 Transformer 发展的预训练语言模型,多通过对 Encoder - Decoder 部
从零开始讲LLM(大语言模型)原理-2.1注意力机制
想象在阅读一段文字时,不会平均对待每一个词,而是会在那些的关键词上,忽略不重要的部分。例如,在句子“坐在上”中,“猫”和“垫子”通常比“在”和“上”更重要。注意力机制的核心思想就是让模型学会这种“聚焦”的能力。它是现代人工智能(尤其是深度学习)领域的一个重要内容,特别是在自然语言处理(NLP)、(CV)等领域取得了巨大成功。注意力机制如同为(下文会讲~)装上“可调焦镜头”,使其从“均匀处理所有输入
从零开始讲LLM(大语言模型)原理-2.2Encoder-Decoder
在《Attention is All You Need》中,作者摒弃传统的 RNN、CNN 架构,仅依靠注意力机制构建出 Transformer 模型,引发了 NLP 领域的重大变革。Transformer 的核心组件为编码器(Encoder)和解码器(Decoder),二者均运用了注意力机制。后续基于 Transformer 发展的预训练语言模型,多通过对 Encoder - Decoder 部
到底了







