logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

从零开始讲LLM(大语言模型)原理-2.2Encoder-Decoder

在《Attention is All You Need》中,作者摒弃传统的 RNN、CNN 架构,仅依靠注意力机制构建出 Transformer 模型,引发了 NLP 领域的重大变革。Transformer 的核心组件为编码器(Encoder)和解码器(Decoder),二者均运用了注意力机制。后续基于 Transformer 发展的预训练语言模型,多通过对 Encoder - Decoder 部

#语言模型#人工智能#自然语言处理
从零开始讲LLM(大语言模型)原理-2.1注意力机制

想象在阅读一段文字时,不会平均对待每一个词,而是会在那些的关键词上,忽略不重要的部分。例如,在句子“坐在上”中,“猫”和“垫子”通常比“在”和“上”更重要。注意力机制的核心思想就是让模型学会这种“聚焦”的能力。它是现代人工智能(尤其是深度学习)领域的一个重要内容,特别是在自然语言处理(NLP)、(CV)等领域取得了巨大成功。注意力机制如同为(下文会讲~)装上“可调焦镜头”,使其从“均匀处理所有输入

#语言模型#人工智能#自然语言处理
从零开始讲LLM(大语言模型)原理-2.2Encoder-Decoder

在《Attention is All You Need》中,作者摒弃传统的 RNN、CNN 架构,仅依靠注意力机制构建出 Transformer 模型,引发了 NLP 领域的重大变革。Transformer 的核心组件为编码器(Encoder)和解码器(Decoder),二者均运用了注意力机制。后续基于 Transformer 发展的预训练语言模型,多通过对 Encoder - Decoder 部

#语言模型#人工智能#自然语言处理
到底了