logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Transformer 到底是什么?一张图看懂大模型的“地基“架构

Transformer 是大模型的统一地基,核心是自注意力机制——让模型能一次性关注整句话,突破RNN的顺序依赖与记忆瓶颈。通过并行计算、层叠结构与可扩展性,它支撑起海量预训练与长文本理解。本文用一张架构图与numpy代码演示其原理:词向量经Query、Key、Value计算注意力权重,实现全局信息融合。虽架构朴素,但凭借数据、算力与深度堆叠,成就了今日生成式AI的基石。

#自然语言处理#语言模型
Transformer 到底是什么?一张图看懂大模型的“地基“架构

Transformer 是大模型的统一地基,核心是自注意力机制——让模型能一次性关注整句话,突破RNN的顺序依赖与记忆瓶颈。通过并行计算、层叠结构与可扩展性,它支撑起海量预训练与长文本理解。本文用一张架构图与numpy代码演示其原理:词向量经Query、Key、Value计算注意力权重,实现全局信息融合。虽架构朴素,但凭借数据、算力与深度堆叠,成就了今日生成式AI的基石。

#自然语言处理#语言模型
大模型就是 AI 吗?一文厘清 AI、机器学习、深度学习、大模型的关系

本文厘清AI、机器学习、深度学习与大模型的层级关系:AI是目标,机器学习是实现路径,深度学习是其神经网络分支,大模型则是深度学习的规模化产物。四者呈包含关系(大模型 ⊂ 深度学习 ⊂ 机器学习 ⊂ AI),强调区分概念本质——大模型非AI全部,而是数据驱动的“通才”工具。避免将术语混用,有助于识别技术真实水平,为后续深入学习打下基础。

#人工智能
到底了