
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
这份笔记重写自 Harvard NLP 的 The Annotated Transformer,并使用官方 GitHub 中的源码作为讲解对象。源码块按原文代码顺序保留,讲解部分用中文重新组织,不做英文逐字翻译。读这篇时建议同时打开前一篇Transformer详解,前一篇偏“看图理解 Transformer 是什么”,这一篇偏“看代码理解 Transformer 怎么跑起来”。最重要的学习路线是:
本指南介绍如何在 VSCode/Cursor 中通过 Remote SSH 连接 Linux 服务器(或嵌入式开发板)进行 C/C++ 代码调试,远程代码内联,包括普通调试和需要 root 权限的调试场景。
什么是硬件?硬件(Hardware)是计算机系统中所有看得见、摸得着的物理设备。就像人体的骨骼、肌肉和器官一样,硬件是计算机的"身体"。什么是软件?软件(Software)是运行在硬件上的程序和数据,是计算机的"灵魂"。软件告诉硬件该做什么、怎么做。硬件 ←→ 软件↓ ↓身体 ←→ 灵魂硬件= 钢琴本身(琴键、琴弦、踏板等物理部件)软件= 乐谱(告诉钢琴家如何演奏)没有硬件,软件无法运行;没有软件
特性传统方案VPP提升/优势吞吐量(L2)1-2 Mpps/核15 Mpps/核7-15倍吞吐量(IPv4路由)0.5-1 Mpps/核12 Mpps/核12-24倍延迟毫秒级微秒级(<10μs)100-1000倍CPU 利用率低(频繁拷贝)高(零拷贝)效率提升3-5倍内存拷贝多次(内核↔用户空间)零拷贝减少50-70%缓存效率低(标量处理)高(向量处理)I-cache命中率提升可扩展性有限插件化
关系代数是关系数据库的理论基础,理解它对于深入掌握SQL和数据库查询优化至关重要。关系代数(Relational Algebra)是一种抽象的查询语言,它使用对关系的运算来表达查询。│ 关系代数的本质 ││ ││ 输入:一个或多个关系(表) ││ ↓ ││ 运算:对关系进行各种操作 ││ ↓ ││ 输出:一个新的关系(表) ││ ││ 核心思想:关系进 → 关系出(封闭性) ││ │并运算是将两个
12 个 Transformer block:85,026,81685026816385973767864321244106248502681638597376786432124410624也就是大约 1.24 亿个参数。GPT-2 small 有时也被叫作 117M 或 124M 级别模型,具体数字会因为统计口径和实现细节略有差异。第一大块:12 个 Transformer block,约 85
12 个 Transformer block:85,026,81685026816385973767864321244106248502681638597376786432124410624也就是大约 1.24 亿个参数。GPT-2 small 有时也被叫作 117M 或 124M 级别模型,具体数字会因为统计口径和实现细节略有差异。第一大块:12 个 Transformer block,约 85
12 个 Transformer block:85,026,81685026816385973767864321244106248502681638597376786432124410624也就是大约 1.24 亿个参数。GPT-2 small 有时也被叫作 117M 或 124M 级别模型,具体数字会因为统计口径和实现细节略有差异。第一大块:12 个 Transformer block,约 85
本文根据 Jay Alammar 的 The Illustrated Transformer 整理。图片来自原文正文,文字部分改写为中文教程,目标是让没有编程和机器学习背景的读者也能一步步理解 Transformer 的核心原理,并在关键地方补上必要的数学解释。先约定几个最基础的符号。一个句子可以看成一串词,比如 。模型不能直接处理文字,所以会把每个词变成一串数字,这串数字叫向量。很多个词的向量排
本文根据 Jay Alammar 的 The Illustrated Transformer 整理。图片来自原文正文,文字部分改写为中文教程,目标是让没有编程和机器学习背景的读者也能一步步理解 Transformer 的核心原理,并在关键地方补上必要的数学解释。先约定几个最基础的符号。一个句子可以看成一串词,比如 。模型不能直接处理文字,所以会把每个词变成一串数字,这串数字叫向量。很多个词的向量排







