
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
以前一直没有研究二进制的移位运算的应用场景是什么,怎么运算?怎么实现数据的四则运算的? 直到最近,在看Think inJava的书籍,才真正理解这个东西。下面记录一下学习笔记。1,二进制1.1 二进制的表示我们知道,计算机中所有数据都是以二进制形式存储。例如1(int)在二进制中的表现形式就是00000000 00000000 00000000 00000001。而0的二进制就是所
1 Maven是什么?Apache Maven 是一种用作软件项目管理和理解工具。它基于项目对象模型(POM)的概念, 可以管理一个项目的构建、报告以及从项目核心信息中生成文档。Maven是一种项目管理和理解工具。Maven向开发者提供了一个完整的构建生命周期框架。开发团队几乎不用花时间就可以使用自动化构建项目的基础框架,因为 Maven 使用了一套标准的目录结构和默认的构建生命周期。在存在多个开
本来想自己写一篇关于oracle登录验证的博文的,但是发现有一篇比较详细的文章oracle登录验证三种方式详解讲解了这部分,因此,决定不重新造轮子了。以下是迁移过来的文章:1.使用OS操作系统集成身份验证在数据库服务器本机只要以sqlplus assysdba连接数据库,不论输入什么用户(哪怕这个用户如aaa在数据库中根本不存在)都可以连接上,并且连接用户是sys好处就是,如果
如果你问一个AI从业者:今天的大模型时代是怎么来的?答案通常会指向一个起点:2017年的Transformer。但从Transformer到ChatGPT,中间还有几步关键的跳跃。今天这篇文章,我们把阶段一的五篇论文串起来看,讲清楚每一步为什么重要,以及它们之间怎么互相呼应。

2022年,斯坦福大学等机构的研究团队(主要由博士生Tri Dao主导)发了篇论文,标题很朴实——FlashAttention。听起来不像什么革命性的东西,对吧?但这篇论文的影响力是爆炸级的。它不是提出了一种新的模型架构,也不是发现了一种新的训练范式。。就这?但结果是:几乎所有主流大模型都采用了它。GPT-4用了,Gemini用了,Llama用了,Claude也用了。在不到一年时间里,FlashA

2020年,OpenAI发布了一篇轰动业界的论文——Scaling Laws。它的核心结论简单粗暴:想要更强的模型,就堆更多的参数。一时间,全行业都在疯狂造大模型,千亿参数成了标配,万亿参数也不是梦。这就是今天要聊的这篇论文——,全名《Training Compute-Optimal Large Language Models》。它用一个精妙的实验设计,给整个行业上了一课。

2019年2月,OpenAI发表了一篇论文。论文本身并不长,但它做了一件之前没有人敢认真尝试的事。他们训练了一个15亿参数的语言模型,给它一个输入,不给任何额外的训练样本,不需要更新任何模型参数,只依靠输入的文本提示,它居然就能做翻译、做摘要、做问答。这在当时叫zero-shot learning。模型从没见过这些任务的训练数据,但它就是会做。OpenAI自己也吓了一跳。他们认为这个模型太强大了,

幂律说的是这么回事:当你把某个变量乘以 k 倍,结果会以 k 的某个固定次方的比例变化。用公式写就是 L ∝ x^{-α}。翻译成人话:你每把参数量翻10倍,loss 就会下降一个可预测的固定比例。不是一个大概的趋势,而是一条在对数坐标上近乎完美的直线。这意味着什么?意味着你可以提前预测一个更大的模型会有多好。在它还没训练完之前,你就知道结果。这对于一个动辄花几百万美元训练模型的公司来说,价值不言

如果你问一个AI从业者:今天的大模型时代是怎么来的?答案通常会指向一个起点:2017年的Transformer。但从Transformer到ChatGPT,中间还有几步关键的跳跃。今天这篇文章,我们把阶段一的五篇论文串起来看,讲清楚每一步为什么重要,以及它们之间怎么互相呼应。

两个向量的点积,衡量的是它们的"方向一致性"。方向越一致,点积越大。所以Query和Key越相似(方向越接近),注意力分数就越高。但这里有一个问题:如果向量维度很大,点积的值也会很大。值一大,softmax就趋向于"赢者通吃"——最大的那个分数接近1,其他全部接近0。这不是我们想要的。所以论文里除了一个根号d_k(Key的维度),相当于把分数拉回来。这个细节虽小,但很关键。没有这个缩放,注意力分布








