
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
2020年,OpenAI发布了一篇轰动业界的论文——Scaling Laws。它的核心结论简单粗暴:想要更强的模型,就堆更多的参数。一时间,全行业都在疯狂造大模型,千亿参数成了标配,万亿参数也不是梦。这就是今天要聊的这篇论文——,全名《Training Compute-Optimal Large Language Models》。它用一个精妙的实验设计,给整个行业上了一课。

2019年2月,OpenAI发表了一篇论文。论文本身并不长,但它做了一件之前没有人敢认真尝试的事。他们训练了一个15亿参数的语言模型,给它一个输入,不给任何额外的训练样本,不需要更新任何模型参数,只依靠输入的文本提示,它居然就能做翻译、做摘要、做问答。这在当时叫zero-shot learning。模型从没见过这些任务的训练数据,但它就是会做。OpenAI自己也吓了一跳。他们认为这个模型太强大了,

幂律说的是这么回事:当你把某个变量乘以 k 倍,结果会以 k 的某个固定次方的比例变化。用公式写就是 L ∝ x^{-α}。翻译成人话:你每把参数量翻10倍,loss 就会下降一个可预测的固定比例。不是一个大概的趋势,而是一条在对数坐标上近乎完美的直线。这意味着什么?意味着你可以提前预测一个更大的模型会有多好。在它还没训练完之前,你就知道结果。这对于一个动辄花几百万美元训练模型的公司来说,价值不言

如果你问一个AI从业者:今天的大模型时代是怎么来的?答案通常会指向一个起点:2017年的Transformer。但从Transformer到ChatGPT,中间还有几步关键的跳跃。今天这篇文章,我们把阶段一的五篇论文串起来看,讲清楚每一步为什么重要,以及它们之间怎么互相呼应。

两个向量的点积,衡量的是它们的"方向一致性"。方向越一致,点积越大。所以Query和Key越相似(方向越接近),注意力分数就越高。但这里有一个问题:如果向量维度很大,点积的值也会很大。值一大,softmax就趋向于"赢者通吃"——最大的那个分数接近1,其他全部接近0。这不是我们想要的。所以论文里除了一个根号d_k(Key的维度),相当于把分数拉回来。这个细节虽小,但很关键。没有这个缩放,注意力分布

2018年6月,OpenAI发表了一篇论文,标题是"Improving Language Understanding by Generative Pre-Training"。这篇论文在当时的关注度远不如BERT——后者在几个月后横空出世,11项NLP基准测试同时刷新,抢走了所有风头。但回头看,GPT-1才是那条后来被证明更有潜力的路线的起点。它第一次清晰地展示了:用生成式预训练(预测下一个词)获得

2022年,斯坦福大学等机构的研究团队(主要由博士生Tri Dao主导)发了篇论文,标题很朴实——FlashAttention。听起来不像什么革命性的东西,对吧?但这篇论文的影响力是爆炸级的。它不是提出了一种新的模型架构,也不是发现了一种新的训练范式。。就这?但结果是:几乎所有主流大模型都采用了它。GPT-4用了,Gemini用了,Llama用了,Claude也用了。在不到一年时间里,FlashA

2020年,OpenAI发布了一篇轰动业界的论文——Scaling Laws。它的核心结论简单粗暴:想要更强的模型,就堆更多的参数。一时间,全行业都在疯狂造大模型,千亿参数成了标配,万亿参数也不是梦。这就是今天要聊的这篇论文——,全名《Training Compute-Optimal Large Language Models》。它用一个精妙的实验设计,给整个行业上了一课。

幂律说的是这么回事:当你把某个变量乘以 k 倍,结果会以 k 的某个固定次方的比例变化。用公式写就是 L ∝ x^{-α}。翻译成人话:你每把参数量翻10倍,loss 就会下降一个可预测的固定比例。不是一个大概的趋势,而是一条在对数坐标上近乎完美的直线。这意味着什么?意味着你可以提前预测一个更大的模型会有多好。在它还没训练完之前,你就知道结果。这对于一个动辄花几百万美元训练模型的公司来说,价值不言

幂律说的是这么回事:当你把某个变量乘以 k 倍,结果会以 k 的某个固定次方的比例变化。用公式写就是 L ∝ x^{-α}。翻译成人话:你每把参数量翻10倍,loss 就会下降一个可预测的固定比例。不是一个大概的趋势,而是一条在对数坐标上近乎完美的直线。这意味着什么?意味着你可以提前预测一个更大的模型会有多好。在它还没训练完之前,你就知道结果。这对于一个动辄花几百万美元训练模型的公司来说,价值不言








